Интуиция подсказывает, что модель с открытыми весами из «flash»-сегмента Alibaba должна обойти маленькую закрытую модель от Anthropic по цене. Судя по двум базовым тарифам, так оно и есть: Qwen3.8-Flash-Next предлагается за $0,15 за миллион входных токенов и $0,47 за миллион выходных на собственном API Alibaba против $0,10 и $0,50 у Claude Haiku 5.5. Однако при тестировании обеих моделей на одном и том же наборе бенчмарков расстановка сил меняется. По данным Artificial Analysis, Claude Haiku 5.5 в режиме максимальной производительности (Max effort) обходится в $0,21 за одну выполненную задачу в Индексе интеллекта (Intelligence Index); Qwen3.8-Flash-Next при тех же измерениях стоит $0,37, при этом ее оценка на три пункта ниже. Более дешевый ценник принадлежит модели с большими итоговыми затратами, и причина та же, что и в большинстве подобных сравнений: прайс-лист — это еще не финальная цена, а модель с открытыми весами окупает себя совсем не через счет от управляемого API. Именно это «другое место» и является настоящим предметом данного сравнения.
Что представляет собой каждая из моделей
Обе модели появились с разницей в шесть недель, и они относятся к разным типам продуктов.
• Claude Haiku 5.5 — модель с закрытыми весами, выпущенная 7 октября 2026 года на Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry и Claude Platform на AWS. Контекст 1M токенов, до 128 000 выходных токенов в синхронном API Messages, адаптивное мышление с регулятором усилий от Low до Max (по умолчанию — medium), срез знаний по июнь 2026 года и тарифная шкала, меняющаяся при превышении 100 000 токенов.
• Qwen3.8-Flash-Next — модель смешанного типа (Mixture-of-Experts) с открытыми весами, выпущенная 26 августа 2026 года по лицензии qwen-community-1.0. Alibaba описывает ее как экспериментальное превью архитектуры, которая ляжет в основу Qwen4. Она содержит 125 млрд параметров основной модели плюс отдельную таблицу n-грамных встраиваний на 51 млрд — в общей сложности около 176 млрд до модуля многотокенового прогнозирования на 4 млрд. Модель активирует 6 млрд параметров на токен, имеет 512 экспертов, маршрутизацию top-10 и 48 слоев. Нативно поддерживает 262 144 токена контекста с возможностью расширения до 1M с помощью YaRN, а также принимает текст, изображения и видео.
• Qwen3.8-Flash — коммерческий аналог с управляемым доступом, который также доступен с 26 августа 2026 года на платформе QwenCloud по цене $0,16 за миллион входных и $0,47 за миллион выходных токенов при стандартном контексте в 1M токенов. Ее стоит отличать от Flash-Next: одна модель представляет собой чекпоинт, который можно скачать и изучить, а вторая — это платный управляемый эндпоинт.
Разница между двумя последними пунктами — главная причина, почему это сравнение представляет такой интерес. Claude Haiku 5.5 и Qwen3.8-Flash-Next конкурируют по очень немногим параметрам, поскольку запустить на собственном железе можно только одну из них.
Фактические затраты, говорящие об обратном
Все приведенные ниже независимые показатели взяты из Artificial Analysis (Intelligence Index v4.3.2). Прайс-листы Anthropic и Alibaba — это официальные цены самих поставщиков.
• Индекс интеллекта (Intelligence Index) — Claude Haiku 5.5 в режиме Max effort набирает 43 балла (второе место из 182 моделей). Qwen3.8-Flash-Next — 40 баллов (шестое место из 117 в своем классе). Разница в три пункта в пользу Anthropic.
• Стоимость за задачу — $0,21 против $0,37. Модель, более дорогая в расчете на токен, оказывается на 43% дешевле в расчете на готовую задачу.
• Количество выходных токенов при прогоне индекса — 440 миллионов для Claude Haiku 5.5 и 240 миллионов для Qwen3.8-Flash-Next (оба значения сопоставляются с медианой в 100 миллионов). Модель Qwen пишет эффективнее, но задача все равно обходится дороже. Это показывает, что дело не только в объеме токенов, но и в соотношении входных данных и оценке, которую применяет тестер.
• Скорость генерации — 241,9 токена в секунду против 56,0. Claude Haiku 5.5 работает более чем в четыре раза быстрее при тех же измерениях. Время до первого токена в 295 секунд при этом прогоне обусловлено рассуждениями модели в режиме Max effort, а не особенностями сети; у Qwen3.8-Flash-Next время до первого токена составляет 2,53 секунды.
• Структура тарифов — стоимость Claude Haiku 5.5 возрастает с $0,10 и $0,50 до $0,50 и $2,50 при превышении порога в 100 000 токенов. Тариф Qwen3.8-Flash является фиксированным ($0,16 и $0,47) независимо от длины, что дает реальное преимущество на длинных промптах. Это единственный аспект, где аргумент о выгодности ценника подтверждается при работе с длинными документами.
• Токенизатор — Claude Haiku 5.5 использует новый токенизатор, общий с Claude 4.7 и более поздними версиями. Из-за этого тот же текст учитывается примерно на 30% большим количеством токенов, чем в предыдущей версии Haiku. Это приближает промпты к отметке в 100 000 токенов, что подтверждается собственной документацией Anthropic. Данный фактор играет против модели как раз в тех сценариях с длинными промптами, где фиксированный тариф Qwen выглядит наиболее выгодно.
Таким образом, суть выбора сводится к следующему: платить больше за токен и получать более быстрый, чуть более умный ответ, который обходится дешевле в расчете на выполненную задачу (но помня о пороге тарификации при длинных вводах). Либо платить меньше за токен и получать более медленную модель, которая обходится дороже за выполненную задачу, но имеет фиксированную ставку и нативное окно в 262 144 токена.
Где открытые веса действительно меняют математику
Все приведенное выше сравнение касается двух управляемых API, и это именно то сравнение, для победы в котором Qwen3.8-Flash-Next не создавалась. Ее главное преимущество в том, что ее не обязательно арендовать.
• Поддержка развертывания с первого дня. Команда SGLang выпустила руководство и специальный образ; для vLLM доступна сборка, в то время как запрос на добавление поддержки архитектуры все еще открыт. Компания NVIDIA проверила работоспособность обоих решений, а также TensorRT LLM на стойке GB300 NVL72, а NeMo обеспечивает возможности дообучения.
• Низкие системные требования для чекпоинта на 176 млрд параметров. Таблица n-грамных встраиваний на 51 млрд может храниться в системной памяти (хоста), а не в VRAM, поскольку адреса поисковых запросов известны заранее и могут предзагружаться. Именно это позволяет запускать модель на кластерах DGX Spark и рабочих станциях с 4×RTX PRO 6000. Появившиеся в тот же день комьюнити-квантования (1-битные сборки, помещающиеся в 75 ГБ оперативной памяти с сохранением примерно 80% полной точности) открывают доступ к модели на оборудовании, имеющемся у небольшой команды.
• Возможность дообучения. И не в смысле хостингового API для тюнинга: веса принадлежат вам по общественной лицензии с обычными условиями, а архитектура подробно описана в техническом отчете, где опубликованы результаты абляционных исследований и неудачные эксперименты.
• Окно контекста меньше, чем кажется. 262 144 токена нативно с возможностью расширения до 1M с помощью YaRN — против 1M нативных токенов у Claude Haiku 5.5 без оговорок по масштабированию позиционных эмбеддингов (RoPE). В задачах с обработкой длинных документов, где фиксированный тариф Qwen выглядит наиболее привлекательно, моделью, способной этот документ удержать, оказывается конкурент.
• Бенчмарки предоставлены разработчиком. Собственная таблица Alibaba ставит Flash-Next выше DeepSeek-V4-Flash-0731 в DeepSWE 1.1 (58,7 против 54,4), SWE-bench Pro (62,5 против 56,0) и GPQA Diamond (91,7 против 90,8), но ниже в NL2Repo-Bench (48,1 против 54,2) — генерации кода на уровне репозитория, то есть в том единственном агентском аспекте, где меньшая модель отстает. Ни один из этих результатов не был независимо воспроизведен третьими лицами, а модели всего шесть недель.
Такова честная граница между ними. Claude Haiku 5.5 — это счетный сервис с фиксированным пределом качества и полным отсутствием операционных хлопот. Qwen3.8-Flash-Next — это продукт, кривая затрат которого стремится вниз к стоимости электроэнергии, предел качества ограничен лишь вашими возможностями по ее развертыванию, но при этом сохраняются риски неподтвержденных бенчмарков и архитектуры, которую рантаймы еще продолжают осваивать.
Практичный способ принять решение
Три вопроса помогут определиться, и только первый из них касается бенчмарков.
Есть ли у вас GPU или хотите ли вы их получить? Если нет, то вариант с самостоятельным хостингом носит теоретический характер, а приведенное выше сравнение управляемых решений исчерпывает тему — и здесь побеждает Claude Haiku 5.5 по стоимости за задачу, скорости и баллам, с той оговоркой, что ограничение шага в 100 000 токенов накладывает штраф на длинные промпты. Если же у вас есть ускорители, не дотягивающие до целевого уровня использования, Qwen3.8-Flash-Next — одна из немногих открытых моделей, где декодирование с 6 миллиардами активных параметров действительно обходится дешево при больших объемах, и показатель в $0,37 за задачу перестает быть главным фактором.
Какова длина среднего промпта? Это единственный случай, когда аргумент с ценником имеет значение. При длине до 100 000 токенов (после токенизатора, который увеличивает объем примерно на 30%) Claude Haiku 5.5 оказывается дешевле по всем параметрам. При превышении этого порога фиксированные $0.16 и $0.47 выглядят предпочтительнее, причем их преимущество растет вместе с длиной вплоть до нативного окна в 262 144 токена, за пределами которого расширение YaRN представляет собой уже другую инженерную задачу.
Какова терпимость рабочей нагрузки к разбросу задержек? 241,9 токена вывода в секунду против 56,0 — это огромный разрыв, к которому при развертывании своими силами добавляется еще и очередь. Агент для техподдержки в реальном времени или управления браузером — то есть те рабочие нагрузки, для которых Anthropic рекомендует этот уровень, — почувствуют эту разницу.
Для тех, кто предпочитает отвечать на второй и третий вопросы на практике, а не умозрительно, самым дешевым инструментом является общий эндпоинт. Qwen3.8-Flash-Next пока нет в каталоге OrcaRouter, как и Claude Haiku 5.5; среди моделей Qwen мы маршрутизируем Qwen3.8-Flash по прейскуранту провайдера с передачей 0% наценки, что является ближайшим работающим аналогом модели в данном сравнении и правильной отправной точкой для тестирования стоимости длинных промптов. Что касается Anthropic, то Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 сегодня доступны для вызова по одному и тому же ключу, поэтому эксперимент с ценами двух поколений сводится к конфигурации, а не к заключению второго договора; а поскольку ценообразование является сквозным, а не смешанным, снижение цен поставщиком на любом из направлений отражается у нас в тот же день, когда оно было объявлено. Автоматическое переключение при сбое делает этот эксперимент безопасным для реального трафика: предварительная модель или неопубликованная таблица бенчмарков — это как раз тот случай, когда можно направить трафик на что-то новенькое, держа за спиной проверенную модель.
Что может изменить ответ
Две вещи, и обе поддаются проверке. Первая — это независимая оценка Qwen3.8-Flash-Next на тест-системе, которая также запускает Claude Haiku 5.5: таблица поставщика приводится в сравнении с DeepSeek, а 40 баллов от независимого совета — это всего лишь одна позиция. Оценка за написание кода на уровне репозитория — это та строка, за которой стоит следить, поскольку именно в NL2Repo модель, как уже было показано, отстает. Второе — это внедрение доработок во время выполнения: поддержка vLLM все еще проходит слияние через открытые пул-реквесты, и до тех пор самостоятельный хостинг этой архитектуры — скорее развлечение для любящих это команд, чем поддерживаемый путь.
До тех пор краткий вывод таков. Qwen3.8-Flash-Next — более интересная модель для владения и более дорогая в аренде. Claude Haiku 5.5 — более дешевый, быстрый и набирающий больше баллов управляемый эндпоинт с тарифом, который наказывает за любые длинные тексты. Выбирайте в зависимости от того, покупаете ли вы токены или весовой коэффициент (чекпоинт), и если вы покупаете токены, учтите, что модель с открытыми весами не дает той скидки, на которую вы рассчитывали.









