Если поставить Kolibri и Granite 4.2 3B рядом, первым честным наблюдением будет то, что это неравный бой, причем совсем не в ту сторону, которую можно было бы предположить. Kolibri — это модель Aleph Alpha с архитектурой «смесь экспертов» (MoE) и 78,1 млрд параметров, выпущенная 3 октября 2026 года, которая активирует 3,46 млрд параметров на токен. Granite 4.2 3B — это плотная модель рассуждения IBM с примерно тремя миллиардами параметров, веса которой появились на Hugging Face 7 августа 2026 года, а технический блог и карточка модели вышли 25 августа. Одна модель превосходит другую в двадцать шесть раз по общему количеству параметров. Причина, по которой их стоит рассматривать вместе, заключается в том, что обе они распространяются по лицензии Apache 2.0, обе работают только с текстом, обе спроектированы для локального хостинга и обе нацелены на одного и того же покупателя: команду, которой нужен анализ документов на собственном оборудовании с прозрачностью, необходимой для прохождения закупочных проверок. Интересный вопрос не в том, какая из них лучше. А в том, что на самом деле дает двадцатишестикратный бюджет параметров и во сколько обходится его использование.
Несоответствие, выраженное прямо
Granite 4.2 3B — это автономная плотная модель, дообученная на базе Granite-4.1-3B-Base, входящая в семейство Granite 4.2, которое IBM выпустила в августе. Она имеет 40 слоев с механизмом внимания с групповыми запросами (GQA), нативный контекст 128K, который IBM расширяет до 512K на пятом этапе предварительного обучения, и три режима «мышления» для каждого запроса: полное мышление по умолчанию, режим с низкими затратами усилий и режим без мышления. Карточка IBM необычно откровенна в отношении того, чем модель 3B не является. В отличие от своих «старших братьев» на 8B и 30B, она намеренно пропустила специализированный блок агентного обучения с подкреплением, обученный в средах SWE-agent, терминала и поиска, поэтому IBM вообще не приводит для нее показатели SWE-bench и позиционирует модель как специалиста по рассуждениям, а не как агента.
Kolibri идет по другому пути по всем осям. Пятьдесят слоев, каждый из которых является смесью экспертов, 384 эксперта на слой (один общий и шесть маршрутизируемых), коэффициент разреженности около 22,6 к 1. Ее контекст составляет 262 144 токена нативно, с валидацией до 1 048 576, при этом в карточке рекомендуется придерживаться значения 262 144 или ниже для задач, чувствительных к задержкам. Четыре уровня интенсивности рассуждений. Вызов инструментов в стиле Hermes с парсером vLLM, поставляемым в том же репозитории, что и веса. И объем около 78 ГБ в формате FP8, при этом минимальная конфигурация, указанная в карточке, требует две карты A100 80 ГБ, две H100 SXM5, одну H200, одну B200 или одну B300.
• Параметры — Kolibri: 78 103 074 560 всего, 3 457 573 120 активных на токен. Granite 4.2 3B: примерно 3 млрд плотных, все параметры активны на каждом токене.
• Контекст — Kolibri: 16 384 при обучении, 65 536 при промежуточном обучении, 262 144 нативно, 1 048 576 валидировано. Granite 4.2 3B: 128K нативно, расширено до 512K.
• Режимы мышления — Kolibri: нет, низкий, средний, высокий, устанавливаются через шаблон чата. Granite 4.2 3B: полное, с низкими затратами усилий и без мышления, для каждого запроса.
• Вызов инструментов — Kolibri: в стиле Hermes, с поставляемым парсером. Granite 4.2 3B: да, но не по тому пути агентного обучения с подкреплением, который получили ее более крупные собратья.
• Языки — Kolibri: немецкий и английский, по замыслу и ничего больше. Granite 4.2 3B: английский в приоритете, с поддержкой более широкого многоязычного обучения IBM.
• Объем — Kolibri: около 78 ГБ в FP8, минимум два GPU. Granite 4.2 3B: примерно 6–8 ГБ в bfloat16, менее 2 ГБ в квантованном виде, уровень ноутбука.
• Лицензия — обе Apache 2.0, обе без ограничений на приемлемое использование или порогов активных пользователей в месяц.
• Развертывание — Kolibri: плагин vLLM aleph-alpha-inference или опубликованный образ контейнера. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF и Ollama под тегом granite4.2:3b.
Три вещи, и стоит уточнить, какие из них являются установленными фактами, а какие — заявленными характеристиками.
Первое — немецкий язык. Это самое резкое реальное различие между двумя моделями, и дело не в результатах тестов. Aleph Alpha построила Kolibri на основе двуязычного немецко-английского корпуса, нацелившись на примерно 20 процентов немецкого языка в рамках предварительного обучения на 20 триллионах токенов, и закончила с немецким пулом в 2,4 триллиона токенов, 80 процентов из которых лаборатория курировала или генерировала самостоятельно. В карточке объясняется, почему это потребовало усилий: дедуплицированные открытые немецкие наборы данных дали только 390 миллиардов токенов, что на порядок меньше необходимого, поэтому лаборатория специально перенастроила фильтр Common Crawl для немецкого языка и перефразировала существующие немецкие документы в энциклопедические статьи, диалоги и отрывки. Деталь с фильтром — это то, что стоит запомнить. Стандартный конвейер обработки языковых данных отбрасывает документы со слишком длинными словами, а немецкая административная проза регулярно превышает английский лимит средней длины слова — поэтому настройки по умолчанию тихо удаляют тот регистр, на котором пишет государственное управление. IBM не создавала Granite для такого корпуса. Granite 4.2 3B справится с немецким, но она не была спроектирована с учетом немецкого юридического и административного регистра, и ни одна таблица лидеров не покажет вам разницу.
Второе — длинный контекст, который сохраняет работоспособность на реальных документах. Потолок Granite в 512K действительно велик, но две модели пришли к этому по-разному, и позиционный дизайн Kolibri является более традиционным аргументом в пользу длинного контекста. Относитесь к цифрам RULER от IBM — 67,52 на 64K и 55,30 на 128K в опубликованных материалах семейства 4.2 — как к честному раскрытию того, насколько качество поиска снижается к 128K, и помните, что у Kolibri вообще нет эквивалентной опубликованной кривой деградации.
Третье — запас прочности в рассуждениях, и здесь честный ответ звучит так: «не такой большой, как предполагает соотношение параметров». Конвейер обучения Kolibri обеспечил предварительное обучение на 20 триллионах токенов на 768 NVIDIA B200 в течение 21 дня, и собственная сравнительная таблица Aleph Alpha, где Kolibri находится в режиме высокого уровня рассуждений, ставит ее на 75,5 по английскому и 70,8 по немецкому среднему значению в сравнении из четырнадцати моделей — где она проигрывает плотной модели Alibaba с 27 миллиардами параметров по большинству показателей. Основные заявления Granite 4.2 3B — это ее собственные данные: AIME 2025 — 78,33, GPQA — 54,80, LiveCodeBench v6 — 69,71 и MMLU-Pro — 67,84, все они предоставлены IBM и не были воспроизведены сторонними исследователями. Разные наборы тестов, разные инструменты, разные поставщики. Нигде нет цифр, полученных с помощью одного и того же инструментария для этой пары, и мы не собираемся их выдумывать.
Где каждая из них действительно выигрывает
Используйте Granite 4.2 3B, если ваше ограничение — это оборудование. При 6–8 ГБ в bfloat16 или менее 2 ГБ в квантованном виде она помещается на ноутбуке, на одном GPU рабочей станции или на изолированном пограничном устройстве, которое никогда не увидит две карты H100. Она работает через пять различных сред выполнения, включая Ollama и GGUF, что важно, когда целью развертывания является чужой ноутбук, а не ваша собственная стойка. И ее карточка необычайно заслуживает доверия именно потому, что IBM записала, что именно она исключила. Поставщик, который отказывается заявлять результаты SWE-bench для модели 3B, показывает вам, где заканчиваются возможности модели.
Запускайте Kolibri, если важен корпус данных и есть необходимое оборудование. Этот релиз предназначен именно для команд, работающих с контрактами на немецком языке, технической документацией или административными файлами, имеющих в распоряжении узел с двумя GPU и требование, чтобы веса моделей никогда не покидали пределы организации. Родное окно контекста в 262 144 токена, кэш KV в формате FP8, четыре уровня интенсивности и путь вызова инструментов Hermes — все это указывает на работу с документами, а не на чат-ботов. Двуязычный токенизатор служит тому же аргументу: Aleph Alpha сообщает о среднем показателе 4,90 байта на токен для немецких веб-текстов против 4,35 для GPT-5 и 3,28 для Kimi K3 (все данные измерены поставщиками на их собственных корпусах), а большее количество символов на токен напрямую влияет на стоимость инференса, а не на оценку качества. Если это подтвердится, экономия будет накапливаться с каждой обработанной страницей.
Асимметрия, о которой никто не говорит, — это данные. IBM опубликовала веса Granite 4.2 3B и подробный технический отчет о том, как создавалась модель, но не предоставила данные для обучения. Aleph Alpha опубликовала конвейер, происхождение данных и показатели энергопотребления вместе с весами Kolibri: 20 триллионов токенов предварительного обучения, 9,5×10² МВт·ч, включая накладные расходы дата-центра, но исключая контролируемую донастройку и обучение с подкреплением. Для команды, которая должна отвечать на вопрос «откуда взялся текст этой модели», эта разница не является косметической.
Реальность маршрутизации для обоих
На сегодняшний день ни одна из моделей не представлена в облачных каталогах. У Kolibri вообще нет API SKU от поставщика — релиз состоит из весов и технического отчета, а Granite 4.2 3B поставляется как веса для пяти стеков исполнения без облачной конечной точки от IBM. Оба варианта предполагают самостоятельный хостинг, и практический вопрос для большинства команд заключается не в том, что выбрать, а в том, оправдывает ли рабочая нагрузка владение любым из этих решений.
Именно здесь уровень маршрутизации оправдывает свое место, даже для моделей, которые он не поддерживает. Мы проверили каталог OrcaRouter по всем вариантам написания названий обеих моделей, и ни Kolibri, ни Granite 4.2 3B там нет, поэтому мы не будем утверждать обратное. Что OrcaRouter действительно дает, так это дешевый способ выяснить, оправдано ли решение о покупке оборудования, прежде чем вы его примете: направьте тестовый путь на небольшой уровень «смеси экспертов» (Mixture-of-Experts), который уже маршрутизируется — вариант Gemma 4 26B-A4B по цене $0,06 за миллион входных токенов и $0,33 за миллион выходных, с окном в 262 144 токена — и посмотрите, действительно ли ваша рабочая нагрузка с немецкими документами требует того, что предоставляет Kolibri, используя один ключ, совместимый с OpenAI, по прейскуранту провайдера без наценок. Если да, вы покупаете GPU, опираясь на факты, а не на догадки. Если нет, вы только что сэкономили на заказе оборудования.
Вердикт и то, что могло бы его изменить
Это не соревнование с победителем. Kolibri и Granite 4.2 3B отвечают на разные вопросы при разных ценовых уровнях, и единственная честная классификация — по ограничениям: если ограничением является оборудование, Granite 4.2 3B — единственный из двух, который подходит. Если ограничением является работа с документами немецких регуляторных реестров на собственных мощностях, Granite 4.2 3B изначально не рассматривался, а Kolibri является более интересным артефактом — полноценный релиз с открытыми весами на 78 млрд параметров, лицензия Apache 2.0, с опубликованными конвейером данных и токенизатором рядом с весами.
Две вещи могли бы прояснить сравнение. Независимый запуск Kolibri для задачи ответов на вопросы по немецким документам проверил бы утверждение, ради которого этот релиз был создан, поскольку ни один лидерборд в настоящее время его не измеряет. А независимое воспроизведение показателей рассуждения Granite 4.2 3B показало бы, может ли устройство уровня ноутбука справиться с той частью вашей рабочей нагрузки, которая изначально не требовала 78 миллиардов параметров. Пока этого не произошло, делайте выбор исходя из ограничений, а не из количества параметров.












