Два месяца назад мы выпустили наши первые модели Bonsai 27B и показали, что мультимодальная модель класса 27B может быть сжата достаточно сильно для эффективной работы на локальном устройстве. Сегодня мы выпускаем Ternary Bonsai 2 27B — нашу самую мощную модель на текущий момент.
Основанная на Qwen3.8 27B, модель Ternary Bonsai 2 27B привносит в серию Bonsai более сильные способности к рассуждению, программированию, работе со зрением и агентные возможности, сохраняя при этом профиль развертывания, который ее определяет: значительно меньший объем памяти, высокая локальная пропускная способность и повышенная энергоэффективность.
Ternary Bonsai 2 27B использует тернарные веса {−1, 0, +1} с групповым масштабированием FP16, что дает 1,76 эффективных бита на вес и общий объем модели 5,9 ГБ. Низкобитовое представление применяется сквозным образом по всей языковой модели. Она поддерживает контекстное окно в 262 тыс. токенов, мультимодальный ввод текста и изображений и выпущена под лицензией Apache 2.0.
По сравнению со своим полноточном аналогом, Ternary Bonsai 2 27B более чем в 9 раз меньше, сохраняя при этом 98,2% совокупной производительности в бенчмарках. При таком уровне сохранения сжатие становится ключом к развертыванию: почти те же возможности в объеме, который позволяет запускать модель в гораздо большем количестве мест.
Что изменилось по сравнению с первым релизом Bonsai 27B
Наш первый релиз Bonsai 27B стал важной вехой, предложив практический способ запуска интеллекта класса 27B на локальных устройствах. Bonsai 2 27B фокусируется на следующем шаге: улучшении качества модели и производительности во время выполнения, необходимых для реальных локальных приложений. По сравнению с предыдущим поколением Bonsai 27B, Bonsai 2 27B предлагает:
- более сильную базовую модель, Qwen3.8 27B
- более высокое сохранение совокупной способности на уровне 98,2% по сравнению с полноточной моделью
- улучшенные способности к рассуждению, программированию, зрению и долгосрочной агентной работе
Более высокая производительность при тех же условиях развертывания
В наборе бенчмарков, охватывающем рассуждения, математику, программирование, следование инструкциям, зрение и использование агентных инструментов, Ternary Bonsai 2 27B набирает 83,9 балла, сохраняя 98,2% совокупной производительности Qwen3.8 27B.
Рисунок I: Результаты бенчмарков Ternary Bonsai 2 27B (режим мышления) в сравнении с полноточными базовыми моделями Qwen3.8 27B и Qwen3.6 27B. Полные результаты по каждому бенчмарку находятся в whitepaper.
Ключевой результат заключается не только в совокупном балле, но и в том, где именно сохраняются возможности. Агенты для программирования, системы использования инструментов, мультимодальные рабочие процессы и долгосрочные задачи особенно чувствительны к деградации модели, поскольку небольшие ошибки могут накапливаться на протяжении многих шагов. Bonsai 2 27B сохраняет большую часть производительности полноточной модели именно в этих областях, работая при этом с долей от исходного объема памяти.
По сравнению с полноточной моделью и другими низкобитовыми альтернативами, Bonsai 2 27B выделяется как исключение по плотности интеллекта. Многие низкобитовые альтернативы становятся пригодными для развертывания только за счет отказа от значимых возможностей в программировании, зрении или использовании агентных инструментов. Bonsai 2 27B раздвигает границы в сторону как более высоких возможностей, так и меньшего использования памяти.
Демо I: Агенты для программирования с Cline, работающие на базе Ternary Bonsai 2 27B на NVIDIA GeForce RTX 5090.
С Bonsai 2 27B локальные модели могут начать выполнять реальную интеллектуальную работу: циклы агентного программирования, рабочие процессы компьютерного использования, анализ конфиденциальных документов, мультимодальную отладку и гибридную оркестрацию, где локальные модели обрабатывают конфиденциальные или высокочастотные задачи, выборочно переключаясь на облако.
Пропускная способность и энергоэффективность
Ternary Bonsai 2 27B достигает до 143 токенов/секунду на NVIDIA GeForce RTX 5090 и 46,8 токенов/секунду на M5 Max. На RTX 4090 Ternary Bonsai 2 27B потребляет всего 0,714 мВтч/токен, что делает ее на 40% более энергоэффективной, чем модель 8B, работающая в полной точности.
Для помощников по программированию более высокая пропускная способность означает более быстрые циклы редактирования и отладки. Для мультимодальных агентов это означает более быструю итерацию по скриншотам, документам и вызовам инструментов. Для частных локальных рабочих процессов лучшая энергоэффективность означает более полезный вывод на том же устройстве, более длительное время автономной работы и более реалистичный путь к помощникам, которые могут оставаться доступными в фоновом режиме, не обращаясь постоянно к облаку.
Почему этот релиз важен
По сравнению с Ternary Bonsai 27B, новая Ternary Bonsai 2 27B сократила разрыв в сохранении производительности по сравнению с полноточной моделью с 95% до более чем 98%. Это значительное улучшение, которое делает текущий релиз практически «без потерь». Это еще больше укрепляет мнение о том, что низкобитовые модели могут быть лучшим способом развертывания ИИ.
Это имеет последствия, выходящие далеко за рамки локального вывода. Низкобитовые модели могут изменить экономику и архитектуру систем ИИ на устройствах, рабочих станциях и в центрах обработки данных: размещение более крупных моделей в том же объеме памяти, обслуживание большего количества пользователей на том же оборудовании, снижение энергопотребления на один вывод и создание гибридных систем, которые динамически решают, что должно выполняться локально, а что — в облаке.
Вопрос будет все чаще заключаться не только в том, насколько способна модель, но и в том, сколько полезного интеллекта можно доставить в рамках заданного бюджета памяти, вычислений и питания. Если возможности могут продолжать масштабироваться при резком снижении этих требований, конверт развертывания для будущих моделей расширяется по всему стеку: от персональных устройств до крупномасштабных центров обработки данных.
Поддержка платформ
Bonsai 2 27B работает на графических процессорах NVIDIA через CUDA и на устройствах Apple (Mac, iPhone, iPad) через MLX с помощью пользовательских низкобитовых ядер. Веса модели доступны сегодня под лицензией Apache 2.0.
Полные технические подробности наших процессов сжатия, оценки и бенчмаркинга доступны в нашем .
Работа с нами
Мы работаем с командами над адаптацией моделей Bonsai к их приложениям, от пост-обучения на специфических для домена данных до оптимизации вывода для целевого оборудования. Если вы создаете продукты ИИ с жесткими требованиями к памяти, задержке или питанию, мы будем рады изучить, как Bonsai может помочь. Свяжитесь с нами по адресу contact@prismml.com.
Присоединяйтесь к нам
Prism возникла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google, при постоянной поддержке со стороны Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейронных сетей без ущерба для их способности к рассуждению.
Если вы хотите помочь в создании следующего поколения современного ИИ, мы будем рады услышать вас. Посетите нашу страницу вакансий.
.png)





