Два месяца назад мы выпустили наши первые модели Bonsai 27B и показали, что мультимодальная модель класса 27B может быть сжата достаточно сильно для эффективной работы на локальном устройстве. Сегодня мы выпускаем Ternary Bonsai 2 27B — нашу самую мощную модель на текущий момент.
Основанная на Qwen3.8 27B, модель Ternary Bonsai 2 27B привносит в серию Bonsai улучшенные способности к рассуждению, программированию, работе с изображениями и агентные функции, сохраняя при этом профиль развертывания, который ее определяет: значительно меньший объем памяти, высокая локальная пропускная способность и лучшая энергоэффективность.
Ternary Bonsai 2 27B использует тернарные веса {−1, 0, +1} с групповым масштабированием FP16, что дает 1,76 эффективных бита на вес и общий размер модели 5,9 ГБ. Низкобитовое представление применяется сквозным образом по всей языковой модели. Она поддерживает контекстное окно в 262 тыс. токенов, мультимодальный ввод текста и изображений и выпущена под лицензией Apache 2.0.
По сравнению со своим полноточным аналогом, Ternary Bonsai 2 27B более чем в 9 раз меньше, сохраняя при этом 98,2% совокупной производительности в тестах. При таком уровне сохранения сжатие становится ключом к развертыванию: почти те же возможности в объеме, который позволяет запускать модель в гораздо большем количестве мест.
Что изменилось по сравнению с первым релизом Bonsai 27B
Наш первый релиз Bonsai 27B стал важной вехой, предложив практический способ запуска интеллекта класса 27B на локальных устройствах. Bonsai 2 27B фокусируется на следующем шаге: улучшении качества модели и производительности во время выполнения, необходимых для реальных локальных приложений. По сравнению с предыдущим поколением Bonsai 27B, Bonsai 2 27B предлагает:
- более мощную базовую модель, Qwen3.8 27B
- более высокое сохранение совокупной производительности на уровне 98,2% по сравнению с полноточной моделью
- улучшенные способности к рассуждению, программированию, работе с изображениями и выполнению долгосрочных агентных задач
Более высокие возможности при тех же условиях развертывания
В наборе тестов, охватывающем рассуждение, математику, программирование, следование инструкциям, работу с изображениями и использование агентных инструментов, Ternary Bonsai 2 27B набирает 83,9 балла, сохраняя 98,2% совокупной производительности Qwen3.8 27B.
Рисунок I: Результаты тестирования Ternary Bonsai 2 27B (режим мышления) в сравнении с полноточными базовыми моделями Qwen3.8 27B и Qwen3.6 27B. Полные результаты по каждому тесту находятся в whitepaper.
Ключевой результат заключается не только в совокупном балле, но и в том, где именно сохраняются возможности. Агенты-программисты, системы использования инструментов, мультимодальные рабочие процессы и долгосрочные задачи особенно чувствительны к деградации модели, поскольку небольшие ошибки могут накапливаться на протяжении многих шагов. Bonsai 2 27B сохраняет большую часть производительности полноточной модели именно в этих областях, работая при этом с долей от исходного объема памяти.
По сравнению с полноточной моделью и другими низкобитовыми альтернативами, Bonsai 2 27B выделяется как исключение по плотности интеллекта. Многие низкобитовые альтернативы становятся пригодными для развертывания только за счет отказа от значимых возможностей в программировании, работе с изображениями или использовании агентных инструментов. Bonsai 2 27B расширяет границы в сторону как более высоких возможностей, так и меньшего использования памяти.
Демо I: Агенты-программисты с Cline, работающие на базе Ternary Bonsai 2 27B на NVIDIA GeForce RTX 5090.
С Bonsai 2 27B локальные модели могут начать выполнять реальную интеллектуальную работу: циклы агентов-программистов, рабочие процессы использования компьютера, анализ конфиденциальных документов, мультимодальную отладку и гибридную оркестрацию, где локальные модели обрабатывают конфиденциальные или высокочастотные задачи, выборочно перенаправляя более сложные запросы в облако.
Пропускная способность и энергоэффективность
Ternary Bonsai 2 27B достигает до 143 токенов/секунду на NVIDIA GeForce RTX 5090 и 46,8 токенов/секунду на M5 Max. На RTX 4090 Ternary Bonsai 2 27B потребляет всего 0,714 мВтч/токен, что делает ее на 40% более энергоэффективной, чем модель 8B, работающая в полноточном режиме.
Для помощников по программированию более высокая пропускная способность означает более быстрые циклы редактирования и отладки. Для мультимодальных агентов это означает более быстрые итерации по скриншотам, документам и вызовам инструментов. Для частных локальных рабочих процессов лучшая энергоэффективность означает более полезный вывод на том же устройстве, более длительное время автономной работы и более реалистичный путь к помощникам, которые могут оставаться доступными в фоновом режиме, не обращаясь постоянно к облаку.
Почему этот релиз важен
По сравнению с Ternary Bonsai 27B, новая модель Ternary Bonsai 2 27B сократила разрыв в сохранении производительности по сравнению с полноточной моделью с 95% до более чем 98%. Это значительное улучшение, которое делает текущий релиз практически «без потерь». Это еще больше укрепляет мнение о том, что низкобитовые модели могут быть лучшим способом развертывания ИИ.
Это имеет последствия, выходящие далеко за рамки локального вывода. Низкобитовые модели могут изменить экономику и архитектуру систем ИИ на устройствах, рабочих станциях и в центрах обработки данных: размещение более крупных моделей в том же объеме памяти, обслуживание большего числа пользователей на том же оборудовании, снижение энергопотребления на один вывод и создание гибридных систем, которые динамически решают, что должно выполняться локально, а что — в облаке.
Вопрос будет все чаще заключаться не только в том, насколько способна модель, но и в том, сколько полезного интеллекта можно получить в рамках заданного бюджета памяти, вычислений и питания. Если возможности могут продолжать масштабироваться при резком снижении этих требований, область развертывания будущих моделей расширяется по всему стеку: от персональных устройств до крупномасштабных центров обработки данных.
Поддержка платформ
Bonsai 2 27B работает на графических процессорах NVIDIA через CUDA и на устройствах Apple (Mac, iPhone, iPad) через MLX с помощью пользовательских низкобитовых ядер. Веса модели доступны уже сегодня под лицензией Apache 2.0.
Полные технические подробности наших процессов сжатия, оценки и тестирования доступны в нашем .
Работа с нами
Мы работаем с командами над адаптацией моделей Bonsai к их приложениям, от дообучения на специфических для домена данных до оптимизации вывода для целевого оборудования. Если вы создаете продукты ИИ с жесткими требованиями к памяти, задержке или энергопотреблению, мы будем рады обсудить, как Bonsai может помочь. Свяжитесь с нами по адресу contact@prismml.com.
Присоединяйтесь к нам
Prism возникла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google, при постоянной поддержке со стороны Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейронных сетей без ущерба для их способности к рассуждению.
Если вы хотите помочь в создании следующего поколения современного ИИ, мы будем рады услышать вас. Посетите нашу страницу вакансий.
.png)





