Сегодня мы представляем Bonsai 27B, основанную на Qwen3.6 27B — новый мультимодальный флагман семейства Bonsai и первую модель такого уровня возможностей, способную работать на смартфоне.
Наши предыдущие релизы доказали, что модели с 1-битными и тернарными весами могут быть коммерчески эффективными языковыми моделями. Bonsai 27B расширяет эти границы до нового уровня возможностей: многошаговые рассуждения, структурированные вызовы инструментов, задачи компьютерного зрения и агентные циклы взаимодействия с компьютером, сохраняющие согласованность на протяжении множества этапов. До сегодняшнего дня локальное развертывание моделей такого уровня было непрактичным по конкретной причине: модель 27B занимает около 54 ГБ в 16-битном представлении, и даже качественная 4-битная сборка объемом 18 ГБ слишком велика для смартфона и большинства ноутбуков.
Bonsai 27B меняет это. Она поставляется в двух вариантах:
Ternary Bonsai 27B использует тернарные веса {−1, 0, +1} с групповым масштабированием FP16, что дает эффективный показатель 1,71 бита на вес. При объеме 5,9 ГБ это вариант, ориентированный на качество: он работает на обычном ноутбуке, сохраняя полный набор возможностей для рассуждений, вызова инструментов и агентной работы.
1-bit Bonsai 27B использует бинарные веса {−1, +1} с тем же групповым масштабированием, что дает 1,125 эффективных бита на вес. При объеме 3,9 ГБ это вариант, ориентированный на компактность, который укладывается в бюджет памяти iPhone 17 Pro, впервые позволяя запустить модель класса 27B на смартфоне.
Как и в каждом релизе Bonsai, низкобитовое представление работает сквозным образом во всей языковой сети, включая эмбеддинги, механизмы внимания, MLP и LM-голову, без использования участков с более высокой точностью. Оба варианта являются мультимодальными: визуальный модуль поставляется в компактном 4-битном формате, поэтому локальные рабочие процессы могут «видеть» скриншоты, документы и изображения с камеры, а не только текст. Bonsai 27B поддерживает контекст объемом 262 тыс. токенов и спекулятивное декодирование, что повышает скорость за счет ускорения по методу «черновик-проверка» без потерь. Все доступно уже сегодня по лицензии Apache 2.0.
Сохранение интеллекта
В рамках набора из 15 бенчмарков, охватывающих знания, рассуждения, математику, программирование, следование инструкциям, вызов инструментов и зрение (оценка проводилась в режиме «мышления», где задействуются все возможности рассуждения модели), Ternary Bonsai 27B сохраняет 95% точности базовой модели, а 1-bit Bonsai 27B — 90%.
Рис. I: Результаты бенчмарков Bonsai 27B (в режиме «мышления») в сравнении с базовой полноразмерной моделью. Полные результаты по каждому бенчмарку приведены в техническом документе.
Если анализировать таблицу по возможностям, картина становится еще более впечатляющей, чем средние показатели: математика и программирование практически не затронуты, вызов инструментов остается в пределах нескольких пунктов от полной точности — именно те возможности, от которых зависят агентные рабочие нагрузки. Для сравнения, самая агрессивная обычная низкобитовая сборка той же базовой модели показывает значительно более низкие результаты, чем 1-bit Bonsai 27B, занимая при этом в 2,5 раза больше памяти.
Это тот же сдвиг Парето, который мы продемонстрировали с нашими предыдущими языковыми и графическими моделями, теперь в масштабе 27B: возможности класса 27B при объеме, меньшем, чем у полноразмерной модели 2B. По плотности интеллекта — показателю, который мы ввели с 1-bit Bonsai 8B, — 1-bit Bonsai 27B выдает 0,53 на ГБ: это более чем в 10 раз выше базового уровня полной точности и примерно в 2,7 раза лучше, чем у лучшей доступной низкобитовой альтернативы.
Почему это важная смена парадигмы
Наиболее ценные рабочие нагрузки ИИ смещаются от разовых ответов к длительной работе: ассистенты, управляющие реальными инструментами, рабочие процессы, выполняющиеся без присмотра до получения результата, и исследования, синтезирующие десятки документов. Этот сдвиг меняет характер нагрузки — агент делает не один вызов модели, а сотни, каждый из которых несет контекст, создает структурированный вывод и передает данные следующему шагу.
Облачные API останутся правильным выбором для многих продуктов. Но для агентных рабочих нагрузок облачное исполнение накладывает структурные ограничения: каждый шаг — это удаленный запрос, стоимость за токен накапливается с каждой итерацией, а каждый план, вызов инструмента и промежуточный результат передаются по сети, включая личные файлы, экран и данные пользователя.
Демо I: Сквозной агентный рабочий процесс с Hermes, работающий на нашей модели Ternary Bonsai 27B на NVIDIA GeForce RTX 5090.
Локальное исполнение меняет уравнение. Когда модель, способная к длительной агентной работе, помещается на устройстве, агент может жить внутри продукта: предельные затраты на стошаговый цикл равны нулю, а данные пользователя никогда не покидают устройство. Открываются целые категории — постоянные локальные агенты, ассистенты, работающие офлайн, ассистенты, которые рассуждают над личными локальными данными по своей архитектуре. Чего не хватало, так это модели, достаточно компактной для такого развертывания и достаточно способной, чтобы доверить ей работу. Bonsai 27B — это именно такая модель.
Она также открывает новую системную архитектуру: гибридные развертывания, которые направляют некритичные и конфиденциальные задачи на способную локальную модель, а для самых сложных этапов резервируют передовые облачные модели, что снижает стоимость выполнения одной задачи агентных систем.
Bonsai 27B достигает до 163 ток/с в 1-битном режиме и 134 ток/с в тернарном на NVIDIA GeForce RTX 5090. На M5 Max она достигает до 87 ток/с в 1-битном режиме и 58 ток/с в тернарном.
Размещение на смартфоне — более строгий барьер, чем кажется по цифрам объема памяти. Смартфон никогда не предоставляет приложению всю свою память — iPhone с 12 ГБ ОЗУ предлагает около 6 ГБ для использования моделью на устройстве, и модель делит этот бюджет со своим KV-кэшем и активациями. Ни одна обычная сборка модели 27B не приближается к этому показателю. При объеме около 4 ГБ 1-bit Bonsai 27B — первая модель, которая проходит этот порог, оставляя место для работы.
Именно из-за этого ограничения семейство поставляется в двух вариантах: тернарный для качества уровня ноутбука, 1-битный для компактности уровня смартфона.
Демо III: Мультимодальные агентные сценарии использования на базе 1-Bit Bonsai 27B на iPhone 17 Pro Max (Демо-режим: кэшированный и предварительно заполненный контекст изображения)
Границы продолжают расширяться
Каждый релиз Bonsai сдвигал границу «интеллекта на гигабайт» влево, и Bonsai 27B переводит ее через практический порог: полный набор возможностей современной модели с мышлением, мультимодальным пониманием, зрением и надежным использованием инструментов теперь помещается на устройствах, которые уже есть у людей.
Мы считаем, что плотность интеллекта станет одной из определяющих осей следующего этапа прогресса ИИ. Чистые возможности определяют, что модель может делать; плотность определяет, где она может это делать. Каждый сдвиг границы влево расширяет набор устройств, продуктов и сред, где может работать продвинутый ИИ, и меняет экономику каждой поверхности развертывания, от смартфонов до серверов с одним GPU. Методология Bonsai не зависит от архитектуры, и границы будут продолжать расширяться: более крупные модели и новые архитектуры уже находятся в разработке.
Ранние компьютеры занимали целые комнаты; сегодня они живут в наших карманах. Интеллект совершает тот же путь, и Bonsai 27B — его самый большой шаг на данный момент. Поддержка платформ
Bonsai 27B работает нативно на устройствах Apple (Mac, iPhone, iPad) через MLX и на графических процессорах NVIDIA через CUDA благодаря специализированным низкобитовым ядрам, созданным для архитектуры гибридного внимания. Веса модели доступны уже сегодня по лицензии Apache 2.0. С этим релизом мы предлагаем бесплатный API для разработчиков с ограниченным сроком действия, чтобы они могли легко протестировать нашу модель.
Полные технические подробности наших процессов сжатия, оценки и тестирования доступны в нашем whitepaper.
Присоединяйтесь к нам
Компания Prism выросла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google, а также продолжает получать поддержку от Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейронных сетей без ущерба для их способности к рассуждению.
Если вы хотите помочь в создании передового ИИ нового поколения, мы будем рады услышать вас. Посетите нашу страницу с вакансиями.
.png)





