Сегодня мы анонсируем Bonsai 27B, основанную на Qwen3.6 27B, новый мультимодальный флагман семейства Bonsai и первую модель такого класса возможностей, которая работает на смартфоне.
Наши предыдущие релизы доказали, что модели с 1-битными и тернарными весами могут быть коммерчески эффективными языковыми моделями. Bonsai 27B расширяет эти границы до нового уровня возможностей: многошаговые рассуждения, структурированные вызовы инструментов, задачи компьютерного зрения и агентные циклы для работы с компьютером, сохраняющие согласованность на протяжении многих шагов. До сегодняшнего дня локальное развертывание моделей такого уровня было непрактичным по конкретной причине: модель 27B занимает около 54 ГБ в 16-битном представлении, и даже качественная 4-битная сборка объемом 18 ГБ слишком велика для смартфона и большинства ноутбуков.
Bonsai 27B меняет это. Она поставляется в двух вариантах:
Тернарная Bonsai 27B использует тернарные веса {−1, 0, +1} с групповым масштабированием FP16, что дает эффективный размер 1,71 бита на вес. При объеме 5,9 ГБ это вариант, ориентированный на качество: он работает на обычном ноутбуке, сохраняя все возможности рассуждения, вызова инструментов и агентной работы.
1-битная Bonsai 27B использует бинарные веса {−1, +1} с тем же групповым масштабированием, что дает 1,125 эффективных бита на вес. При объеме 3,9 ГБ это вариант, ориентированный на компактность, который вписывается в бюджет памяти iPhone 17 Pro, впервые позволяя запустить модель класса 27B на смартфоне.
Как и в каждом релизе Bonsai, низкобитное представление работает сквозным образом во всей языковой сети, включая эмбеддинги, механизмы внимания, MLP и LM-голову, без использования участков с более высокой точностью. Оба варианта являются мультимодальными, при этом визуальный блок поставляется в компактном 4-битном формате, поэтому рабочие процессы на устройстве могут «видеть» скриншоты, документы и входные данные с камеры, а не только текст. Bonsai 27B поддерживает полное контекстное окно в 262 тыс. токенов и поддерживает спекулятивное декодирование, увеличивая скорость за счет ускорения по методу «черновик-проверка» без потерь. Все доступно уже сегодня по лицензии Apache 2.0.
Сохранение интеллекта
В 15 тестах, охватывающих знания, рассуждения, математику, программирование, следование инструкциям, вызов инструментов и зрение (оценивалось в режиме мышления, где задействуются все возможности рассуждения модели), тернарная Bonsai 27B сохраняет 95% точности базовой модели, а 1-битная Bonsai 27B — 90%.
Рис. I: Результаты тестов Bonsai 27B (режим мышления) в сравнении с базовой моделью полной точности. Полные результаты по каждому тесту приведены в техническом документе.
Если проанализировать таблицу по возможностям, картина становится еще более четкой, чем при усреднении: математика и программирование практически не затронуты, вызов инструментов остается в пределах нескольких пунктов от полной точности — именно те возможности, от которых зависят агентные рабочие нагрузки. Для сравнения, самая агрессивная обычная низкобитная сборка той же базовой модели показывает значительно более низкие результаты, чем 1-битная Bonsai 27B, занимая при этом в 2,5 раза больше памяти.
Это тот же сдвиг Парето, который мы продемонстрировали с нашими предыдущими языковыми и визуальными моделями, теперь в масштабе 27B: возможности класса 27B при объеме, меньшем, чем у модели полной точности 2B. По плотности интеллекта — показателю, который мы представили вместе с 1-битной Bonsai 8B, — 1-битная Bonsai 27B выдает 0,53 на ГБ: это более чем в 10 раз выше базового уровня полной точности и примерно в 2,7 раза лучше, чем у лучшей доступной низкобитной альтернативы.
Почему это важная смена парадигмы
Наиболее ценные рабочие нагрузки ИИ смещаются от разовых ответов к длительной работе: ассистенты, которые управляют реальными инструментами, рабочие процессы, выполняемые без присмотра перед возвратом результата, и исследования, синтезирующие десятки документов. Этот сдвиг меняет форму рабочей нагрузки — агент не делает один вызов модели, он делает сотни, каждый из которых несет контекст, создает структурированный вывод и передает данные следующему шагу.
Облачные API останутся правильным выбором для многих продуктов. Но для агентных рабочих нагрузок облачное выполнение накладывает структурные ограничения: каждый шаг — это удаленный запрос, стоимость за токен накапливается с каждой итерацией, а каждый план, вызов инструмента и промежуточный результат передаются по сети, включая личные файлы, экран и данные пользователя.
Демо I: Сквозной агентный рабочий процесс с Hermes, работающий на нашей модели Ternary Bonsai 27B на NVIDIA GeForce RTX 5090.
Локальное выполнение меняет уравнение. Когда модель, способная к длительной агентной работе, помещается на устройстве, агент может жить внутри продукта: предельные затраты на стошаговый цикл равны нулю, а данные пользователя никогда не покидают машину. Открываются целые категории — постоянные агенты на устройстве, ассистенты, работающие офлайн, ассистенты, которые рассуждают над личными локальными данными по своей архитектуре. Чего не хватало, так это модели, достаточно маленькой для такого развертывания и достаточно способной, чтобы доверить ей работу. Bonsai 27B — это именно такая модель.
Она также открывает новую системную архитектуру: гибридные развертывания, которые направляют некритичные и конфиденциальные задачи на способную локальную модель, а для самых сложных шагов резервируют передовые облачные модели, снижая стоимость каждой задачи агентных систем.
Bonsai 27B достигает до 163 ток/с в 1-битном и 134 ток/с в тернарном варианте на NVIDIA GeForce RTX 5090. На M5 Max она достигает до 87 ток/с в 1-битном и 58 ток/с в тернарном варианте.
Размещение на смартфоне — это более строгий барьер, чем предполагают цифры объема памяти. Смартфон никогда не предоставляет приложению всю свою память — iPhone с 12 ГБ ОЗУ предлагает около 6 ГБ для использования моделью на устройстве, и модель делит этот бюджет со своим KV-кэшем и активациями. Ни одна обычная сборка модели 27B не приближается к этому показателю. При объеме около 4 ГБ 1-битная Bonsai 27B — первая, кто проходит этот порог, оставляя место для работы.
Именно из-за этого ограничения семейство поставляется в двух вариантах с учетом конкретных целей: тернарный для качества уровня ноутбука, 1-битный для объема уровня смартфона.
Демо III: Мультимодальные агентные сценарии использования на базе 1-Bit Bonsai 27B на iPhone 17 Pro Max (демо-режим: кэшированный и предварительно заполненный контекст изображения)
Границы продолжают расширяться
Каждый релиз Bonsai сдвигал границу «интеллекта на гигабайт» влево, а Bonsai 27B переносит ее за практический порог: полный набор возможностей современной модели с мышлением, мультимодальным пониманием, зрением и надежным использованием инструментов теперь помещается на устройствах, которые уже есть у людей.
Мы считаем, что плотность интеллекта станет одной из определяющих осей следующего этапа прогресса ИИ. Чистые возможности определяют, что модель может делать; плотность определяет, где она может это делать. Каждый сдвиг границы влево расширяет набор устройств, продуктов и сред, где может работать продвинутый ИИ, и меняет экономику каждой поверхности развертывания, от смартфонов до серверов с одним GPU. Методология Bonsai не зависит от архитектуры, и границы будут продолжать расширяться: более крупные модели и новые архитектуры уже находятся в разработке.
Ранние компьютеры занимали целые комнаты; сегодня они живут в наших карманах. Интеллект совершает тот же путь, и Bonsai 27B — его самый большой шаг на данный момент. Покрытие платформы
Bonsai 27B работает нативно на устройствах Apple (Mac, iPhone, iPad) через MLX и на графических процессорах NVIDIA через CUDA благодаря специализированным низкобитовым ядрам, созданным для архитектуры гибридного внимания. Веса модели доступны уже сегодня по лицензии Apache 2.0. С этим релизом мы предлагаем бесплатный ограниченный по времени API для разработчиков, чтобы они могли легко протестировать нашу модель.
Полные технические подробности наших процессов сжатия, оценки и тестирования доступны в нашем техническом отчете.
Присоединяйтесь к нам
Компания Prism выросла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google, а также продолжает получать поддержку от Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейронных сетей без ущерба для их способности к рассуждению.
Если вы хотите помочь в создании передового ИИ нового поколения, мы будем рады услышать вас. Посетите нашу страницу вакансий.
.png)





