Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem bonsai 2 27b pochti bez poter szhatiya v 9 raz menshem obeme
Dev48

© 2026 · All rights reserved.

Представляем Bonsai 2 27B: почти без потерь сжатия в 9 раз меньшем объеме

Источник: PrismML

Представляем Bonsai 2 27B: почти без потерь сжатия в 9 раз меньшем объеме

Источник: PrismML

Ternary Bonsai 2 27B сохраняет 98,2% производительности Qwen3.8 27B в бенчмарках при объеме 5,9 ГБ, обладая мультимодальными и агентными возможностями.

26 сентября 2026 г.

Два месяца назад мы выпустили наши первые модели Bonsai 27B и показали, что мультимодальная модель класса 27B может быть сжата достаточно сильно для эффективной работы на локальном устройстве. Сегодня мы выпускаем Ternary Bonsai 2 27B — нашу самую мощную модель на текущий момент.

Основанная на Qwen3.8 27B, модель Ternary Bonsai 2 27B привносит в серию Bonsai более сильные способности к рассуждению, программированию, работе со зрением и агентные возможности, сохраняя при этом профиль развертывания, который ее определяет: значительно меньший объем памяти, высокая локальная пропускная способность и повышенная энергоэффективность.

Ternary Bonsai 2 27B использует тернарные веса {−1, 0, +1} с групповым масштабированием FP16, что дает 1,76 эффективных бита на вес и общий объем модели 5,9 ГБ. Низкобитовое представление применяется сквозным образом по всей языковой модели. Она поддерживает контекстное окно в 262 тыс. токенов, мультимодальный ввод текста и изображений и выпущена под лицензией Apache 2.0.

По сравнению со своим полноточном аналогом, Ternary Bonsai 2 27B более чем в 9 раз меньше, сохраняя при этом 98,2% совокупной производительности в бенчмарках. При таком уровне сохранения сжатие становится ключом к развертыванию: почти те же возможности в объеме, который позволяет запускать модель в гораздо большем количестве мест.

Что изменилось по сравнению с первым релизом Bonsai 27B

Наш первый релиз Bonsai 27B стал важной вехой, предложив практический способ запуска интеллекта класса 27B на локальных устройствах. Bonsai 2 27B фокусируется на следующем шаге: улучшении качества модели и производительности во время выполнения, необходимых для реальных локальных приложений. По сравнению с предыдущим поколением Bonsai 27B, Bonsai 2 27B предлагает:

  • более сильную базовую модель, Qwen3.8 27B
  • более высокое сохранение совокупной способности на уровне 98,2% по сравнению с полноточной моделью
  • улучшенные способности к рассуждению, программированию, зрению и долгосрочной агентной работе

Более высокая производительность при тех же условиях развертывания

В наборе бенчмарков, охватывающем рассуждения, математику, программирование, следование инструкциям, зрение и использование агентных инструментов, Ternary Bonsai 2 27B набирает 83,9 балла, сохраняя 98,2% совокупной производительности Qwen3.8 27B.

Рисунок I: Результаты бенчмарков Ternary Bonsai 2 27B (режим мышления) в сравнении с полноточными базовыми моделями Qwen3.8 27B и Qwen3.6 27B. Полные результаты по каждому бенчмарку находятся в whitepaper.

Ключевой результат заключается не только в совокупном балле, но и в том, где именно сохраняются возможности. Агенты для программирования, системы использования инструментов, мультимодальные рабочие процессы и долгосрочные задачи особенно чувствительны к деградации модели, поскольку небольшие ошибки могут накапливаться на протяжении многих шагов. Bonsai 2 27B сохраняет большую часть производительности полноточной модели именно в этих областях, работая при этом с долей от исходного объема памяти.

По сравнению с полноточной моделью и другими низкобитовыми альтернативами, Bonsai 2 27B выделяется как исключение по плотности интеллекта. Многие низкобитовые альтернативы становятся пригодными для развертывания только за счет отказа от значимых возможностей в программировании, зрении или использовании агентных инструментов. Bonsai 2 27B раздвигает границы в сторону как более высоких возможностей, так и меньшего использования памяти.

Демо I: Агенты для программирования с Cline, работающие на базе Ternary Bonsai 2 27B на NVIDIA GeForce RTX 5090.

С Bonsai 2 27B локальные модели могут начать выполнять реальную интеллектуальную работу: циклы агентного программирования, рабочие процессы компьютерного использования, анализ конфиденциальных документов, мультимодальную отладку и гибридную оркестрацию, где локальные модели обрабатывают конфиденциальные или высокочастотные задачи, выборочно переключаясь на облако.

Пропускная способность и энергоэффективность

Ternary Bonsai 2 27B достигает до 143 токенов/секунду на NVIDIA GeForce RTX 5090 и 46,8 токенов/секунду на M5 Max. На RTX 4090 Ternary Bonsai 2 27B потребляет всего 0,714 мВтч/токен, что делает ее на 40% более энергоэффективной, чем модель 8B, работающая в полной точности.

Для помощников по программированию более высокая пропускная способность означает более быстрые циклы редактирования и отладки. Для мультимодальных агентов это означает более быструю итерацию по скриншотам, документам и вызовам инструментов. Для частных локальных рабочих процессов лучшая энергоэффективность означает более полезный вывод на том же устройстве, более длительное время автономной работы и более реалистичный путь к помощникам, которые могут оставаться доступными в фоновом режиме, не обращаясь постоянно к облаку.

Почему этот релиз важен

По сравнению с Ternary Bonsai 27B, новая Ternary Bonsai 2 27B сократила разрыв в сохранении производительности по сравнению с полноточной моделью с 95% до более чем 98%. Это значительное улучшение, которое делает текущий релиз практически «без потерь». Это еще больше укрепляет мнение о том, что низкобитовые модели могут быть лучшим способом развертывания ИИ.

Это имеет последствия, выходящие далеко за рамки локального вывода. Низкобитовые модели могут изменить экономику и архитектуру систем ИИ на устройствах, рабочих станциях и в центрах обработки данных: размещение более крупных моделей в том же объеме памяти, обслуживание большего количества пользователей на том же оборудовании, снижение энергопотребления на один вывод и создание гибридных систем, которые динамически решают, что должно выполняться локально, а что — в облаке.

Вопрос будет все чаще заключаться не только в том, насколько способна модель, но и в том, сколько полезного интеллекта можно доставить в рамках заданного бюджета памяти, вычислений и питания. Если возможности могут продолжать масштабироваться при резком снижении этих требований, конверт развертывания для будущих моделей расширяется по всему стеку: от персональных устройств до крупномасштабных центров обработки данных.

Поддержка платформ

Bonsai 2 27B работает на графических процессорах NVIDIA через CUDA и на устройствах Apple (Mac, iPhone, iPad) через MLX с помощью пользовательских низкобитовых ядер. Веса модели доступны сегодня под лицензией Apache 2.0.

Полные технические подробности наших процессов сжатия, оценки и бенчмаркинга доступны в нашем .

Работа с нами

Мы работаем с командами над адаптацией моделей Bonsai к их приложениям, от пост-обучения на специфических для домена данных до оптимизации вывода для целевого оборудования. Если вы создаете продукты ИИ с жесткими требованиями к памяти, задержке или питанию, мы будем рады изучить, как Bonsai может помочь. Свяжитесь с нами по адресу contact@prismml.com.

Присоединяйтесь к нам

Prism возникла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google, при постоянной поддержке со стороны Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейронных сетей без ущерба для их способности к рассуждению.

Если вы хотите помочь в создании следующего поколения современного ИИ, мы будем рады услышать вас. Посетите нашу страницу вакансий.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от PrismML

Анонс Bonsai 27B: первая модель класса 27B, работающая на смартфоне
PrismML

Анонс Bonsai 27B: первая модель класса 27B, работающая на смартфоне