Как мы создали самый быстрый GLM-5 на Artificial Analysis

Источник: Baseten

Как мы создали самый быстрый GLM-5 на Artificial Analysis

Источник: Baseten

Мы достигли более 200 токенов в секунду на GLM-5.

•Обновлено: 3 октября 2026 г.

Сегодня Artificial Analysis провела бенчтестирование нашего API моделей для GLM-5, и мы достигли лучших в отрасли результатов как по времени до первого токена (TTFT), так и по количеству токенов в секунду (TPS).

[Скриншот бенчмарка Artificial Analysis: 200+ TPS, ~200 мс TTFT, первое место в таблице лидеров]

GLM-5 — это последняя флагманская модель Z.ai с открытыми весами, имеющая 744 млрд параметров в общей сложности и 40 млрд активных параметров на один проход вперед, обученная на 28,5 трлн токенов и выпущенная под лицензией MIT. На данный момент это самая мощная модель с открытым исходным кодом в мире по бенчмаркам программирования и агентских возможностей: 77.8 на SWE-bench Verified, 92.7% на AIME 2026 и 1-е место среди открытых моделей на Vending Bench 2.

Будучи моделью рассуждения, GLM-5 генерирует цепочку размышлений перед выдачей финального ответа, обменивая дополнительные вычислительные ресурсы инференса на более высокое качество. Из-за этого токены в секунду становятся важнейшим показателем для продакшн-развертывания: цепочка размышлений часто оказывается длиннее финального ответа, и пользователи ощущают каждую ее миллисекунду.

Чтобы запускать GLM-5 с рекордной скоростью, мы используем:

  • Стек инференса Baseten с базовыми оптимизациями, включая маршрутизацию с учетом KV-кэша.

Стек инференса Baseten с базовыми оптимизациями, включая маршрутизацию с учетом KV-кэша.

  • Оптимизированные ядра диспетчеризации MoE, настроенные под характерную для GLM-5 более глубокую, но узкую архитектуру.

Оптимизированные ядра диспетчеризации MoE, настроенные под характерную для GLM-5 более глубокую, но узкую архитектуру.

  • Кастомные ядра, использующие разреженное внимание DeepSeek (Sparse Attention) для снижения затрат на KV-кэш при длинном контексте.

Кастомные ядра, использующие разреженное внимание DeepSeek (Sparse Attention) для снижения затрат на KV-кэш при длинном контексте.

  • Низконакладный движок спекулятивного декодирования MTP, встроенный в стек инференса Baseten.

Низконакладный движок спекулятивного декодирования MTP, встроенный в стек инференса Baseten.

Архитектура GLM-5: что делает ее уникальной для обслуживания

GLM-5 разделяет свое происхождение MoE с DeepSeek V3, однако Z.ai пошла на осознанный архитектурный компромисс, который определяет всю серию GLM: больше слоев, меньший размер скрытого слоя. Модель стала глубже, но менее широкой.

Этот выбор имеет реальные последствия во время инференса. Большая глубина означает усиленное движение данных между слоями и более жесткие ограничения планирования для каждого прямого прохода. Более узкий скрытый размер изменяет объем вычислений на слой, и стандартные ядра MoE, оптимизированные под размерности DeepSeek V3, не выходят на свой оптимальный режим работы при запуске GLM-5. Для достижения максимальной утилизации требуется настройка под фактическую форму модели.

GLM-5 также впервые в семействе GLM интегрирует разреженное внимание DeepSeek (DSA), что существенно меняет профиль KV-кэша. А в части спекулятивного декодирования GLM-5 поставляется с нативными головами многотокенового прогнозирования (Multi-Token Prediction), что означает отсутствие необходимости обучать или хостить отдельную модель-драфт.

Каждое из этих трех проектных решений потребовало собственной оптимизации в нашем стеке.

Оптимизированные ядра MoE для более глубокой и узкой архитектуры

В моделях «Смесь экспертов» (MoE) диспетчеризация (маршрутизация токенов к нужным экспертам и сбор результатов) является одним из наиболее критичных к производительности этапов прямого прохода. Эффективность этой диспетчеризации сильно зависит от скрытой размерности и количества слоев модели.

Профиль GLM-5 существенно отличается от DeepSeek V3: более узкий размер скрытого слоя меняет арифметическую интенсивность вычислений экспертов, а дополнительное количество слоев усугубляет стоимость любой неэффективности на уровне слоев. Универсальные ядра MoE оставляют здесь часть производительности неиспользованной.

Наш стек инференса включает оптимизированные ядра MoE, профилированные и настроенные под конкретную архитектуру GLM-5. Это обеспечивает лучшую утилизацию GPU при каждом вызове эксперта, меньшие накладные расходы на диспетчеризацию на слой и для сотен слоев в целом.

Максимальная эффективность разреженного внимания DeepSeek

GLM-5 — первая модель GLM, в которую интегрировано разреженное внимание DeepSeek (DSA). DSA разреживает внимание по всей последовательности, драматически уменьшая объем KV-кэша при длинном контексте с сохранением полного контекстного окна в 200 тыс. токенов. Для агентских рабочих нагрузок, под которые создана GLM-5 (многошаговое использование инструментов, крупные кодовые базы, длительные сеансы агентов), это одно из самых важных архитектурных решений в модели.

Сложность заключается в том, что стандартные ядра внимания не используют паттерн разреженности. Наивная реализация возвращается к плотным путям внимания и теряет большую часть выигрыша в памяти. Чтобы раскрыть всю ценность DSA, стек инференса должен явно учитывать эту разреженную структуру.

Наши ядра созданы для прямого использования паттерна DSA. В результате запросы с длинным контекстом выполняются быстро и эффективно с точки зрения памяти, что означает бóльшие размеры батчей, лучшую пропускную способность под нагрузкой и более качественный опыт для пользователей, запускающих GLM-5 в глубоких агентских рабочих процессах, для которых она и была создана.

Низконакладное спекулятивное декодирование MTP

Спекулятивное декодирование — самый эффективный способ увеличить количество токенов в секунду без ущерба для качества. Базовый принцип: дешево генерировать токены-кандидаты с помощью модели-черновика (драфта), а затем параллельно проверять их целевой моделью. Когда целевая модель принимает черровые токены, вы получаете несколько токенов по цене одного прямого прохода.

Для такой крупной модели, как GLM-5, типичная проблема заключается в отсутствии меньшей модели из того же семейства, которую можно было бы использовать в качестве черновика, а обучение кастомного спекулятора требует времени. GLM-5 полностью обходит это ограничение благодаря поставке с нативными головами многотокенового прогнозирования (MTP), встроенными непосредственно в архитектуру модели. Токены-черновики поступают из той же модели с минимальным добавлением весов.

Минимальные накладные расходы — ключевая фраза. Спекуляции MTP эффективны только в том случае, если затраты на стороне хоста на управление черровыми токенами не съедают прирост пропускной способности. Наш движок спекулятивного декодирования создан специально для обеспечения низких накладных расходов на MTP: он тесно интегрирует планирование черновиков в цикл инференса, поддерживает легковесную координацию на стороне хоста и обеспечивает высокие показатели принятия токенов для разнообразных рабочих нагрузок, таких как генерация кода, долгосрочные рассуждения и использование агентских инструментов, под которые оптимизирована GLM-5.

Для модели рассуждений, способной генерировать десятки тысяч токенов размышлений перед выдачей финального ответа, более высокий показатель TPS напрямую и линейно преобразуется в более быстрое время отклика от начала до конца.

[График: ????]

Создание приложений с помощью самого быстрого GLM-5

Достижение отличных результатов в бенчмарках приносит удовлетворение, но мы оцениваем свою работу по тому, что она позволяет создавать нашим клиентам.

GLM-5 создана специально для сложной системной инженерии и долгосрочных агентских задач. Набрав 77.8 баллов на SWE-bench Verified, она приближается к Claude Opus 4.5 в области программной инженерии, а при скорости более 200 токенов в секунду на Baseten приложения на базе GLM-5 работают значительно быстрее Claude, оставаясь при этом полностью открытыми по весам под лицензией MIT.

Независимо от того, запускаете ли вы автономных агентов-программировщиков, создаете конвейеры многошагового использования инструментов или выпускаете любой продукт, требующий интеллекта передового уровня на производственной скорости, попробуйте GLM-5 на Baseten, чтобы получить лучшую в отрасли пропускную способность на самой мощной открытой модели в мире.

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Baseten