Сегодня Artificial Analysis провела бенчтестирование нашего API моделей для GLM-5, и мы достигли лучших в отрасли результатов как по времени до первого токена (TTFT), так и по количеству токенов в секунду (TPS).
[Скриншот бенчмарка Artificial Analysis: 200+ TPS, ~200 мс TTFT, первое место в таблице лидеров]
GLM-5 — это последняя флагманская модель Z.ai с открытыми весами, имеющая 744 млрд параметров в общей сложности и 40 млрд активных параметров на один проход вперед, обученная на 28,5 трлн токенов и выпущенная под лицензией MIT. На данный момент это самая мощная модель с открытым исходным кодом в мире по бенчмаркам программирования и агентских возможностей: 77.8 на SWE-bench Verified, 92.7% на AIME 2026 и 1-е место среди открытых моделей на Vending Bench 2.
Будучи моделью рассуждения, GLM-5 генерирует цепочку размышлений перед выдачей финального ответа, обменивая дополнительные вычислительные ресурсы инференса на более высокое качество. Из-за этого токены в секунду становятся важнейшим показателем для продакшн-развертывания: цепочка размышлений часто оказывается длиннее финального ответа, и пользователи ощущают каждую ее миллисекунду.
Чтобы запускать GLM-5 с рекордной скоростью, мы используем:
- Стек инференса Baseten с базовыми оптимизациями, включая маршрутизацию с учетом KV-кэша.
Стек инференса Baseten с базовыми оптимизациями, включая маршрутизацию с учетом KV-кэша.
- Оптимизированные ядра диспетчеризации MoE, настроенные под характерную для GLM-5 более глубокую, но узкую архитектуру.
Оптимизированные ядра диспетчеризации MoE, настроенные под характерную для GLM-5 более глубокую, но узкую архитектуру.
- Кастомные ядра, использующие разреженное внимание DeepSeek (Sparse Attention) для снижения затрат на KV-кэш при длинном контексте.
Кастомные ядра, использующие разреженное внимание DeepSeek (Sparse Attention) для снижения затрат на KV-кэш при длинном контексте.
- Низконакладный движок спекулятивного декодирования MTP, встроенный в стек инференса Baseten.
Низконакладный движок спекулятивного декодирования MTP, встроенный в стек инференса Baseten.
Архитектура GLM-5: что делает ее уникальной для обслуживания
GLM-5 разделяет свое происхождение MoE с DeepSeek V3, однако Z.ai пошла на осознанный архитектурный компромисс, который определяет всю серию GLM: больше слоев, меньший размер скрытого слоя. Модель стала глубже, но менее широкой.
Этот выбор имеет реальные последствия во время инференса. Большая глубина означает усиленное движение данных между слоями и более жесткие ограничения планирования для каждого прямого прохода. Более узкий скрытый размер изменяет объем вычислений на слой, и стандартные ядра MoE, оптимизированные под размерности DeepSeek V3, не выходят на свой оптимальный режим работы при запуске GLM-5. Для достижения максимальной утилизации требуется настройка под фактическую форму модели.
GLM-5 также впервые в семействе GLM интегрирует разреженное внимание DeepSeek (DSA), что существенно меняет профиль KV-кэша. А в части спекулятивного декодирования GLM-5 поставляется с нативными головами многотокенового прогнозирования (Multi-Token Prediction), что означает отсутствие необходимости обучать или хостить отдельную модель-драфт.
Каждое из этих трех проектных решений потребовало собственной оптимизации в нашем стеке.
Оптимизированные ядра MoE для более глубокой и узкой архитектуры
В моделях «Смесь экспертов» (MoE) диспетчеризация (маршрутизация токенов к нужным экспертам и сбор результатов) является одним из наиболее критичных к производительности этапов прямого прохода. Эффективность этой диспетчеризации сильно зависит от скрытой размерности и количества слоев модели.
Профиль GLM-5 существенно отличается от DeepSeek V3: более узкий размер скрытого слоя меняет арифметическую интенсивность вычислений экспертов, а дополнительное количество слоев усугубляет стоимость любой неэффективности на уровне слоев. Универсальные ядра MoE оставляют здесь часть производительности неиспользованной.
Наш стек инференса включает оптимизированные ядра MoE, профилированные и настроенные под конкретную архитектуру GLM-5. Это обеспечивает лучшую утилизацию GPU при каждом вызове эксперта, меньшие накладные расходы на диспетчеризацию на слой и для сотен слоев в целом.
Максимальная эффективность разреженного внимания DeepSeek
GLM-5 — первая модель GLM, в которую интегрировано разреженное внимание DeepSeek (DSA). DSA разреживает внимание по всей последовательности, драматически уменьшая объем KV-кэша при длинном контексте с сохранением полного контекстного окна в 200 тыс. токенов. Для агентских рабочих нагрузок, под которые создана GLM-5 (многошаговое использование инструментов, крупные кодовые базы, длительные сеансы агентов), это одно из самых важных архитектурных решений в модели.
Сложность заключается в том, что стандартные ядра внимания не используют паттерн разреженности. Наивная реализация возвращается к плотным путям внимания и теряет большую часть выигрыша в памяти. Чтобы раскрыть всю ценность DSA, стек инференса должен явно учитывать эту разреженную структуру.
Наши ядра созданы для прямого использования паттерна DSA. В результате запросы с длинным контекстом выполняются быстро и эффективно с точки зрения памяти, что означает бóльшие размеры батчей, лучшую пропускную способность под нагрузкой и более качественный опыт для пользователей, запускающих GLM-5 в глубоких агентских рабочих процессах, для которых она и была создана.
Низконакладное спекулятивное декодирование MTP
Спекулятивное декодирование — самый эффективный способ увеличить количество токенов в секунду без ущерба для качества. Базовый принцип: дешево генерировать токены-кандидаты с помощью модели-черновика (драфта), а затем параллельно проверять их целевой моделью. Когда целевая модель принимает черровые токены, вы получаете несколько токенов по цене одного прямого прохода.
Для такой крупной модели, как GLM-5, типичная проблема заключается в отсутствии меньшей модели из того же семейства, которую можно было бы использовать в качестве черновика, а обучение кастомного спекулятора требует времени. GLM-5 полностью обходит это ограничение благодаря поставке с нативными головами многотокенового прогнозирования (MTP), встроенными непосредственно в архитектуру модели. Токены-черновики поступают из той же модели с минимальным добавлением весов.
Минимальные накладные расходы — ключевая фраза. Спекуляции MTP эффективны только в том случае, если затраты на стороне хоста на управление черровыми токенами не съедают прирост пропускной способности. Наш движок спекулятивного декодирования создан специально для обеспечения низких накладных расходов на MTP: он тесно интегрирует планирование черновиков в цикл инференса, поддерживает легковесную координацию на стороне хоста и обеспечивает высокие показатели принятия токенов для разнообразных рабочих нагрузок, таких как генерация кода, долгосрочные рассуждения и использование агентских инструментов, под которые оптимизирована GLM-5.
Для модели рассуждений, способной генерировать десятки тысяч токенов размышлений перед выдачей финального ответа, более высокий показатель TPS напрямую и линейно преобразуется в более быстрое время отклика от начала до конца.
[График: ????]
Создание приложений с помощью самого быстрого GLM-5
Достижение отличных результатов в бенчмарках приносит удовлетворение, но мы оцениваем свою работу по тому, что она позволяет создавать нашим клиентам.
GLM-5 создана специально для сложной системной инженерии и долгосрочных агентских задач. Набрав 77.8 баллов на SWE-bench Verified, она приближается к Claude Opus 4.5 в области программной инженерии, а при скорости более 200 токенов в секунду на Baseten приложения на базе GLM-5 работают значительно быстрее Claude, оставаясь при этом полностью открытыми по весам под лицензией MIT.
Независимо от того, запускаете ли вы автономных агентов-программировщиков, создаете конвейеры многошагового использования инструментов или выпускаете любой продукт, требующий интеллекта передового уровня на производственной скорости, попробуйте GLM-5 на Baseten, чтобы получить лучшую в отрасли пропускную способность на самой мощной открытой модели в мире.











