На этой неделе DeepSeek выпустила открытые веса DeepSeek-V4.1-Flash на HuggingFace, и модель уже доступна через API моделей Baseten (поддержка Loops появится в ближайшее время). Ключевые спецификации включают:
- 552 млрд общего числа параметров
552 млрд общего числа параметров
- 8 млрд активных параметров для префилла, 16 млрд для генерации
8 млрд активных параметров для префилла, 16 млрд для генерации
- Контекстное окно на 1 млн токенов
Контекстное окно на 1 млн токенов
- Мультимодальный ввод (текст + изображение), текстовый вывод
Мультимодальный ввод (текст + изображение), текстовый вывод
Популяризированное серией Gemini от Google, обозначение "flash" описывает более легкие и дешевые модели, разработанные для достижения производительности, сравнимой с более крупными аналогами. V4.1-Flash знаменует собой третий релиз модели типа flash с открытыми весами от DeepSeek в этом году, присоединяясь к недавним предложениям от Z.ai и Alibaba, поскольку исследовательские лаборатории предоставляют более высокий уровень интеллекта по более низким ценам для рабочих нагрузок агентов программирования.
Сравнение моделей DeepSeek: старые и новые версии
DeepSeek V4.1-Flash демонстрирует улучшения по сравнению с моделями V4-Flash и V4-Pro как в текстовых, так и в мультимодальных возможностях.
В бенчмарках по программированию и агентским задачам V4.1-Flash превосходит V4-Pro, имея примерно треть от общего числа параметров. Наибольший прирост наблюдается в долгосрочных агентских задачах, где улучшение исчисляется двузначными числами, в то время как одношаговые задачи командной строки улучшаются более скромно. Прирост реален, но результат 54.8 на Automation-Bench означает, что модель терпит неудачу примерно в половине сложных рабочих процессов. Держите человека в контуре управления для агентских пайплайнов.
Взято из карточки модели HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash *Высший балл составляет 100 для всех указанных бенчмарков.
V4.1-Flash — первая неэкспериментальная модель DeepSeek с нативной поддержкой ввода изображений, которая ранее была ограничена V4-Flash-Vision-Exp. В этом поколении также улучшилось визуальное рассуждение, особенно в интерпретации графиков и логических рассуждениях по изображениям, что полезно, если вы передаете ей скриншоты, панели мониторинга или макеты пользовательского интерфейса. Тем не менее, показатель ZeroBench все еще не дотягивает до 50, и при таком уровне вам все равно понадобится человек, проверяющий рассуждения на основе изображений для любых важных задач.
Взято из карточки модели HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash-Vision-Exp *Высший балл составляет 100 для всех указанных бенчмарков.
DeepSeek вывела из эксплуатации модели V4-Flash на своей платформе и теперь перенаправляет их трафик на V4.1-Flash. Трафик V4-Pro также будет перенаправлен начиная с 14 сентября. Если вы используете любую модель DeepSeek V4, обновитесь до V4.1-Flash. Ее также стоит рассмотреть, если вы используете крупную универсальную модель от другой лаборатории и хотите получить более высокую и эффективную производительность в программировании и агентских задачах.
Асимметричные параметры активации для более эффективного использования вычислений
DeepSeek-V4.1-Flash — единственная модель своего масштаба, использующая архитектуру Causal Encoder-Decoder (CED).
Два ключевых этапа вычислений модели:
- Префилл: чтение ввода
Префилл: чтение ввода
- Генерация: создание вывода
Генерация: создание вывода
Другие MoE-модели активируют одинаковое количество параметров как для этапа префилла, так и для этапа генерации. CED разделяет 40 слоев V4.1-Flash на 2-слойный каузальный энкодер и 20-слойный декодер, а кэш KV декодера проецируется напрямую из вывода энкодера. Это означает, что для префилла нужно запускать только энкодер, активируя 8 млрд параметров на токен, в то время как генерация запускает всю модель на 16 млрд.
Идея заключается в том, что генерация вывода сложнее чтения ввода, поэтому вычисления отдают приоритет генерации, а не префиллу. Для сравнения, V4-Flash активирует 13 млрд как для префилла, так и для генерации, поэтому V4.1-Flash жертвует более тяжелой генерацией (16 млрд) ради гораздо более легкого префилла (8 млрд).
CED сокращает вычисления при префилле за счет остановки на энкодере и повторного использования спроецированного KV-кэша во время генерации.
Эта конфигурация повышает экономическую эффективность для агентов программирования, где агентские циклы генерируют гораздо больше токенов префилла, чем токенов генерации. Кроме того, поскольку состояния «ключ-значение» (key-value) декодера проецируются из вывода энкодера, а не вычисляются независимо в каждом слое, CED способствует значительному уменьшению KV-кэша, что снижает затраты на кэширование.
Дополнительная экономия за счет улучшений KV-кэша
По данным DeepSeek, глобальный KV-кэш V4.1-Flash требует всего четверть памяти по сравнению с кэшем V4-Flash. Архитектура CED вносит свой вклад, проецируя KV-кэш декодера из вывода энкодера, а не вычисляя его независимо. Она также работает в сочетании с двумя другими методами для дальнейшего уменьшения KV-кэша.
- Compressed Sparse Attention 2: совместное использование элементов «ключ-значение» между слоями внимания
Compressed Sparse Attention 2: совместное использование элементов «ключ-значение» между слоями внимания
- FP4 KV caching: хранение элементов «ключ-значение» с более низкой точностью.
FP4 KV caching: хранение элементов «ключ-значение» с более низкой точностью.
Глобальный KV-кэш DeepSeek-V4.1-Flash требует меньше памяти на токен.
Взято из статьи Представляем DeepSeek-V4.1-Flash: умнее, быстрее, эффективнее.
Меньший объем памяти на токен означает, что в кэш помещается больше контекста, что повышает коэффициент попаданий. Когда префикс промпта уже закэширован, модель пропускает повторное вычисление внимания для этих токенов, сокращая время до первого токена и увеличивая пропускную способность на один GPU. Агенты программирования получают от этого наибольшую выгоду, так как агентские циклы повторно отправляют практически один и тот же контекст на каждом шаге. Использование этого повтора в продакшене зависит от того, как запросы распределяются между GPU, и здесь в дело вступает стек обслуживания.
Инференс для DeepSeek-V4.1-Flash в продакшене
Стек инференса Baseten справляется с этой маршрутизацией с помощью NVIDIA Dynamo и маршрутизации с учетом KV-кэша, которые направляют каждый запрос на реплику, уже содержащую его префикс, а не на любую свободную реплику.
«Маршрутизация с учетом KV отправляет запросы на реплики, у которых уже закэширован соответствующий контекст, экономя время за счет предотвращения избыточных вычислений префилла».
Взято из статьи Двукратное ускорение инференса с маршрутизацией с учетом KV-кэша
Все это работает на базе API моделей Baseten, где DeepSeek-V4.1-Flash доступна уже сейчас. Попробуйте ее в нашей библиотеке моделей или свяжитесь с нами по поводу выделенного развертывания, если вашей команде необходимы зарезервированные мощности.










