Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Deepseek v41 flash bolee effektivnyy prefill dlya agentov programmirovaniya
Dev48

© 2026 · All rights reserved.

DeepSeek-V4.1-Flash: более эффективный префилл для агентов программирования

Источник: Baseten

DeepSeek-V4.1-Flash: более эффективный префилл для агентов программирования

Источник: Baseten

Узнайте о DeepSeek-V4.1-Flash, мультимодальной MoE-модели с 552 млрд параметров, использующей архитектуру Causal Encoder-Decoder и эффективное кэширование KV.

25 сентября 2026 г.

На этой неделе DeepSeek выпустила открытые веса DeepSeek-V4.1-Flash на HuggingFace, и модель уже доступна через API моделей Baseten (поддержка Loops появится в ближайшее время). Ключевые спецификации включают:

  • 552 млрд общего числа параметров

552 млрд общего числа параметров

  • 8 млрд активных параметров для префилла, 16 млрд для генерации

8 млрд активных параметров для префилла, 16 млрд для генерации

  • Контекстное окно на 1 млн токенов

Контекстное окно на 1 млн токенов

  • Мультимодальный ввод (текст + изображение), текстовый вывод

Мультимодальный ввод (текст + изображение), текстовый вывод

Популяризированное серией Gemini от Google, обозначение "flash" описывает более легкие и дешевые модели, разработанные для достижения производительности, сравнимой с более крупными аналогами. V4.1-Flash знаменует собой третий релиз модели типа flash с открытыми весами от DeepSeek в этом году, присоединяясь к недавним предложениям от Z.ai и Alibaba, поскольку исследовательские лаборатории предоставляют более высокий уровень интеллекта по более низким ценам для рабочих нагрузок агентов программирования.

Сравнение моделей DeepSeek: старые и новые версии

DeepSeek V4.1-Flash демонстрирует улучшения по сравнению с моделями V4-Flash и V4-Pro как в текстовых, так и в мультимодальных возможностях.

В бенчмарках по программированию и агентским задачам V4.1-Flash превосходит V4-Pro, имея примерно треть от общего числа параметров. Наибольший прирост наблюдается в долгосрочных агентских задачах, где улучшение исчисляется двузначными числами, в то время как одношаговые задачи командной строки улучшаются более скромно. Прирост реален, но результат 54.8 на Automation-Bench означает, что модель терпит неудачу примерно в половине сложных рабочих процессов. Держите человека в контуре управления для агентских пайплайнов.

Взято из карточки модели HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash *Высший балл составляет 100 для всех указанных бенчмарков.

V4.1-Flash — первая неэкспериментальная модель DeepSeek с нативной поддержкой ввода изображений, которая ранее была ограничена V4-Flash-Vision-Exp. В этом поколении также улучшилось визуальное рассуждение, особенно в интерпретации графиков и логических рассуждениях по изображениям, что полезно, если вы передаете ей скриншоты, панели мониторинга или макеты пользовательского интерфейса. Тем не менее, показатель ZeroBench все еще не дотягивает до 50, и при таком уровне вам все равно понадобится человек, проверяющий рассуждения на основе изображений для любых важных задач.

Взято из карточки модели HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash-Vision-Exp *Высший балл составляет 100 для всех указанных бенчмарков.

DeepSeek вывела из эксплуатации модели V4-Flash на своей платформе и теперь перенаправляет их трафик на V4.1-Flash. Трафик V4-Pro также будет перенаправлен начиная с 14 сентября. Если вы используете любую модель DeepSeek V4, обновитесь до V4.1-Flash. Ее также стоит рассмотреть, если вы используете крупную универсальную модель от другой лаборатории и хотите получить более высокую и эффективную производительность в программировании и агентских задачах.

Асимметричные параметры активации для более эффективного использования вычислений

DeepSeek-V4.1-Flash — единственная модель своего масштаба, использующая архитектуру Causal Encoder-Decoder (CED).

Два ключевых этапа вычислений модели:

  • Префилл: чтение ввода

Префилл: чтение ввода

  • Генерация: создание вывода

Генерация: создание вывода

Другие MoE-модели активируют одинаковое количество параметров как для этапа префилла, так и для этапа генерации. CED разделяет 40 слоев V4.1-Flash на 2-слойный каузальный энкодер и 20-слойный декодер, а кэш KV декодера проецируется напрямую из вывода энкодера. Это означает, что для префилла нужно запускать только энкодер, активируя 8 млрд параметров на токен, в то время как генерация запускает всю модель на 16 млрд.

Идея заключается в том, что генерация вывода сложнее чтения ввода, поэтому вычисления отдают приоритет генерации, а не префиллу. Для сравнения, V4-Flash активирует 13 млрд как для префилла, так и для генерации, поэтому V4.1-Flash жертвует более тяжелой генерацией (16 млрд) ради гораздо более легкого префилла (8 млрд).

CED сокращает вычисления при префилле за счет остановки на энкодере и повторного использования спроецированного KV-кэша во время генерации.

Эта конфигурация повышает экономическую эффективность для агентов программирования, где агентские циклы генерируют гораздо больше токенов префилла, чем токенов генерации. Кроме того, поскольку состояния «ключ-значение» (key-value) декодера проецируются из вывода энкодера, а не вычисляются независимо в каждом слое, CED способствует значительному уменьшению KV-кэша, что снижает затраты на кэширование.

Дополнительная экономия за счет улучшений KV-кэша

По данным DeepSeek, глобальный KV-кэш V4.1-Flash требует всего четверть памяти по сравнению с кэшем V4-Flash. Архитектура CED вносит свой вклад, проецируя KV-кэш декодера из вывода энкодера, а не вычисляя его независимо. Она также работает в сочетании с двумя другими методами для дальнейшего уменьшения KV-кэша.

  • Compressed Sparse Attention 2: совместное использование элементов «ключ-значение» между слоями внимания

Compressed Sparse Attention 2: совместное использование элементов «ключ-значение» между слоями внимания

  • FP4 KV caching: хранение элементов «ключ-значение» с более низкой точностью.

FP4 KV caching: хранение элементов «ключ-значение» с более низкой точностью.

Глобальный KV-кэш DeepSeek-V4.1-Flash требует меньше памяти на токен.

Взято из статьи Представляем DeepSeek-V4.1-Flash: умнее, быстрее, эффективнее.

Меньший объем памяти на токен означает, что в кэш помещается больше контекста, что повышает коэффициент попаданий. Когда префикс промпта уже закэширован, модель пропускает повторное вычисление внимания для этих токенов, сокращая время до первого токена и увеличивая пропускную способность на один GPU. Агенты программирования получают от этого наибольшую выгоду, так как агентские циклы повторно отправляют практически один и тот же контекст на каждом шаге. Использование этого повтора в продакшене зависит от того, как запросы распределяются между GPU, и здесь в дело вступает стек обслуживания.

Инференс для DeepSeek-V4.1-Flash в продакшене

Стек инференса Baseten справляется с этой маршрутизацией с помощью NVIDIA Dynamo и маршрутизации с учетом KV-кэша, которые направляют каждый запрос на реплику, уже содержащую его префикс, а не на любую свободную реплику.

«Маршрутизация с учетом KV отправляет запросы на реплики, у которых уже закэширован соответствующий контекст, экономя время за счет предотвращения избыточных вычислений префилла».

Взято из статьи Двукратное ускорение инференса с маршрутизацией с учетом KV-кэша

Все это работает на базе API моделей Baseten, где DeepSeek-V4.1-Flash доступна уже сейчас. Попробуйте ее в нашей библиотеке моделей или свяжитесь с нами по поводу выделенного развертывания, если вашей команде необходимы зарезервированные мощности.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Waymo быстро масштабируется. Вот что показывают данные автопарка.Пресса
Waymo

Waymo быстро масштабируется. Вот что показывают данные автопарка.

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность
Пресса
OpenAI

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота
DataRobot

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота

Создание мультимодальных моделей для пространственного мышления
Lambda

Создание мультимодальных моделей для пространственного мышления

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботомПресса
ElevenLabs

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботом

Ещё от Baseten

LangChain обучает кастомные модели для LangSmith Engine с помощью Baseten Loops
Baseten

LangChain обучает кастомные модели для LangSmith Engine с помощью Baseten Loops

Представляем Baseten Hosted Tools
Baseten

Представляем Baseten Hosted Tools

NVIDIA Nemotron 3 Diarization: метки спикеров в реальном времени по цене один цент за час аудио
Baseten

NVIDIA Nemotron 3 Diarization: метки спикеров в реальном времени по цене один цент за час аудио

Дообучение на ваших трейсах LangSmith с помощью Baseten Loops
Baseten

Дообучение на ваших трейсах LangSmith с помощью Baseten Loops