Сегодня мы официально представляем модель DeepSeek V4.1 Flash. Это самая компактная модель в нашей новой серии архитектур, обладающая нативными возможностями мультимодального визуального понимания. Новая архитектура изначально проектировалась с расчетом на более высокий верхний предел возможностей, повышенную скорость инференса, увеличенную пропускную способность и возможность масштабирования до моделей с еще большим количеством параметров.
DeepSeek V4.1 Flash представляет собой MoE-модель с 552 млрд параметров, в которой используется принципиально новая структура Causal-Encoder-Decoder. Входные и выходные данные асимметричны: активация на входе составляет всего 8 млрд параметров, а на выходе — 16 млрд, что существенно снижает затраты по сравнению с известными моделями аналогичного размера. Кроме того, в V4.1 Flash задействованы новые методы предварительного обучения и масштабного посткастового обучения с подкреплением, благодаря чему в бенчмарках модель успешно превзошла по уровню интеллекта целый ряд флагманских моделей, включая DeepSeek V4 Pro.
Сравнение производительности DeepSeek-V4.1-Flash с ведущими передовыми моделями на бенчмарке Agentic Benchmark
Модель нового поколения значительно уменьшила размер кэша KV Cache: по сравнению с предыдущим поколением потребность в памяти HBM сократилась в 4 раза, а в SSD — в 8 раз. В сценариях использования агентов расходы на попадание в кэш часто составляют значительную долю, поэтому сжатие KV Cache существенно снизило стоимость выполнения задач агентного типа.
На рисунке показан непрерывный прогресс DeepSeek в сокращении объема хранения контекста. По сравнению с моделями первого поколения размер KV Cache уменьшился в 437 раз.
DeepSeek V4.1 Flash одновременно стала доступна через DeepSeek API с нативной поддержкой мультимодальности. Чтобы вызвать новейшую модель V4.1 Flash, просто измените название модели на deepseek-flash. Предыдущие версии V4 Flash и V4 Flash Vision Exp теперь выведены из эксплуатации. В целях совместимости названия моделей deepseek-v4-flash и deepseek-v4-flash-vision-exp будут временно перенаправляться на V4.1 Flash.
В то же время, по результатам многочисленных тестов, V4.1 Flash полностью превзошла DeepSeek V4 Pro по всем ключевым показателям — производительности, стоимости, скорости и общему времени выполнения, поэтому мы планируем поэтапный вывод модели V4 Pro из эксплуатации. После 12:00 по пекинскому времени 14 сентября 2026 года и до выхода в будущем V4.1 Pro все запросы пользователей к deepseek-v4-pro будут полностью перенаправляться на V4.1 Flash и тарифицироваться по ее цене.
WorkBuddy (включая CodeBuddy) и OpenCode в качестве официальных партнеров теперь полностью интегрировали DeepSeek V4.1 Flash. Приглашаем к использованию!
Изменение цен на API
Благодаря инновациям в архитектуре модели, DeepSeek V4.1 Flash способна обслуживать еще больше пользователей с меньшими затратами, в связи с чем мы соответствующим образом снизили цены на V4.1 Flash. Кроме того, для более эффективного распределения ресурсов мы по-прежнему используем дифференцированное ценообразование в часы пик и вне пиковых нагрузок: цена в часы наименьшей нагрузки составляет половину от стоимости в часы пик, что побуждает пользователей корректировать расписание задач в соответствии с реальными условиями использования. Новые цены вступают в силу 10 сентября 2026 года в 12:00.
Мы окажем всестороннюю поддержку сообществу открытого кода в реализации инференса для новой модели и постараемся расширить масштабы ее развертывания различными способами. Если у вас есть потребность в крупномасштабном развертывании и необходимые для этого ресурсы (кластер графических процессоров от 2 тыс. карт и система хранения данных), пожалуйста, свяжитесь с нами.









