Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Deepseek api predstavlyaet keshirovanie konteksta na diske snizhaya tseny na por
Dev48

© 2026 · All rights reserved.

DeepSeek API представляет кэширование контекста на диске, снижая цены на порядок

Источник: DeepSeek

DeepSeek API представляет кэширование контекста на диске, снижая цены на порядок

Источник: DeepSeek

При использовании API больших языковых моделей значительная часть пользовательских вводов часто повторяется. Например, запросы пользователей часто содержат повторяющиеся ссылки, а в многодиалоговых беседах предыдущий контент часто вводится заново.

25 сентября 2026 г.

При использовании API больших языковых моделей значительная часть пользовательских вводов часто повторяется. Например, запросы пользователей часто содержат повторяющиеся ссылки, а в многодиалоговых беседах предыдущий контент часто вводится заново.

Для решения этой проблемы компания DeepSeek внедрила технологию кэширования контекста на диске (Context Caching on Disk). Этот инновационный подход кэширует контент, который, как ожидается, будет использоваться повторно, в распределенном массиве дисков. При обнаружении дублирующихся вводов повторяющиеся части извлекаются из кэша, что исключает необходимость повторных вычислений. Это не только снижает задержку обслуживания, но и существенно сокращает общие затраты на использование.

При попадании в кэш DeepSeek взимает 0,014 доллара США за миллион токенов, что снижает затраты на API до 90%1.

Подсказка 1: Цена API была обновлена. Подробности см. в разделе «Модели и цены».

Как использовать службу кэширования DeepSeek API​

Служба кэширования на диске теперь доступна всем пользователям и не требует никаких изменений в коде или интерфейсе. Служба кэширования работает автоматически, а тарификация основана на фактических попаданиях в кэш.

Обратите внимание, что дубликатами будут считаться только запросы с идентичными префиксами (начиная с 0-го токена). Частичные совпадения в середине ввода не вызывают попадания в кэш.

Вот два классических сценария использования кэша:

1. Многодиалоговая беседа: следующий диалог может использовать кэш контекста, созданный предыдущим диалогом.

2. Анализ данных: последующие запросы с тем же префиксом могут использовать кэш контекста.

Выгодные сценарии для кэширования контекста на диске:

  • Ассистенты вопрос-ответ с длинными предустановленными промптами
  • Ролевые игры с обширными настройками персонажей и многодиалоговыми беседами
  • Анализ данных с повторяющимися запросами по одним и тем же документам/файлам
  • Анализ кода и отладка с повторяющимися ссылками на репозиторий
  • Улучшение производительности вывода модели с помощью обучения на малом количестве примеров (Few-shot learning).
  • ...

Для получения более подробных инструкций обратитесь к руководству «Использование кэширования контекста».

Мониторинг попаданий в кэш​

Два новых поля в разделе использования ответа API помогают пользователям отслеживать производительность кэша:

  • prompt_cache_hit_tokens: Количество токенов из ввода, которые были обслужены из кэша (0,014 доллара США за миллион токенов)
  • prompt_cache_miss_tokens: Количество токенов из ввода, которые не были обслужены из кэша (0,14 доллара США за миллион токенов)

Снижение задержки​

Задержка первого токена будет значительно уменьшена в запросах с длинными, повторяющимися вводами.

Для промпта на 128 КБ с высокой степенью цитирования задержка первого токена сокращается с 13 с до всего лишь 500 мс.

Снижение затрат​

Пользователи могут сэкономить до 90% средств благодаря оптимизации под характеристики кэша.

Даже без какой-либо оптимизации исторические данные показывают, что пользователи экономят в среднем более 50%.

Служба не имеет дополнительных комиссий, помимо 0,014 доллара США за миллион токенов за попадания в кэш, а использование хранилища для кэша бесплатно.

Вопросы безопасности​

Система кэширования разработана с использованием надежной стратегии безопасности.

Кэш каждого пользователя изолирован и логически невиди Sм для других, что обеспечивает конфиденциальность и безопасность данных.

Неиспользуемые элементы кэша автоматически очищаются по истечении определенного периода времени, что гарантирует их сохранение или повторное использование.

Почему DeepSeek лидирует в области дискового кэширования​

Судя по общедоступной информации, DeepSeek, судя по всему, является первым в мире провайдером больших языковых моделей, внедрившим масштабное дисковое кэширование в службах API.

Это стало возможным благодаря архитектуре MLA в DeepSeek V2, которая повышает производительность модели и одновременно значительно уменьшает размер кэша KV контекста, обеспечивая эффективное хранение на недорогих дисках.

Параллелизм и ограничения скорости DeepSeek API​

API DeepSeek разработан для обработки до 1 триллиона токенов в день без ограничений по параллелизму или скорости, что обеспечивает высокое качество обслуживания для всех пользователей. Не стесняйтесь масштабировать свой параллелизм.

Система кэширования использует 64 токена в качестве единицы хранения; контент размером менее 64 токенов кэшироваться не будет.

Система кэширования не гарантирует 100% попаданий в кэш.

Неиспользуемые элементы кэша автоматически очищаются, обычно в течение нескольких часов или дней.

← Все статьи