Кэширование промптов для MiniMax M3 на SambaCloud: как это работает

Источник: SambaNova•

Кэширование промптов для MiniMax M3 на SambaCloud: как это работает

Кэширование промптов, впервые представленное в SambaCloud с моделью MiniMax M2.7, теперь доступно для MiniMax M3. Когда запросы содержат стабильный префикс объемом не менее 4096 токенов, SambaCloud может загружать этот префикс из кэша вместо повторного вычисления, при этом не требуется вносить…

Кэширование промптов, впервые представленное в SambaCloud с моделью MiniMax M2.7, теперь доступно и для MiniMax M3. Когда запросы содержат стабильный префикс длиной не менее 4096 токенов, SambaCloud может использовать этот префикс из кэша вместо его повторного вычисления, при этом изменения в коде не требуются. Кэшированные токены тарифицируются со скидкой 90% от стандартной стоимости входных данных, а при контексте от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают время до получения первого токена (TTFT) на 35–88%.

Коротко о главном

  • Кэширование промптов теперь доступно для MiniMax M3 на SambaCloud. Это означает, что когда агенты повторно отправляют один и тот же длинный контекст (например, репозиторий, набор научных статей или фиксированный список определений инструментов) и префикс считывается из кэша, заново обрабатываются только новые токены.

Кэширование промптов теперь доступно для MiniMax M3 на SambaCloud. Это означает, что когда агенты повторно отправляют один и тот же длинный контекст (например, репозиторий, набор научных статей или фиксированный список определений инструментов) и префикс считывается из кэша, заново обрабатываются только новые токены.

  • Функция работает на базе автоматического кэширования префиксов (Automatic Prefix Caching) и не требует настройки: префиксы длиной от 4096 токенов подходят для кэширования (максимальный объем — 192 000 токенов), а при стабильном трафике частота попаданий в кэш обычно превышает 90%.

Функция работает на базе автоматического кэширования префиксов (Automatic Prefix Caching) и не требует настройки: префиксы длиной от 4096 токенов подходят для кэширования (максимальный объем — 192 000 токенов), а при стабильном трафике частота попаданий в кэш обычно превышает 90%.

  • При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают TTFT на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза: время TTFT при 192 тыс. токенов сокращается с 8,4 до 1,0 секунды.

При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают TTFT на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза: время TTFT при 192 тыс. токенов сокращается с 8,4 до 1,0 секунды.

  • Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных: $0,06 за миллион токенов вместо $0,60.

Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных: $0,06 за миллион токенов вместо $0,60.

  • Каждый ответ содержит объект prompt_tokens_details с полями cached_tokens и cache_creation_tokens, что позволяет точно узнать, сколько токенов было получено из кэша.

Каждый ответ содержит объект prompt_tokens_details с полями cached_tokens и cache_creation_tokens, что позволяет точно узнать, сколько токенов было получено из кэша.

Почему кэширование промптов особенно важно для MiniMax M3

MiniMax M3 создана для агентов, работающих с большими объемами данных. Контекстное окно в 1 млн токенов, работающее на базе MiniMax Sparse Attention, позволяет поместить в один запрос целые репозитории, логи работы агента за несколько дней и полные научные статьи. Именно для таких длинных повторяющихся контекстов кэширование промптов дает наибольший эффект. Кэширование охватывает префиксы до 192 000 токенов, и в рамках этого лимита, чем длиннее стабильный префикс, тем большая часть каждого запроса может быть получена из кэша, а не вычислена заново.

Рассмотрим, как выглядит цикл работы агента M3 в продакшене:

  • Агент для написания кода, который один раз загружает репозиторий, а затем выполняет десятки или сотни итераций редактирования и тестирования.
  • Исследовательский ассистент, который удерживает в контексте набор статей и отвечает на поток вопросов по ним.
  • Агент для работы с компьютером, который использует одни и те же инструкции и определения инструментов на каждом этапе длительной задачи.

Без кэширования каждая такая итерация заново обрабатывает весь контекст. С кэшированием заново обрабатываются только новые токены — последнее сообщение пользователя или результат работы инструмента. В продакшене агентские рабочие нагрузки обычно демонстрируют частоту попаданий в кэш около 90% в среднем, согласно industry estimates.

Кэширование промптов в SambaCloud работает на основе автоматического кэширования префиксов. Когда начальные токены нового запроса совпадают с префиксом, который мы недавно обрабатывали, мы берем эти токены из кэша, а не вычисляем их повторно. От вас не требуется ничего, кроме поддержания стабильности префикса.

Как максимизировать попадания в кэш:

  • Размещайте стабильный контент в начале. Системный промпт, документы, примеры и определения инструментов должны идти первыми; изменяемые части — в конце.
  • Следите за тем, чтобы префикс был идентичен на уровне байтов. Перефразирование системного промпта, вставка сообщения перед ним или изменение порядка контента приведет к созданию новой записи в кэше. Изменение только сообщения пользователя позволяет повторно использовать кэшированный префикс.

Первые несколько запросов наполняют кэш; экономия растет по мере повторного использования префикса. При стабильном трафике частота попаданий обычно превышает 90%.

Что кэширование промптов дает в плане задержки

При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают время до получения первого токена (TTFT) на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза. При 192 тыс. токенов TTFT сокращается с 8,4 до 1,0 секунды.

Что это значит для вашего счета

Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных.

Как увидеть это в ответе

Каждый ответ включает объект prompt_tokens_details:

cached_tokens — это количество токенов, полученных из кэша и тарифицируемых по сниженной ставке. cache_creation_tokens не равно нулю в запросе, который создает запись в кэше, и равно нулю при последующих попаданиях; это поле носит информационный характер и не влечет дополнительных расходов. prompt_tokens − cached_tokens — это то, что было обработано как новые данные.

Полезно знать

  • Кэширование промптов доступно для MiniMax M3. Другие модели возвращают cached_tokens: 0.
  • Состояние кэша локально для каждого узла обслуживания; в развертываниях с несколькими экземплярами префикс кэшируется независимо на каждом узле.
  • Вытеснение происходит по алгоритму LRU и зависит от нагрузки. Постоянство кэша не гарантируется, поэтому время жизни конкретного префикса зависит от трафика.

Начало работы с кэшированием промптов на MiniMax M3

Если ваша рабочая нагрузка предполагает многократную отправку одного и того же длинного контекста, кэширование на M3 уже работает для вас. Проверьте prompt_tokens_details в следующем ответе, чтобы убедиться в этом. Полная информация доступна в документации по кэшированию промптов.

Впервые в SambaCloud? Изучите MiniMax M3 в песочнице или создайте API-ключ и начните разработку.

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от SambaNova