Кэширование промптов, впервые представленное в SambaCloud с моделью MiniMax M2.7, теперь доступно и для MiniMax M3. Когда запросы содержат стабильный префикс длиной не менее 4096 токенов, SambaCloud может использовать этот префикс из кэша вместо его повторного вычисления, при этом изменения в коде не требуются. Кэшированные токены тарифицируются со скидкой 90% от стандартной стоимости входных данных, а при контексте от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают время до получения первого токена (TTFT) на 35–88%.
Коротко о главном
- Кэширование промптов теперь доступно для MiniMax M3 на SambaCloud. Это означает, что когда агенты повторно отправляют один и тот же длинный контекст (например, репозиторий, набор научных статей или фиксированный список определений инструментов) и префикс считывается из кэша, заново обрабатываются только новые токены.
Кэширование промптов теперь доступно для MiniMax M3 на SambaCloud. Это означает, что когда агенты повторно отправляют один и тот же длинный контекст (например, репозиторий, набор научных статей или фиксированный список определений инструментов) и префикс считывается из кэша, заново обрабатываются только новые токены.
- Функция работает на базе автоматического кэширования префиксов (Automatic Prefix Caching) и не требует настройки: префиксы длиной от 4096 токенов подходят для кэширования (максимальный объем — 192 000 токенов), а при стабильном трафике частота попаданий в кэш обычно превышает 90%.
Функция работает на базе автоматического кэширования префиксов (Automatic Prefix Caching) и не требует настройки: префиксы длиной от 4096 токенов подходят для кэширования (максимальный объем — 192 000 токенов), а при стабильном трафике частота попаданий в кэш обычно превышает 90%.
- При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают TTFT на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза: время TTFT при 192 тыс. токенов сокращается с 8,4 до 1,0 секунды.
При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают TTFT на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза: время TTFT при 192 тыс. токенов сокращается с 8,4 до 1,0 секунды.
- Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных: $0,06 за миллион токенов вместо $0,60.
Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных: $0,06 за миллион токенов вместо $0,60.
- Каждый ответ содержит объект prompt_tokens_details с полями cached_tokens и cache_creation_tokens, что позволяет точно узнать, сколько токенов было получено из кэша.
Каждый ответ содержит объект prompt_tokens_details с полями cached_tokens и cache_creation_tokens, что позволяет точно узнать, сколько токенов было получено из кэша.
Почему кэширование промптов особенно важно для MiniMax M3
MiniMax M3 создана для агентов, работающих с большими объемами данных. Контекстное окно в 1 млн токенов, работающее на базе MiniMax Sparse Attention, позволяет поместить в один запрос целые репозитории, логи работы агента за несколько дней и полные научные статьи. Именно для таких длинных повторяющихся контекстов кэширование промптов дает наибольший эффект. Кэширование охватывает префиксы до 192 000 токенов, и в рамках этого лимита, чем длиннее стабильный префикс, тем большая часть каждого запроса может быть получена из кэша, а не вычислена заново.
Рассмотрим, как выглядит цикл работы агента M3 в продакшене:
- Агент для написания кода, который один раз загружает репозиторий, а затем выполняет десятки или сотни итераций редактирования и тестирования.
- Исследовательский ассистент, который удерживает в контексте набор статей и отвечает на поток вопросов по ним.
- Агент для работы с компьютером, который использует одни и те же инструкции и определения инструментов на каждом этапе длительной задачи.
Без кэширования каждая такая итерация заново обрабатывает весь контекст. С кэшированием заново обрабатываются только новые токены — последнее сообщение пользователя или результат работы инструмента. В продакшене агентские рабочие нагрузки обычно демонстрируют частоту попаданий в кэш около 90% в среднем, согласно industry estimates.
Кэширование промптов в SambaCloud работает на основе автоматического кэширования префиксов. Когда начальные токены нового запроса совпадают с префиксом, который мы недавно обрабатывали, мы берем эти токены из кэша, а не вычисляем их повторно. От вас не требуется ничего, кроме поддержания стабильности префикса.
Как максимизировать попадания в кэш:
- Размещайте стабильный контент в начале. Системный промпт, документы, примеры и определения инструментов должны идти первыми; изменяемые части — в конце.
- Следите за тем, чтобы префикс был идентичен на уровне байтов. Перефразирование системного промпта, вставка сообщения перед ним или изменение порядка контента приведет к созданию новой записи в кэше. Изменение только сообщения пользователя позволяет повторно использовать кэшированный префикс.
Первые несколько запросов наполняют кэш; экономия растет по мере повторного использования префикса. При стабильном трафике частота попаданий обычно превышает 90%.
Что кэширование промптов дает в плане задержки
При объеме контекста от 8 тыс. до 192 тыс. токенов попадания в кэш сокращают время до получения первого токена (TTFT) на 35% для коротких запросов и на 88% для длинных, что дает среднее ускорение в 4,7 раза. При 192 тыс. токенов TTFT сокращается с 8,4 до 1,0 секунды.
Что это значит для вашего счета
Кэшированные токены для MiniMax M3 тарифицируются со скидкой 90% от стандартной стоимости входных данных.
Как увидеть это в ответе
Каждый ответ включает объект prompt_tokens_details:
cached_tokens — это количество токенов, полученных из кэша и тарифицируемых по сниженной ставке. cache_creation_tokens не равно нулю в запросе, который создает запись в кэше, и равно нулю при последующих попаданиях; это поле носит информационный характер и не влечет дополнительных расходов. prompt_tokens − cached_tokens — это то, что было обработано как новые данные.
Полезно знать
- Кэширование промптов доступно для MiniMax M3. Другие модели возвращают cached_tokens: 0.
- Состояние кэша локально для каждого узла обслуживания; в развертываниях с несколькими экземплярами префикс кэшируется независимо на каждом узле.
- Вытеснение происходит по алгоритму LRU и зависит от нагрузки. Постоянство кэша не гарантируется, поэтому время жизни конкретного префикса зависит от трафика.
Начало работы с кэшированием промптов на MiniMax M3
Если ваша рабочая нагрузка предполагает многократную отправку одного и того же длинного контекста, кэширование на M3 уже работает для вас. Проверьте prompt_tokens_details в следующем ответе, чтобы убедиться в этом. Полная информация доступна в документации по кэшированию промптов.
Впервые в SambaCloud? Изучите MiniMax M3 в песочнице или создайте API-ключ и начните разработку.












