Блог
Вы умножили количество токенов на тарифную ставку и получили число. Но счет с этим не согласен. Вот пять пробелов, каждый из которых измерим, а не утвержден, в порядке, в котором они стоят вам денег.
От команды Unbiased AI · опубликовано 25 августа 2026 · все цифры измерены нами и датированы на месте; тарифы проверены 25 августа 2026 года
96%
разница в счете между двумя моделями на идентичной тарифной сетке, измеренная на одних и тех же запросах
2,6x
сколько кэширование стоило нашей измеряемой сессии агента: 0,59 доллара с ним, 1,54 доллара без него
78x
токены, которые наша измеряемая сессия агента прочитала по сравнению с теми, которые она записала. Счет идет за контекст, а не за ответы
Арифметика тарифной сетки упускает пять измеримых вещей: модели выдают разное количество токенов за одинаковую работу, токенизатор изменился между поколениями моделей, поэтому токены не являются сопоставимыми, кэшированные чтения оплачиваются по доле от ставок ввода, неудачные дешевые запуски оплачиваются дважды, а комиссионные платформы применяются к другой базе, чем токены.
Пробел 1: одинаковая работа не является одинаковыми токенами
Две модели могут использовать одну и ту же тарифную сетку и выдавать разные счета, потому что вы платите за токены, а модели не одинаково многословны. В нашей шеститестовой батарее Opus 5 и Opus 4.8 оба имеют счет $5 за ввод и $25 за вывод на миллион токенов, и батарея стоила $0,2243 на одной и $0,1146 на другой: разница в 96%, которую никакая страница с ценами не может вам показать.
Это измеримо, и мы публикуем это ежемесячно как Индекс Избыточности. Если вы замените модели на идентичной тарифной сетке и ваш счет изменится, это обычно происходит по этой причине.
Переносимые символы на один выходной токен
Claude Haiku 4.53.409
Claude Opus 4.82.294
Claude Fable 5.12.292
Claude Fable 52.191
Claude Sonnet 52.047
Claude Opus 52.034
Выше означает, что каждый выставленный токен несет больше текста, поэтому тот же ответ стоит меньше токенов. Выделенная модель — это та, которая все еще использует предыдущий токенизатор. Измерено на той же шеститестовой батарее, 2026-08-25.
Пробел 2: единица измерения изменилась
Это новее, и почти никто не учел это в своих ценах. Документация Anthropic гласит, что модели Claude 4.7 и более поздние используют новый токенизатор, который выдает «примерно на 30% больше токенов для того же текста». Мы измерили эффект на нашей собственной батарее: 3,409 символов на выставленный токен на предыдущем токенизаторе против 2,172 на новом, или 57,0% больше текста на токен у старого поколения.
Интерпретируйте это как счет за услуги, а не как техническую сноску. Если вы построили модель затрат на основе модели до 4.7 и перешли к текущей, то та же проза теперь стоит больше токенов при той же цене за токен. Ваша таблица не была неверной; единица измерения под ней изменилась.
Вышеуказанная диаграмма — это измерение по каждой модели. Это причина, по которой мы теперь публикуем индекс символов рядом с индексом токенов.
Пробел 3: чтение из кэша стоит по-разному
Кэшированный ввод оплачивается примерно в десять раз дешевле, чем ставка ввода, на большинстве моделей, а Fable 5.1 идет еще дальше — 0,025x, что составляет 0,25 доллара за миллион против базовой ставки в 10 долларов. Любая арифметика, которая оценивает весь ввод по базовой ставке, сильно переоценивает хорошо закэшированную нагрузку и недооценивает изменчивую нагрузку.
Наше опубликованное измерение сессии агента: пять API-вызовов для исправления одной ошибки, 0,5887 доллара измерено с кэшированием, 1,54 доллара переоценено без него. Разница в 2,6x, которая полностью зависит от того, стабильна ли ваша префикс-запроса, и это самый большой рычаг на счету агента.
Пробел 4: неудача оплачивается дважды
Арифметика тарифной сетки предполагает, что каждый вызов успешен. Дешевые уровни чаще терпят неудачи при сложной работе, и неудачный дешевый запуск не бесплатен, это дешевый запуск плюс дорогой повторный запуск плюс время на проверку. При 15% уровне неудач модель с объемным уровнем и путем эскалации может стоить больше за выполненную задачу, чем передовая модель, которую вы избегали.
Число, которое нужно модели, — это стоимость за выполненную задачу, а не стоимость за вызов. Если вы не знаете свой уровень неудач по классам задач, это измерение, которое нужно принять, прежде чем оптимизировать что-либо еще.
Пробел 5: комиссии применяются к другой базе
Если вы маршрутизируете через шлюз, комиссия часто не взимается за токены. OpenRouter взимает 5,5% за покупки в кредит с минимальным порогом в 0,80 доллара, поэтому небольшой пополнение счета оплачивается по эффективной ставке, значительно превышающей 5,5%. Requesty наценка на токены составляет 5%. Portkey взимает фиксированную плату в размере 49 долларов в месяц, при этом токены выставляются напрямую. Три разные базы, три разных поведения по мере масштабирования.
Опубликованные эталонные показатели Pareto 26.9 находятся на карточке модели. Измеренные затраты на задачи и составной балл не были опубликованы для этого релиза.
Краткая версия
Цена за токен — это входная информация для вашего счета, а не предсказание его. Все пять вышеуказанных пробелов измеримы за полдня на вашем собственном трафике: измерьте свои три основные задачи на ваших кандидатских моделях, проверьте свой коэффициент попадания в кэш и найдите свой уровень неудач по классам задач. Все остальное — это арифметика с числами, которые у вас теперь есть на самом деле.
Вопросы, ответы
Чаще всего избыточность: ваша модель выдает больше выходных токенов, чем предполагалось в вашей оценке. Затем поведение кэша, повторные попытки при неудачных дешевых вызовах и комиссионные платформы, применяемые к кредитам, а не к токенам. Все пять измеримы на вашем собственном трафике.
Нет. В нашей батарее две модели, использующие одну и ту же тарифную сетку $5/$25, различались на 96% в том, что они выставляли за идентичные запросы, полностью из-за количества токенов.
Да. Anthropic документирует примерно на 30% больше токенов для того же текста в моделях Claude 4.7 и более поздних. Мы измерили 3,409 символов на токен на предыдущем токенизаторе против 2,172 на новом. Выставление счетов идет за токены, поэтому та же проза стоит больше.
Кэширование, если ваша нагрузка повторно использует контекст: наша измеряемая сессия агента стоила в 2,6 раза больше без него, и это конфигурация, а не замена платформы. Затем соответствие уровней для регулярного трафика, затем пакетизация всего, что может подождать.
Сравните любые две модели
Список ставок и датированные измерения конкурентов: цены и измеренные счета. Измеренные затраты на задачи Pareto 26.9 не опубликованы. Избыточность: Издание 2.








