Блог
Те же шесть промптов, тот же метод, 72 новых замеренных прогона для шести моделей, включая новую Fable 5.1. Этот выпуск также исправляет ошибку, допущенную в первом выпуске: одна из сравниваемых моделей подсчитывала токены не так, как остальные.
Команда Unbiased AI · опубликовано 25 августа 2026 г. · 72 прогона замерены 25 августа 2026 г.; тарифы подтверждены в тот же день
1.62
Индекс токенов Opus 5: по-прежнему самая высокая стоимость за идентичную работу среди всех измеренных моделей
57.0%
больше символов на оплаченный токен в предыдущем токенизаторе, что завышает каждое сравнение между поколениями
$1.9486
стоимость этих 72 прогонов для нас. Необработанные данные по каждому прогону опубликованы ниже
Во втором выпуске был повторно измерен объем вывода для шести моделей Claude на идентичных промптах (72 замеренных прогона). Claude Opus 5 имеет самый высокий индекс токенов — 1.62 против 0.89 у Opus 4.8, что означает на 82% более высокий геометрический средний индекс токенов при идентичных промптах и тарифных сетках. Во втором выпуске также измеряются выходные символы, что устраняет разницу в токенизаторах, которая искажала сравнения между поколениями в первом выпуске.
Что измеряет индекс
Две модели с одинаковой тарифной сеткой могут выставлять счета по-разному, потому что цена указана за токен, а модели не пишут одинаковое количество токенов для одной и той же задачи. Индекс многословности измеряет именно это: шесть типов задач, два прогона на модель, идентичные промпты, отсутствие ограничений по длине, настройки по умолчанию. Оценка каждой модели — это геометрическое среднее объема вывода на задачу относительно медианы по всем измеренным моделям. 1.00 — это медиана. Более высокое значение означает, что вы платите больше за ту же работу.
В первом выпуске измерялись только токены. Во втором выпуске измеряются и токены, и символы, и публикация обоих показателей — главная цель этого выпуска.
Ошибка в первом выпуске
В документации по ценообразованию Anthropic указано, что модели начиная с Claude 4.7 используют более новый токенизатор, который «создает примерно на 30% больше токенов для того же текста». Это утверждение ставит под сомнение любое сравнение количества токенов между двумя поколениями, а первый выпуск охватывал их: пять из шести моделей использовали новый токенизатор, а Haiku 4.5 — предыдущий.
Поэтому мы измерили это, а не приняли 30% на веру. В той же серии тестов модели на новом токенизаторе в среднем выдавали 2.172 символа на выходной токен; Haiku 4.5 на предыдущем токенизаторе — 3.409. Это на 57.0% больше текста на оплаченный токен, что почти вдвое превышает задокументированную цифру.
Два честных предостережения по поводу этой цифры. В документации сказано, что точное увеличение зависит от контента и характера нагрузки, а наш набор тестов намеренно перегружен кодом и JSON, что плотно насыщено пунктуацией и хуже токенизируется по новой схеме; набор тестов, состоящий только из прозы, вероятно, был бы ближе к заявленным 30%. Кроме того, количество символов на токен является свойством как текста, так и токенизатора, поэтому модель, которая пишет более сжатую прозу, также меняет это соотношение. Мы сообщаем о результатах измерений, а не утверждаем, что идеально изолировали работу токенизатора.
Что это означает конкретно: часть лестного результата Haiku в первом выпуске была обусловлена не лаконичностью, а токенизатором, который требует меньше токенов для того же текста. В рамках одного поколения токенизатора индекс токенов является справедливым сравнением. При сравнении поколений справедлив только индекс символов.
Результаты второго выпуска
По токенам Opus 5 остается лидером с показателем 1.62 против 0.89 у Opus 4.8: это на 82% более высокий геометрический средний индекс токенов. Его индекс символов на 58% выше (1.42 против 0.90). Это соотношения геометрических средних индексов на задачу, а не процентные различия в общем объеме вывода. В этом эксперименте обе модели использовали одну и ту же тарифную сетку $5/$25.
Fable 5.1, измеренная здесь впервые, имеет индекс 0.86 по токенам против 1.01 у Fable 5 при той же сетке $10/$50. Стоимость выполнения шести задач составила $0.2904 для 5.1 и $0.2556 для 5.
Haiku 4.5 остается самой дешевой моделью на задачу с большим отрывом ($0.0219 за серию тестов), и этот вывод вообще не зависит от вопроса токенизации, поскольку ее тарифная сетка в пять-десять раз ниже, чем у всех остальных. Исправление токенизатора меняет то, как мы оцениваем ее лаконичность, а не то, является ли она дешевой.
Что с этим делать
Если вы выбираете между двумя моделями с одинаковой тарифной сеткой, индекс токенов — это число, которое предсказывает ваш счет, и разрыв может быть больше, чем любая скидка, которую вы согласуете. Если вы сравниваете поколения моделей, используйте индекс символов или измеряйте свои собственные задачи, так как количество токенов несопоставимо.
И воспринимайте любую замену модели как изменение счета, даже если прайс-лист не меняется. Это вывод, который подтверждают оба выпуска: тарифная сетка — это не итоговый счет.
Воспроизведение результатов
Количество токенов и символов для каждого прогона приведено в файле с необработанными данными ниже. Метод: два прогона на задачу для каждой модели с настройками по умолчанию без ограничений по длине. Скрипт выполнения для второго выпуска в настоящее время не опубликован; старый скрипт не воспроизводит результаты этого выпуска.
Данные: verbosity-index.json. Необработанные прогоны: verbosity-index-e2-raw.json. Первый выпуск для сравнения: оригинальный индекс.
Ответы на вопросы
Измерение того, сколько выходных токенов модель тратит на идентичную работу. Шесть типов задач, два прогона на модель, идентичные промпты, отсутствие ограничений по длине. Оценки относительны медианы по задаче среди измеренных моделей; 1.00 — медиана, более высокое значение означает более высокий счет.
Три вещи: 72 новых прогона, добавлена Fable 5.1, и выходные символы измеряются наряду с токенами, чтобы разницу в токенизаторах между поколениями моделей можно было отделить от реальной многословности.
Anthropic документирует, что модели Claude 4.7 и более поздние выдают примерно на 30% больше токенов для того же текста, чем ранние модели. Мы измерили 3.409 символа на токен для предыдущего токенизатора против 2.172 для нового. Поскольку оплата идет за токен, сравнение токенов между поколениями завышает многословность новых моделей.
Да, и не из-за токенизатора: обе используют новый. У Opus 5 индекс токенов на 82% выше, а индекс символов — на 58% выше. Это соотношения геометрических средних индексов на задачу, а не разрывы в общем объеме вывода. Измеренные счета за шесть задач составили $0.2243 и $0.1146 соответственно при тех же исторических тарифах $5/$25.
Сравнение любых двух моделей
Список тарифов и датированные измерения конкурентов: цены и измеренные счета. Стоимость измеренных задач Pareto 26.9 не опубликована. Индекс многословности: выпуск 2.
