Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Indeks razgovornosti vypusk 2
Dev48

© 2026 · All rights reserved.

Индекс разговорности, выпуск 2

Источник: Unbiased

Индекс разговорности, выпуск 2

Источник: Unbiased

72 fresh metered runs across six models, now measuring characters as well as tokens. Edition 1 had a confound, and correcting it changes the ranking.

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.

Блог

Те же шесть запросов, тот же метод, 72 новых измеренных запуска по шести моделям, включая новую Fable 5.1. Этот выпуск также исправляет ошибку, допущенную в первом выпуске: одна из моделей, которую мы сравнивали, не считала токены так же, как остальные.

Команда Unbiased AI · опубликовано 25 августа 2026 года · 72 запуска измерены 25 августа 2026 года; тарифы проверены в тот же день

1,62

Индекс токенов Opus 5: он по-прежнему взимает больше всего за идентичную работу среди всех измеренных моделей

57,0%

больше символов на выставленный токен у предыдущего токенизатора, измерено, что завышает все межпоколенческие сравнения

$1,9486

сколько нам стоили эти 72 запуска. Исходные данные по каждому запуску опубликованы ниже

В выпуске 2 повторно измерен объём вывода по шести моделям Claude на идентичных запросах (72 измеренных запуска). Claude Opus 5 имеет самый высокий индекс токенов — 1,62 против 0,89 у Opus 4.8, что на 82% выше геометрического среднего индекса токенов при идентичных запросах и тарифных планах. Выпуск 2 также измеряет символы вывода, что устраняет разницу в токенизаторе, которая завышала межпоколенческие сравнения в первом выпуске.

Что измеряет индекс

Две модели по одному и тому же тарифному плану могут взимать очень разные цены, потому что цена рассчитывается за токен, а модели не пишут одинаковое количество токенов для одной и той же задачи. Индекс разговорности измеряет это: шесть типов задач, два запуска на модель, идентичные запросы, без указаний по длине, стандартные настройки. Оценка каждой модели — это геометрическое среднее её объёма вывода на задачу относительно медианы по всем измеренным моделям. 1,00 — это медиана. Более высокие значения стоят вам больше за идентичную работу.

В первом выпуске измерялись только токены. В выпуске 2 измеряются токены и символы, и публикация обоих — цель этого выпуска.

Ошибка в первом выпуске

В документации Anthropic о ценах отмечается, что модели от Claude 4.7 и выше используют новый токенизатор, который «производит примерно на 30% больше токенов для того же текста». Это одно предложение подрывает любое сравнение количества токенов, которое охватывает два поколения, и первый выпуск охватывал его: пять из шести моделей использовали новый токенизатор, а Haiku 4.5 использовала предыдущий.

Поэтому мы измеряли это, а не доверяли 30% на слово. По той же батарее моделей, использующих новый токенизатор, среднее значение составило 2,172 символа на токен вывода; Haiku 4.5, использующая предыдущий токенизатор, в среднем дала 3,409. Это на 57,0% больше текста на выставленный токен, что почти в два раза больше задокументированного показателя, а не близко к нему.

Два честных замечания относительно этого числа. В документации говорится, что точное увеличение зависит от контента и формы нагрузки, и наша батарея намеренно содержит много кода и JSON, что является плотным по знакам препинания и хуже токенизируется по новой схеме; батарея, содержащая только прозу, вероятно, будет ближе к заявленным 30%. И символы на токен — это свойство текста, а также токенизатора, поэтому модель, которая пишет более сжатую прозу, также сдвигает соотношение. Мы сообщаем о измерении, а не утверждаем, что идеально изолировали токенизатор.

Что это означает конкретно: часть лестного результата Haiku в первом выпуске была не сжатостью, а токенизатором, который взимает меньше токенов за ту же прозу. В пределах одного поколения токенизатора индекс токенов является справедливым сравнением. Между поколениями — только индекс символов.

Результаты выпуска 2

По токенам Opus 5 остается аутсайдером с показателем 1,62 против 0,89 у Opus 4.8: геометрическое среднее индекса токенов на 82% выше. Его индекс символов на 58% выше (1,42 против 0,90). Это соотношения геометрических средних индексов на задачу, а не процентные различия в общем объёме вывода. Обе модели использовали один и тот же тарифный план $5/$25 в этом эксперименте.

Fable 5.1, измеренная здесь впервые, набрала 0,86 по токенам против 1,01 у Fable 5 по тому же тарифному плану $10/$50. Батарея из шести задач стоила $0,2904 на 5.1 и $0,2556 на 5.

Haiku 4.5 остается самой дешёвой моделью за задачу с большим отрывом ($0,0219 за батарею), и этот вывод не зависит от вопроса токенизатора вообще, потому что её тарифный план в пять-десять раз ниже, чем у всего остального. Исправление токенизатора меняет то, как мы сравниваем её сжатость, а не то, является ли она дешёвой.

Что делать с этим

Если вы выбираете между двумя моделями по одному и тому же тарифному плану, индекс токенов — это число, которое предсказывает ваш счёт, и разница может быть больше, чем любая скидка, которую вы сможете согласовать. Если вы сравниваете модели разных поколений, используйте индекс символов или измерьте свои собственные задачи, потому что количество токенов не является сопоставимым.

И относитесь к любой замене модели как к изменению выставления счетов, даже если прайс-лист не меняется. Это вывод, который оба выпуска продолжают давать: тарифный план — это не счёт.

Воспроизвести это

Количество токенов и символов на один запуск содержится в исходном файле данных ниже. Метод — два запуска на задачу на модель при стандартных настройках без указаний по длине. Скрипт выполнения выпуска 2 в настоящее время не опубликован; старый скрипт батареи не воспроизводит этот выпуск.

Данные: verbosity-index.json. Исходные запуски: verbosity-index-e2-raw.json. Первый выпуск, для сравнения: исходный индекс.

Вопросы, ответы

Измерение того, сколько токенов вывода модель тратит на идентичную работу. Шесть типов задач, два запуска на модель, идентичные запросы, без указаний по длине. Оценки относительны медианы по задаче среди измеренных моделей; 1,00 — это медиана, более высокие значения стоят больше.

Три вещи: 72 новых запуска, добавлена Fable 5.1 и измерены символы вывода вместе с токенами, чтобы разница в токенизаторе между поколениями моделей могла быть отделена от реальной разговорности.

Anthropic документирует, что модели Claude 4.7 и выше выдают примерно на 30% больше токенов для того же текста, чем предыдущие модели. Мы измеряли 3,409 символов на токен у предыдущего токенизатора против 2,172 у нового. Поскольку выставление счетов осуществляется за токен, межпоколенческие сравнения токенов завышают разговорность новых моделей.

Да, и не из-за токенизатора: обе используют новый. У Opus 5 индекс токенов был на 82% выше, а индекс символов — на 58% выше. Это соотношения геометрических средних индексов на задачу, а не различия в общем объёме вывода. Измеренные счета за шесть задач составили $0,2243 и $0,1146 соответственно при тех же исторических тарифах $5/$25.

Сравните любые две модели

Список тарифов и датированных измерений конкурентов: цены и измеренные счета. Измеренные затраты задач Pareto 26.9 не опубликованы. Разговорность: Выпуск 2.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентамиПресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Сообщества вокруг дата-центров Amazon: что происходит рядом с центрами обработки данных по всей территории США
Amazon

Сообщества вокруг дата-центров Amazon: что происходит рядом с центрами обработки данных по всей территории США

Ещё от Unbiased AI

Почему ваш счет не совпадает с вашими расчетами
Unbiased AI

Почему ваш счет не совпадает с вашими расчетами

Повышение цены, которого не произошло
Unbiased AI

Повышение цены, которого не произошло

Ваше Harness находится на переднем крае?
Unbiased AI

Ваше Harness находится на переднем крае?

Почему ваш счет не совпадает с вашими расчетами
Unbiased AI

Почему ваш счет не совпадает с вашими расчетами

Повышение цен, которого не случилось
Unbiased AI

Повышение цен, которого не случилось