Первая независимая оценка GPT-6.1 Sol: 0.84 балла отставания от Astra при стоимости задачи менее четверти от ее цены

Источник: OrcaRouter

Первая независимая оценка GPT-6.1 Sol: 0.84 балла отставания от Astra при стоимости задачи менее четверти от ее цены

Источник: OrcaRouter

Artificial Analysis теперь оценивает GPT-6.1 Sol в 51.8 балла по своему индексу интеллекта (Intelligence Index), что на 0.84 балла меньше, чем у GPT-6 Astra, при стоимости $0.72 за тестовую задачу по сравнению с $3.26 у Astra.

•Обновлено: 29 сентября 2026 г.

Каждый материал о GPT-6.1 Sol, опубликованный в дни после релиза на DevDay 29 сентября 2026 года от Ope​nAI (включая эту статью в блоге), содержал одну и ту же оговорку: цифры производительности принадлежали разработчику, и ни одна третья сторона модель еще не оценивала. Теперь эта оговорка устарела. В индексе интеллекта Artificial Analysis появилась строка для GPT-6.1 Sol, запущенного в режиме максимального уровня рассуждений (maximum reasoning effort), и это первая оценка за всю короткую историю модели, полученная не от Ope​nAI. Она составляет 51.8 против 52.7 у GPT-6 Astra и 47.5 у GPT-6 Sol — разрыв составляет менее одного балла с флагманом за $10/$50 и является шагом вперед на 4.3 пункта по сравнению с моделью, которую GPT-6.1 Sol заменяет. Число, которое делает эту строку особенно интересной, находится рядом: платформа фиксирует стоимость выполнения оценки для каждого балла, и тестовый прогон индекса для GPT-6.1 Sol обошелся в $0.72 за задачу, в то время как для Astra он стоил $3.26. В четыре с половиной раза больше денег за 0.84 балла — вот и вся суть сравнения в одной строке, причем теперь это измеренный показатель, а не маркетинговая формулировка вендора.

Сама строка и условия проведения тестов

Artificial Analysis публикует свой индекс интеллекта (Intelligence Index) как комплексный показатель, состоящий из десяти оценок, и версия, запущенная 30 сентября 2026 года, имела номер v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Все три модели OpenAI в этом материале работают на одной и той же версии, поэтому сравнение ниже является прямым и чересчур корректным в том смысле, в каком никогда не бывают собственные презентационные таблицы вендора. Платформа также фиксирует дату релиза модели — 2026-09-29, дату проведения DevDay — и оценивает ее в конфигурации с максимальной сложностью (max-effort), которая указана в заголовке самой страницы.

• Индекс интеллекта (Intelligence Index) — 51.8 для GPT-6.1 Sol (макс.), 52.7 для GPT-6 Astra (макс.), 47.5 для GPT-6 Sol (макс.).• Стоимость одной задачи индекса — $0.72 для GPT-6.1 Sol, $3.26 для Astra, $1.05 для GPT-6 Sol. Это собственная оценка платформы стоимости полного прогона индекса, а не прайс-лист.• Затраченные выходные токены — 67.2 миллиона для GPT-6.1 Sol, 60.0 миллионов для Astra, 76.8 миллионов для GPT-6 Sol. В собственных комментариях AA 67 миллионов названы «весьма лаконичным» результатом на фоне медианы платформы в 82 миллиона, что является второй, более тихой победой над заменяемой моделью.• Скорость вывода — 66.8 токенов в секунду для GPT-6.1 Sol, 57.0 для Astra, 76.2 для GPT-6 Sol.• Цены согласно спискам платформы — $2.00 за входные и $10.00 за выходные токены на миллион для GPT-6.1 Sol, причем кэшированный ввод стоит $0.10, а запись в кэш — $2.50. Эти четыре цифры полностью совпадают с прайс-листом вендора, что является наименее драматичной и наиболее полезной особенностью этой строки: независимым списком тарифов, которые мы уже приводили ранее.

Одно методическое замечание, прежде чем эти цифры начнут использовать как аргументы в спорах. Индекс AA состоит из десяти оценок, и те тесты, на которые OpenAI делала упор в собственном анонсе — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — в их число не входят. AA запускает собственный вариант AutomationBench, который отличается от тестового набора, использованного вендором. Таким образом, независимые данные не подтверждают и не опровергают четыре ключевых заявления из анонса; они измеряют совершенно иной набор задач и заслуживают внимания скорее как альтернативное мнение о конфигурации модели, а не как вердикт по конкретным предложениям из презентации.

Astra по-прежнему побеждает с отрывом менее чем в балл, но ценой в четыре с половиной раза дороже

Обе модели предлагают шкалу уровней усилий (effort ladder), и теперь платформа опубликовала оценку и стоимость запуска для каждого из этих уровней у обеих моделей. Если сопоставить их вместе, эти шкалы показывают то, чего не может передать единое сравнение по главным цифрам: лучшая конфигурация GPT-6.1 Sol конкурирует вовсе не с лучшей конфигурацией Astra. Она конкурирует со второй по эффективности конфигурацией Astra.

• GPT-6.1 Sol, макс. — 51.8, $0.72 за задачу индекса. GPT-6 Astra, макс. — 52.7, $3.26.• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.

Astra лидирует на каждом уровне, что является честным итогом противостояния и одновременно наименее интересной его частью. Самое интересное — это соотношение цен. Если вам нужна самая дешевая конфигурация Astra, превосходящая максимум GPT-6.1 Sol, то это Astra на уровне xhigh: 52.4 против 51.8 при стоимости $2.31 против $0.72. Это 0.56 балла индекса за дополнительные $1.59 на каждый прогон оценки — примерно в 3.2 раза дороже менее чем за один процент прироста балла. Если двигаться в обратную сторону и снизить GPT-6.1 Sol до уровня xhigh, вы потеряете 0.8 балла, в то время как счет упадет до $0.39, что в 5.9 раз дешевле уровня xhigh у Astra и составляет одну девятую от стоимости прогона Astra с максимальными усилиями.

Существует и вторая трактовка этой же шкалы, которая ставит под сомнение целесообразность покупки Astra с максимальными усилиями. Четыре более низких уровня Astra дешевле максимального, а ее уровень xhigh уступает максимуму всего на 0.29 балла — чуть более полупроцента результативности при снижении затрат на выполнение на 29%. Любое обсуждение закупок этой пары, которое начинается с фразы «Astra на максимуме» и заканчивается «Astra стоит в 4.5 раза дороже», упускает из виду собственные более дешевые уровни Astra.

Шесть оценок достаются Astra, две — GPT-6.1 Sol, еще в двух зафиксирована ничья

Общий композитный показатель скрывает разделение результатов. Если оценивать модели по каждому тесту отдельно при максимальных усилиях, GPT-6.1 Sol не выглядит просто чуть более худшей версией Astra — она превосходит конкурента в двух аспектах и уступает в шести.

• GDPval-AA — Elo 1575.1 для GPT-6.1 Sol против 1541.9 для Astra, перевес в 33 пункта на задачах профессионального характера. Это крупнейшая самостоятельная победа более дешевой модели.• AA-LCR v1.1, рассуждения на длинном контексте — 0.830 против 0.807. Лидирует GPT-6.1 Sol.• AA-Briefcase v1.1 — Elo 1564.2 против 1568.9. Astra впереди на 4.7 пункта.• AutomationBench-AA — 0.649 против 0.685. Astra впереди на 3.6 пункта.• Terminal-Bench 4.0 — 0.561 против 0.591. Astra впереди на 3.0 пункта.• SciCode — 0.542 против 0.565. Astra впереди на 2.3 пункта.• Humanity's Last Exam — 0.529 против 0.547. Astra впереди на 1.8 пункта.• AA-Omniscience — 41.5 против 43.4. Astra впереди на 1.9 пункта.• GDP.pdf и CritPt — абсолютная ничья (0.310 и 0.317 соответственно) у обеих моделей.

Две из этих строк значат больше, чем их позиция в общем списке. Отрыв в GDPval-AA — единственный случай, когда преимущество более дешевой модели достаточно велико, чтобы пережить смену тестового окружения, и оно приходится ровно на ту рабочую нагрузку, о которой заявлял вендор в своем позиционировании — профессиональную работу с большим объемом документов. А две ничьи приходятся на тесты с наименьшим разбросом результатов, что служит напоминанием о том, что общий разрыв в 0.84 балла складывается из показателей, которые по отдельности варьируются от победы в 33 пункта до поражения на 3.6 пункта.

По сравнению с предшественником прирост реален, но неоднороден

Сравнение, которое действительно важно для каждого, кто уже использует GPT-6 Sol в продакшене — это сопоставление 6.1 Sol с ее собственным предшественником, и независимые данные говорят об этом четче, чем публикация вендора. Улучшения зафиксированы в восьми тестах из десяти. Два показывают регресс.

• SciCode — GPT-6.1 Sol получает 0,542 балла, в то время как GPT-6 Sol набирал 0,576. Новая модель хуже справляется с научным кодом на 3,5 пункта.• AA-LCR v1.1 — 0,830 у 6.1 Sol против 0,837 у GPT-6 Sol. Разница минимальна, но не в ту сторону на оценке длинного контекста.• AA-Omniscience — 41,5 против 27,1. Это сильнейшее изменение в таблице: скачок на 14,4 пункта в оценке знаний, при этом точность на этом наборе выросла с 0,545 до 0,621.• Уровень галлюцинаций на том же наборе — 0,543 у GPT-6.1 Sol по сравнению с 0,601 у GPT-6 Sol, что всё еще выше 0,513 у GPT-6 Astra. AA-Omniscience делит свой результат на категории «ответил верно» и «уверенно заблуждается», и именно в этом делении обновление 6.1 оправдывает себя: это заметно менее нечестная модель, чем Sol, хотя она по-прежнему остается самой нечестной из трех.• Terminal-Bench 4.0 — 0,561 против 0,439, прирост на 12,2 пункта. AA-Briefcase — от 1482,8 до 1564,2 Эло. GDP.pdf — от 0,248 до 0,310.

Смысл в том, что это обновление было скорее направлено на знания и инструменты, чем на рассуждения. Метрики, которые изменились сильнее всего, — это те, которые вознаграждают за знание фактов, а не за их выдумывание; метрика, которая снизилась, — узкая и техническая. Любой, кто перешел на 6.1 Sol ради экономии на кэше, получает прирост знаний в качестве бонуса и не должен полагаться на то, что это распространяется на каждую используемую им среду тестирования.

Где она располагается в таблице лидеров и что находится выше

В стандартном порядке индекса интеллекта в таблице лидеров GPT-6 Astra с максимальным усилением занимает 7-е место, а GPT-6.1 Sol с максимальным усилением — 10-е, в то время как GPT-6 Sol с максимальным усилением находится на 20-м. Девять позиций над GPT-6.1 Sol — это две конфигурации Astra, три конфигурации Claude Opus 5.5, одна конфигурация Claude Sonnet 5.5 и две конфигурации Claude Fable 5.1; таким образом, модель, к которой GPT-6.1 Sol ближе всего, — это флагман её собственного семейства, а модель, которую она фактически сместила в этом порядке, — её собственный предшественник, расположившийся на тринадцать позиций ниже.

Если убрать параметр усиления, порядок меняется способом, который имеет значение для планирования затрат: GPT-6.1 Sol в режиме xhigh занимает 13-е место, в режиме high — 15-е, в режиме medium — 19-е и в режиме low — 35-е, в то время как Astra занимает 14-е место в режиме high, 16-е в режиме medium и 26-е в режиме low. Иными словами, GPT-6.1 Sol в режиме xhigh превосходит Astra в режиме high в таблице лидеров, а GPT-6.1 Sol в режиме medium превосходит Astra в режиме low. Усилие здесь является более весомым рычагом, чем выбор модели, по крайней мере среди этих двух.

Что делать с этой цифрой, если говорить честно

Утверждение поставщика, которое проверялось в этой строке, заключалось в том, что GPT-6.1 Sol практически не уступает флагману при цене примерно в пять раз ниже. Независимая формулировка этого утверждения звучит так: она отстает от флагмана менее чем на 0,84 индексных пункта, а прогон оценки для её результата обошелся в 22% от стоимости прогона флагмана. Это достаточно близко к заявлению, чтобы никто не чувствовал себя обманутым, и это более весомый аргумент, чем «не проверено», во всех аспектах, важных для покупателя.

Чего эта строка точно не делает, так это не оценивает вашу рабочую нагрузку. Запуск индекса представляет собой специфический набор задач, а цифра, которая определяет реальный счет, — это тарифный сетка по отношению к вашему собственному профилю токенов. Именно поэтому строка кэша по-прежнему остается главным ориентиром для моделирования: $0,10 за кэшированный ввод у GPT-6.1 Sol против $1,00 у Astra дают десятикратную разницу, которой не касается ни один индексный балл. С нашей стороны действует тот же сквозной подход: OrcaRouter обслуживает GPT-6 Astra, GPT-6 Sol и GPT-6 Luna по собственным базовым ценам OpenAI без какой-либо наценки, поэтому в день изменения тарифов поставщика тариф с нашей стороны также меняется без ожидания заключения второго контракта. GPT-6.1 Sol отсутствует в наших маршрутах — публичный каталог на сегодняшний день возвращает ошибку «модель не найдена» для openai/gpt-6.1-sol, и нет честного способа описывать модель, которую мы не можем предоставить. То, что вы действительно получаете за один ключ API прямо сейчас, — это пара, о которой действительно спорят в бенчмарках: Astra для самой сложной работы и Sol для больших объемов, с неизменными базовыми ценами поставщиков и автоматическим переключением между ними в случае сбоя одного из них.

Две вещи позволили бы прояснить ситуацию еще сильнее. Второй независимый тестовый набор для той же модели подсказал бы нам, является ли лидерство GDPval-AA свойством самой модели или этого метода оценки, и это самый полезный недостающий набор данных в таблице. А независимое измерение длинного контекста на уровне 272 000 токенов значило бы больше, чем еще одна сводная точка, потому что именно там ценообразование этого семейства перестает быть дешевым.

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от OrcaRouter