Изображение

Удивительная история случилась с рейтингом Artificial Analysis. В день анонса GPT-6 это была одна из ее самых слабых позиций: 61 балл против 66 у Claude Fable 5.1. Пока сообщество спорило о цифрах, авторы за четыре дня дважды переписали сам рейтинг — до версии 4.3, где Astra и Fable 5.1 делят первое место с 53 баллами. Заодно просели баллы у всех: лучшие открытые китайские, Kimi K3 и GLM-5.3, теперь на 7–9 местах с 44.

Claude Fable 5.1 удачно пошутил: «раньше модели подгоняли под бенчмарки, теперь бенчмарки под модели».

Что сделали Artificial Analysis? Они поменяли состав бенчмарков, по которым строится рейтинг, а также подкрутили их «веса» — насколько важен каждый бенч. Выглядит действительно как оптимизация под одну модель, но стоит вступиться за организаторов — добавлены в том числе бенчмарки, в которых Fable 5.1 сильнее.

Новая версия рейтинга наглядно показывает, в каких областях какая модель лучше, а также полностью упускает пару сфер, где GPT-6 лидирует.

Fable 5.1 хороша в знаниях — сложные вопросы (Humanity's Last Exam, AA-Omniscience) — и в повседневной работе: GDPval (офисные задания) и AA-Briefcase (многонедельная аналитика).

С весны ходят слухи, что Fable — очень большая модель, в которую загрузили максимум знаний. Бенчмарки косвенно подтверждают слухи: однако отставание GPT-6 во многих не такое уж и большое — размер модели OpenAI тоже вырос.

GPT-6 Astra сильнее там, где надо не знать, а делать: Terminal-Bench 4.0, AutomationBench, GDP.pdf. Сходится с тем, что OpenAI затачивала модель под долгие агентские сценарии.

Отдельно стоит добавить, что GPT-6 реже галлюцинирует, а также в 2,5 раза дешевле Fable 5.1 — расходы на одну ее задачу составили $3,26 против $7,63.

При этом провалов нет ни у кого: отставание в большинстве тестов небольшое, для повседневных задач подойдет любая. Но есть вещи, которых Artificial Analysis не учитывает вовсе.

Во-первых, это работа с интерфейсами. Все агентские тесты рейтинга — терминал и API: модель работает с файлами и командной строкой, экрана она не видит. И это формат работы для разработчиков, но не массового пользователя — ему привычнее MacOS и Windows.

И как раз в интерфейсах GPT-6 показала главный скачок. На OSWorld 2.0 — тест, где агент сам работает в десктопных приложениях, — 72,6% против 65,7% у GPT-5.6, при этом задача занимает около 40 минут вместо 75. Claude Opus 5 там набирает 70,2%; результат Fable 5.1 OpenAI не приводит. На ScreenSpot-Pro, точность попадания по элементам интерфейса, — 92,7%, а это уже близко к свободной работе в визуальных средах.

Во-вторых, научные задачи. Terminal-Bench-Science — 70 реальных рабочих задач ученого с кодом, данными и симуляциями — не путать с обычным Terminal-Bench из рейтинга: 64,6% против 52,6% у Fable 5.1 и 22,4% у GPT-5.6. FrontierMath Tier 4, исследовательская математика: 97,6% против 87,8% — при этом набор маленький, 40 решенных задач из 41 против 36, а разработку теста частично оплачивала OpenAI. И один результат не из бенчмарков: доказательство про промежутки между простыми числами, которое OpenAI приписывает Astra.

Авторы Artificial Analysis не отрицают слабых сторон своего рейтинга. По их словам, давно идет работа над пятой версией, которая будет смещена к «решению проблем обычного мира» — по логике, как раз к средам за пределами терминала.

А некоторые вещи подобные рейтинги и вовсе замерить не могут. По ощущениям, Fable 5.1 лучше ведет диалог с пользователем — поэтому уже несколько дней она используется для постановки и приемки задач, выполняемых GPT-6.