The Jerusalem PostCornell University's response to student rape allegations to be reviewed by New York A-G - reportESPN DeportesLa Novena de MLB: Regreso de Judge ya no es medida desesperadaESPNInactives watch: Daniels, DeVonta to sit; McConkey questionableScreen RantThe Pan's Labyrinth 3D Re-Release Is Just The Beginning For Guillermo Del ToroThe Sydney Morning Herald‘Best chance to flourish’: Bulldogs finally land sorely needed defensive help for flag tiltالنهارمبادرة "تجّار دبي" للتجارة الإلكترونية... البرامج والمزايا وكيفية الاستفادةBBC 中文「工程師治國」:中國為何熱衷於「超級工程」?SoompiSeo Kang Jun And Jo Aram Meet Outside Of Work In “A Love Other Than Yours”Observador DesportoAs notícias das 4hMalay MailMalaysian listed as ‘uncontactable’ after Nepal floods returns home safely, 54 still missingLa NaciónEduardo Levy Yeyati: “Con expectativas disminuidas, hoy esperamos menos del país”InquirerStudent wounded in stabbing at a Laoag school
The Daily Newsstand · Free, Always
Saturday, October 3, 2026

Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость

Translate

Осень 2026 года выдалась плотной: 1 сентября Anthropic выпустила Claude Fable 5.1, 3 сентября OpenAI показала GPT-6 Astra, следом отчитались остальные. Разбираться в этом потоке приходится по цифрам, а цифры бывают трёх сортов, и мешать их нельзя. Ниже — что именно мерят источники, где расходятся и как из этого считать стоимость работы, а не стоимость токена.

Шаг 1. Разделить цифры производителей и независимые замеры

Таблицы компаний рисуются в свою пользу. Выбор тестов, уровень рассуждения, собственная обвязка — программа подачи задач и проверки ответов — всё это настраивается под нужный результат. Один и тот же тест в разных обвязках даёт разные числа: Terminal-Bench 4.0 для Grok 4.7 — 37,6 % у xAI и 33 % у Artificial Analysis. Поэтому по таблицам компаний можно сравнивать только грубо.

Terminal-Bench 4.0 по данным производителей. Данные: анонсы Anthropic и xAI. График: Технозаметки

Terminal-Bench 4.0 по данным производителей. Данные: анонсы Anthropic и xAI. График: Технозаметки

Независимые замеры (Artificial Analysis) держат одинаковые условия для всех. Их сводный индекс — десять тестов, сведённые в одно число, плюс отдельные замеры скорости вывода, времени до первого токена, выходных токенов и цены задачи. Слабость индекса известна: это средняя температура по больнице. Модель, сильная в нише, в индексе проигрывает.

Третий сорт — прямые сравнения. Издания и блогеры берут одно задание на 2–3 модели и мерят время, доллары и оценивают результат. Это ближе всего к реальной работе, но выборка крошечная: три задания или один «Тетрис» — иллюстрация, не статистика.

Ловушка в том, что за сутки на агрегаторах появляются десятки пересказов. Расхождения индекса Artificial Analysis для одной модели доходят до 15 баллов, а цена GPT-6.1 Sol «десять центов» в прейскуранте OpenAI вообще отсутствует. Сверяться нужно с первоисточниками: анонсами, прейскурантами и страницами моделей на Artificial Analysis.

Отдельно про уровень рассуждения: ступени идут от low до max, и одна модель на разных ступенях ведёт себя как разные модели. Opus 5.5 low против max — 16 баллов индекса и цена задачи в 11 раз выше. Сравнивать лучшие результаты стоит только на самом высоком измеренном уровне.

Шаг 2. Пересчитать прейскурант в цену задачи

Прейскурант — это цена слова, а платёж идёт за решённую задачу. Расход слов на задачу у моделей очень разный, а токены размышлений оплачиваются по цене выхода. Artificial Analysis считает среднюю стоимость задачи индекса на заданном уровне рассуждения, и картина получается неочевидная.

Индекс Artificial Analysis и цена одной задачи индекса. Данные: Artificial Analysis, 3 октября 2026 года. График: Технозаметки

Индекс Artificial Analysis и цена одной задачи индекса. Данные: Artificial Analysis, 3 октября 2026 года. График: Технозаметки

Самая дорогая задача — у Sonnet 5.5: $7,67 на максимальном уровне. У Fable 5.1 — $7,63, у Opus 5.5 — $5,98. При этом за токен Sonnet вдвое дешевле Opus и впятеро дешевле Fable. Причина в многословии Sonnet 5.5: 420 млн выходных токенов на прогон против медианы класса 81 млн. У Opus 5.5 — 260 млн, у Fable — 190 млн.

GPT-6 Astra при дорогом токене даёт $3,26 за задачу, вдвое дешевле Opus. GPT-6.1 Sol: 67 млн токенов на прогон, 52 балла индекса, 72 цента за задачу — лучшее соотношение качества и цены среди моделей выше 50 баллов. Grok 4.7 по прейскуранту в пять раз дешевле Astra, но задача стоит $3,74: 81 тысяча выходных токенов на задачу против 36 тысяч у Grok 4.6.

Снизу по цене: GPT-6 Luna — 38 баллов за 7 центов, DeepSeek V4.1 Flash — 39 баллов за 27 центов, DeepSeek V4 Pro — 36 баллов за 67 центов. Старшая DeepSeek дороже Flash при худшем результате, и после летнего подорожания она не очевидный выбор по цене. Вывод простой: модель выбирают по цене решённой задачи, а не по прейскуранту — при одинаковой цене за токен счёт может разойтись вдвое.

Шаг 3. Сверить индекс с отраслевыми тестами

Сводный индекс Artificial Analysis на 3 октября, лучшие результаты: Claude Opus 5.5 — 58 баллов, первое место из 224 моделей; Claude Sonnet 5.5 — 56; Claude Fable 5.1 — 53; GPT-6 Astra — 53; GPT-6.1 Sol — 52; Grok 4.7 — 46; DeepSeek V4.1 Flash — 39; GPT-6 Luna — 38; DeepSeek V4 Pro — 36. Пять первых мест делят две американские компании, разрыв между ними шесть баллов. Это меньше, чем разница между ступенями low и medium у одной модели: наверху плотная группа, и настройка решает не меньше, чем поставщик.

Terminal-Bench 4.0 проверяет агентов в терминале: Sonnet 5.5 — 70,6 %, Opus 5.5 — 66,4 %, GPT-6 Astra — 57,9 %, Fable 5.1 — 55,8 %, Grok 4.7 — 37,6 %, Grok 4.6 — 20,3 %. У GPT-6.1 Sol, Luna и DeepSeek результат не опубликован. OSWorld: Opus 5.5 — 81,8 %, Sonnet 5.5 — 80,1 %. В AutomationBench по данным OpenAI GPT-6.1 Sol обходит Opus 5.5 на 2,2 пункта. В научной версии Terminal-Bench лидирует Astra, в Harvey — Grok 4.7 с 19,6 % против 6,7 % у Fable 5.1.

У каждой модели своя ниша, и выводы источников совпадают: длинные агентные задачи в программировании — за Claude, лучшее соотношение качества и цены — у GPT-6.1 Sol, Grok 4.7 вырос, но до флагманов не дотягивает. DeepSeek — лучший среди открытых моделей, но независимые замеры DeepSeek ниже собственных отчётов компании.

Итог

Считать цену задачи по расходу токенов, а не по прейскуранту, проверять уровень рассуждения при любом сравнении и сверяться с первоисточниками — эти три правила снимают большую часть расхождений между публикациями. Ограничения метода тоже понятны: сводный индекс усредняет нишевые модели, прямые сравнения опираются на выборку в одно-два задания, а по части моделей независимых замеров на нужном уровне рассуждения просто нет, и результат остаётся неопубликованным.

В полной версии разобраны скорость печати и время до первого слова, быстрые режимы, длина ответа на больших документах, а также работа из России и проверка моделей на собственных задачах.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.

Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость — KioskNews