PunchUNIUYO to monetise sports with new policy — VCESPN DeportesMax, el más rápido en tercera práctica en Bakú; Checo luce fuerteThe Jerusalem PostGov't warns against bringing Four Species into Israel without authorization ahead of SukkotInquirer2028 polls survey: Sara-Robin 12 points ahead of Leni-Bam tandem — OCTADaily MaverickEDUCATION: R6,600 a month to catch up: Inside SA’s costly private tutoring marketCNN TürkSermaye piyasası soruşturmasında yeni gelişme: 19 tutuklamaUOLRússia tenta criar alternativa à Starlink após perder acesso à rede de Elon MuskVarietyBlock the Merger Coalition Asks Court to Reject Paramount’s Settlement With States Over Warner Bros. DealWirtualna PolskaOdjechał samochodem osobowym. Zaginął 12-latek, policja z apelemThe IndependentDyfed-Powys Police hit by cyber attack as information at riskDaily MailBreakthrough brain cancer test cuts diagnosis from weeks to hours: 'Huge leap forward for patients'RapplerCarlos Yulo falls short of parallel bars medal, concludes stellar Asian Games
The Daily Newsstand · Free, Always
Friday, September 25, 2026

Grok 4.7, GPT-6 Astra, Claude и китайские модели, кто эффективнее?

Translate

Вчера SpaceXAI выложила Grok 4.7. За три недели до этого OpenAI выпустила GPT-6 Astra, Anthropic — Claude Fable 5.1. Ещё в июле рядом встал Claude Opus 5: сама Anthropic пишет, что для большинства задач включать надо его, а Fable доставать, когда Opus уже не тянет ваши замеры.

Китайские лаборатории в этой компании больше не «дешёвый запасной аэродром». Qwen3.8 Max стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 на суточных инженерных задачах сидит в том же коридоре, что и свежий Grok.

Ниже один набор работ: длинный код, терминал, схемы, юридические дела и счёт. Цифры лабораторий и независимый прогон Artificial Analysis лежат отдельно. На Terminal‑Bench они расходятся почти в полтора раза. Спорить «кто первый» по одной картинке из анонса после этого бесполезно.

Кто вообще вышел

Grok 4.7 вышла 21 сентября. Новая база поверх Grok 4.6, дольше учили с подкреплением: модель должна сама планировать, вызывать инструменты и проверять результат на задачах, которые длятся часами. Контекст 500 тысяч токенов. На вход текст и картинки, на выход текст. Уровни рассуждения: low, medium, high, xhigh. Претрейн обрезан июнем 2026 года, дополнительные данные доходили до августа.

Она уже есть в API xAI, в Cursor на всех тарифах, в Grok Build как модель по умолчанию, в надстройках Word, PowerPoint и Excel, а ещё через OpenRouter, Vercel и Cloudflare. В обычный чат Grok и в X её обещают позже.

В карточке модели есть прямая строка: для кода Grok 4.7 дополнительно учили на обезличенных траекториях из Cursor. CursorBench после этого читать как экзамен на незнакомом материале уже нельзя.

GPT-6 Astra вышла 3 сентября. Контекст 1,05 миллиона токенов, ответ до 128 тысяч, знания обрезаны 30 апреля 2026 года. Это модель про компьютер, браузер, разработку и профессиональную работу. OpenAI первой из своих отнесла её к уровню Critical по кибервозможностям и вместе с этим усилила проверки на действия без явного разрешения.

Claude Opus 5 вышла 24 июля. Миллион токенов контекста, 128 тысяч на выход, обрезка знаний — май 2026. Цена $5 и $25. Claude Fable 5.1 вышла 1 сентября: тот же размер окна, цена $10 и $50, обрезка — июнь 2026. «Думание» у Fable включено всегда, глубину крутят параметром effort. Mythos 5.1 — те же веса с другими ограничениями, только для закрытых программ. В открытый доступ её нет.

Китайский ряд, который уже попадает в те же таблицы: Qwen3.8 Max от Alibaba, снимок 2 сентября, картинки на входе, веса закрыты. Kimi K3 от Moonshot, длинный контекст. GLM-5.3 от Z.ai, сильнее всего на длинной инженерии; открытая Flash‑версия сидит высоко среди моделей с открытыми весами. DeepSeek V4 — это семейство. Flash: 284 млрд параметров, 13 млрд активных, лицензия MIT, контекст 1 миллион, выход до 384 тысяч. Pro — старшая текстовая модель той же линейки.

Модель

Контекст

Вход / выход

Что важно

Grok 4.7

500 тыс.

$2 / $6

Агент, Cursor, схемы. Окно короче конкурентов

GPT-6 Astra

1,05 млн

$10 / $50

Компьютер, браузер, терминал. Выше 272 тыс. токенов тариф другой

Claude Opus 5

1 млн

$5 / $25

Рабочая модель Anthropic. Почти потолок Fable

Claude Fable 5.1

1 млн

$10 / $50

Длинные агенты, наука, документы

Qwen3.8 Max

около 1 млн

$2 / $6

Тот же стикер, что у Grok. Веса закрыты

DeepSeek V4 Flash

1 млн

$0,44 / $1,32

Пик. Вне пика $0,22 / $0,66. Веса открыты

DeepSeek V4 Pro

1 млн

$1,32 / $3,96

Пик. Вне пика вдвое дешевле

GLM-5.3

длинный

$1,40 / $4,40

Текст. Кэш входа $0,26

Цены — доллары за миллион токенов, обычный режим. У Astra при входе длиннее 272 тысяч токенов весь запрос считается иначе: $20 за вход и $75 за выход. У DeepSeek пик — будни, два окна по UTC, ночью и в выходные дешевле вдвое. Точную строку Kimi K3 лучше брать в консоли Moonshot в день интеграции: публичный тариф там не в долларах за токен по сетке OpenAI.

Одна цифра, которой можно верить осторожно

Artificial Analysis собирает индекс из десяти оценок: офисные дела, профессиональные задачи, автоматизация интерфейсов, терминал, научный код, длинный контекст и ещё несколько узких тестов. Это не истина. Зато всех гоняют в одной обвязке, и лаборатории не выбирают себе удобный режим в подписи к столбику.

Рис. 1. Индекс Artificial Analysis v4.3.2. Qwen3.8 Max — снимок сравнения AA от 2 сентября. Остальные — сводка индекса и обновление по Grok от 21 сентября.

Семь баллов между Astra и Grok — это не «чуть‑чуть не дотянул». На этом индексе такой разрыв отделяет флагман от крепкого второго ряда. Qwen от Grok отделяет один балл при той же цене входа. Kimi отстаёт на два. DeepSeek индекс не выигрывает и не обязан: он выигрывает счёт и право скачать веса.

Ничья Astra и Fable на отметке 53 склеена из разных сил. Astra впереди на терминале и на автоматизации интерфейсов. Fable впереди на наборе офисных дел AA‑Briefcase, на профессиональных задачах GDPval, на научном коде SciCode и на Humanity’s Last Exam. Одинаковый балл не значит одинаковую модель.

У Grok 4.7 режимы high и xhigh на этом индексе совпали: оба по 46. Доплачивать за максимальное усилие имеет смысл только там, где ваш собственный тест это видит.

Терминал, где цифры расходятся вдвое

Terminal‑Bench 4.0 — 66 тяжёлых сценариев в настоящем терминале. Бюджет до восьми часов, у каждой задачи автоматическая проверка. xAI сама пишет, что абсолютный процент чувствителен к обвязке агента. Дальше это видно без лупы.

Рис. 2. Слева Grok 4.7 набирает 38% в своей обвязке Grok Build. Справа, у Artificial Analysis, те же веса получают 26% и пропускают вперёд даже Flash.

Модель

Карточка xAI, Harbor

Artificial Analysis, 21 сентября

Claude Fable 5.1

57,9%

около 55%

GPT-6 Astra

в этой таблице нет

около 60%

Grok 4.7

38,0%, режим xhigh

26%

GPT-5.6 Sol

37,3%

в этом графике нет

DeepSeek V4 Flash

в этой таблице нет

27%

Grok 4.6

20,3%

в этом графике нет

7 сентября Artificial Analysis публиковала более точные соседние цифры: Astra 59,1%, Fable 52,0%. 21 сентября разбор свежего графика округляет их примерно до 60% и 55%. Порядок тот же, десятые гуляют из‑за effort и из‑за того, уводит ли Fable часть запросов на модель слабее. Разница между 38% в карточке Grok и 26% на чужом прогоне — уже не десятые.

Скачок самого Grok честный: у Grok 4.6 в той же карточке было 20,3%. Модель стала заметно взрослее на длинной терминальной работе. До Astra и Fable на чужой обвязке она не дотягивает. Открытый Flash, который стоит в разы дешевле, на графике AA оказывается на процент выше.

Пока лаборатории не публикуют общий протокол, в статье живут обе цифры. Выбирать ту, которая удобнее для абзаца, здесь как раз и есть подлог.

Репозитории, марафон и сутки в одной задаче

Код у этих моделей не сводится к одному экзамену. На коротком патче в чужом репозитории расклад один. На задаче, где агент живёт двадцать часов, расклад другой. GPT-5.6 Sol в таблицах ниже — предыдущий флагман OpenAI. Это не Astra. Где Astra в замере нет, так и написано.

Рис. 3. Четыре кодовых экзамена из карточки Grok 4.7. Проценты несравнимы между рядами: у каждого теста своя шкала и своя обвязка.

Тест

Кто впереди

Grok 4.7

Кто ещё рядом

CursorBench 4.0

Fable 5.1, 51,8%

46,3%

Sol 41,7%, Grok 4.6 40,4%

DeepSWE v1.1

Sol, 72,7%

71,0%

Fable 5 — 69,7%

SWE‑Marathon

Opus 5, 50%

46%

Fable 5 — 45%, Sol 42,5%

FrontierSWE V2

Fable 5.1, 56,3%

29,0%

Sol 32,2%, Kimi K3 25,9%

CursorBench 4.0 — длинные задачи из реальных сессий Cursor. Версия 4.0 не сравнивается с 3.2. Grok обходит Sol и себя месячной давности и остаётся позади Fable. Учитывать дообучение на курсорных траекториях тут обязательно.

DeepSWE v1.1 — 113 задач в 91 репозитории, пять языков, решения написаны с нуля, одна обвязка mini‑SWE‑agent, замер Datacurve. Здесь Grok 4.7 вплотную к Sol и чуть выше Fable 5. Astra в таблице карточки нет. Это самый удобный для Grok кодовый слайд, и он честный: обвязка общая.

SWE‑Marathon — 20 многочасовых задач, восемь попыток, зачёт только если прошли все проверки. Обвязки родные, поэтому сравниваются связки «модель плюс её агент», а не голые веса. Замер Abundant AI. Opus здесь первый, Grok второй, Fable 5 третья. Для человека, который выбирает модель в редактор на каждый день, этот ряд похож на жизнь больше, чем медаль терминала.

FrontierSWE V2 — 34 задачи до 20 часов, частичный зачёт, пять прогонов, обвязка Proximal. Fable 5.1 уезжает всем: 56,3% против 32,2% у Sol и 29% у Grok. Kimi K3 с 25,9% оказывается рядом с Grok, а не в другой лиге. На сутках автономной работы китайская модель уже спорит со вторым рядом, а потолок по‑прежнему у Fable.

Схемы, суды и почему индекс этого не видит

Общий балл прячет профессии. На электротехнике Grok стоит между Astra и Opus. На юридических делах она лучшая из опубликованного списка, хотя абсолютные проценты стыдные у всех.

Рис. 4. Слева EEBench, награда за физически верную схему. Справа юридический агент: задача зачтена, только если закрыт каждый критерий.

EEBench мерит схемы и чипы, замер Atopile. Grok шёл в обвязке Grok Build, остальные в своих. Astra 69,3%, Grok 4.7 66,0%, Opus 61,6%, Fable 5 54,2%, Sol 39,4%. Три пункта до Astra и заметный отрыв от Fable. Если работа ближе к плате и корпусу, чем к очередному CRUD, эта шкала важнее CursorBench.

Рядом, без отдельного графика, CAD‑генерация геометрии: Grok 4.7 на high набирает 44,4%, Grok 4.6 — 40,9%, Sol — 37,1%, Opus — 36,6%. Замер Mecado. Отрыв небольшой и устойчивый.

Юридический агент Vals AI: 120 закрытых дел, интернет выключен, шесть файловых инструментов, зачёт только если прошли все критерии. Grok 4.7 — 19,6%, Grok 4.6 — 15,8%, Fable 5 — 11,3%, Fable 5.1 — 6,7%, Sol — 2,5%. Отрыв Grok не косметический. Fable 5.1 здесь слабее даже Fable 5: жёсткое «все пункты или ноль» наказывает осторожную модель, которую фильтр ещё и уводит в сторону. Для юридического черновика это повод прогнать свои дела, а не верить общему индексу.

На HealthBench Professional, клинических диалогах, Grok 4.7 показывает 56,7% против 48,5% у Grok 4.6. В карточке прямо сказано: ответы Grok оценивал Grok 4.6, а цифры Fable и Astra взяты из их карточек. Срезанные фильтром задачи записаны как ноль. В один столбик это не ставится. Диагноз по‑прежнему смотрит врач. Карточка Grok сама выносит медицину, право и финансы из зоны автономных решений.

Китайский ряд — это уже ценник, не запасной выход

Год назад сравнение с DeepSeek было разговором «в десять раз дешевле и заметно хуже». В сентябре 2026 формулировка другая. На потолок Astra и Fable они не запрыгивают. На цену Grok и на второй ряд — запрыгивают спокойно.

Рис. 5. Ось цены логарифмическая. Qwen и Grok стоят в одной точке по доллару и почти в одной по баллу. Astra и Fable делят и стикер $10, и балл 53.

Qwen3.8 Max на индексе стоит на балл позади Grok и стоит те же $2 / $6. Кэш попадания у Qwen — $0,25 за миллион. Картинки на вход есть. Веса закрыты. На терминале в срезе AA у этого Qwen около 39%. Это выше независимого результата Grok и ниже Astra с Fable. Прямо сравнивать 39% Qwen с 38% из карточки xAI нельзя: обвязки разные. Сравнивать 39% Qwen с 26% Grok на графике AA уже можно, это один прогон.

Kimi K3 — 44 балла индекса и 25,9% на FrontierSWE рядом с 29% у Grok. Для длинного контекста и задач, где в контур входит картинка, её имеет смысл ставить первой из китайских в свой тест.

GLM-5.3 сильнее всего на длинной инженерии. Flash на индексе AA — 42 балла и входит в лучшие открытые веса. У Z.ai для GLM-5.3 указаны $1,40 за миллион на вход, $0,26 за кэш и $4,40 на выход. Если пайплайн текстовый, переплата за картинку на входе не нужна.

DeepSeek V4 Flash индекс не украшает: 35 баллов. Зато в пике это $0,44 и $1,32, вне пика $0,22 и $0,66, скорость на срезе AA около 200 токенов в секунду, лицензия MIT. На чужом Terminal‑Bench Flash уже на процент выше Grok 4.7. Pro с индексом 36 нужен, когда Flash на вашем тесте начинает врать, а платить как за Opus всё ещё не хочется.

Стикер врёт. Счёт за задачу — уже меньше

Две модели с ценником $10 и $50 могут стоить по‑разному, если одна заканчивает работу меньшим числом токенов. Artificial Analysis как раз это и посчитал: средняя цена одной задачи своего индекса.

Рис. 6. Индекс у Astra и Fable одинаковый, 53 балла. Средняя задача у Astra выходит в $3,26, у Fable в $7,63.

Кэш может сузить этот разрыв, а может и перевернуть его на длинной петле. Повторное чтение уже виденного контекста: у Fable 5.1 это $0,25 за миллион, у Opus 5 — $0,50, у Astra — $1. Запись кэша у Astra стоит $12,50. Агент, который по кругу таскает один репозиторий, на Fable иногда выходит дешевле, чем обещает график выше. Считать надо на своём журнале вызовов, не на стикере.

У Grok 4.7 в анонсе вход и выход оставлены на уровне Grok 4.6: $2 и $6. Отдельной строки кэша для 4.7 в открытом прайсе на день выхода ещё не было. У Grok 4.6 кэш стоил $0,50 на запросах короче 200 тысяч токенов и дорожал на длинных. Пока в консоли не появилась строка 4.7, закладывать в смету лучше пару $2 / $6 и проверять кэш по факту первого счёта.

Режим побыстрее есть у нескольких сразу. У Grok Fast примерно вдвое быстрее и вдвое дороже, пока только в Cursor и Grok Build, в публичном API его нет. У Opus быстрый режим около 2–2,5 раза по скорости и двойная цена. Имеет смысл, когда человек сидит и ждёт правку. Ночной прогон дешевле оставить на обычной скорости.

И про окно, пока оно не потерялось между ценами. 500 тысяч токенов у Grok против миллиона у Astra, Opus, Fable и китайцев — это предел, если в контекст кладут монорепозиторий целиком плюс документацию. Для типичного сервиса пятисот тысяч хватает. Большое окно само по себе не значит, что модель одинаково внимательна к файлу в середине. Магию в контекст пока не завезли.

Про фильтры, коротко

Astra — первая модель OpenAI на пороге Critical по киберу. Компания ответила более жёсткими проверками на запросы, похожие на атаку, и на действия без явного разрешения. Fable часть запросов по киберу и биологии уводит на модель слабее, и за такой уведённый запрос берут цену слабой модели. Mythos эти ограничения снимает только у проверенных организаций.

Grok пишет, что интеллект не понижает и на другую модель молча не переключается. В карточке есть свои кибер‑ и био‑тесты, включая HackerBench. Независимой перепроверки этих процентов нет, как и у большинства свежих карточек. Свой список разрешённых и запрещённых запросов прогоняют на той модели, которую реально включат.

Кого включать

Одного флагмана на все случаи в сентябре нет. Расклад по работе, а не по пресс‑релизу:

Какая работа

Кого ставить первым

Почему

Долгий терминал, браузер, компьютер

GPT-6 Astra

На чужом Terminal‑Bench впереди, задача индекса дешевле, чем у Fable

Наука, документы, сложный агент

Claude Fable 5.1

Сильнее на науке и офисном наборе. Имеет смысл, если Opus уже упёрся

Код каждый день

Claude Opus 5

Индекс 51 против 53, цена вдвое ниже Fable, на марафоне первый

Много кода дёшево, схемы, право, Cursor

Grok 4.7

EEBench и юридический агент. На чужом терминале слабее Flash

Массовые вызовы, свой контур, открытые веса

DeepSeek, Qwen, Kimi, GLM

Второй ряд за цену, которая у Qwen совпадает с Grok

Перед тем как закрепить модель в команде, хватает трёх своих прогонов. Один реальный тикет из репозитория. Одна многочасовая задача в терминале. Один документ, который стыдно отдать с выдуманной ссылкой. Индекс показывает, в какую дверь стучаться. Счёт и характер ошибок показывает только ваша обвязка.

Откуда цифры

Карточка Grok 4.7 от 21 сентября 2026, SpaceXAI. Анонс GPT-6 Astra и страница модели OpenAI. Документация Anthropic по Claude Opus 5 и Claude Fable 5.1. Индекс Artificial Analysis v4.3 от 7 сентября и график по Grok 4.7 от 21 сентября в разборе The Decoder. Сравнение Qwen3.8 Max и DeepSeek V4 Flash на Artificial Analysis. Тарифы DeepSeek и GLM — по опубликованным прайсам лабораторий на конец августа и по строкам AA.

Вендорский процент и независимый процент в тексте не смешаны. Где обвязка чужая, это написано рядом с числом. Если к моменту чтения прайс или балл сдвинулись, верить надо консоли и свежему прогону, не этой таблице.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.