Grok 4.7, Claude Opus 5.5 и DeepSeek V4.1 Flash: какую модель брать в сентябре

За две недели сентября обновились сразу три лаборатории: 10-го DeepSeek опубликовал открытые веса V4.1 Flash, 21-го xAI выпустила Grok 4.7, 22-го Anthropic показала Claude Opus 5.5. Ставки разные: DeepSeek давит ценой, Grok — соотношением цены и скорости, Opus — качеством на продолжительных задачах. Ниже — замеры независимых тестов и собственные отчёты компаний, пересчитанные в стоимость одинаковой работы.
Коротко о каждой
Claude Opus 5.5 — старшая модель Anthropic для длительных агентных сценариев: кода, исследований, разбора документов. Контекст — миллион токенов, вывод — до 128 тысяч. Рассуждение всегда включено, глубину задаёт уровень усилия от low до max.
Grok 4.7 собрана на новой базовой модели большего размера, а не на дообученной 4.6. Контекст — 500 тысяч токенов, четыре уровня рассуждения, поиск по вебу и по X встроены. По умолчанию стоит в Cursor и в терминальном агенте xAI Grok Build.
DeepSeek V4.1 Flash — открытая модель под MIT: 552 миллиарда параметров, на каждый токен задействуются 8–16 миллиардов. Контекст — миллион токенов, поддерживается ввод изображений. Веса на Hugging Face, API продают около полутора десятков провайдеров.
Что показывают тесты
Общая линейка — Intelligence Index от Artificial Analysis: десять тестов, сведённых в одно число, замеры выполняет не сам разработчик модели.
Opus 5.5 — 54 при уровне усилия high, 58 при max;
Grok 4.7 — 46, на два пункта выше предыдущей версии;
DeepSeek V4.1 Flash — 39. Для открытой модели это высоко: медиана открытых моделей сопоставимого размера — 18.
В агентном программировании разрыв больше. На Terminal-Bench 4.0, где модель сама работает в терминале, Anthropic указывает для Opus 5.5 66,4 %. Grok 4.7 по замеру Artificial Analysis получает 33 % (xAI называет 38 %), DeepSeek V4.1 Flash по данным компании — 31 %. На более простых задачах, как починка багов в DeepSWE, Grok и DeepSeek держатся на уровне прошлогодних лидеров — 73–74 %. На самых сложных экспертных вопросах Humanity's Last Exam у DeepSeek 37 % против 56 % у предыдущего Opus 5.

Числа производителей стоит делить надвое: каждый подбирает выгодные себе тесты и настройки. Однако порядок Opus — Grok — DeepSeek совпадает во всех источниках.
Сколько стоит
Тарифы за миллион токенов на входе и на выходе:
Opus 5.5 — $4 и $20, закэшированный вход — $0,20;
Grok 4.7 — $2 и $6, кэш — $0,50;
DeepSeek V4.1 Flash — $0,30 и $1,20, кэш — меньше цента.
Оговорки: у Grok ставки удваиваются при запросе длиннее 200 тысяч токенов. У DeepSeek вне пика всё вдвое дешевле; пиковые часы — будни с 4 до 7 и с 9 до 13 по Москве. Opus 5.5 подешевел на 20 % относительно Opus 5, дополнительно Anthropic обещает около 40 % экономии на задаче за счёт меньшего расхода токенов.
Типовой агентный запрос: 30 тысяч токенов на входе, 8 тысяч на выходе, без кэша.
Opus 5.5 — около 28 центов;
Grok 4.7 — около 11 центов;
DeepSeek V4.1 Flash — 2 цента в пик, 1 цент вне пика.
Цена токена — не цена задачи. Grok многословен: в агентных тестах Artificial Analysis он выводил в среднем 81 тысячу токенов на задачу, вдвое больше прошлой версии. DeepSeek тоже: прогон индекса потребовал 250 миллионов выходных токенов при медиане 140. На длинном запросе в 250 тысяч входных токенов Grok с двойным тарифом стоит $1,10 — почти как Opus 5.5 с $1,16.
Скорость
По Artificial Analysis быстрее всех отвечает DeepSeek — около 227 токенов в секунду. Grok 4.7 — около 188. Opus 5.5 заметно медленнее, около 92, хотя Anthropic заявляет прибавку в 30 % к прошлой версии и продаёт быстрый режим за двойную цену. У Grok такой режим тоже есть, но только внутри Cursor и Grok Build.
Что важно из России
Claude и Grok напрямую из России недоступны: России нет в списке стран Anthropic, оплатить подписку или API российской картой нельзя ни там, ни там. Остаются посредники — с наценкой и своими рисками.
DeepSeek проще: чат бесплатный, открывается без обходных путей, открытые веса запускаются на своём сервере. Правда, 552 миллиарда параметров требуют серьёзного железа — это вариант для компании, а не для домашней машины. Обратная сторона облачной версии: данные хранятся в Китае, политических тем модель избегает. Для кода и рабочих текстов это не мешает, для конфиденциальных документов — аргумент держать модель у себя.

Кому что
Opus 5.5 — когда задача длинная, а ошибка стоит дорого: крупный рефакторинг, аудит кода, разбор сотен страниц документов. Самая сильная модель из трёх; после снижения цены на типовом запросе дороже Grok в два с половиной раза.
Grok 4.7 — середина: достаточное программирование, быстрый ответ, актуальные данные из X. Годится для автоматизации, где задач много, а каждая несложная. Факты проверять: в тесте AA-Omniscience модель, не зная ответа, в 29 % случаев всё равно отвечает — и неверно.
DeepSeek V4.1 Flash — когда объём важнее качества отдельной задачи: черновики, классификация, перевод, массовая обработка текстов. Либо когда данные нельзя отдавать в чужое облако.
Итог
Универсальной модели нет. Деление такое: сложное и ответственное — Opus 5.5, быстрое и массовое с новостями — Grok 4.7, всё, что считается миллионами токенов, — DeepSeek. Все три вышли в последние две недели, независимые замеры ещё будут уточняться. Прежде чем выбирать надолго, стоит прогнать по десятку своих задач каждую модель: это вечер и пара долларов.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.