ESPN DeportesYoshinobu Yamamoto intenta dar el sexto triunfo seguido a los DodgersESPNWNBA playoff bracket coming into focus: Dream lock in 4-seed, Liberty are No. 8The Jerusalem PostUkraine transfers two North Korean prisoners of war to South Korea, Zelensky saysInquirerIloilo school cancels classes over ‘security concern’UOLEUA reconhece oito tentativas de suicídio no porta-aviões LincolnPunchFCT truck driver, two others held for vandalising NNPC pipelineالنهارسلاح الفصائل إلى 2027... هل اشترت بغداد الوقت لتفادي الصدام؟ynetתחזית מזג האוויר: טמפרטורות רגילות לעונהLa NaciónRusia puso retenciones cero para el trigo, la cebada y el maíz hasta fin de añoVarietyPaige DeSorbo on Healing From Domestic Violence With Her Pet: ‘Sometimes the Thing That Helps You Feel Safe Again Has Four Paws’SportstarAsian Games 2026 Live Updates, Day 6: India's Roshibina wins wushu silver, Satnam-Salman bag bronze in rowing, Indian quartet qualifies for 4x400m mixed relay final - Scores and NewsThe Sydney Morning HeraldMacau hotel puts ClearVue solar glass tech to the test
The Daily Newsstand · Free, Always
Thursday, September 24, 2026

Grok 4.7, Claude Opus 5.5 и DeepSeek V4.1 Flash: какую модель брать в сентябре

Translate

За две недели сентября обновились сразу три лаборатории: 10-го DeepSeek опубликовал открытые веса V4.1 Flash, 21-го xAI выпустила Grok 4.7, 22-го Anthropic показала Claude Opus 5.5. Ставки разные: DeepSeek давит ценой, Grok — соотношением цены и скорости, Opus — качеством на продолжительных задачах. Ниже — замеры независимых тестов и собственные отчёты компаний, пересчитанные в стоимость одинаковой работы.

Коротко о каждой

Claude Opus 5.5 — старшая модель Anthropic для длительных агентных сценариев: кода, исследований, разбора документов. Контекст — миллион токенов, вывод — до 128 тысяч. Рассуждение всегда включено, глубину задаёт уровень усилия от low до max.

Grok 4.7 собрана на новой базовой модели большего размера, а не на дообученной 4.6. Контекст — 500 тысяч токенов, четыре уровня рассуждения, поиск по вебу и по X встроены. По умолчанию стоит в Cursor и в терминальном агенте xAI Grok Build.

DeepSeek V4.1 Flash — открытая модель под MIT: 552 миллиарда параметров, на каждый токен задействуются 8–16 миллиардов. Контекст — миллион токенов, поддерживается ввод изображений. Веса на Hugging Face, API продают около полутора десятков провайдеров.

Что показывают тесты

Общая линейка — Intelligence Index от Artificial Analysis: десять тестов, сведённых в одно число, замеры выполняет не сам разработчик модели.

  • Opus 5.5 — 54 при уровне усилия high, 58 при max;

  • Grok 4.7 — 46, на два пункта выше предыдущей версии;

  • DeepSeek V4.1 Flash — 39. Для открытой модели это высоко: медиана открытых моделей сопоставимого размера — 18.

В агентном программировании разрыв больше. На Terminal-Bench 4.0, где модель сама работает в терминале, Anthropic указывает для Opus 5.5 66,4 %. Grok 4.7 по замеру Artificial Analysis получает 33 % (xAI называет 38 %), DeepSeek V4.1 Flash по данным компании — 31 %. На более простых задачах, как починка багов в DeepSWE, Grok и DeepSeek держатся на уровне прошлогодних лидеров — 73–74 %. На самых сложных экспертных вопросах Humanity's Last Exam у DeepSeek 37 % против 56 % у предыдущего Opus 5.

Строки кода на экране ноутбука. Фото: Artem Sapegin, Unsplash, CC0

Строки кода на экране ноутбука. Фото: Artem Sapegin, Unsplash, CC0

Числа производителей стоит делить надвое: каждый подбирает выгодные себе тесты и настройки. Однако порядок Opus — Grok — DeepSeek совпадает во всех источниках.

Сколько стоит

Тарифы за миллион токенов на входе и на выходе:

  • Opus 5.5 — $4 и $20, закэшированный вход — $0,20;

  • Grok 4.7 — $2 и $6, кэш — $0,50;

  • DeepSeek V4.1 Flash — $0,30 и $1,20, кэш — меньше цента.

Оговорки: у Grok ставки удваиваются при запросе длиннее 200 тысяч токенов. У DeepSeek вне пика всё вдвое дешевле; пиковые часы — будни с 4 до 7 и с 9 до 13 по Москве. Opus 5.5 подешевел на 20 % относительно Opus 5, дополнительно Anthropic обещает около 40 % экономии на задаче за счёт меньшего расхода токенов.

Типовой агентный запрос: 30 тысяч токенов на входе, 8 тысяч на выходе, без кэша.

  • Opus 5.5 — около 28 центов;

  • Grok 4.7 — около 11 центов;

  • DeepSeek V4.1 Flash — 2 цента в пик, 1 цент вне пика.

Цена токена — не цена задачи. Grok многословен: в агентных тестах Artificial Analysis он выводил в среднем 81 тысячу токенов на задачу, вдвое больше прошлой версии. DeepSeek тоже: прогон индекса потребовал 250 миллионов выходных токенов при медиане 140. На длинном запросе в 250 тысяч входных токенов Grok с двойным тарифом стоит $1,10 — почти как Opus 5.5 с $1,16.

Скорость

По Artificial Analysis быстрее всех отвечает DeepSeek — около 227 токенов в секунду. Grok 4.7 — около 188. Opus 5.5 заметно медленнее, около 92, хотя Anthropic заявляет прибавку в 30 % к прошлой версии и продаёт быстрый режим за двойную цену. У Grok такой режим тоже есть, но только внутри Cursor и Grok Build.

Что важно из России

Claude и Grok напрямую из России недоступны: России нет в списке стран Anthropic, оплатить подписку или API российской картой нельзя ни там, ни там. Остаются посредники — с наценкой и своими рисками.

DeepSeek проще: чат бесплатный, открывается без обходных путей, открытые веса запускаются на своём сервере. Правда, 552 миллиарда параметров требуют серьёзного железа — это вариант для компании, а не для домашней машины. Обратная сторона облачной версии: данные хранятся в Китае, политических тем модель избегает. Для кода и рабочих текстов это не мешает, для конфиденциальных документов — аргумент держать модель у себя.

Суперкомпьютер Columbia в исследовательском центре NASA. Фото: Trower, NASA, общественное достояние

Суперкомпьютер Columbia в исследовательском центре NASA. Фото: Trower, NASA, общественное достояние

Кому что

  • Opus 5.5 — когда задача длинная, а ошибка стоит дорого: крупный рефакторинг, аудит кода, разбор сотен страниц документов. Самая сильная модель из трёх; после снижения цены на типовом запросе дороже Grok в два с половиной раза.

  • Grok 4.7 — середина: достаточное программирование, быстрый ответ, актуальные данные из X. Годится для автоматизации, где задач много, а каждая несложная. Факты проверять: в тесте AA-Omniscience модель, не зная ответа, в 29 % случаев всё равно отвечает — и неверно.

  • DeepSeek V4.1 Flash — когда объём важнее качества отдельной задачи: черновики, классификация, перевод, массовая обработка текстов. Либо когда данные нельзя отдавать в чужое облако.

Итог

Универсальной модели нет. Деление такое: сложное и ответственное — Opus 5.5, быстрое и массовое с новостями — Grok 4.7, всё, что считается миллионами токенов, — DeepSeek. Все три вышли в последние две недели, независимые замеры ещё будут уточняться. Прежде чем выбирать надолго, стоит прогнать по десятку своих задач каждую модель: это вечер и пара долларов.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.