RTP DesportoCorridas de Fórmula 1 mais curtas a partir de 2027וואלההאם רע"ם ועוצמה יהודית ייפסלו? דיונים בבקשות לפסילה לכנסת ה־26The Jerusalem PostMotive behind Ontario synagogue shooting attack not yet determined by Canadian policePunchVIDEO: NSCDC busts illegal fruit juice factory in Lagos, arrests twoDaily MaverickWHAT’S COOKING: A pair of meaty recipes to plan for Braai DayBollywood HungamaVeteran actor Radha files complaint against sister Ambika and brother over alleged Rs 50 crores cheque fraudInquirerDepEd asked: Why reiterate Pride Month memo when it’s always voluntary?UOLFuracão Polo atinge categoria 4 no Pacífico mexicanoColliderApple TV’s Sensational Spy Series Is on a 630-Day Streaming StreakEgypt IndependentEgypt stresses protection of workers in Lebanon, stronger labor cooperationThe Sydney Morning HeraldLachie Neale faces tribunal in bid to play in AFL grand finalBlickMit viel Gold versehen: Messi präsentiert Spezialtrikot für Argentinien-Abschied
The Daily Newsstand · Free, Always
Tuesday, September 22, 2026

Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2

Translate

В прошлой статье я гонял Алису и Гигачат по сложным бенчмаркам как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должна была отвечать текстом в браузере - как будто она общалась с пользователем, а пользователь задавал разные задания. Те тесты определяли, справляется ли модель именно как чат-агент.

Тут - нечто совсем другое. В этих бенчмарках агенту "дают" настоящий компьютер, и сверхсложные, многоступенчатые задания. Например, починить пайплайн, разобраться с проблемами в консоли сервера, собрать сложную форму, закрыть визу, свести таблицу из почты и банка. На выходе ждут рабочий артефакт, который должен соответствовать целевым критериям.

Бенчмарки Terminal-Bench 4 и OSWorld 2 - это два экзамена для ИИ с агентскими обвязками, которые различные лаборатории сейчас считают маст хэв.

Как вы наверное заметили, мне интересно тестировать наши, отечественные модели, отечественные решения. Почему? Ну потому что в первую очередь я верю в мозги наших разработчиков, которые во всем мире всегда считались топовыми. Мне совершенно непонятно почему мы так отстаем в ИИ, и я отказываюсь в это верить (хотя нет, понятно - отсутствие венчура, отсутствие поддержки от государства и увядших мозгах наших чиновников, которым важнее регистрировать куриц в МФЦ, чем развивать стратегически важное направление). Ладно, политику в сторону, нам придется с этим как-то справляться самостоятельно.

Так вот. Я общаюсь с несколькими командами, которые развивают ИИ решения в России. Все они классные и, я уверен, они покажут хорошие результаты. А я о них напишу или даже скоро потестирую что-то еще и поделюсь результатами. Забегая вперед, так же я надеюсь, что общение с командой Гигачата разовьется в нечто большее, чем самостоятельное проведение мной предыдущих бенчмарков. Верю что и разработчики Алисы со мной тоже подружатся, и мы вместе сделаем что-то интересное и полезное.

Сейчас же самое интересное и на самом деле просто топовая новость - агентская обвязка команды Маракуйи прошла одни из самых сложных тестов в мире, с очень крутыми показателями. Притом, что это их первое прохождение этих бенчмарков.

Что это за бенчмарки и насколько они жёсткие

Некоторые пишут, что это «самые сложные в мире бенчмарки». Может и нет, но гарантированно это одни из самых сложных в мире тестов на реальную работу за компьютером. Рядом стоят Agents’ Last Exam, Senior SWE-bench, Humanity’s Last Exam, ARC-AGI. У каждого свой фокус. Для агента в терминале и на рабочем столе Terminal-Bench 4 и OSWorld 2 сейчас самые главные и самые ценные.

OSWorld 2.0 состоят из 108 сквозных сценариев. Человеку медиана 1,6 часа на задачу, в 48 раз дольше, чем в OSWolrd 1. У сильного агента в среднем больше 250 шагов, около 318 вызовов инструментов. Официальный лимит — 500 шагов. Даже лидер на момент появления этого бенча, Claude Opus 4.8, закрывал целиком только 20,6% задач.

Terminal-Bench проверяет другие возможности агента: только консоль (шелл), без графического интерфейса. Версия 4.0 вышла в августе 2026, набор урезали с 74 до 66 задач: восемь насыщенных и сломанных убрали, двадцать переписали. Смысл урезки — тесты, которые все уже решают и к которым заранее готовили агентов и обвязки, убрали. Официальный лимит для агента — восемь часов на задачу.

Оба теста считают систему целиком: модель плюс обвязка. На лидерборде Terminal-Bench рядом с моделью всегда стоит агент — Codex, Claude Code, Grok Build, mini-SWE-agent. На OSWorld рядом — computer-use: скриншоты, мышь, клавиатура, пакетные вызовы инструментов. Нажать, сохранить файл и довести среду до проверяемого состояния может только агент с инструментами, голая LLM модель ничего сделать не сможет.

Поэтому эти два теста особенно интересны, они проверяют не столько модель, сколько обвязку вокруг модели и как модель работает с обвязкой.

OSWorld 2.0 — из чего состоит

Авторы — XLANG Lab, University of Hong Kong, с поддержкой Snorkel AI.

Бенчмарк состоит из 108 задач, 31 специально созданного для тестирования сайта (почта, банк, командный чат, визы, бронирование) плюс десктоп: Chrome, LibreOffice, VS Code, GIMP, Thunderbird, Shotcut, FreeCAD, Blender, KiCad, Zotero, Obsidian, Reaper, MuseScore и десятки других. В среднем 2,44 приложения на задачу; у 75,9% сценариев в прогоне участвуют два сервиса и больше. Семь профессиональных доменов и 21 подкатегория: исследования и образование, творческое производство, инженерия, личные сервисы, бизнес и финансы, администрирование и комплаенс, здравоохранение.

У бенчмарка есть две оценки, их постоянно путают — в том числе в презентациях вендоров (и часто - делают это намеренно).

  • Решено полностью (binary accuracy) — задача зачтена целиком. Это то, как формируется официальный лидерборд.

  • Средний балл (partial score) — доля контрольных точек. В среднем 27,25 точек на задачу. Можно набрать 70% точек и всё равно получить ноль по «решено полностью», если финальный артефакт не сошёлся.

Anthropic в своих материалах часто показывает средний балл. Например, 70% у Opus 5 — это partial: набранные контрольные точки. Доля задач, доведённых до конца, в той же строке другая.

У каждой задачи висят теги challenge phenomena — узкие места длинного рабочего дня. Одна задача несёт несколько тегов.

Явление

Доля задач

Что это на практике

Cross-source reasoning

42,6%

Свести факты из почты, банка, документа и прошлых заявок

Visual-spatial precision

41,7%

Попасть в пиксель, выровнять макет, проверить геометрию

Implicit-state inference

39,8%

Достать состояние, которого нет в инструкции: логи, прошлые формы, скрытые поля

Multi-item state tracking

39,8%

Удержать пачку строк, записей, правок

Conflict disambiguation

36,1%

Выбрать, какой источник главный, когда они спорят

Multimodal editing

27,8%

Картинка, видео, звук, CAD, медицинский снимок

Tutorial following

20,4%

Прочитать PDF/видео-гайд и сделать так же на своих данных

Dynamic environment

9,3%

Посреди дела в чат прилетает новое правило

Streaming interaction

5,6%

Экран живёт между скриншотом и кликом: всплывашка уехала

Proactive interaction / human-in-the-loop

5,6%

Надо спросить пользователя, когда условия дырявые

Оценщик смотрит конечное состояние среды. Правильная последовательность кликов или действий не требуется, нужен конечный результат. Отдельно идёт safety-аудит: обход песочницы, правка sudoers, порча чужих документов, отключение защиты экрана. Нарушение снимает баллы, даже если задача «как будто решена» (хотя лично я бы не стал за это снимать баллы, если уж авторы заявляют, что главное - результат).

В общем, OSW2 - это дико сложный бенчмарк. Кстати мне кажется, что обычный человек, рядовой пользователь его даже и не пройдет, или пройдет лишь частично.

Terminal-Bench 4.0 — что это такое из чего состоит

Агент сидит в Linux-контейнере с настоящим шеллом. GUI нет. Нужно читать код, ставить тулчейн, чинить баги, гонять тесты, оставлять артефакт там, куда указывает условие. Проверяет исходный верификатор задачи — обычно pytest в отдельном контейнере. Награда бинарная: все проверки зелёные — единица, хотя бы одна красная — ноль. Шесть тестов из семи дают тот же ноль что и пустой прогон.

Какие это задачи, несколько примеров:

  • react-lead-form — собрать рабочую форму на Vite/React;

  • ks-solver-cpp — численный солвер на C++;

  • biped-contact-dynamics — динамика шага, hop, jump, run;

  • formal-crypto / coq-block-bound / takens-embedding-lean — формальные доказательства;

  • fin-saccr-rwa — банковский SA-CCR, Excel и CSV;

  • photonic-waveguide-routing — трассировка волноводов;

  • glycan-ms2-elucidation — масс-спектр гликана;

  • cad-model — CAD, STEP на выходе;

  • pretrain-shard-corruption — починить претрейн, когда шарды битые;

  • session-window-debug — отладка потокового обработчика событий;

  • jax-speedrun-gpu / fp8-rmsnorm-gemm — GPU-ядра на H100.

Это смежная работа как минимум уровня сеньор разработчика: чужой репозиторий, скрытые тесты, лимит по CPU/RAM/сети, восемь часов на попытку.

Официальный лидерборд считает resolution rate по 66 задачам, обычно с несколькими независимыми прогонами и доверительным интервалом. Команда Harbor отдельно гоняет oracle (авторское решение должно проходить) и no-op (пустое решение должно получать ноль), плюс цикл против читерства. Canary-строка просит не класть задания в обучающие корпуса, хотя есть там такие вещи, что задумываешься, а не специально ли авторы заложили несколько дыр, или даже не несколько, чтобы френдли модели проходили, а остальные - нет. Может быть об этом стоит написать отдельную статью.

Как это проходят мировые лидеры

В таблице пара «модель + агент». Напомню еще раз, что тут тестируется не обвязка и не модель, а их совокупность — обвязка даёт модели руки, а модель этими руками пользуется.

Terminal-Bench 4.0, срез лидерборда Snorkel / Harbor, сентябрь 2026:

Модель

Агент

Effort

Resolution

GPT-6 Astra

Codex

max

58,2% ±2,8

Claude Fable 5.1

Claude Code

max

57,9% ±3,8

Claude Opus 5

Claude Code

xhigh

53,9% ±3,2

Claude Fable 5

Claude Code

max

44,5% ±3,8

GLM-5.3

Claude Code

max

41,8% ±3,2

GPT-5.6 Sol

Codex

max

37,3% ±3,8

Claude Opus 4.8

Claude Code

max

23,6% ±3,6

GPT-5.6 Terra

Codex

max

21,5% ±3,3

Grok 4.6

Grok Build

high

20,3% ±3,1

Gemini 3.8 Flash

mini-SWE-agent

high

19,1% ±3,4

Два момента по таблице выше: GLM-5.3 с открытыми весами набирает 41,8% внутри Claude Code. Модель сильная, руки чужие. Моменто второй: цена полного прогона у лидеров — тысячи долларов и миллиарды токенов. Astra уложилась экономнее Fable (1,5 млрд токенов против 2,7 млрд).

OSWorld 2.0, 500 шагов. Это срез, который стоит в их отчёте от 15 сентября 2026 (официальные строки лидерборда, тот же набор из 108 задач). К моменту написания этой статьи, 21 сентября, у Opus 5 на Snorkel уже появляются и более высокие оценки.

Система

Решено полностью

Средний балл

Claude Opus 5, max

31,4%

68,3%

GPT-5.6 Sol, max

27,3%

62,7%

Claude Opus 5, medium

27,1%

60,3%

Claude Opus 4.8, max

20,6%

54,8%

Claude Opus 4.7, max

18,2%

48,9%

GPT-5.5

13,0%

49,5%

Claude Sonnet 4.6, max

8,3%

41,5%

Kimi 2.6

4,6%

22,1%

Qwen 3.7-Plus

2,8%

21,5%

Как модели проходят тесты: они ходят по рабочему столу, делаю скриншот, "думают", далее осуществляют клик или команду, пауза, снова скриншот, и так далее. У Claude — родной computer-use, часто пакетными вызовами. У остальных — pyautogui и похожие действия. Лимит 500 шагов.

Документация OSWorld 2.0 фиксирует ещё один эффект: агенты умеют обходить интерфейс — полезть в DOM, убить LibreOffice, вытащить скрытое состояние. Задача может закрыться способом, которого у человека за тем же столом нет. Авторы это помечают отдельно и штрафуют (о чем писал выше). В прогоне Маракуйи таких штрафов не было.

Результаты Маракуйи ИИ

Маракуйя ИИ — это среда агентская обвязка (и среда разработки, можно сказать что это "отечественный Cursor или Claude Code). Внутри стоит внешнаяя, чужая языковая модель. Это может быть что угодно, что выберет разработчик, хоть дипсик, хоть Fable, хоть Гигачат (вот это лично мне прогнать было бы очень интересно!).

Снаружи — среда, в которой модель получает руки: файлы, терминал, браузер, мышь и клавиатуру, цикл шагов, возврат ошибок, проверку результата. LLM получает данные от агентов, думает и отдает агентам команды. Среда исполняет их на настоящем компьютере и показывает, что вышло.

Прогон OSWorld шёл на deepseek-v4.1-flash, reasoning effort high, режим полного доступа, через официальный персональный MCP платформы. Оценщик — немодифицированный код OSWorld. Обвязка вокруг агента — своя. По правилам бенчмарка такие цифры идут как self-reported: задачи и судья официальные, попадание в verified-лидерборд требует отдельной верификации авторами. Сравнивать всё равно полезно — одноимённые метрики, тот же релиз набора.

Результат Маракуйи в OSWorld 2.0 — 20,2% / 47,8% (partial)

Метрика

Значение

Задач оценено

104 из 108

Решено полностью

20,2% (21 задача)

Средний балл по точкам

47,8%

Действий через GUI

26,6% (2772 из 10429)

Машинное время

43,8 ч

Штрафов за недопустимый способ

0

Прогонов, снятых из-за сбоя платформы

12, в метрики не входят

На той же шкале, тем же срезом лидерборда: Claude Opus 4.8 — 20,6% / 54,8%; GPT-5.5 — 13,0% / 49,5%; Claude Opus 5 — 31,4% / 68,3%. По доле полностью закрытых задач Маракуйя с deepseek-v4.1-flash стоит рядом с Opus 4.8 и выше GPT-5.5. Притом, использованная модель чуть ли не кратно дешевле фронтира.

Через экран сделана примерно четверть действий, остальное — терминал и файлы. Работа шеллом в OSWorld легитимна: это один из пяти учтённых режимов. Авторы отдельно следят, не ушёл ли агент в обход GUI так, как не смог бы человек. Здесь safety-проверки все пройдены: document_integrity, disk_usage, snap_sandbox_bypass, xhost_disabled, sudoers_unchanged и прочие из отчёта, все пройдено легитимно.

Маракуйя закрывает сценарии целиком: Thunderbird — 3 из 3. Файловый менеджер — высокий средний балл, GIMP — 2 из 5 при среднем 0,76, Impress — 0,93. Где пока дыры: Excel (средний 0,13), Writer (0,17), VS Code, PDF-просмотрщик, Shotcut. По тегам слабее всего tutorial following, dynamic environment, streaming и human-in-the-loop — как раз те задачи, на которых спотыкаются и фронтиры.

Что занизило результаты тестов:

  1. Официальный протокол даёт 500 шагов, и еще есть лимит по времени. В него упёрлись 25 задач из 104; 14 из них в результате получили ноль, так как не доделали задачу. Вероятно, если бы модель была бы развернута локально, то тесты прошли бы быстрее и оценка была бы выше. Но что может позволить себе компания с многомиллиардной, если не триллионной капитализацией, небольшая команда разработки очевидно не может так шиковать;

  2. Девять задач судья смотрит по скриншоту. Судьёй был deepseek-v4-pro, который картинку не принимает.

Это очевидно косяк в сетапе теста, и выстрел себе в ногу. Судью надо было ставить с работающим OCR. В итоге, лично мой вердикт по одному тексту — оценки этих девяти недостоверны, причем в обе стороны - решение могло быть верным, а могло быть и неверным. 3. Прогон шёл по порядку, четыре задачи остались без оценки из-за сбоя платформы. Выборка чуть перекошена. Рекомендация команде - перепройти тест с учетом этих косяков, и полагаю оценка будет значительно выше.

Terminal-Bench 4.0 — 33,9%

33,9% решённых задач на наборе 4.0. На ориентире официального лидерборда это место между Claude Opus 4.8 + Claude Code (23,6%) и GPT-5.6 Sol + Codex (37,3%), ниже GLM-5.3 внутри Claude Code (41,8%) и конечно же ниже Astra/Fable 5.1 (~58%), с их триллиардами на разработку и обучение и армией разработчиков.

Недалеко от топовых лидеров, и обгоняет наверное 90% всех прочих обвязок в мире

Недалеко от топовых лидеров, и обгоняет наверное 90% всех прочих обвязок в мире

Цифры 33,9% — это то, сколько задач закрыла Маракуйя на своём стенде со своей агентской обвязкой и инструментариями,и это, на мой взгляд, много. Очень МНОГО. Маракйя примерно там же, где Sol, и выше Opus 4.8 (!!!).

Что из этого следует (личное мнение, как и вся статья в целом)

Первое. В России уже есть продукт того же класса, что Claude Code, Codex и Cursor: агент с файлами, терминалом, браузером и рабочим столом. Программисту в РФ это даёт рабочую среду на своём контуре, с без ВПН, с оплатой картами МИР (когда будет релиз; пока что Маракуйя Код находится в закрытом тестировании для узкой группы, в которую я тоже вхожу).

Второе. Как указали в комментариях к моей предыдущей стетье о бенчмарках Алисы и Гигачата, сила здесь в обвязке. deepseek-v4.1-flash в руках Маракуйи закрывает пятую часть OSWorld 2 целиком и треть Terminal-Bench 4. Лидерборды тоже подтверждают, что обвязка решает: GLM-5.3 тоже показывает значительно лучшие результаты, когда она проходит эти же тесты в Claude Code.

Третье. Наши разработчики - топ. Команда из 10 человек построила агентскую обвязку и среду для разработки, аналогичную иностранным, которые стоили миллиарды долларов. Это вселяет надежду в то, что отечественная сфера ИИ не безнадежно отстала. Да, времена тяжелые, инвесторы и чиновники до сих пор не понимают что ИИ - это не только прибыль, но и стратегическое направление развития, которое критически для развития страны. Но вопреки всему, есть команды, которые делают то, что казалось бы сделать невозможно.

ADD: Вот сейчас стопроцентов налетят пессимисты в комментарии, которые расскажут что все это чушь и в России нет ИИ и никогда не будет, пользуйтесь Антропиком. А тем временем, в моей бета Маракуйи, пока я писал эту статью, автономный агент нашел 78 тысяч нужных мне сайтов и добыл 13 тысяч контактов, по признаку "опубликовал сам человек для того, чтобы с ним могли связаться", разложил по 4 excel файлам, все категоризировал, написал комментарий к каждому человеку из списка и отметил, что именно ждет пользователь. Ни Курсор, ни Кодекс, ни Клод так не смогли и умерли примерно через полчаса автономной работы. Поэтому я не принимаю пессимизм и критику от тех, кто не пробовал и не знает, что это за зверь у меня на тестировании.

Алиса и Гигачат

В прошлой статье отечественные чаты выглядели скромно на Arena, MultiChallenge, τ³ и ПРАКТ. Конечно последовали комментарии из разряда «не смешите, какие это ИИ от Алисы и Гигачата» (о чем я написал только что дополнение выше).

Я активно подбиваю команду Маракуйи интегрировать Гигачат 3.5 ультру и Алису API в продукт, и прогнать эти же бенчмарки внутри их обвязки. Знаю, что у Алисы есть модели, которые не в открытом доступе (недавний релиз Алисы для Бизнеса 360 показывает, что и что-то в направлении агентов они пытаются делать - работает слабенько, агент все время умирает в процессе выполнения задач, но как-то работает). Если разработчики Алисы это читают - напишите мне в личку, давайте сделаем совместный прогон Алисы + Маракуйи, я готов взяться за организацию этой коллаборации.

Конечно, я не знаю заранее, какая будет цифра. На самом деле Ultra на длинном тексте и в τ³ из прошлой статьи уже выглядит неплохо. Через Маракуйю у модели появится шанс работать как агент с руками, и мне кажется (да, я оптимист), что результаты могут всех удивить. Если это получится, то для наших разработчиков появится крутейшая среда разработки, без танцев с бубнами, ВПНом/VPS, иностранными картами и банов аккаунтов.

Для всех остальных разработчиков, если у вас есть сильные ИИ модели, которые вы создали сами - напишите мне тут в диалоги. Я вижу в некоторых чатах, что есть команды, которые пишут свои модели и обучают их с нуля, тоже вопреки всему и отсутствию 10к H100. Может быть и с вами получится организовать коллаб, и создать что-то, что может и потеснит мировые ИИ, кто его знает. Но знаю точно одно: под лежачий камень вода не течет. Если мы хотим развить ИИ в нашей стране, то спасение утопающих - дело рук самих утопающих.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.