Daily MaverickProtests erupt in Nigeria after 37 miners die in custody of paramilitary agencyInquirerCPD: 14.1% of Filipinos still use traditional family planningPunchAlexander-Arnold, Palmer return to England squad for Nations LeagueThe Jerusalem PostMamdani says he will not join demonstrations against Netanyahu during New York visitוואלהשלושה תלמידים נהרגו באירוע ירי בבית ספר בפיליפינים, בהם החשוד ביריEl Comercio“Estados Unidos tiene la tecnología, pero la guerra con Irán revela el límite de sus arsenales”RTP DesportoFlamengo apurado para as `meias` da LibertadoresSouth China Morning PostUS hands over 64 smuggled artefacts to China in diplomatic push before leaders’ meetingGhaflaSenator Karen Nyamu Opens Up About Parental Guilt And Balancing Politics With Raising Three ChildrenThe Hollywood ReporterHow Fatih Akin Breathed Life Into San Sebastian’s Haunting Opener ‘Ghost Song’Anime News NetworkRelive Your FF7 Trauma in Tokyo Game Show Photo OpNOS SportMotorcoureur Veijer breekt sleutelbeen bij crash in vrije training
The Daily Newsstand · Free, Always
Friday, September 18, 2026

Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena‑Hard

Translate

Я обещал написать эту статью и я наконец-то закончил тесты и готов поделиться с вами результатами.

Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы - модели обрывались, где-то нужно было костылять заплатки чтобы они отвечали, где-то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании).

Наконец-то я получил ответы, которые мне интересны - и, надеюсь, будут интересны и вам, и создателям Алисы и Гигачата. Почему они сами не проходят такие бенчмарки я догадываюсь, но на месте руководства этими проектами я бы наоборот, поставил бы прохождение бенчмарков в цикл. Потому что только так можно понять где твоя модель, а где мировые лидеры.

Я хотел сделать бенчмарк и Маракуйи ИИ, но ребята ушли в глубокий рефакторинг и обещают скоро вернуться с совсем новым продуктом - отечественной кодовой средой, аналогом Cursor, Claude Code, Codex, но без VPN, иностранных карт и вообще суверенное решение. Поэтому, к сожалению, в этой статье я поделюсь результатами только трех моделей: Алиса, Гигачат Ультра, Гигачат Макс, а Маракуйю оставлю видимо на потом и на отдельную статью.

Алиса тестировалась через веб-коннектор - именно так, как с ней взаимодействуют пользователи. В 90% случаев она в процессе оправдывалась: "Сейчас повышенная нагрузка, поэтому я включаю модель попроще". Но тест на то и есть тест: именно так с ней и взаимодействуют пользователи и именно такой результат они и получают. Гигачат - тестировался по АПИ. Бесплатных токенов, которые дают при регистрации, не хватило - поэтому я тестировал с трех аккаунтов: двух своих и с аккаунта жены. Этого хватило.

Важно про Алису: тестировалась Алиса, доступная пользователям. Алиса для бизнеса, которая появилась в Алиса 360, не тестировалась - она вышла недавно и пока что руки не дошли до нее. Вероятно, она покажет немного лучший результат; но судя по моему персональному опыту работы с ней, шансов на это не так чтобы много.

Ну вот и все о чем стоило бы рассказать перед тем, как я поделюсь результатами, а сами результаты - ниже.

Зачем гонять чужие бенчмарки

Русский чат легко проверить на «напиши стихотворение». Мне нужно было другое: держит ли он форму, когда задание длинное, на английском, с правилами и несколькими репликами подряд. Западные лаборатории для этого давно собрали открытые наборы задач. Я прогнал по ним отечественные чаты — одни вопросы, одни правила счёта.

Сначала модель отвечает как обычный чат, каждый пункт — новый диалог. Потом отдельный судья читает готовые ответы. Здесь это Grok 4.6. Если связь оборвалась и вопрос до модели не дошёл, попытку не считаю и повторяю. Если чат вернул пустоту или свою ошибку сервера — это ноль, а не «у нас сломался браузер».

Кто в сравнении

Алиса — чат на alice.yandex.ru с подпиской Яндекс Плюс. Человек в стране открывает сайт, поэтому я тестировал сайт.

GigaChat Max и GigaChat Ultra — два тарифа Сбера. Их нельзя склеить в одну строку: Ultra сильнее на длинном тексте и на задачах с инструментами, Max дешевле и слабее на тех же вопросах.

Arena-Hard — кто пишет лучше на трудном задании

Два ученика, одна сложная контрольная: код, кейс, длинная инструкция. Учитель не ставит «пять из пяти», а говорит, чей лист лучше. Так устроен Arena-Hard: 750 тяжёлых заданий, ответы сравниваются парами — победа, поражение или ничья. Победа уходит тому, кто довёл расчёт и закрыл пункты.

У каждой пары два столбика. Левый — доля побед модели слева в названии, правый — справа. Ничья входит в 750, на графике её нет. 83% у Max против Алисы значит: из 750 пар учитель отдал лист Max в 620 случаях, Алисе — в 106, ничья — 24.

Arena-Hard: соревнование трех моделей

Arena-Hard: соревнование трех моделей

На сложных письменных задачах Ultra чаще даёт полный и технически верный ответ, Max — заметно чаще Алисы. Алиса выигрывает там, где соперник отказывается или ломает условие. Порядок: Ultra, затем Max, затем Алиса.

WildBench — длинный рабочий чат

Обычный рабочий день с ассистентом: длинные треды, чеклисты, «доделай», «перепиши мягче», «учти прошлый абзац». WildBench — 1024 таких разговора. Судья ставит оценку от 1 до 10 за весь ответ. Пятёрка — «нормально, без блеска». Ниже пяти — слабее обычного. WB-Score — та же шкала, сдвинутая так, чтобы пятёрка стала нулём: (средняя − 5) × 2. Минус на ней не значит «ноль ответов», а «средняя ниже пяти».

WildBench - результаты почти одинаковые. WB-SCORE - показатель от среднего (5, 5 = норма)

WildBench - результаты почти одинаковые. WB-SCORE - показатель от среднего (5, 5 = норма)

Алиса в среднем чуть ниже «нормально», Max чуть выше, Ultra увереннее держит длинный чат. Разрыв небольшой, порядок тот же: Ultra, Max, Алиса.

MultiChallenge — память и послушание в диалоге

Диалог из нескольких реплик. В середине пользователь меняет правило, просит учесть сказанное раньше, правит текст. Модель отвечает на последнюю реплику. Судья говорит только «да» или «нет»: попал ли финальный ответ в критерий.

Четыре оси. Память — не забыть факт из начала разговора. Инструкция — не соскочить с правила, которое задали по ходу. Редактирование — править текст, а не писать заново мимо задания. Согласованность — не противоречить своему же предыдущему ответу.

46% у Ultra — примерно каждый второй финальный ответ попал в критерий. 15% у Алисы — примерно каждый седьмой. Для бытового чата это жёсткий экзамен: критерии узкие, история длинная.

MultiChallenge - Ultra далеко впереди

MultiChallenge - Ultra далеко впереди

Ultra вдвое чаще Max закрывает условие в конце длинного диалога. Алиса чаще теряет правило по пути. На «перепиши версию» все трое слабее, чем на память факта.

τ³ — агент в колл-центре

Модель сажают на место оператора. У неё правила компании и кнопки в учебной CRM: найти клиента, поменять билет, провести возврат. С другой стороны говорит симулятор клиента — в этом тесте везде Ultra. Зачёт только если задача закрыта по правилам с первого раза. Можно красиво извиниться и провалить возврат — балл не зачтётся. Три мира: авиабилеты, розница, телеком.

Число 0,66 у Ultra — доля успешных разговоров из 278. Алиса в среднем 0,076, Max 0,119. Ultra уходит вперёд за счёт телекома и розницы.

Тау3 - ультра тут показывает кратно лучшие результаты

Тау3 - ультра тут показывает кратно лучшие результаты

Ultra умеет закрывать тикет по правилам, особенно в телекоме. Max чаще срывает процедуру. Алиса на авиа далеко даже от Max, на рознице почти не закрывает сценарий, на телекоме внезапно немного обогнала Max.

Скорость ответа

Отдельная ось: сколько секунд чат думал, пока писал ответ. Это не качество. Алиса на Arena отвечает быстрее. Ultra на MultiChallenge отвечает быстрее Max.

Скорость ответов моделей в разных тестах

Скорость ответов моделей в разных тестах

Arena / WildBench / MultiChallenge, секунды: Алиса 9,6 / 10,4 / 19,2; Max 15,6 / 20,8 / 10,9; Ultra 17,9 / 21,6 / 10,7.

ПРАКТ-120 — работа с файлами и вебом

Это - самый интересный тест из всех. Он определяет как модель ведет себя в агентских задачах, которые реапьно нужны людям, то есть то, с чем фактически приходят люди к ИИ. Об этом тесте я писал в этой статье.

Кратно, что такое ПРАКТ-120: это 120 рабочих задач «как у человека в офисе с ChatGPT». Модели дают бриф и, где нужно, дают файлы в обработку. На выходе ждут текст с источниками, например в формате Word, или исправленную таблицу Excel, или ответ по пачке документов, и так далее. Эксперт ставит 0–100: правильность, полнота, следование инструкции, источники, пригодность в деле.

  • Поиск, 30 задач. Открытый веб, входных файлов нет. «Собери факты, укажи источники».

  • Документы, 30 задач. Ответ должен сидеть в выданной пачке. Выдуманная цитата режет балл.

  • Word, 25 задач. Нужен настоящий файл .docx, не текст в чате.

  • Excel, 25 задач. Нужен настоящий .xlsx с расчётом, не картинка таблицы.

  • Сквозные, 10 задач. Найти, посчитать, оформить документом.

PRACT-120 - реальные задачи, которые нужны людям.

PRACT-120 - реальные задачи, которые нужны людям.

Как выадются оценки: нет обязательного файла на выходе — ноль. Критическая выдумка, которая меняет решение, — не выше 49. Среднее по всем 120 задачам включает нули. Word, Excel и сквозные у всех троих — ноль: настоящего документа они не отдали.

Внезапно, Алиса, вебовская, почти на уровне Гигачата Ультра. Ультра лучше работает с документами, Алиса вытащила себя буквально за волосы за счет поисковика. Это и неудивительно, с Яндекс поиском в кармане.

Что из всего этого следует

На письменных и диалоговых тестах картина одна. Ultra сильнее Max, Max сильнее Алисы. Разрыв большой на Arena и MultiChallenge, спокойнее на WildBench: там все трое живут около школьной «четвёрки-пятёрки».

τ³ добавляет другое измерение: умение закрывать заявку по правилам в учебной CRM. Ultra здесь уходит далеко вперёд (0,66). Max и Алиса обе около 0,08–0,12 и практически бессильные.

Для офиса с файлами ПРАКТ важнее «напиши эссе»: Word и Excel у всех троих ноль, Ultra выигрывает за счёт работы с выданными документами, Алиса — за счёт поиска в вебе. Работать с файлами нормально из этих моделей никто не умеет (забегая вперед - Алиса для бизнеса наконец-то научилась работать более чем с одним файлом и даже появился какой-то RAG внутри; работает пока что криво-косо, автономии практически нет и каждые 5 минут надо тыкать палочкой чтобы продолжала - но это предмет следующих тестов).

Что еще из важного: письменные ответы оценивал Grok 4.6 Extra High. Другой судья может сдвинуть проценты. Порядок силы на этих трёх чатах совпал на Arena, WildBench и MultiChallenge. Это уже повод относиться к Ultra как к сильному отечественному чату на длинном тексте, к Max — как к середняку той же семьи, к Алисе — как к быстрому потребительскому чату, которому на жёстком ТЗ чаще не хватает полноты, и которая, спустя столько лет, все еще больше развлекушка, чем что-то полезное в реальных задачах.

Мое следующее приключение

Прямо сейчас я занимаюсь очередным мазохизмом: я пытаюсь прогнать Гигачат и Алису 360 через два самых сложных бенчмарка, которые наверное существуют в природе: OS World и Terminal Bench 4.

Предварительно скажу так: оценка 0 у всех. Грешил на настройки моей инфраструктуры, но судя по всему нет - модели просто не справляются. Возможно, эти тесты в принципе не скормить им снаружи, будучи обычным пользователем и не частью команды Алисы/Сбера, или без специального доступа к какому-нибудь АПИ. В общем если это читают разработчики Гигачата/Алисы и у вас есть желание независимого бенчмарка на том, на что смотрит весь мир - напишите мне в диалоги, проведем бенчмарки вместе.

Всем спасибо, надеюсь статья была интересная и может быть кому-то даже полезная.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.