The Jerusalem PostJerusalem begins renovation at Kafr Akab UNRWA facility, will become educational complexESPN DeportesMourinho habla del mercado, árbitros y trato a ViníciusESPNWNBA Power Rankings: Valkyries make statement with win over LynxPunchOyo empowers 80 civil servants with digital skillsInquirer EntertainmentKit Harington replaces Nicholas Hoult as Gilderoy Lockhart in ‘Harry Potter’ seriesוואלההקרמלין: "נשיא פינלנד שייך למפלגות 'המלחמה'"Daily MaverickWhy South Africa’s coalition politics is a failureRTP Desporto12h30m Benfica não fica com excesso de médiosNMEWatch Andy Burnham jam The Smiths on guitar with Ukrainian soldier during Kyiv visitWirtualna PolskaZabójstwo w Krakowie. Media: Trzech podejrzanych zbiegło z krajuColliderHulu Officially Cancels 5/10 'New Girl' ReplacementBlickKollision in Balsthal SO: Velofahrer erfasst Schülerin (13) und flüchtet – Mädchen erheblich verletzt
The Daily Newsstand · Free, Always
Tuesday, August 25, 2026

ИИ поступает в ШАД в 2026

Translate

Автор: Лыков Александр, к.ф.-м.н., академический руководитель Школы Высшей Математики и ШАД Хелпера.

В статье мы приведём результаты решения задач с первого этапа вступительного экзамена в ШАД в 2026 от ИИ.

Что мы проверяли.

На первом этапе поступающим предлагалось решить 40 задач из разных разделов математики и алгоритмов за два часа. Более подробно о том, как проходила вступительная кампания в ШАД в 2026 году описано в статье https://habr.com/ru/articles/1050754/ . На экзамене проверялся только ответ, решение не смотрели. Всего было четыре варианта: A, B, C, D. Список задач можно посмотреть тут: https://shadhelper.notion.site/#3c6f1b94fe9b80328c20f75b9842cb84

Мы взяли все задачи с первого этапа и посмотрели, как их решали различные LLM. Мы не ставили целью сравнивать между собой LLM. Скорее мы хотели оценить возможность ИИ в целом пройти первый этап отбора в ШАД.

Результаты

Ниже таблица с результатами:

Модель

Средний балл

% правильных

Время

Claude: Opus, 4.8

39.5 / 40

98.8%

25 мин

DeepSeek-R1-0528

38.25 / 40

95.6%

43 мин*

ChatGPT: Sol, Medium

37.75 / 40

94.4%

14 мин

Qwen 3.7 Max

32.5 / 40

81.3%

155 мин

Gigachat-3-Ultra

25.25 / 40

63.1%

3–4 мин

Таблицы по вариантам:

Score

A

B

C

D

Average

Claude: Opus, 4.8

40

40

40

38

39.5

DeepSeek-R1-0528

40

40

37

36

38.25

ChatGPT: Sol, Medium

37

40

38

36

37.75

Qwen 3.7 Max

32

27

35

36

32.5

Gigachat-3-Ultra

31

24

28

18

25.25

Модели DeepSeek и Gigachat мы тестировали с помощью API к моделям и Python-скрипта. Остальные модели с помощью harness’ов. Для Claude и ChatGPT взяли Github Copilot, для Qwen использовали Qwen CLI.

Строго говоря, результат зависит не только от самих языковых моделей, но и от конкретных способов их использования: API или coding harness.

Проходной балл был в районе 30. Поэтому все зарубежные LLM прошли бы первый этап. Обратим внимание, что мы использовали не самые мощные модели, доступные сейчас, так как задачи с первого этапа достаточно простые. Взяли те, что “были под рукой”.

Репозиторий с решениями, проверкой и Python-скриптами: https://github.com/alexlyk/shad2026_1_llm

Кто на чём ошибался

Распределение задач по предметам

Предмет \ Вариант

A

B

C

D

Математический анализ

10

10

10

10

Алгебра, включая линейную

10

10

10

10

Теория вероятностей

10

10

10

10

Дискретная математика

5

5

5

5

Алгоритмы и структуры данных

5

5

5

5

Итого задач

40

40

40

40

В дискретную математику включены комбинаторные задачи, задачи о графах, подсчётах конфигураций и перестановках. Аналитическая геометрия и задачи с матрицами отнесены к алгебре.

Топ тем по каждому предмету с указанием количества задач на заданную тему (составлено ИИ):

Предмет

Тема-победитель

A

B

C

D

Математический анализ

Дифференцируемость, теоремы о среднем и формула Тейлора

4

4

4

4

Алгебра

Линейные операторы и спектральная теория

5

5

3

3

Теория вероятностей

Математическое ожидание и дисперсия, включая условное матожидание

4

3

4

4

Дискретная математика

Комбинаторика: сочетания, перестановки и подсчёт конфигураций

4

5

4

4

Алгоритмы и структуры данных

Анализ сложности алгоритмов

4

4

3

3

Далее проанализируем систематические ошибки моделей.

Задач, в которых ошиблись все пять моделей, не выявлено.

По предметам такая статистика:

Предмет

Средний балл всех моделей

Математический анализ

94.1%

Линейная алгебра и геометрия

90.8%

Дискретная математика

89.5%

Теория вероятностей

89.3%

Алгоритмы и структуры данных

85.5%

По темам.

Тема программы

Задачи

Средний балл

Системы линейных уравнений

C23, D23

60.0%

Амортизационный анализ

A36–D36

67.5%

Характеристические функции

A9–D9

72.5%

Минимальные остовные деревья

C39, D39

75.0%

Геометрическая вероятность

A4–D4

80.0%

Дифференцируемость высокого порядка

A16–D16

80.0%

Условная вероятность и формула Байеса

A1, A2, B1, B2, C2, D2

80.0%

Алгоритм Дейкстры и функции стоимости пути

C40, D40

80.0%

Определители и обратные матрицы

8 задач

83.8%

Включения-исключения

B35, C35, D35

86.7%

Сходимость и предельные теоремы

A10–D10

87.5%

Модель

Наиболее слабые темы

Claude

Слабых тем не выявлено: 99% во всех представленных темах

DeepSeek

Системы линейных уравнений — 50%; классическая/комбинаторная вероятность — 75%; условные моменты и дисперсия — 83.3%

ChatGPT

Системы линейных уравнений — 0%; амортизационный анализ — 75%; характеристические функции, рекуррентные соотношения и определители — по 87.5%

Qwen

Характеристические функции — 50%; минимальные остовные деревья — 50%; комбинаторика последовательностей — 50%; определители — 56.3%; условная вероятность и Байес — 58.3%; амортизационный анализ — 62.5%

GigaChat

Амортизационный анализ и Дейкстра — 0%; дифференцируемость высокого порядка — 12.5%; геометрическая вероятность, MST и обратимость матричных выражений — по 25%

Универсальной слабости всех моделей нет. Совокупно наиболее труден алгоритмический блок, но результат сильно зависит от модели.

Сколько времени и денег это стоило

Таблица времени выполнения задач в минутах

Time (min)

A

B

C

D

Claude: Opus, 4.8

25

25

25

25

DeepSeek-R1-0528

22

22

39

43

ChatGPT: Sol, Medium

14

14

14

14

Qwen 3.7 Max

155

155

155

155

Gigachat-3-Ultra

3

3.1

3.6

3.6

Github Copilot и Qwen CLI решали варианты параллельно. Поэтому, например, Claude решил все варианты за 25 минут. Qwen CLI долго пыхтел, перезапускал себя, разбивал задачу на куски, но не сдавался. В итоге через 155 минут всё решил, но с ошибками.

По деньгам: Claude, ChatGPT входят в 20-долларовую подписку. DeepSeek потратил 15 центов на один вариант, Gigachat-3-Ultra выдаёт бесплатные токены на свою модель.

Gemini, который списал у DeepSeek

Мы также провели эксперимент для Gemini 3.1 Pro (Preview), Medium + Github Copilot. Но по результатам он был дисквалифицирован. И вот по какой причине.

При первом прогоне он поразительно быстро нашёл решения - за 2.5 минуты. При дальнейшем с ним диалоге он мне написал:

Иными словами, в эксперименте агент на Gemini обнаружил в рабочей директории решения DeepSeek и скопировал их, а в последующих запусках не выполнил задание полностью. Агент оптимизировал выполнение поставленной задачи, а не соблюдение неявного намерения экспериментатора. Это фича нашей методики, а не модели.

Так что нужно быть аккуратным в таких экспериментах.

При повторных запусках он упорно отказывался решать задачи. Ссылался на то, что их очень много, нужно разбивать на подзапросы и т.д., как студент-троечник. Дисквалификация.

Выводы

Первый вывод состоит в том, что имея подписку за $20 на ЛЛМ можно пройти первые два этапа вступительных испытаний в ШАД (про прохождение второго этапа мы писали в статье https://habr.com/ru/articles/1050754/). Неужели онлайн-экзамены после таких результатов имеют право на жизнь?

Второй вывод грустный - наиболее сильная отечественная ЛЛМ, Gigachat, не прошла бы и первый этап вступительных экзаменов в ШАД (проходной балл был не ниже 30). Но мы надеемся и верим, что разработчики GigaChat к следующим экзаменам нас порадуют и GigaChat пройдёт все этапы.

Мы категорически против списываний и использования ЛЛМ на любых экзаменах, где это запрещено. Экзамен - это соревнование и нужно иметь мужество участвовать в нём честно и добросовестно. Кроме того, неизвестно, насколько могут заблокировать абитуриенту право ещё раз сдавать вступительные экзамены в случае обнаружения списывания.

Анализ не выявил “гробовых” задач, которые бы ни одна ЛЛМ не смогла осилить. Также нет систематических пробелов по разделам и темам. Ошибки разных LLM слабо совпадают: задача, сложная для одной модели, зачастую без проблем решается другой. Это скорее похоже не на общий предел современных LLM, а на особенности конкретных моделей.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.