ИИ поступает в ШАД в 2026
Автор: Лыков Александр, к.ф.-м.н., академический руководитель Школы Высшей Математики и ШАД Хелпера.
В статье мы приведём результаты решения задач с первого этапа вступительного экзамена в ШАД в 2026 от ИИ.
Что мы проверяли.
На первом этапе поступающим предлагалось решить 40 задач из разных разделов математики и алгоритмов за два часа. Более подробно о том, как проходила вступительная кампания в ШАД в 2026 году описано в статье https://habr.com/ru/articles/1050754/ . На экзамене проверялся только ответ, решение не смотрели. Всего было четыре варианта: A, B, C, D. Список задач можно посмотреть тут: https://shadhelper.notion.site/#3c6f1b94fe9b80328c20f75b9842cb84
Мы взяли все задачи с первого этапа и посмотрели, как их решали различные LLM. Мы не ставили целью сравнивать между собой LLM. Скорее мы хотели оценить возможность ИИ в целом пройти первый этап отбора в ШАД.
Результаты
Ниже таблица с результатами:
Модель | Средний балл | % правильных | Время |
|---|---|---|---|
Claude: Opus, 4.8 | 39.5 / 40 | 98.8% | 25 мин |
DeepSeek-R1-0528 | 38.25 / 40 | 95.6% | 43 мин* |
ChatGPT: Sol, Medium | 37.75 / 40 | 94.4% | 14 мин |
Qwen 3.7 Max | 32.5 / 40 | 81.3% | 155 мин |
Gigachat-3-Ultra | 25.25 / 40 | 63.1% | 3–4 мин |
Таблицы по вариантам:
Score | A | B | C | D | Average |
|---|---|---|---|---|---|
Claude: Opus, 4.8 | 40 | 40 | 40 | 38 | 39.5 |
DeepSeek-R1-0528 | 40 | 40 | 37 | 36 | 38.25 |
ChatGPT: Sol, Medium | 37 | 40 | 38 | 36 | 37.75 |
Qwen 3.7 Max | 32 | 27 | 35 | 36 | 32.5 |
Gigachat-3-Ultra | 31 | 24 | 28 | 18 | 25.25 |
Модели DeepSeek и Gigachat мы тестировали с помощью API к моделям и Python-скрипта. Остальные модели с помощью harness’ов. Для Claude и ChatGPT взяли Github Copilot, для Qwen использовали Qwen CLI.
Строго говоря, результат зависит не только от самих языковых моделей, но и от конкретных способов их использования: API или coding harness.
Проходной балл был в районе 30. Поэтому все зарубежные LLM прошли бы первый этап. Обратим внимание, что мы использовали не самые мощные модели, доступные сейчас, так как задачи с первого этапа достаточно простые. Взяли те, что “были под рукой”.
Репозиторий с решениями, проверкой и Python-скриптами: https://github.com/alexlyk/shad2026_1_llm
Кто на чём ошибался
Распределение задач по предметам
Предмет \ Вариант | A | B | C | D |
|---|---|---|---|---|
Математический анализ | 10 | 10 | 10 | 10 |
Алгебра, включая линейную | 10 | 10 | 10 | 10 |
Теория вероятностей | 10 | 10 | 10 | 10 |
Дискретная математика | 5 | 5 | 5 | 5 |
Алгоритмы и структуры данных | 5 | 5 | 5 | 5 |
Итого задач | 40 | 40 | 40 | 40 |
В дискретную математику включены комбинаторные задачи, задачи о графах, подсчётах конфигураций и перестановках. Аналитическая геометрия и задачи с матрицами отнесены к алгебре.
Топ тем по каждому предмету с указанием количества задач на заданную тему (составлено ИИ):
Предмет | Тема-победитель | A | B | C | D |
|---|---|---|---|---|---|
Математический анализ | Дифференцируемость, теоремы о среднем и формула Тейлора | 4 | 4 | 4 | 4 |
Алгебра | Линейные операторы и спектральная теория | 5 | 5 | 3 | 3 |
Теория вероятностей | Математическое ожидание и дисперсия, включая условное матожидание | 4 | 3 | 4 | 4 |
Дискретная математика | Комбинаторика: сочетания, перестановки и подсчёт конфигураций | 4 | 5 | 4 | 4 |
Алгоритмы и структуры данных | Анализ сложности алгоритмов | 4 | 4 | 3 | 3 |
Далее проанализируем систематические ошибки моделей.
Задач, в которых ошиблись все пять моделей, не выявлено.
По предметам такая статистика:
Предмет | Средний балл всех моделей |
|---|---|
Математический анализ | 94.1% |
Линейная алгебра и геометрия | 90.8% |
Дискретная математика | 89.5% |
Теория вероятностей | 89.3% |
Алгоритмы и структуры данных | 85.5% |
По темам.
Тема программы | Задачи | Средний балл |
|---|---|---|
Системы линейных уравнений | C23, D23 | 60.0% |
Амортизационный анализ | A36–D36 | 67.5% |
Характеристические функции | A9–D9 | 72.5% |
Минимальные остовные деревья | C39, D39 | 75.0% |
Геометрическая вероятность | A4–D4 | 80.0% |
Дифференцируемость высокого порядка | A16–D16 | 80.0% |
Условная вероятность и формула Байеса | A1, A2, B1, B2, C2, D2 | 80.0% |
Алгоритм Дейкстры и функции стоимости пути | C40, D40 | 80.0% |
Определители и обратные матрицы | 8 задач | 83.8% |
Включения-исключения | B35, C35, D35 | 86.7% |
Сходимость и предельные теоремы | A10–D10 | 87.5% |
Модель | Наиболее слабые темы |
|---|---|
Claude | Слабых тем не выявлено: 99% во всех представленных темах |
DeepSeek | Системы линейных уравнений — 50%; классическая/комбинаторная вероятность — 75%; условные моменты и дисперсия — 83.3% |
ChatGPT | Системы линейных уравнений — 0%; амортизационный анализ — 75%; характеристические функции, рекуррентные соотношения и определители — по 87.5% |
Qwen | Характеристические функции — 50%; минимальные остовные деревья — 50%; комбинаторика последовательностей — 50%; определители — 56.3%; условная вероятность и Байес — 58.3%; амортизационный анализ — 62.5% |
GigaChat | Амортизационный анализ и Дейкстра — 0%; дифференцируемость высокого порядка — 12.5%; геометрическая вероятность, MST и обратимость матричных выражений — по 25% |
Универсальной слабости всех моделей нет. Совокупно наиболее труден алгоритмический блок, но результат сильно зависит от модели.
Сколько времени и денег это стоило
Таблица времени выполнения задач в минутах
Time (min) | A | B | C | D |
|---|---|---|---|---|
Claude: Opus, 4.8 | 25 | 25 | 25 | 25 |
DeepSeek-R1-0528 | 22 | 22 | 39 | 43 |
ChatGPT: Sol, Medium | 14 | 14 | 14 | 14 |
Qwen 3.7 Max | 155 | 155 | 155 | 155 |
Gigachat-3-Ultra | 3 | 3.1 | 3.6 | 3.6 |
Github Copilot и Qwen CLI решали варианты параллельно. Поэтому, например, Claude решил все варианты за 25 минут. Qwen CLI долго пыхтел, перезапускал себя, разбивал задачу на куски, но не сдавался. В итоге через 155 минут всё решил, но с ошибками.
По деньгам: Claude, ChatGPT входят в 20-долларовую подписку. DeepSeek потратил 15 центов на один вариант, Gigachat-3-Ultra выдаёт бесплатные токены на свою модель.
Gemini, который списал у DeepSeek
Мы также провели эксперимент для Gemini 3.1 Pro (Preview), Medium + Github Copilot. Но по результатам он был дисквалифицирован. И вот по какой причине.
При первом прогоне он поразительно быстро нашёл решения - за 2.5 минуты. При дальнейшем с ним диалоге он мне написал:


Иными словами, в эксперименте агент на Gemini обнаружил в рабочей директории решения DeepSeek и скопировал их, а в последующих запусках не выполнил задание полностью. Агент оптимизировал выполнение поставленной задачи, а не соблюдение неявного намерения экспериментатора. Это фича нашей методики, а не модели.
Так что нужно быть аккуратным в таких экспериментах.
При повторных запусках он упорно отказывался решать задачи. Ссылался на то, что их очень много, нужно разбивать на подзапросы и т.д., как студент-троечник. Дисквалификация.
Выводы
Первый вывод состоит в том, что имея подписку за $20 на ЛЛМ можно пройти первые два этапа вступительных испытаний в ШАД (про прохождение второго этапа мы писали в статье https://habr.com/ru/articles/1050754/). Неужели онлайн-экзамены после таких результатов имеют право на жизнь?
Второй вывод грустный - наиболее сильная отечественная ЛЛМ, Gigachat, не прошла бы и первый этап вступительных экзаменов в ШАД (проходной балл был не ниже 30). Но мы надеемся и верим, что разработчики GigaChat к следующим экзаменам нас порадуют и GigaChat пройдёт все этапы.
Мы категорически против списываний и использования ЛЛМ на любых экзаменах, где это запрещено. Экзамен - это соревнование и нужно иметь мужество участвовать в нём честно и добросовестно. Кроме того, неизвестно, насколько могут заблокировать абитуриенту право ещё раз сдавать вступительные экзамены в случае обнаружения списывания.
Анализ не выявил “гробовых” задач, которые бы ни одна ЛЛМ не смогла осилить. Также нет систематических пробелов по разделам и темам. Ошибки разных LLM слабо совпадают: задача, сложная для одной модели, зачастую без проблем решается другой. Это скорее похоже не на общий предел современных LLM, а на особенности конкретных моделей.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.