ESPN DeportesBarcelona aumenta la venta en casaThe Jerusalem PostMilan's Jewish woman describes what it's like to be Jewish amid rising antisemitism - interviewESPNFollow live: USA locked in tight battle with Spain in FIBA semifinalוואלהשריפה פרצה סמוך ל"ביג פאשן" בירכאBBC NewsCricket: Today at the TestCollider7 Years Later, Stephen King’s Forgotten Horror Anthology Series Deserves a RevivalHabertürkİHA saldırılarına kınamaIl Fatto QuotidianoI vincitori di Venezia 83 – Il Leone d’oro va Woman Unknown. Malkovich e Arcel migliori attori. All’israeliano Naza il premio speciale della Giuriaynet בידורהסרט שמציג עדויות על "הרג מכוון" בעזה זכה בפרס יוקרתי בפסטיבל ונציהANSAVenezia, Il Premio Speciale della Giuria a Naza, Coppa Volpi a Mathilde Arcel e John MalkovichNumeramaBlizzCon 2026 en direct : retour de StarCraft, sortie de Diablo V, WoW Forever, série Netflix x Diablo, The Last Titan…ZDF heute"Bombastisch": Para-Schwimmer beenden EM mit 27 Medaillen
The Daily Newsstand · Free, Always
Saturday, September 12, 2026

Кризис физики: теория должна уметь умереть

Translate

Недавно на Хабре появилась статья “Кризис в физике”, основанная на большом монологе Шона Кэрролла The Crisis in Physics.

Статья большая, обстоятельная и местами даже интересная. Однако после прочтения у меня осталось странное ощущение: кризис обсуждается очень долго, но нормального определения кризиса так и не появляется.

Кэрролл приводит вполне разумные соображения. Стандартная модель прекрасно работает. Общая теория относительности тоже работает. Новые ускорители стоят безумных денег. Доступные энергетические масштабы давно исследованы. Природа перестала подбрасывать физикам очевидные экспериментальные подсказки. Поэтому прогресс замедлился.

Все это, скорее всего, верно. Только это описание внешних условий, а не самой проблемы.

С моей точки зрения, кризис фундаментальной физики заключается в другом:

Пространство допустимых теорий растет быстрее, чем эксперименты успевают его сокращать.

Или, если сказать совсем просто:

У нас становится все больше теорий, которые все сложнее нормально убить экспериментом.

Это уже не просто отсутствие новых частиц. Это поломка механизма отбора теорий.

Какой именно кризис?

Сразу оговорюсь: речь не идет о кризисе всей физики.

Физика конденсированного состояния, фотоника, квантовая оптика, материаловедение, физика плазмы и множество других направлений вполне успешно развиваются. Там ставятся эксперименты, открываются эффекты, строятся устройства и возникают новые технологии.

Проблема относится прежде всего к фундаментальной физике: физике элементарных частиц, квантовой гравитации и той части космологии, которая пытается восстановить микроскопическое устройство мира по ограниченному набору наблюдений.

Причем кризис - это не обязательно ситуация, когда ученые перестали публиковать статьи или закончились интересные задачи. Статей может становиться больше. Конференций тоже. Можно генерировать все новые модели, вводить дополнительные поля, симметрии, размерности и взаимодействия.

Научная активность и научный прогресс - не одно и то же.

Можно очень активно двигаться по кругу.

Поэтому я бы определил кризис следующим образом:

Кризис фундаментальной физики - это кризис эмпирической дискриминации, при котором доступные наблюдения все хуже выбирают между конкурирующими фундаментальными объяснениями.

Это определение объясняет сразу несколько наблюдаемых симптомов:

  1. Отрицательные результаты исключают отдельные параметры, но редко уничтожают исследовательскую программу.

  2. Все большее значение приобретают неэмпирические критерии: красота, естественность, математическая связность и популярность направления.

  3. Разные теоретические конструкции воспроизводят один и тот же ограниченный набор наблюдений.

  4. После каждого нового результата остается возможность модифицировать вспомогательные предположения.

  5. Выбор направления начинает сильнее зависеть от устройства научного сообщества, финансирования и моды.

Кэрролл касается почти всех этих пунктов, но не связывает их в одну проблему.

Фальсифицируемость - это не bool

Обычно разговор о научности быстро приходит к Карлу Попперу и фальсифицируемости. Упрощенная версия выглядит примерно так:

bool is_falsifiable(theory);

Если теория фальсифицируема, то она научная. Если нет - не научная.

Как нетрудно догадаться, такой интерфейс слишком простой даже для философии науки.

Сам Поппер различал степень проверяемости и строгость испытаний теории. Здесь речь о популярном упрощении его позиции.

Рассмотрим две теории.

Первая предсказывает:

x = 42.0 \pm 0.1.

Вторая предсказывает:

0 < x < 10^{100}.

Формально обе теории фальсифицируемы. Для второй тоже можно придумать результат, который ее опровергнет. Например, получить отрицательное значение или число больше 10^{100}.

Но эмпирическая сила этих утверждений очевидно различна. Первая теория сильно рискует. Вторая почти ничем не рискует.

Именно поэтому полезнее спрашивать не только:

Можно ли в принципе опровергнуть теорию?

А:

Какую долю возможных наблюдений теория запрещает?

Пусть существует семейство моделей

\mathcal T = \{T(\theta, a)\},

где \theta - параметры модели, а a - набор вспомогательных предположений: начальные условия, распределения, дополнительные взаимодействия, устройство невидимого сектора и так далее.

После эксперимента E остается допустимая область \Theta_E. Тогда грубую силу эксперимента можно представить как

D(E;\mathcal T)=1-\frac{\mu(\Theta_E)}{\mu(\Theta)}.

Здесь \mu - заранее выбранная мера на заданном семействе моделей, причем 0<\mu(\Theta)<\infty. Это оценка исключенной доли внутри конкретной постановки.

Конечно, немедленно возникает неприятный вопрос: какую именно меру выбрать? Параметризация пространства тоже влияет на результат.

В байесовской постановке можно оценивать изменение вероятностей конкурирующих моделей. Если T обозначает модель, а y - результат эксперимента , информационный выигрыш записывается как

I(y;E)=D_{\mathrm{KL}}\left[p(T\mid y,E)\,\Vert\,p(T)\right].

Но сейчас важна не конкретная формула. Важна сама постановка.

Эксперимент, после которого теория допускает почти все те же варианты, что и раньше, является слабым тестом исследовательской программы. Даже если он очень точный, очень дорогой и опубликован в хорошем журнале.

Отсюда возникает полезное понятие: эмпирическая жесткость теории.

Жесткая теория делает узкие предсказания и дорого платит за ошибку. Эластичная теория способна растянуться почти под любой результат.

И вот здесь начинается реальная проблема современной фундаментальной физики. Многие программы остаются формально проверяемыми, но становятся все более эластичными.

Теорию никогда не проверяют в одиночку

Наивная версия Поппера тоже не работает. Реальный эксперимент не проверяет одно уравнение в вакууме.

Он одновременно проверяет:

  • основную теорию;

  • вспомогательные гипотезы;

  • начальные условия;

  • модель детектора;

  • статистическую обработку;

  • предположения о фоне;

  • правильность калибровки;

  • отсутствие неизвестных систематических ошибок.

Именно это обычно связывают с тезисом Дюгема - Куайна и проблемой недоопределенности теории данными.

Если эксперимент не совпал с предсказанием, логически не следует, что ошибочно именно ядро теории. Возможно, неправильно оценен фон. Возможно, не учтено взаимодействие. Возможно, начальные условия были другими.

Это не дефект науки. Так наука действительно работает.

Если бы ученые выбрасывали теорию после первого несовпадения, ньютоновская механика, гелиоцентрическая система и множество других успешных программ не пережили бы этап становления.

Имре Лакатос предложил более реалистичное описание: существует не отдельная теория, а исследовательская программа. У нее есть жесткое ядро и защитный пояс вспомогательных гипотез. При столкновении с аномалией сначала модифицируется защитный пояс.

Это вполне нормально.

Вопрос в другом: что происходит после модификации?

Лакатос различал прогрессивные и вырождающиеся исследовательские программы. Прогрессивная модификация не просто объясняет уже известную аномалию, а приводит к новому независимому предсказанию, которое затем подтверждается. Вырождающаяся программа в основном догоняет данные и добавляет исправления постфактум.

Исторически это различие хорошо видно на двух похожих ситуациях.

Аномалии движения Урана удалось объяснить существованием Нептуна. Дополнительная гипотеза не просто спасла ньютоновскую механику, а предсказала положение нового объекта.

А попытка объяснить аномальную прецессию перигелия Меркурия планетой Вулкан не сработала. В конце концов понадобилась общая теория относительности.

В обоих случаях можно было сказать: “наша базовая теория верна, просто существует невидимый объект”. В одном случае это оказалось правильно, в другом - нет.

Следовательно, введение дополнительной сущности само по себе не является ни научным, ни ненаучным. Все решает то, какие новые риски берет на себя расширенная теория.

Если очередная модификация только закрывает уже обнаруженную дыру и не создает новых независимых тестов, мы не получили больше знания. Мы просто лучше подогнали модель.

Темная материя: одна фраза, три разные гипотезы

Темная материя - хороший пример, но здесь очень легко сформулировать претензию неправильно.

Фраза “теория темной материи нефальсифицируема” слишком грубая и, строго говоря, неверная. Под словами “темная материя” обычно смешиваются как минимум три разных уровня утверждений.

Уровень

Утверждение

Что реально проверяется

Наблюдательный

В гравитационных системах присутствует эффект, который нельзя объяснить непосредственно наблюдаемой барионной материей в рамках стандартной динамики

Кривые вращения, линзирование, динамика скоплений, структура Вселенной

Космологический

Этот эффект можно описать холодной невзаимодействующей или слабовзаимодействующей компонентой в модели \LambdaCDM

Реликтовое излучение (CMB), барионные акустические осцилляции (BAO), рост крупномасштабной структуры, статистика галактик

Микрофизический

Темная материя состоит из конкретной частицы, поля или компактных объектов с определенной массой и взаимодействиями

Прямой поиск, косвенный поиск, коллайдеры, астрофизические ограничения

Первый уровень - это почти название наблюдаемой проблемы. Сам по себе он еще не выбирает онтологию: дополнительная невидимая компонента, модификация гравитационной динамики или более сложная комбинация должны различаться уже последующими наблюдениями.

Второй уровень весьма жестко проверяется. Базовая шестипараметрическая модель CDM действительно очень хорошо описывает огромный массив космологических данных. Финальный анализ Planck 2018 показал согласованность температурных, поляризационных и линзирующих данных с плоской шестипараметрической CDM. Это сильный результат, который нельзя просто выкинуть из рассмотрения.

А вот третий уровень остается чрезвычайно широким.

Темной материей могут быть:

  • слабовзаимодействующие массивные частицы (WIMP);

  • аксионы и аксионоподобные поля;

  • стерильные нейтрино;

  • сверхлегкие бозонные поля;

  • частицы скрытого сектора;

  • первичные черные дыры;

  • несколько разных компонент одновременно;

  • что-нибудь еще, до чего пока не додумались.

Обзор актуальных кандидатов можно найти, например, в Dark Matter Candidates and Searches и в разделе Dark Matter обзора Particle Data Group.

Конкретная WIMP-модель вполне фальсифицируема. Эксперимент LUX-ZEPLIN с экспозицией 4,2 тонно-года не обнаружил избытка над ожидаемым фоном и установил сильные ограничения на сечение взаимодействия WIMP с нуклонами.

Это реальный отрицательный результат. Он исключает значительную область параметров.

Но что именно он убивает?

Не темную материю вообще.

Не гипотезу о том, что темная материя состоит из частиц.

И даже не все WIMP-модели.

Он убивает определенную область конкретного пространства моделей при конкретных предположениях о взаимодействиях и распределении темной материи в гало.

После этого можно уменьшить сечение, изменить массу, выбрать другое взаимодействие, перейти к неупругому рассеянию, изменить производство частицы в ранней Вселенной или вообще сменить кандидата.

Еще раз: в этом нет мошенничества. Каждый такой вариант может быть физически осмысленным и заслуживать исследования.

Проблема возникает на уровне всей программы. Последовательность отрицательных экспериментов может уничтожать все новые ветви дерева, практически не затрагивая его ствол.

Получается интересная конструкция:

  • WIMP не найден - из этого не следует, что темная материя не состоит из частиц.

  • Аксион не найден в диапазоне A - из этого не следует, что аксиона нет.

  • Кандидат X исключен - из этого не следует, что программа темной материи опровергнута.

В результате отдельные модели остаются фальсифицируемыми, а общий класс сохраняет очень высокую эластичность.

Именно поэтому я бы говорил не о нефальсифицируемости темной материи, а о слабой фальсифицируемости микрофизической программы темной материи как целого.

Когда точность не решает проблему

Есть естественное возражение: надо просто собрать больше данных и повысить точность измерений.

Иногда это действительно работает. Более точный эксперимент сужает параметры, обнаруживает отклонение или полностью исключает модель.

Но не всегда.

Предположим, что наблюдение дает нам два числа, а микрофизическая теория содержит функцию, несколько полей, неизвестные начальные условия и набор взаимодействий. Тогда повышение точности двух чисел не обязательно восстановит уникальную микрофизику.

Мы можем очень точно измерить эффективные параметры и при этом почти ничего не узнать о фундаментальном устройстве системы.

Простой пример - жидкость. Можно чрезвычайно точно измерить плотность, вязкость и скорость звука. Но только из этих трех величин невозможно однозначно восстановить молекулярный состав вещества.

В современной космологии возникает похожая ситуация. На макроскопическом уровне модель может быть исключительно успешной, но различные микроскопические теории дают практически одинаковые наблюдаемые следствия.

В статье The Spectre of Underdetermination in Modern Cosmology эта проблема рассматривается для инфляции, темной материи и темной энергии. Авторы отдельно отмечают, что темная материя находится в несколько лучшем положении, поскольку допускает лабораторные, астрофизические и коллайдерные тесты. Однако доступные окна наблюдения покрывают лишь ограниченные области огромного пространства моделей.

Еще жестче проблема сформулирована в работе 2026 года Navigating Permanent Underdetermination in Dark Energy and Inflationary Cosmology. Для некоторых классов моделей инфляции и темной энергии можно строить микрофизически различные теории, предсказания которых для основных наблюдаемых параметров оказываются сколь угодно близкими.

Т.е. проблема может быть не временной, а принципиальной.

Можно бесконечно повышать точность доступных наблюдений и так и не получить уникальную фундаментальную теорию.

И вот это уже гораздо больше похоже на кризис, чем просто отсутствие новой частицы на очередном ускорителе.

Неэмпирическое подтверждение

Когда эксперимент плохо различает теории, возникает соблазн использовать другие признаки.

Например:

  • математическую непротиворечивость;

  • способность объединять разные области физики;

  • отсутствие известных альтернатив;

  • неожиданное объяснение ранее не связанных проблем;

  • естественность параметров;

  • красоту и простоту конструкции.

Все эти критерии полезны. Без них невозможно даже выбрать, какую из миллионов гипотез стоит исследовать первой.

Но здесь необходимо различать две совершенно разные задачи:

  1. Выбор теории для дальнейшей работы.

  2. Увеличение уверенности в том, что теория описывает реальность.

Красивая теория вполне может заслуживать десяти лет работы. Но из этого не следует, что природа обязана быть с ней согласна.

Ричард Давид (Richard Dawid), Стефан Хартман и Ян Шпренгер формализовали так называемый No Alternatives Argument: длительное отсутствие жизнеспособных альтернатив может при определенных условиях повышать байесовскую уверенность в теории.

С другой стороны, Джордж Эллис и Джо Силк в статье Defend the Integrity of Physics предупреждали, что попытка освободить спекулятивные фундаментальные теории от экспериментальной проверки подрывает сам научный метод. Карло Ровелли отдельно описал опасности чрезмерной неэмпирической уверенности.

Я думаю, что противоречие здесь во многом терминологическое.

Неэмпирические аргументы действительно могут повышать рациональность исследования теории. Они помогают распределять ограниченное время и ресурсы.

Но их нельзя считать полноценной заменой эмпирической селекции.

Иначе получается циклическая конструкция:

  1. Эксперимент не может проверить теорию.

  2. Альтернативы плохо разработаны, потому что основное сообщество работает над этой теорией.

  3. Отсутствие разработанных альтернатив считается подтверждением теории.

  4. Поэтому еще больше людей работает над этой теорией.

С точки зрения распределенных систем это называется положительной обратной связью. Она замечательно усиливает сигнал. Даже если исходного сигнала почти не было.

Модель кризиса

Попробуем теперь сформулировать происходящее чуть более формально.

Пусть \mathcal V_t - пространство жизнеспособных теоретических моделей в момент времени t. Тогда его изменение можно грубо записать так:

\Delta \mathcal V=G_{\text{new}}+R_{\text{rescued}}-X_{\text{excluded}},

где

  • G_{\text{new}} - новые предложенные модели;

  • R_{\text{rescued}} - модели, спасенные дополнительными предположениями;

  • X_{\text{excluded}} - модели, действительно исключенные экспериментом.

Пока

X_{\text{excluded}}>G_{\text{new}}+R_{\text{rescued}},

пространство объяснений сокращается. Мы узнаем, каким мир быть не может.

Если же

G_{\text{new}} + R_{\text{rescued}} \gg{} X_{\text{excluded}},

пространство допустимых объяснений растет.

При этом число статей, моделей и исследовательских групп может увеличиваться. Но неопределенность относительно фундаментального устройства мира не уменьшается.

Это и есть кризис эмпирической дискриминации.

Можно даже ввести еще одну грубую величину - стоимость спасения теории:

C_{\text{rescue}}=\frac{\text{число новых предположений после отрицательного результата}}{\text{число новых независимо подтвержденных предсказаний}}.

Если теория после каждой неудачи вводит два новых параметра и не делает новых рискованных предсказаний, стоимость спасения растет.

Опять же, это не готовая физическая величина. Но такой способ мышления полезнее бинарного вопроса “фальсифицируема теория или нет?”.

Почему объяснение Кэрролла недостаточно

Кэрролл в основном говорит: фундаментальная физика стала жертвой собственного успеха. Доступные масштабы исследованы, новые эксперименты сложны, природа не дает подсказок.

Это хорошее объяснение того, почему возникли условия кризиса.

Но оно не объясняет, почему именно эти условия опасны.

Опасны они потому, что при недостатке экспериментальных ограничений теория начинает разрастаться быстрее проверки.

Если бы у нас была одна жесткая теория, которая делала единственное предсказание на недоступной пока энергии, это было бы неприятно, но методологически понятно. Мы бы просто ждали эксперимент.

Реальная ситуация хуже. У нас возникают огромные семейства моделей, многие из которых способны воспроизвести уже известные данные. Новый эксперимент обычно исключает часть параметров, после чего теоретическое пространство перестраивается.

Поэтому проблема не только в количестве данных. Важна дискриминирующая способность данных.

Можно измерить один и тот же эффективный параметр в сто раз точнее и почти не приблизиться к выбору микрофизической теории. А можно провести один новый тип эксперимента, который уничтожит сразу целый класс объяснений.

С научной точки зрения второй эксперимент намного ценнее, даже если его абсолютная точность хуже.

А теперь приходит ИИ

До недавнего времени создание серьезной физической модели было дорогим процессом.

Нужно было изучить литературу, освоить математику, вывести уравнения, написать код, проверить предельные случаи, сравнить результаты с наблюдениями и подготовить статью. Даже плохая теория требовала заметного количества человеческого времени.

Это естественным образом ограничивало скорость генерации гипотез.

ИИ это ограничение постепенно снимает.

Уже сейчас модели умеют искать литературу, писать вычислительный код, выполнять символьные преобразования, подбирать параметры, строить численные модели и оформлять результаты. Пока качество не всегда достаточное. Однако здесь важна тенденция, а не конкретная версия очередной модели.

Стоимость производства теории будет падать:

C_{\text{theory}} \rightarrow 0.

А стоимость физического эксперимента - не обязательно:

C_{\text{experiment}} \not\rightarrow 0.

Большой адронный коллайдер нельзя сгенерировать токенами. Новый телескоп не появляется после удачного промпта. Вселенную нельзя перезапустить с другими начальными условиями. Даже полностью автоматизированная лаборатория ограничена временем, материалами, энергией и доступными масштабами.

Поэтому в эпоху ИИ дисбаланс может стать радикальным:

N_{\text{hypotheses}} \gg{} N_{\text{decisive experiments}}.

И тогда сегодняшний кризис покажется довольно уютным.

Фабрика эпициклов

Предположим, эксперимент не нашел ожидаемый сигнал.

Человек-теоретик может придумать несколько способов спасения модели. ИИ способен перебрать тысячи:

  • добавить слабое взаимодействие;

  • изменить механизм рождения частиц;

  • ввести скрытый сектор;

  • нарушить симметрию;

  • подобрать нестандартное распределение;

  • изменить начальные условия;

  • добавить зависимость параметров от энергии;

  • скомбинировать несколько ранее независимых моделей.

После этого можно автоматически найти варианты, совместимые со всеми известными ограничениями.

Формально получится замечательный результат: модель согласуется с экспериментом.

Только это будет согласование после того, как результат уже известен.

ИИ рискует стать идеальной машиной для производства эпициклов. Не потому, что он глупый, а потому, что именно такую задачу ему легко поставить: минимизировать ошибку на известных данных.

Переобучение на Вселенной

В машинном обучении всем известно, что высокая точность на обучающей выборке ничего не гарантирует. Нужны проверочная и отложенная выборки.

В теоретической физике ситуация страннее. У нас одна Вселенная и ограниченный набор наблюдений. Большая часть данных уже опубликована и доступна модели.

ИИ может построить теорию, идеально объясняющую всю историю наблюдений. Но это не обязательно будет хорошая теория. Возможно, он просто переобучился на Вселенной.

Поэтому возрастает ценность предсказаний, зафиксированных до открытия новых данных.

Версионирование здесь не запрещает после неудачного эксперимента сказать: “мы не учли эффект Y”. Возможно, действительно существует.

Оно фиксирует более скромную, но важную вещь: версия 1.3 не прошла тест, а версия 1.4 появилась уже после того, как результат стал известен.

model version: 1.3
frozen before dataset: D1

predictions:
  observable_A = ...
  observable_B = ...

downgrade criteria:
  ...

result on D1:
  prediction failed

successor:
  model version: 1.4
  change: added Y
  D1 used for model construction

new predictions:
  observable_C = ...

Версию 1.4 можно и нужно проверять дальше. Но результат D1 уже нельзя считать ее независимым предсказательным успехом: он использовался при построении модели. Для нового подтверждения версия 1.4 должна заранее предсказать что-нибудь еще.

Git тоже не запрещает исправлять код после упавшего теста. Он только сохраняет историю. Если разработчик многократно смотрит на проверочный набор данных и после каждого падения меняет реализацию, этот набор перестает быть независимой проверкой. Нужен новый независимый проверочный набор данных либо процедура, явно учитывающая адаптивное использование данных.

С теориями происходит то же самое.

Сам по себе журнал версий проблему не решает. Он лишь не дает смешать три разных события: теория предсказала результат; теория совместима с результатом; теория была изменена после результата. Полный механизм требует еще учета подгонки под результат и новых независимых тестов.

В работе Generalization in Adaptive Data Analysis and Holdout Reuse Синтия Дворк и соавторы показывают, как повторное использование проверочных данных приводит к переобучению, и предлагают способы контролировать этот эффект. Такие процедуры требуют соблюдения своих условий: уже опубликованный набор наблюдений нельзя задним числом объявить защищенной отложенной выборкой.

Инфляция научных публикаций

ИИ удешевляет не только создание модели, но и производство текста.

Можно получить аккуратную статью с формулами, графиками, обзором литературы и вполне убедительным введением. Проверить такую статью по-прежнему должен специалист.

Возникает неприятная асимметрия:

C_{\text{generate}} \ll{} C_{\text{verify}}.

Сгенерировать ошибочную работу можно за часы. Найти тонкую ошибку иногда занимает недели.

В статье The Need for Verification in AI-Driven Scientific Discovery, опубликованной в Philosophical Transactions of the Royal Society A, авторы прямо формулируют эту проблему: масштабируемая генерация гипотез без столь же масштабируемой проверки может не ускорить, а затормозить научный прогресс.

Еще прямее идея выражена в работе Falsify, Don’t Just Discover - AI-Generated Discoveries are NOT Born Scientific: генерация результата сама по себе не делает его научным; необходима процедура возможного опровержения.

В препринте The Unintended Consequences of Large Language Models as a Labor-Augmenting Technology in Science Эймон Дуэде и соавторы моделируют экономические стимулы. Удешевление поиска перспективных проектов в их модели повышает избирательность, а облегчение публикации имеющихся данных - снижает ее. Выводы описывают сценарии в рамках модели и требуют эмпирической проверки.

Это кажется очевидным. Однако очевидные вещи обычно и ломаются первыми, когда за публикации, гранты и цитирования возникает оголтелая гонка.

Синтетический консенсус

Есть еще одна проблема.

Представим, что десять независимых групп пришли к похожему выводу. Это может считаться дополнительным свидетельством, особенно если они использовали разные методы и данные.

Теперь представим, что сто ИИ-агентов, обученных на одном корпусе, использующих похожие модели и оптимизирующихся по одним метрикам, написали сто статей с похожим выводом.

Получили ли мы сто независимых свидетельств?

Очевидно, нет.

Мы получили один сильно коррелированный источник, размноженный сто раз.

Но внешне это может выглядеть как консенсус: множество статей, взаимные цитирования, обзоры и метаанализы. Через несколько итераций новые модели будут учиться уже на этой синтетической литературе и усиливать первоначальный перекос.

Так возникает научная версия петли обратной связи.

Особенно опасно это для направлений, где экспериментальная проверка слаба. Там литературный вес теории легче перепутать с эмпирическим весом.

ИИ может сузить пространство исследований

Обычно предполагается, что ИИ увеличит разнообразие идей. Это возможно, но совсем не гарантировано.

Модель обучается на существующей литературе. Лучше всего она работает там, где уже много качественных данных, кода и статей. Следовательно, у нее есть естественное смещение в сторону хорошо разработанных направлений.

В исследовании Artificial Intelligence Tools Expand Scientists’ Impact but Contract Science’s Focus авторы проанализировали десятки миллионов научных работ. По их оценке, ученые, использующие ИИ-инструменты, публиковали существенно больше статей и быстрее продвигались, однако коллективный объем исследуемых тем сокращался, а взаимодействие между направлениями уменьшалось. Авторы связывают это с концентрацией на областях, богатых данными, но прямо признают, что не могут полностью установить причинную связь.

Т.е. ИИ может одновременно увеличить индивидуальную производительность и уменьшить разнообразие науки.

Для фундаментальной физики это особенно неприятно. Если существующая доминирующая программа уже поглощает большую часть литературы и кадров, обученный на этой литературе ИИ естественным образом будет считать ее наиболее перспективной. После чего поможет создать еще больше работ в том же направлении.

Положительная обратная связь снова передает привет.

Аргумент “альтернатив нет” станет слабее

Есть и противоположное следствие.

Если ИИ способен систематически генерировать математически согласованные альтернативы, аргумент “мы долго искали и не нашли другой теории” становится слабее.

Возможно, альтернатив не было не потому, что правильная теория уникальна, а потому что пространство идей слишком велико для человеческого поиска.

ИИ способен обнаружить десятки ранее не рассмотренных конструкций. Это полезно: он разрушает ложную уверенность, основанную на ограниченности человеческого воображения.

Но затем возникает следующая проблема: как выбрать между сотней новых альтернатив?

Мы снова возвращаемся к эксперименту.

ИИ может решить проблему генерации теорий и тем самым сделать проблему их эмпирической дискриминации еще очевиднее.

ИИ может не только ухудшить ситуацию

До этого момента ИИ выглядел как устройство для промышленного производства научного шума. Это несколько несправедливо.

ИИ способен усилить не только генерацию, но и фальсификацию.

Нужно лишь правильно поставить задачу.

Сегодня большинство систем оптимизируется примерно так:

найди модель, которая лучше объясняет данные;

Для науки не менее важна обратная задача:

найди наблюдение, на котором модели разойдутся максимально сильно;

Это уже задача оптимального дизайна эксперимента.

Методологический предшественник здесь - Strong Inference Джона Платта: систематически строить альтернативы и искать эксперименты, позволяющие между ними выбирать. ИИ дает возможность масштабировать эту работу.

Пусть есть набор конкурирующих моделей T_1,…,T_n, текущие вероятности p(T) и предсказания возможных результатов p(y\mid T,E). Тогда выбирать следующий эксперимент можно по ожидаемому информационному выигрышу:

E^*=\arg\max_{E\in\mathcal E_B}\mathbb E_{y\sim p(y\mid E)}\left[D_{\mathrm{KL}}\bigl(p(T\mid y,E)\Vert p(T)\bigr)\right].

Здесь \mathcal E_B - множество технически реализуемых экспериментов в пределах бюджета B, а p(y\mid E) учитывает предсказания моделей с их текущими весами. Такой подход подробно рассматривается в обзоре Modern Bayesian Experimental Design.

Грубо говоря, надо ставить не самый точный эксперимент и не самый модный, а тот, после которого максимальное число теорий перестанет быть жизнеспособным.

ИИ здесь может быть чрезвычайно полезен:

  • искать области, где предсказания моделей расходятся;

  • строить контрпримеры;

  • находить скрытые зависимости от вспомогательных предположений;

  • проверять предельные случаи;

  • автоматически воспроизводить численные результаты;

  • проектировать более информативные измерения;

  • отслеживать, какие параметры действительно исключены;

  • обнаруживать, когда новая версия модели просто переименовала старую проблему.

Я бы вообще разделил научную ИИ-систему на независимые роли:

Теоретик        -> предлагает гипотезы
Прокурор        -> пытается их уничтожить
Экспериментатор -> ищет максимально различающий тест
Аудитор         -> фиксирует версии, данные и критерии отказа

Если один и тот же агент генерирует теорию и затем оценивает ее качество, возникает очевидный конфликт интересов. Человек с любимой теорией страдает той же проблемой. Только ИИ способен масштабировать ее на миллионы вариантов.

Само разделение ролей независимости не создает. Нужны независимые данные, воспроизводимые вычисления и проверки, результат которых можно установить без согласия другого агента.

Главной метрикой научного ИИ должно быть не количество сгенерированных статей и даже не число найденных моделей.

Гораздо полезнее другая метрика:

Какую долю пространства разумных объяснений система помогла исключить?

ИИ, создавший тысячу теорий, не обязательно сделал научное открытие.

ИИ, который предложил один эксперимент и уничтожил 999 теорий, - возможно, сделал.

Эмпирический контракт теории

Что можно сделать практически?

Я бы предложил прикладывать к каждой серьезной фундаментальной модели не только вывод уравнений, но и своеобразный эмпирический контракт.

Контракт не создает недостающий эксперимент. Он помогает явно учитывать, что проверено, что изменено и какая неопределенность осталась.

1. Область утверждений

Нужно явно написать, что именно утверждает теория.

Она объясняет наблюдаемый эффект? Является эффективной моделью? Претендует на конкретную микрофизику? Или всего лишь показывает математическую возможность?

Эти уровни нельзя смешивать.

2. Критерии отказа

До получения новых данных необходимо указать результаты, которые существенно понизят статус модели.

Не абстрактное “когда-нибудь можно проверить”, а конкретное:

если X < a и Y > b => базовая версия модели исключена

Если никакой реалистичный результат не снижает доверие к программе, это надо честно признать.

3. Замороженные предсказания

Предсказания должны быть привязаны к версии и зафиксированы до открытия новых данных.

После эксперимента можно создать новую модель. Но данные, использованные для ее создания, уже не являются независимой проверкой. Новая версия должна заранее зафиксировать следующий рискованный тест.

Разница между предсказанием и объяснением уже известных данных давно обсуждается в философии науки; хороший обзор есть в статье Prediction versus Accommodation.

4. Бюджет спасения

Каждая подгонка под результат должна попадать в журнал изменений:

  • была ли она предусмотрена до результата или введена после него;

  • какой новый параметр добавлен;

  • какую аномалию он устраняет;

  • какие новые независимые предсказания создает;

  • на каких новых данных они будут проверяться;

  • чем новая версия отличается от старой.

Если число предположений растет, а число новых проверок нет, программа накапливает эпистемический технический долг.

5. Сравнение с альтернативами

Нельзя оценивать модель только по тому, насколько хорошо она описывает данные.

Нужно спрашивать, описывает ли она их лучше конкурирующих моделей и существует ли эксперимент, который различит эти объяснения.

Иначе мы измеряем качество аппроксимации, а не силу объяснения.

6. Мощность исключения

Отрицательный эксперимент должен сообщать не только новый предел параметра, но и масштаб исключенного пространства моделей.

Это сложно и зависит от выбора меры. Но даже грубая оценка лучше, чем заголовок “темная материя снова не найдена”, который ничего не говорит о том, насколько изменилось наше знание.

7. Независимая отложенная выборка

Часть наблюдений или классов эффектов должна оставаться вне процесса построения модели.

В фундаментальной физике это не всегда возможно. Но там, где возможно, следует использовать слепой анализ, заранее замороженные pipeline и независимые наборы данных.

ИИ делает такой подход не желательным, а обязательным.

Возражения

“Наука всегда была недоопределена данными”

Да.

Никакой эксперимент не проверяет теорию в логической изоляции. Всегда существуют вспомогательные предположения и альтернативные объяснения.

Но из того, что проблема не равна нулю, не следует, что ее величина не важна.

Состояния с двумя жизнеспособными теориями и с миллионом жизнеспособных теорий эпистемически различаются.

Фальсифицируемость и недоопределенность имеют степень.

“Темная материя прекрасно работает”

На уровне эффективной космологической модели - да, работает очень хорошо.

Это не отвечает на вопрос о микрофизической природе темной материи. Нельзя использовать успех CDM как прямое подтверждение конкретного WIMP, аксиона или скрытого сектора.

Нужно просто не смешивать уровни утверждений.

“Теория может быть полезной до экспериментальной проверки”

Конечно.

Она может развивать математику, связывать разные области, предлагать новые вычислительные методы и помогать проектировать эксперименты.

Проблема начинается не тогда, когда непроверенная теория исследуется, а тогда, когда исследовательскую перспективность начинают выдавать за подтверждение устройства природы.

“ИИ также удешевит эксперименты”

Безусловно. Автоматизация лабораторий, управление установками, обработка данных и оптимальный дизайн эксперимента могут существенно снизить стоимость проверки.

Но снижение будет неравномерным.

В химии можно автоматически поставить тысячи реакций. В физике высоких энергий нельзя автоматически построить тысячу коллайдеров. В космологии нельзя получить тысячу независимых Вселенных.

Поэтому для фундаментальной физики асимметрия между генерацией и проверкой, скорее всего, сохранится.

Заключение

Фундаментальная физика не умерла. У нее остаются реальные данные, сильные теории, нерешенные задачи и огромный потенциал для открытий.

Но это не означает, что кризиса нет.

Просто кризис следует искать не там, где его обычно ищут.

Проблема не в том, что физики перестали придумывать теории. Наоборот, теорий слишком много.

Проблема не только в том, что эксперименты стали дорогими. Проблема в том, что каждый новый эксперимент исключает все меньшую долю пространства возможных объяснений.

Проблема не в отсутствии фальсифицируемости как формального свойства. Проблема в уменьшении эмпирической жесткости исследовательских программ.

В краткой форме диагноз выглядит так:

скорость генерации и спасения теорий > скорость их экспериментального исключения

ИИ резко увеличит левую часть этого неравенства.

Поэтому в эпоху ИИ главной научной ценностью станет не способность породить еще одну красивую модель. Это будет дешево.

Главной ценностью станет способность сформулировать такой эксперимент, после которого множество красивых моделей окажутся неправильными.

Наука развивается не только тогда, когда мы придумываем новые объяснения.

Она развивается прежде всего тогда, когда выясняем, какие объяснения больше невозможны.

Теория должна уметь умереть.

Иначе это не теория устройства мира, а бессмертный программный проект, в котором после каждого упавшего теста просто добавляют еще один feature flag.

Полезные ссылки

  1. Шон Кэрролл - The Crisis in Physics

  2. Карл Поппер - Stanford Encyclopedia of Philosophy

  3. Имре Лакатос - Stanford Encyclopedia of Philosophy

  4. Underdetermination of Scientific Theory

  5. Prediction versus Accommodation

  6. George Ellis, Joe Silk - Defend the Integrity of Physics

  7. Richard Dawid, Stephan Hartmann, Jan Sprenger - The No Alternatives Argument

  8. Carlo Rovelli - The Dangers of Non-Empirical Confirmation

  9. Planck 2018 Results. VI. Cosmological Parameters

  10. Particle Data Group - Dark Matter

  11. LUX-ZEPLIN - Dark Matter Search Results from 4.2 Tonne-Years

  12. The Spectre of Underdetermination in Modern Cosmology

  13. Navigating Permanent Underdetermination in Dark Energy and Inflationary Cosmology

  14. The Need for Verification in AI-Driven Scientific Discovery

  15. Falsify, Don’t Just Discover - AI-Generated Discoveries are NOT Born Scientific

  16. Artificial Intelligence Tools Expand Scientists’ Impact but Contract Science’s Focus

  17. John R. Platt - Strong Inference

  18. Cynthia Dwork et al. - Generalization in Adaptive Data Analysis and Holdout Reuse

  19. Tom Rainforth et al. - Modern Bayesian Experimental Design

  20. Eamon Duede et al. - The Unintended Consequences of Large Language Models as a Labor-Augmenting Technology in Science

Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.