ESPNSources: Rams' Garrett faces 6-week recovery, may be out until NovemberPunchNDDC urges Niger Delta communities to protect public infrastructureThe Jerusalem PostInside the Palestinian university that turned the Sbarro massacre into an exhibit - analysisRTP DesportoRonaldo pode começar no banco frente à NoruegaESPN DeportesDream y Liberty, sembradas 4 y 8InquirerPNP sees more time to prepare after deferment of barangay, SK pollsBollywood HungamaEXCLUSIVE: Yami Gautam Dhar’s Nayyi Navelli trailer to be unveiled on September 30; makers plan special welcome with 250 dholsDaily MaverickDOWN TO EARTH: Eleven-man Wallabies resist Springboks’ rearguard to secure famous Perth winIl Fatto Quotidiano“Voglio dedicare più tempo a me e ai miei figli dopo un anno, come tu sai, personalmente un po’ complicato”: il maestro Stefano Magnanensi lascia Domenica In e Mara VenierRTL BoulevardPremier Jetten van podium gehaald na verstoren D66-toespraakABC NewsUK police arrest 5 men under terrorism, explosives acts close to US air baseEgypt IndependentDeluge begins in Hawaii as Hurricane Nolo continues to strengthen
The Daily Newsstand · Free, Always
Sunday, September 27, 2026

Теория возможностей заменит теорию вероятностей в ML?

Translate

Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ.

Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.

Начнем с примера, демонстрирующего, как в космонавтике и теории рисков отличают две неопределенности: алеаторную (случайную) и эпистемическую (связанную с нехваткой знаний).

ESA and Delande, Jah, and Jones (2019)

ESA and Delande, Jah, and Jones (2019)

Поломка ракеты при запуске - это бинарное событие: даже зная все о ракете и ее траектории, мы не можем со 100%-ной уверенностью сказать, произойдет ли авария. Поэтому 2 исхода с порогом вероятности p_0.

Справа находится пример эпистемической неопределенности: космический мусор на орбите. Мы не знаем, где находится каждый объект, его скорость или массу, поэтому не можем сказать, прилетит ли он в МКС. Так появляется третья зона (желтая).

График по центру отвечает за вероятность столкновения в зависимости от точности данных (ковариации позиции). Разные цвета обозначают разные размеры обломков. Пунктиром отмечена алеаторная неопределенность, т.е. игнорирование отсутствия информации и использование только физической случайности. Вероятность здесь низкая и убывает. Сплошной линией - эпистимическая и здесь вероятность столкновения высокая: чем меньше знаем, тем больше риск, причем по мере уточнения данных вероятность падает, что логично.

Таким образом, мы приходим к концепции: "Если нет информации, возможно все". Немного формализуем задачу и заодно отметим различия с теорией вероятностей.

Теория вероятностей

Теория возможностей

исследуемый параметр \theta \in \Theta

случайная величина

неопределенная переменная (uncertain variable)

основная функция f_\theta(\theta)

плотность распределения и нормировка через интеграл

possibility function f_\theta (\theta) \geq 0 и нормировка через супремум: sup_{\theta \in \Theta} f_\theta(\theta) = 1

"среднее"

математическое ожидание через интеграл плотности

\mathbb{E}^*(\theta) = argsup_{\theta \in \Theta} f_\theta(\theta)

дисперсия

\mathbb{D}(\theta) = \mathbb{E}(\theta - \mathbb{E}(\theta))^2

\mathbb{V}(\theta) = \mathbb{E}^*(-\frac{d^2}{d\theta^2} logf_\theta(\theta))^{-1}

Особый случай: если нет информации, считаем f_\theta(\theta) = 1 для любого \theta \in \Theta. Также одним из интересных свойств является независимость от параметризации (в отличие от появляющегося якобиана при замене в плотности), это объясняется очень просто: если мы ничего не знаем в одном пространстве, то ничего не знаем и в другом.

Продолжим анализ свойств функций возможностей и сравнение с аппаратом теории вероятностей.

Теория вероятностей

Теория возможностей

работа с выборками

можно сэмплировать

нельзя сэмплировать

inference

условная вероятность

f_{\psi}(\psi) = \sup_{\theta \in \Theta} f_{\theta,\psi}(\theta, \psi)

f_{\theta}(\theta \mid \psi) = \frac{f_{\theta,\psi}(\theta, \psi)}{f(\psi)}

независимость величин

независимость событий

f_{\theta,\psi}(\theta, \psi) = f_{\theta}(\theta) f_{\psi}(\psi)

факторизация

при независимости случайных величин совместная плотность представляется в виде произведения единственным образом.

при независимости разложение совместного распределения на множители не является единственно возможным.

Теорема Байеса

\pi(\theta \mid y) = \frac{L(y \mid \theta)\pi(\theta)}{\pi(y)}, где:

L(y \mid \theta) - правдоподобие,\pi(\theta) - априорная вероятность, \pi(\theta \mid y) - апостериорная вероятность и знаменатель вычисляется как:

\pi(y) =  \begin{cases}  \int L(y \mid \theta)\pi(\theta)\,\mathrm{d}\theta & \text{if } \pi \text{ probabilistic} \\ \sup_{\theta \in \Theta} L(y \mid \theta)\pi(\theta) & \text{if } \pi \text{ possibilistic} \end{cases}

Вероятностная часть была известна уже давно, а возможностная была представлена в 2026 году.

Рассмотрим еще один относительно свежий результат (2025 года). В теории вероятностей формула Донскера-Варадхана связывает математическое ожидание экспоненты случайной величины с относительной энтропией (KL-дивергенцией) и в машинном обучении используется для поиска верхних границ вероятности переобучения нейросетей. Ученые из Наньянского технологического университета представили аналог этой теоремы для теории возможностей. Главное отличие в том, что во втором случае мы получаем две формулы, это объясняется тем, что, в отличие от теории вероятностей, у нас нет жесткого ограничения на плотность распределения (интеграл = 1), поэтому приближать можно по-разному (см. график). То есть на множестве функций возможностей можно ввести частичный порядок.

частичный порядок

частичный порядок

Комментарий к графику:

CBO(g) - аналог ELBO в байесовском выводе, но для теории возможностей.

\underline{\text{CBO}}(g) = \sup_{g \in \mathcal{F}(\Theta)} \inf_{\theta \in \Theta} \{ -\ell(\theta) - \log \frac{g(\theta)}{\pi(\theta)} \}

\overline{\text{CBO}}(g) = \inf_{g \in \mathcal{F}(\Theta)} \sup_{\theta \in \Theta} \{ -\ell(\theta) - \log \frac{g(\theta)}{\pi(\theta)} \}

\underline{\text{CBO}} \rightsquigarrow \{ g \in \mathcal{F}(\Theta) : g \preceqg^*_{\max} \}

\overline{\text{CBO}} \rightsquigarrow \{ g \in \mathcal{F}(\Theta) : g^*_{\max} \preceq g \}

Также под теорию возможностей было адаптировано "ядро" обучения - градиентный спуск. Ниже приводится алгоритм upper CBO Optimisation (uCBOpt):

  1. \textbf{Требуется:}скорости обучения\{\rho_t\}, коэффициент затухания весов \delta > 0, параметр кривизны \vartheta \in (0, \delta], параметры момента \beta_1, \beta_2 \in [0, 1], и начальное значение гессиана h_0 > 0.

  2. \textbf{Инициализация:} \eta \leftarrow (веса нейросети), h \leftarrow h_0, g \leftarrow 0.

  3. \textbf{для} t = 1, 2, \dots\ \textbf{выполнять}

  4. \hat{g} \leftarrow \hat{\nabla} \ell(\eta) - Стохастический градиент

  5. \hat{h} \leftarrow \hat{g} \odot \hat{g}

  6. g \leftarrow \beta_1 g + (1 - \beta_1)\hat{g}

  7. h \leftarrow \beta_2 h + (1 - \beta_2)\hat{h}

  8. \bar{g} \leftarrow g / (1 - \beta_1^t)

  9. \eta \leftarrow \eta - \rho_t(\bar{g} + \delta\eta) / (h + \delta - \vartheta)

  10. \textbf{конец цикла}

  11. \textbf{вернуть} \eta

визуализация работы алгоритма

визуализация работы алгоритма

Сравнение с Adam:

Adam

uCBOpt

η−\rho\frac{\bar g}{\sqrt{h}+\varepsilon}

η-\rho\frac{\bar g+\delta\eta}{h+\delta-\vartheta}

деление на \sqrt{h}

деление на h

\varepsilon только стабилизирует

\delta, \vartheta управляют верхней оценкой кривизны

нет weight decay в формуле шага

\delta\eta встроен в обновление

Встраивание weight decay напрямую в обновление позволяет лучше контролировать регуляризацию.

Также авторами была приведена сравнительная таблицу для разных датасетов.

результаты 1

результаты 1

Сравнение проводилось на данных, которые модель видела во время обучения, и на незнакомых. В качестве метрик были выбраны: Accuracy, Negative Log-Likelihood, Expected Calibration Error, False Positive Rate at 95% True Positive Rate, Area Under the Receiver Operating Characteristic curve, Area Under the Precision-Recall curve for Out-of-domain. Рассмотрим результаты для нового алгоритма подробнее.

In-domain.

Доля правильных ответов (точность) на "знакомой" выборке выше относительно остальных. Низкое отрицательное лог. правдоподобие означает, что модель не просто угадывает класс, но и выдает высокую вероятность для правильного класса и низкую для неправильных. Ожидаемая ошибка калибровки измеряет разницу между уверенностью модели и её реальной точностью, низкий результат у uCBOpt-adapt (алгоритм выше с адаптацией гиперпараметров в процессе обучения).

Метрики говорит о том, что когда информация есть, теория возможностей работает не хуже теории вероятностей: uCBOpt-adapt показывает лучшие результаты по ключевым метрикам

Out-of-domain.

FPR@95 для детекции аномалий: показывает, как часто модель ошибочно принимает "незнакомый" объект за "знакомый", когда мы настроены на то, чтобы поймать 95% всех аномалий, один из новых алгоритмов оказался в топе лучших. AUPR-Out, альтернатива AUROC, которая лучше работает в условиях сильного дисбаланса классов. Она показывает, насколько хорошо модель находит "чужие" объекты, не ошибаясь при этом на "своих".

Также авторами для сравнения были использованы и другие датасеты: CIFAR-10, CIFAR-100. Таблица приводится ниже, для краткости, без анализа.

результаты 2

результаты 2

Заключение

Таким образом, теория возможностей предлагает альтернативный подход к описанию неопределенности. Повторяя некоторые аспекты теории вероятностей (независимость, теорема Байеса), она меняет общее представление об информации. Теория вероятностей в машинном обучении является фундаментом, имеет удобный аппарат для описания большинства процессов, поэтому неудивительно, что для теория возможностей доказываются аналоги теорем. Появление приведенного алгоритма и построение новой теории является примером непрерывного развития науки. Так машинное обучение помогает двигать вперед математику, а не только отбирает ее хлеб.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.