Почему нейробиологи 60 лет назад понимали мозг лучше, чем мы понимаем нейросети

Конец 1950-х, Гарвард, лаборатория Дэвида Хьюбела и Торстена Визеля. Кошке под наркозом через слайд-проектор показывают полоски света, а электрод фиксирует, как на это откликается отдельный нейрон зрительной коры. Никаких компьютеров, только аналоговые инструменты. Но из этого вырос один из главных результатов в истории нейробиологии: открытие нейронов зрительной коры, избирательно реагирующих на ориентацию. За него Хьюбел и Визель позже получили Нобелевскую премию.
В 2026 году все ровно наоборот. Мы можем открыть любой вес нейросети, посмотреть любую активацию, любой градиент, но вот что происходит внутри нее — до сих пор непонятно. Объект исследования стал доступнее, но знаем мы о нем куда меньше.
Об этом и идет речь в свежем препринте «From Interpretability Methods to Interpretable Models». Пятнадцать лет подряд исследователи объяснимого ИИ (Explainable AI, или XAI) в компьютерном зрении занимались почти одним и тем же: улучшали методы объяснения, сравнивали их между собой, проверяли на достоверность и на устойчивость к манипуляциям. А вот вопрос, который напрашивался сам собой задавали на удивление редко. Стала ли модель после всех этих усилий понятнее человеку?

Инструментарий, который мы все это время оттачивали не на том
За прошедшее время в исследовании компьютерного зрения оформились четыре крупных направления.
Методы атрибуции (attribution) отвечают на вопрос, какие пиксели повлияли на решение модели. Это самый ранний и проработанный класс методов: градиентные, основанные на активациях, основанные на пертурбации входа. Именно методы атрибуции получили больше всего критики. Ранние проверки на адекватность показали: часть популярных методов ведет себя не лучше обычного детектора границ и нечувствительна к рандомизации модели или меток. Дальнейшая работа выявила их проблемы с надежностью, устойчивостью к манипуляциям и самим определением того, что такое честное объяснение.
Визуализация признаков (feature visualization) решает другую задачу. Атрибуция показывает, куда модель смотрит, но не показывает, что именно она там видит. Метод либо подбирает реальные изображения, которые активируют конкретный нейрон, либо синтезирует картинку специально под эту активацию.
Концепт-ориентированные методы (concept-based) используют понятные человеку категории вместо отдельных нейронов. Ранние версии вроде TCAV ограничивались заранее заданным словарем концептов. Поздние, включая разреженные автокодировщики (SAE), извлекают концепты из представлений модели, без заранее заданного списка.
Методы на основе контуров (circuit-based) устроены иначе, они разбирают внутренние алгоритмы модели. Например, проект Circuits program, который развивает сооснователь Anthropic Крис Ола. Вместе с командой он проследил, как в ранних слоях InceptionV1 работают детекторы кривых. Исследователи шли нейрон за нейроном, слой за слоем и постепенно собрали картину того, что сеть видит на первых этапах обработки изображения. Позже тот же подход применили к нейросети CLIP от OpenAI. И обнаружили мультимодальные нейроны, которые они откликаются и на изображение паука, и на слово spider («паук»).
Находка полисемантичных нейронов в InceptionV1, тех, что кодируют сразу несколько несвязанных понятий, стала одной из причин, по которым исследователи вообще занялись концепт-ориентированными методами. Один инструмент нащупал предел собственных возможностей и этим подтолкнул появление следующего.
Споры о том, насколько эти инструменты вообще полезны, не утихают до сих пор. В марте 2025 года команда механистической интерпретируемости из DeepMind решила проверить SAE на практике. Не просто посмотреть, находит ли метод какие-то концепты, а сравнить его с простой альтернативой на конкретной задаче. Взяли детекцию вредоносных намерений в промптах языковой модели и обучили два классификатора: обычную линейную пробу поверх активаций модели и пробу поверх признаков, извлеченных SAE. Результат для метода вышел неприятным. Линейная проба справлялась почти идеально, в том числе на новых, не встречавшихся при обучении формулировках атак. SAE заметно ей уступал. По итогам команда объявила, что снижает приоритет фундаментальных исследований SAE. Метод не давал того выигрыша, ради которого в него вкладывались.
Однако команда ученых из Корнеллского университета и Калифорнийского университета в Беркли выступила с контраргументом: выводы DeepMind о SAE справедливы только для тех задач, где концепт известен заранее, например в поиске заранее заданной категории вредоносности. Но в поиске неизвестных или еще не описанных концпептов у SAE есть ключевое преимущество, которое линейная проба структурно дать не может.
В итоге исследовательское сообщество спорит об эффективности методов внутри одного семейства, игнорируя вопрос: помогают ли эти методы людям лучше понимать модели.
Несовершенный инструмент еще не повод ждать
В истории нейробиологии происходило то же самое. Еще до опытов Хьюбела и Визеля, в конце 1950-х, команда Джерома Леттвина вставила электроды в зрительный нерв лягушки. И нашла клетки, которые вели себя как детекторы жуков, которые срабатывали только на мелкие темные пятна в поле зрения.
А в 1972 году команда Чарльза Гросса добралась до нижневисочной коры макаки. Там нашлись нейроны, которые откликались на куда более сложные вещи, например на форму руки. По научной байке тех лет, один такой нейрон сработал случайно, когда экспериментаторы махнули перед обезьяной туалетным ершиком.
Инструменты не стояли на месте. От простых стимулов ученые перешли к методу обратной корреляции, который позволял картировать рецептивные поля. Затем появились причинные методы вроде микростимуляции. Они дали возможность не только фиксировать активность, но и вмешиваться в работу нейронных цепей.
Однако способ записи, когда сигнал снимали с одного электрода за раз, исподволь формировал у исследователей взгляд на зрение как на прямой и последовательный процесс. Позже выяснилось, что в коре работают рекуррентные связи: сигналы от вышестоящих зон влияют на ответы даже в первичной зрительной коре. Без обратной связи не свести концы с концами: часть вычислений, которые мозг явно выполняет, иначе не объяснить. Прямую модель это, что называется, не отменяет. Быстрая первичная обработка по-прежнему остается центральной частью зрения, но теперь она стала заметно богаче. Несовершенный инструмент — не повод отказываться от исследований.
Почему сейчас подходящий момент
Хоть моделей компьютерного зрения становится все больше, архитектурное разнообразие, как ни странно, тает на глазах. На смену десяткам сверточных архитектур пришла горстка базовых семейств: Vision Transformer, языково-контрастные модели вроде CLIP, DINO v3, маскированное моделирование изображений (masked image modeling) и предиктивные подходы класса «модель мира» (world-model) вроде I-JEPA.
Это заставляет взглянуть на вопрос под иным углом. Раньше под каждую новую архитектуру приходилось изобретать свой метод объяснения, а теперь можно взять уже готовый инструментарий и системно изучать, как формируются внутренние представления модели под влиянием разных обучающих целей и датасетов.
Проблема в том, что напрямую сравнивать модели непросто: у каждой свой, ни на что не похожий внутренний язык описания мира. Раньше просто считали число уникальных детекторов концептов или усредняли оценки интерпретируемости по признакам, а на разницу не обращали внимания. Сейчас на сцену выходят инструменты прямого сравнения: кросс-кодировщики и универсальные разреженные автокодировщики. Они строят общее пространство концептов сразу для нескольких моделей и позволяют сравнивать их куда тоньше.
Но снимают они лишь часть проблемы, и притом не главную. Техническую сложность сопоставления представлений они действительно облегчают, а вот ответить на вопрос, который все это время стоял в центре, не помогают: стали ли модели понятнее человеку и продвигаемся ли мы в этом. Структурное согласие между моделями и человеческое понимание — вещи разные.
Два разных вопроса, которые до сих пор путают
В статьях о XAI часто смешивают два разных вопроса, а их стоит развести.
Что модель представляет и вычисляет. Это задача структурного анализа. Можно взять две уже обученные модели, показать им одни и те же картинки и посмотреть, как соотносятся их внутренние представления, все без участия человека. Для этого есть кросс-кодировщики и методы, работающие с концептами.
Понимают ли люди работу модели. И речь тут не об авторах модели, а о независимых оценщиках, от которых зависит сертификация и внедрение ИИ. И тут простого ответа нет, графиками такое не измерить. Понятна ли модель человеку, станет ясно только после проверки на живых пользователях.
В медицине эта разница особенно бросается в глаза. Один обзор по слабым местам XAI приводит пример из нейрорадиологии. GPT-4 выдавал развернутые и гладко написанные обоснования, и врачи доверяли его рекомендациям даже тогда, когда те были ошибочными. Модель уверенно предлагала нестандартные протоколы, опираясь на бессмысленные доводы, и почти никогда не признавалась, что не уверена в себе.
Это подтверждают и другие исследования: сам факт наличия объяснения человек воспринимает как компетентность, даже если объяснение ошибочно.
В итоге врач, сбитый с толку гладкими объяснениями нейросити, уже не в состоянии объективно и независимо оценить ее ответ.
При этом интерпретируемость не зависит от масштаба и способностей модели. Она может быть большой и умной, но автоматически понятнее от этого она не станет — эти два свойства почти никак не связаны.
Ловушка автоматизации
Если измерять человеческое понимание психофизикой дорого и медленно (а это действительно так), возникает соблазн убрать человека из процесса оценки и заменить его другой моделью. Первую серьезную попытку предприняли именно так: метрика Machine Interpretability Score, то есть «оценка машинной интерпретируемости», автоматизирует человеческую задачу принудительного выбора. Она смотрит, насколько последовательно обученная модель перцептивного сходства группирует изображения, сильнее всего активирующие тот или иной нейрон.
Автоматический судья сам по себе есть модель человеческого восприятия. Получается, такая мера заранее предполагает то, что должна была установить. В итоге интерпретируемость сводится к согласию с чужой догадкой о том, что люди находят похожим, а именно это мы и пытались понять.
Это тот же паттерн, что и с врачом из предыдущего раздела, только вывернутый наизнанку. Там форма объяснения обманывала человека, а тут форма измерения подменяет собой вопрос, который измерение должно было прояснить. Важен порядок действий: сначала надо строгой психофизикой установить, что вообще значит «человек понял модель», и только потом автоматизировать измерение. Если зафиксировать определение раньше, чем оно устоялось, есть риск оптимизировать не ту цель.
Что дальше
У системной нейробиологии объект был почти недоступен: мозг под черепной коробкой, а электрод в лучшем случае дает доступ к горстке нейронов из миллиардов. Капля в море. И десятилетиями приходилось работать грубыми инструментами. Но это дало науку, которая до сих пор накапливает знание, кирпичик за кирпичиком.
У нас ситуация обратная, мы имеем абсолютный доступ к любой информации о нейронке. А вопрос, понимаем ли мы модели, которые сами же построили, все еще висит в воздухе. Просто потому, что почти никто не удосужился задать его напрямую, вместо того чтобы в очередной раз ходить по кругу и сравнивать методы друг с другом.
Разница между экспертным подтверждением и независимым пониманием, похоже, и есть главный камень преткновения всей области. Сертификация, регуляторные требования вроде EU AI Act, доверие пользователей: все это держится на допущении, что кто-то посторонний может открыть модель и разобраться, что у нее внутри. Пока этот кто-то не появился в достаточном количестве психофизических экспериментов, интерпретируемость остается утверждением на веру, а не измеренным свойством.
Сталкивались ли вы в своей практике с ситуацией, когда объяснение модели, карта атрибуции, вектор концепта, что угодно, убеждало эксперта, но не выдерживало проверки человеком со стороны?
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.