RTP DesportoPortugal qualificado para `oitavos` do Europeu de voleibol após derrota de IsraelInquirerMarcos yet to decide on fuel excise tax suspension – Palaceוואלהבגלל תקלה באתר העירייה: המידע רפואי ונתוני הרווחה של תושבי בית שמש היו חשופים לציבורESPNFacts vs. Feelings: What eight notable Week 1 performances mean for Week 2The Jerusalem PostNetanyahu’s New York UN visit sees unusual US Secret Service security involvementESPN DeportesEl mayor éxito y la mayor decepción de los 30 equiposDaily MaverickGROUNDUP: The N1 town’s decade of decay — Beaufort WestBollywood HungamaThe Vvaan Trailer: Sidharth Malhotra and Tamannaah Bhatia starrer explores Indian folklore, supernatural elements and adventure; watchCollider‘Anaconda’ Meets ‘Jurassic Park’ in New Creature Feature With a Truly Gigantic Predator [Exclusive]SCMP ChinaChina uses 100,000 home-grown AI chips to build leading weather forecast systemDeadlineChris Harrison’s Dating Series ‘The Vow’ Sets Premiere On Fox Nation
The Daily Newsstand · Free, Always
Wednesday, September 16, 2026

Почему LLM не могут овладеть человеческим языком в совершенстве

Translate

Даже идеальная модель с бесконечным объемом текста не восстановит ту часть смысла, которая никогда не была закодирована в языковой форме.

Представьте фразу в рабочем чате: «он снова упал». «Он» может означать сервер, сервис, тестовый стенд или процесс сборки. Люди восстанавливают смысл по предыдущим сообщениям и общей ситуации. В самой фразе объекта нет, и без контекста она вообще ничего не сообщает.

Можно ли восстановить смысл, вложенный человеком в фразу, если у нас есть только сама фраза? И изменится ли ответ, если вместо человека будет языковая модель, обученная на триллионах токенов?

Эмили Ченг из Universitat Pompeu Fabra и Райан Коттерелл из ETH Zürich попытались ответить на этот вопрос средствами теории информации. В препринте работы A Formal Limitation on Learning Human Language From Textual Corpora от 28 августа 2026 года они попытались разобраться, насколько точно смысл говорящего вообще можно восстановить из одного текста. Результат относится к любому способу представления текста, включая скрытые состояния современных LLM.

Суть исследования

Использование языка авторы смоделировали как совместное распределение трех величин: смысла, контекста и высказывания. На этой основе они вывели верхнюю границу вероятности, с которой декодер способен восстановить смысл, вложенный в высказывание говорящим.

Ограничение возникает в самом канале коммуникации. Если часть смысла передается через ситуацию и отсутствует в высказывании, представление одной фразы не может содержать этой информации, и без контекста эту неопределенность не устранить.

Границы неопределенности проверяли на искусственных языках, на задаче восстановления опущенных местоимений в китайском и на задаче описания цветов. В экспериментах участвовали Qwen 2.5, Llama 3, Gemma 2 и три зрительно-языковые модели размером от 2 до 14 млрд параметров.

От грамматики к смыслу

Главный вопрос исследователей: сколько вообще можно узнать о естественном языке, располагая только текстами? Этот вопрос возник задолго до современных LLM, и больше полувека классическая теория обучения формальным языкам давала на него скорее отрицательный ответ.

В 1967 году математик и исследователь информатики Э. Марк Голд показал: ученик, которому предъявляют неограниченный поток грамматически правильных строк, но не показывают неправильные, не сможет гарантированно восстановить исходную грамматику. В 1980 году Дана Энглуин из Йельского университета развила этот результат и описала условия, при которых семейство формальных языков можно определить только по положительным данным. Для каждого языка должен существовать конечный набор характерных примеров, отличающих его от более широких альтернатив.

Если понимать эти результаты буквально, текст сам по себе — бедный источник данных: поток положительных примеров без явной информации о том, какие конструкции невозможны.

Вероятностные модели изменили постановку задачи. Вместо того чтобы точно определять, принадлежит строка языку или нет, можно оценивать распределение вероятностей над строками. Эта идея опирается на распределительную гипотезу: свойства языковых единиц изучают по контекстам, в которых они появляются.

Современные языковые модели продолжают эту линию: учатся на огромном количестве последовательностей и восстанавливают статистическую структуру языка. На практике из такого сигнала удается извлечь много информации о синтаксисе, употреблении слов и семантических отношениях.

Но авторов исследования интересует другой вопрос: сколько из текста можно узнать о намеренном смысле говорящего.

Что есть смысл

Смысл можно понимать через объекты внешнего мира, на которые указывает высказывание. А можно в духе немецкого философа Готлоба Фреге, который различал смысл выражения (способ, которым нам представлено его содержание) и референцию — объект, к которому выражение относится.

Людвиг Витгенштейн иллюстрировал зависимость смысла от ситуации примером со стройкой. Один рабочий произносит название строительного элемента — «Плита!» — а второй приносит нужную плиту. Значение здесь определяется употреблением: одного слова достаточно, чтобы в конкретном контексте передать команду.

Человеческая коммуникация по природе своей прагматична. Каждое высказывание в естественном языке, включая те, что впоследствии попали в обучающие корпуса LLM, когда-то произносилось в определенной социальной, физической и культурной ситуации. У говорящего было намерение, а слушатель использовал высказывание вместе с контекстом, чтобы это намерение восстановить. Именно намерения говорящих в конечном счете формируют статистику языка.

Способность систем, обученных только на распределении форм, представлять именно намеренный смысл исследовалась мало. Поэтому авторы сосредоточились на смысле, который говорящий хочет передать, и пришли к выводу: системы, получающие только языковую форму без контекста, принципиально формируют неполное представление намеренного смысла.

В 2020 году Эмили Бендер и Александр Коллер предложили мысленный эксперимент с осьминогом, который подключается к подводному кабелю и перехватывает переписку двух людей, ничего не зная о мире, в котором они живут. Он может выучить статистические закономерности сообщений и даже научиться продолжать диалог, но, по мысли авторов, этого недостаточно для восстановления смысла языка: он связан не только с формой высказываний, но и с намерениями говорящих и внешним миром.

Отчасти этот скептицизм оказался пророческим. Наиболее мощные современные LLM обучаются уже не только на тексте: после предобучения обычно следует этап с внешними сигналами. Самый известный пример — обучение с подкреплением на основе человеческой обратной связи, где модель оптимизируют по человеческим оценкам предпочтительности ответов. Так в обучение добавляется сигнал об успешности коммуникации, которого нет в сыром текстовом корпусе.

По мере того как передовые модели отходят от исключительно текстового обучения, вопрос становится только острее: если известно распределение использования языка, каковы пределы того, что система способна узнать о языке и намерениях говорящего только из языковой формы, независимо от объема доступного ей текста?

Как авторы описывают разговор математически

Модель коммуникаций. Источник

Модель коммуникаций. Источник

В модели есть три основные случайные величины: 

  • (M) — смысл, который хочет передать говорящий; 

  • (C) — контекст коммуникации (все, кроме текущего высказывания: личности участников, физическая ситуация, социальные обстоятельства, предыдущая часть разговора);

  •  (U) — само высказывание. 

Есть и (\widehat{M}) — смысл, который в итоге восстанавливает слушатель.

Связи устроены так:

C → M

M → U,  C → U

U → M̂,  C → M̂

Авторы предполагают, что говорящий и слушатель имеют доступ к общему контексту. В реальной жизни это не всегда так: если участники понимают ситуацию по-разному, начинается уточнение — исследователи называют это прагматическим восстановлением общего контекста.

Добавим (Z)— представление высказывания. Функция g: U → Z преобразует текст (U) в некоторое представление (Z).

Для языковой модели это могут быть внутренние активации одного из слоев, но теоретический результат не привязан к нейросети — (g) может быть любым преобразованием текста.

Дальше есть декодер: f: Z → M, который пытается по этому представлению восстановить настоящий смысл. Условие простое: если внутреннее представление действительно содержит смысл говорящего, из него должен существовать способ этот смысл восстановить хотя бы с заданной точностью. Множество возможных смыслов авторы рассматривают как пространство, в котором можно измерить расстояние между двумя значениями. Эту меру расстояния они обозначают dd.

Должно выполняться d(f(g(u)),m)≤ϵ, где (g) превращает высказывание в представление, (f) пытается восстановить из него смысл, а (d) измеряет отклонение от настоящего.

При (\epsilon=0) речь идет о точном восстановлении класса. Например, какое именно местоимение имел в виду человек. При (\epsilon>0) допустима небольшая ошибка. Такая постановка подходит для непрерывных величин вроде цвета.

Использование языка рассматривается как множество актов коммуникации между разными парами говорящих и слушателей, поэтому язык описывается распределением по смыслам, контекстам и высказываниям.

Модель делает два упрощения: говорящий и слушатель разделяют один и тот же контекст (многошаговые диалоги не рассматриваются — только одно направленное высказывание), и в языковом канале для простоты отсутствует шум (хотя основные результаты распространяются и на случаи с шумом).

Ключевая идея работы описывается через взаимную информацию. Количество информации о смысле, доступное из высказывания и контекста вместе, раскладывается так: I(M;U,C)=I(M;U)+I(M;C∣U).

Энтропия (H(M)) показывает, насколько неопределенным остается смысл (M), а взаимная информация (I(M;U)) — насколько знание высказывания (U) уменьшает эту неопределенность.

(I(M;U)) — это информация о смысле непосредственно в высказывании. (I(M;C|U)) — информация, которую добавляет контекст уже после того, как высказывание известно.

Возьмем фразу «Он уже пришел». Форма сообщает многое: мужской род, определенное событие, завершенность. Но кого именно обозначает «он», без предыдущего разговора установить может быть невозможно.

Если (I(M;C|U) \approx 0), контекст почти ничего не добавляет — высказывание уже содержит почти все нужное. Если эта величина велика, значимая часть информации лежит вне текста. Именно она определяет максимально возможную точность системы, которая получает только (U).

Точный смысл имеет верхнюю границу

Сначала авторы рассматривают дискретный или счетный случай. Например, системе нужно определить одно из нескольких местоимений, а неопределенность конечна: (H(M) < \infty). 

Пусть (M) — настоящий смысл, (Z) — представление текста, (f)— классификатор, восстанавливающий (M) из (Z). Вероятность правильного восстановления: pe​=P[f(g(U))=M]

Для нее выведена верхняя граница: fsup​pe​≤H(M)I(M;U)+H2​(pe​)​, 

где (H(M)) — энтропия распределения смыслов, (H_2) — двоичная энтропия, а (\sup_f) означает, что рассматривается лучший из возможных декодеров.

Главная переменная здесь (I(M;U)). Она показывает, сколько информации о намеренном смысле содержится в самом высказывании. Чем ее меньше, тем ниже максимальная точность восстановления по этому тексту. 

С учетом контекста эту зависимость можно переписать:

I(M;U)=I(M;U,C)−I(M;C∣U),I(M;U) = I(M;U,C) - I(M;C\mid U),I(M;U)=I(M;U,C)−I(M;C∣U)то есть информация в высказывании равна всей информации, доступной из высказывания и контекста вместе, минус та часть, которую добавляет только контекст. Отсюда:

sup⁡fpe≤I(M;U,C)−I(M;C∣U)+H2(pe)H(M).\sup_f p_e \leq \frac{I(M;U,C) - I(M;C\mid U) + H_2(p_e)}{H(M)}.fsup​pe​≤H(M)I(M;U,C)−I(M;C∣U)+H2​(pe​)

Доказательство опирается на неравенство Фано, которое связывает оставшуюся неопределенность с вероятностью ошибки при восстановлении случайной величины.

Если смысл нельзя разбить на классы

С местоимениями все относительно просто, число возможных вариантов конечно. Но смысл не всегда раскладывается на классы: цвет, например, меняется непрерывно. 

Тогда вместо точного совпадения рассматривают вероятность того, что восстановленное значение окажется достаточно близко к настоящему:P[d(f(g(U)),M)≤ϵ]

Неравенство Фано напрямую к непрерывному пространству не применить, поэтому авторы сводят задачу регрессии к вспомогательной классификации. В пространстве смыслов выбирают набор точек с расстоянием не меньше (2\epsilon) между ними, и каждому настоящему значению сопоставляют ближайшую такую точку. Так появляется дискретная переменная (J_\epsilon). Событие (B) означает, что система правильно определила соответствующий ей класс. 

Если предсказание оказалось не дальше (\epsilon) от настоящего значения, оно неизбежно попадает и в правильную область. Так вероятность успешного восстановления непрерывного значения ограничивают через вероятность правильной классификации. 

При (\epsilon>0), конечной энтропии (H(J_\epsilon)) и более чем одном классе:  fsup​P[d(f(g(U)),M)≤ϵ]≤H(Jϵ​)I(Jϵ​;U)+H2​(B)​. 

Смысл тот же: чем меньше информации о нужном значении в самом высказывании, тем ниже максимальная точность восстановления без контекста. 

Проверка теории на искусственных языках

Источник

Источник

Для проверки границ исследователи создали искусственные языки с заранее известным совместным распределением смысла (M), высказывания (U) и контекста (C), устроенные так, что  H(M∣U,C)=0

То есть по высказыванию и контексту вместе смысл определяется идеально — участники такого языка способны успешно общаться. 

Затем у модели отобрали контекст. Она получала только пару «высказывание — смысл» и должна была восстанавливать из . Для дискретного эксперимента авторы создали шесть языков: 10 категорий контекста, 10 смыслов, алфавит из 15 символов для высказываний. 

Главный управляемый параметр — (I(M;U)), количество информации о смысле в самом высказывании. Его меняли от нуля до (\log_2|\mathcal{M}|). Для восстановления смысла использовали многослойные перцептроны. Во всех языках экспериментальная точность оставалась ниже теоретической границы, и чем больше информации помещалось в саму форму, тем выше становились и реальное качество модели, и потолок, предсказанный теорией. 

Непрерывный искусственный язык дал тот же результат: смысл выбирали из двумерного пространства (M \sim \mathrm{Unif}[-1,1]^2), контексты и высказывания оставались категориальными. Построили восемь языков с тем же условием (H(M|U,C)=0) и разным количеством информации между высказыванием и дискретизированным смыслом. 

Модель обучали восстанавливать двумерный смысл по одному высказыванию, минимизируя среднеквадратичную ошибку. Для (\epsilon = 0.2, 0.4, 0.6) получили упаковки из 25, 9 и 5 областей с энтропией 4,64, 3,17 и 2,32 бита соответственно. Эмпирическая точность снова не пересекла теоретическую границу. 

Искусственные языки понадобились прежде всего для проверки математики в системе с заранее известными распределениями. После этого авторы перешли к естественному языку. 

Шесть моделей и два эксперимента с естественным языком

Здесь функция (g) уже представляла собой реальные внутренние активации предобученных моделей. Взяли три текстовые модели — Qwen 2.5 14B, Llama 3 8B, Gemma 2 2B — и три зрительно-языковые для сравнения: Qwen 2.5 VL 7B с настройкой на инструкциях, Llama 3.2 Vision 11B и Gemma 3 12B с настройкой на инструкциях. 

Для каждой модели проверяли скрытое состояние последнего токена на всех слоях, оно в авторегрессионной модели учитывает всю предшествующую последовательность. Сами модели оставались замороженными, поверх их представлений обучали небольшой перцептрон. 

Китайский позволяет оставить местоимение за кадром

Первая задача — восстановление опущенных местоимений в китайском языке. В китайском местоимение можно пропустить, если оно понятно из контекста. Вопрос «У тебя есть жвачка?» может звучать как 你有口香糖吗 (явное «ты») или просто 有口香糖吗 — буквально «есть жвачка?». Если два человека только что вместе поужинали, слушатель понимает, что пропущено «ты» — но в самом предложении этой информации уже нет. 

Для эксперимента переработали корпус китайских телесубтитров (Wang et al., 2018) — 2 150 945 коротких реплик. После фильтрации высказываний ровно с одним явным или опущенным местоимением осталось 904 996 примеров, из них в 184 092 (20,3%) местоимение было опущено. Оставили 12 классов личных местоимений; чаще всего встречалось 我 — «я». 

Из корпуса случайно выбрали 50 тысяч реплик и разделили на обучающую и тестовую выборки 80/20. Аудиовизуальный контекст сериалов в датасет не входил. Модели получали только текст реплики; авторы допускают, что носитель китайского, видящий сцену целиком, в большинстве случаев восстановил бы пропущенное местоимение, но отдельно это допущение не проверяли. 

Базовая стратегия была такой: если местоимение присутствует в тексте, брать его напрямую, если опущено — выбирать самое частое, 我. Поскольку в 79,7% примеров местоимение было выражено явно, эта стратегия уже давала точность около 0,85. 

Затем проверили внутренние представления всех шести моделей, перебирая слои, параметры декодера и случайные инициализации. Теоретическая верхняя граница для этой задачи составила 0,93, и ни одна модель ее не превысила. Среди проверенных были и VLM с визуальным сигналом при обучении, но в этом эксперименте конкретный визуальный контекст текущей реплики им не передавали, и заметного улучшения относительно базовых 0,85 они не показали. 

Авторы связывают это с тем, что в самой реплике может оставаться мало информации о пропущенном местоимении. Масштабное предобучение здесь не компенсирует недостающий контекст. Значимая часть нужной информации, по всей видимости, содержится в визуальной и социальной ситуации сцены, которую модели не видели. 

Как понять цвет без соседних цветов

Для проверки теоремы в непрерывном пространстве использовали датасет Monroe et al. (2017), собранный в игре между двумя людьми: оба видят три цветных образца, один из которых целевой, и заранее его знает только говорящий. Говорящий пишет описание вроде darkish red — «темновато-красный», второй должен выбрать нужный образец из трех. 

Цвета перевели из RGB в CIELAB, где евклидово расстояние лучше коррелирует с воспринимаемой человеком разницей между оттенками, и нормализовали координаты до [0,1]³. В этом пространстве при (\epsilon=0{,}2) теоретическая граница составила около 0,66. 

Здесь (M) — целевой цвет, (C) — все три показанных образца, (U) — текстовое описание. Оставили только раунды, где слушатель выбрал правильно — получилось 38 975 примеров. 

Все шесть моделей оказались ниже границы в 0,66. Дополнительно рассчитали результаты для от 0,01 до 0,75 — во всем диапазоне экспериментальные результаты укладывались в теоретическое ограничение. При больших значениях допустимой ошибки граница сближалась с фактическими результатами моделей. 

Задача с цветами хорошо показывает, почему одно и то же описание несет разное количество полезной информации в разных обстоятельствах. «Темновато-красный» почти однозначен, если два других варианта — зеленый и синий. Но если перед человеком три близких оттенка красного, для правильного выбора требуется куда больше контекста. 

Что доказало исследование

Авторы рассматривали конкретное понятие: намеренный, прагматический смысл говорящего, и использовали достаточно слабый критерий его представления. Смысл должен статистически декодироваться из внутренних признаков системы. Даже при таком определении точность имеет верхнюю границу, зависящую от количества информации о смысле в самом высказывании. 

Если часть информации доступна только через контекст (I(M;C|U) > 0), то текстовая форма содержит меньше информации, чем весь акт коммуникации целиком. Отсюда и более сильный практический вывод: увеличение объема текстовых данных само по себе не устраняет этот разрыв. Эти теоремы относятся даже к идеальному представлению, полученному при обучении на бесконечном количестве данных. 

Важная деталь в том, что среди протестированных систем были модели, которые видели изображения при обучении, некоторые прошли настройку на инструкциях. Их обучение уже не ограничивалось сырым текстом. Но в эксперименте важна информация, доступная при восстановлении конкретного смысла: если VLM когда-то обучалась на миллионах изображений, это не означает, что она знает визуальный контекст конкретной реплики из скрытого от нее сейчас сериала. Поэтому авторы формулируют ограничение относительно представления текущего высказывания: какой бы богатой ни была история обучения модели, из одного (U) не восстановить ту часть информации о смысле (M), которую контекст (C)добавляет сверх самого высказывания. 

У работы есть ограничения. Самая крупная проверенная модель содержала 14 млрд параметров; более мощные системы, возможно, приблизятся к теоретическому потолку сильнее, но сам потолок не должен исчезнуть: он следует из количества информации во входе, а не из производительности архитектуры. Ситуация с дополнительным контекстом (например, системной инструкцией) в статье не исследуется — авторы считают это естественным продолжением работы. И наконец, работа исследует декодируемость: если из активаций можно восстановить информацию, это не значит, что модель причинно использует именно ее в дальнейшем выводе — авторы называют статистическую декодируемость необходимым первым шагом и предлагают в будущем изучать представление смысла причинными методами. 

Текст остается лишь частью коммуникации

Во время человеческой коммуникации слушатель восстанавливает намерение говорящего из высказывания и общей ситуации. Эти два источника информации можно разделить математически: если часть смысла несет только контекст, система, получившая одно высказывание, эту часть теряет независимо от размера модели или числа токенов в обучающем корпусе. Это следствие того, сколько информации вообще осталось в наблюдаемом сигнале. 

Во всех экспериментах результаты моделей оставались ниже рассчитанных теоретических границ. Но это не значит, что современные модели уже приблизились к фундаментальному пределу: авторы допускают, что более крупные системы подойдут к нему ближе. 

Принцип, впрочем, остается неизменным. Языковая модель извлекает из текста огромное количество закономерностей, но текст — лишь часть более богатой человеческой коммуникации. Когда говорящий оставляет часть сообщения в общем контексте, в сохраненной строке этой информации уже нет, и никакое качество представления текста само по себе не восстановит то, чего в тексте никогда не было. 

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.