The Jerusalem PostLebanon seeks UN-backed replacement for UNIFIL as US opposes mandate extensionוואלהרוכב אופנוע כבן 30 נפגע ממשאית בכביש 20 - מצבו קשה ולא יציבInquirer2 suspected drug pushers arrested in QuezonRTP DesportoAmorim antecipa jogo "especial" e acredita que o Benfica pode vencer a provaESPNPGA Tour announces categories, points system for two new 2028 seriesESPN DeportesFlick apoya a Lamine y desea que termine ya el Balón de OroDaily MaverickTHE CONVERSATION: Lymphatic walking explained: Does swinging your arms really detox your body?PinkvillaPinkvilla Predicts: Avengers Endgame Encore hot in presales, Some positives for The Vvaan, final forecast for Vibe and DaayraScreen RantPluribus Season 2 Filming Start Month Officially Confirmed By Vince GilliganThe GuardianYorkshire v Somerset, Sussex v Notts, and more: county cricket, day one – livekickerFC 27: Terminchaos um die Web App - Start doch schon morgenRolling StoneCool Suits: 7 Fall/Winter Suiting Ideas From Men’s Wearhouse
The Daily Newsstand · Free, Always
Tuesday, September 15, 2026

Диффузионная LLM технически умеет глушить свой контекст. Я попробовал этим воспользоваться

Translate

У авторегрессионной модели контекст — это то, что уже случилось. Токен выдан, и переписать его нечем: генерация умеет только дописывать справа.

У диффузионной всё иначе. На каждом шаге она делает полный двунаправленный проход по всей последовательности и переоценивает каждую позицию. Решение «эту фиксируем, эту оставляем открытой» принимает встроенный механизм уверенности: прошёл максимум softmax порог — токен приморожен, не прошёл — остаётся маской и будет переписан. То есть у диффузионной модели структурно есть возможность, которой у авторегрессии нет: глушить сигналы внутри собственного контекста. Не коммитить то, в чём не уверена. Стереть то, что мешает. Мне стало интересно, можно ли этим воспользоваться на практике — заставить модель самой вычистить мусор из выданного ей контекста.

МодельLLaDA-8B‑Instruct в Q4_K_M через llama.cpp.

Задача — RAG над графом знаний: 150 вопросов RoG-WebQSP, на вопрос 25 триплетов, на пути к ответу — по медиане один. Остальные 24 заведомо лишние, выбраны BFS к золоту

Как работает диффузионная LM, если коротко

Авторегрессия порождает текст слева направо, по одному токену. Маскированная диффузионная модель начинает с последовательности, целиком состоящей из масок, и предсказывает все замаскированные позиции сразу. Порядок раскрытия ничем не задан: первым фиксируется то, в чём модель уверена, а не то, что левее.

Используем механизм c порогом из FastDLLM, confidense 0.9

Если подробнее, но самое главное что мы попытаемся экслуатировать я описал

Идея: положить граф не в промпт, а под маску

Обычно retrieved-контекст кладут в промпт, а промпт неизменяем — модель обязана нести все 25 триплетов через каждый шаг. Что если положить граф в перезаписываемую область масок?Тогда она физически сможет стереть ненужное.

То же самое пытались эксплуатировать, но для коррекции ответа слабой модели более мощной, читать тут, у нас гипотеза интереснее, может ли dLLM отбирать нужные факты. что нужные ей для ответа.

Идея, вообще говоря, не из мира текста. Ретрив внутрь диффузии впервые принесли в компьютерном зрении: retrieval-augmented diffusion models подмешивают соседей из внешней базы изображений прямо в процесс денойзинга, а не подают их как неизменяемое условие.

Технически мы планируем подавать вместо конкретных эмбеддингов определённых токенов — их смесь.

x_i = α · e(g_i) + (1 − α) · e(<mask>)

где g_i — i-й токен линеаризованного графа. \alpha=1 — жёсткий граф в перезаписываемых слотах,α=0 — чистая маска. в тестах использовался \alpha = \frac{1}{2}

Результат 1: паритет, вчетверо дороже

Доля мусора здесь — параметр, который я задаю сам, поэтому сделал её независимой переменной.

Ответ присутствует в контексте при всех бюджетах, включая три триплета, так что различия по EM - это цена отвлечения, а не потеря факта.

Триплетов

Граф в промпте

Граф под маской

Разрыв

McNemar

3

0.747

0.613

−13.3

+3/−23, p<0.001

5

0.740

0.673

−6.7

+8/−18, p=0.076

10

0.740

0.687

−5.3

+11/−19, p=0.200

25

0.753

0.760

+0.7

+9/−8, p=1.000

50

0.701

0.701

0.0

+11/−11, p=1.000

Разрыв закрывается монотонно, и не за счёт просадки промпта: промптовая кривая плоская, а масочная растёт с 0.613 до 0.760. Но нигде не переворачивается. Лучшее, чего механизм добился, — статистический паритет, и достался он вчетверо дороже: 18.7 шага против 4.8.

Ответ на это можно найти в «Masks Can Be Distracting»: лишние mask-токены работают как дистракторы, и понимание контекста падает с их количеством. Механизм, который для работы требует длинной маскированной области, платит за неё сразу и он не окупается.

Результат 2: модель не вычищает мусор, она его ассимилирует

Самое интересное обнаружилось, когда я посмотрел, что стало с засеянной областью. Ожидал чистку: релевантное сохранено, на месте нерелевантого что то. Увидел ассимиляцию под вопрос.

Q: what are the two official languages of paraguay?
Gold: Spanish Language, Paraguayan Guaraní

GOLD

сохр

что положили

что осталось

1.00

Paraguayan Guaraní human language main country Parag

Paraguayan Guaraní human language main country Parag

0.70

Spanish Language human language countries spoken in

Spanish Language human language spoken country main

Дистракторы

сохр

что положили

что осталось

0.71

Ecuador country languages spoken Spanish Language.

Ecuador human language spoken Spanish Language.

0.67

Progressive Democratic Party organization geographic

Christian Democratic Party headquarters geographic l

0.67

Aguaray location containedby Paraguay.

Aguaré location containedby<|endoftext|><|endoftext|>

Мусор никуда не делся — он переписан в мусор другими словами. Причём характерно: дистракторное отношение country languages spoken дрейфует в human language spoken, заимствуя формулировку у золотого триплета.

Модель ведёт себя как денойзинг-автоэнкодер: делает текст более «типичным», а не более релевантным.

Результат 3: отбор есть, он вопрос-обусловлен и крошечный

Теперь главный вопрос: различает ли встроенный механизм уверенности релевантный факт и мусор?

Я добавил дамп уверенности по каждой позиции на нулевом шаге. Первое, что оттуда видно: 72 % позиций области графа проходят порог 0.9 сразу.

Отбор виден. При α=0.5 модель фиксирует 75.6 % позиций золотого факта против 65.3 % позиций дистрактора — разрыв 10.4 пункта.

Вот только сам по себе он ничего не доказывает: золотые триплеты могут просто состоять из более предсказуемого текста. Нужен контроль — тот же граф, но чужой вопрос. Если разрыв держится и там, это предсказуемость токенов, а не отбор.

Контроль показывает, что часть эффекта тривиальна: при чужом вопросе разрыв падает с 10.4 до 5.5 пункта. Вопрос-обусловленная часть — разница между ними — и есть то единственное, что можно назвать отбором.

на гистограммах также показана обусловленная часть для удаления, копирования и уверенности.

Заключение:

Гипотеза была красивой: если у диффузионной модели структурно есть то, чего нет у авторегрессии — право не коммитить неуверенное и переписывать уже выданное, — то почему бы не отдать ей на откуп чистку retrieved-контекста? Не мы решаем, какие триплеты лишние, а сама модель, по уверенности, стирает мусор и оставляет нужное.

Практика гипотезу не подтвердила — по крайней мере в том виде, в каком я её сформулировал. обусловленнасть присутсвует но как её эксплуатировать открытый вопрос.

Оговорки

  • Одна модель, один датасет, квантизация Q4_K_M. Ничего не обобщается без проверки.

  • Рост масочной кривой по бюджету идёт вместе с ростом числа шагов (12.9 → 18.7), так что «выгода от работы с содержимым» и «просто больше вычислений» этим свипом не разведены.

  • Наблюдение про ассимиляцию — качественное, на нескольких вопросах, не квантифицировано.

Ссылки

  1. LLaDALarge Language Diffusion Models (arXiv:2502.09992)

  2. Fast-dLLMFast-dLLM: Training-free Acceleration of Diffusion LLM (arXiv:2505.22618)

  3. Masks Can Be DistractingMasks Can Be Distracting (arXiv:2511.21338)

  4. RDMRetrieval-Augmented Diffusion Models (arXiv:2204.11824)

  5. RoGReasoning on Graphs: Faithful and Interpretable LLM Reasoning (arXiv:2310.01061)

  6. Context-aware correctionContext-aware correction of weak models by strong models (arXiv:2512.19004)

  7. Теормин по dLLMОбзор диффузионных языковых моделей, AIRI (Хабр, AIRI)

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.