LLMSignal #003 — А что если агенту вообще не нужно генерировать текст, чтобы выбрать следующее действие

Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model, открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B.
Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ), после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ): чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия.
Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ), где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать.
Именно кэширование является одной из ключевых инженерных идей CLM. В агентной системе состояние постоянно изменяется, однако множество инструментов, ссылок, кнопок или допустимых команд часто остаётся прежним; поэтому CLM разделяет кодировщик состояния и кодировщик действия и позволяет независимо сохранять полученные представления. В задаче с примерно тысячей возможных действий авторы сообщают о снижении задержки относительно Jev до 13 раз, а в наборе zero-shot тестов заявляют ускорение до 9 раз при сопоставимом качестве. Эти цифры являются результатами команды CLM, а не независимым benchmark.
Главное ограничение тоже следует непосредственно из архитектуры. CLM особенно выгодна, когда множество возможных действий известно заранее или повторяется между шагами, поскольку тогда g(aᵢ) можно кэшировать; если каждое действие уникально, динамически генерируется и больше никогда не повторяется, значительная часть преимущества исчезает. Поэтому CLM пока выглядит не заменой LLM, а специализированным быстрым слоем внутри agent stack.
Keywords: Contrastive Language Model, CLM-8B, local LLM, AI agents, coding agents, System 1, contrastive learning, InfoNCE, Qwen3-8B, DeepSWE, Terminal-Bench, inference.
Sources: Stanford Hazy Research / Contrastive-LM release materials; Contrastive-LM DeepSWE reproducibility checkpoint on Hugging Face.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.