RTP DesportoTriatlo/Mundiais: Letícia Magalhães e Catarina Santos concluem prova de juniores em 29.º e 30.ºBollywood HungamaSCOOP: Salman Khan’s Monster lands a MONSTROUS Rs. 100 crore deal; PVR INOX bags All India distribution rightsPunchPDP chieftain hails Oyebanji for donating 100 vehicles to security agenciesESPNWhat to do with seven start-sit decisions you might be dreadingDaily MaverickOUR CITY NEWS: R10bn urgently needed to fix Joburg’s crumbling roadsInquirerIloilo school cancels classes over ‘security concern’CNN TürkDİLAY ÖZDEMİR KİMDİR, KAÇ YAŞINDA, NERELİ? Voleybolcu Dilay Özdemir Hangi Takımlarda Forma Giydi? Filenin Sultanları'nın Genç YıldızıESPN DeportesCheco Pérez, con buena primera práctica en GP de Azerbaiyán de F1The Jerusalem PostIsraeli envoy to US's son fighting for life in hospital after car-ramming attack, Leiter saysVanguardFour suspected Boko Haram terrorists arrested in Yoben-tvWo beginnt Antisemitismus?: Was die Debatte um die Berliner Linke so kompliziert machtCBS NewsJudge blocks Trump's ban on CNN, MS NOW and Politico's White House access for now
The Daily Newsstand · Free, Always
Thursday, September 24, 2026

LLMSignal #003 — А что если агенту вообще не нужно генерировать текст, чтобы выбрать следующее действие

Translate

Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model, открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B.

Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ), после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ): чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия.

Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ), где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать.

Именно кэширование является одной из ключевых инженерных идей CLM. В агентной системе состояние постоянно изменяется, однако множество инструментов, ссылок, кнопок или допустимых команд часто остаётся прежним; поэтому CLM разделяет кодировщик состояния и кодировщик действия и позволяет независимо сохранять полученные представления. В задаче с примерно тысячей возможных действий авторы сообщают о снижении задержки относительно Jev до 13 раз, а в наборе zero-shot тестов заявляют ускорение до 9 раз при сопоставимом качестве. Эти цифры являются результатами команды CLM, а не независимым benchmark.

Главное ограничение тоже следует непосредственно из архитектуры. CLM особенно выгодна, когда множество возможных действий известно заранее или повторяется между шагами, поскольку тогда g(aᵢ) можно кэшировать; если каждое действие уникально, динамически генерируется и больше никогда не повторяется, значительная часть преимущества исчезает. Поэтому CLM пока выглядит не заменой LLM, а специализированным быстрым слоем внутри agent stack.

Keywords: Contrastive Language Model, CLM-8B, local LLM, AI agents, coding agents, System 1, contrastive learning, InfoNCE, Qwen3-8B, DeepSWE, Terminal-Bench, inference.
Sources: Stanford Hazy Research / Contrastive-LM release materials; Contrastive-LM DeepSWE reproducibility checkpoint on Hugging Face.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.