ESPNDon't look now, Michiganders, but you're back in the Bottom 10RTP Desporto12h30 Aviso a CR7: "Jesus não vira cara à luta"The Jerusalem PostMaine Senate candidate Troy Jackson opposes US giving Israel 'blank check'PunchTinubu mourns NADECO chieftain Ralph ObiohaVanguardIGP Disu mourns 25 NAF personnel, passengers killed in crashRapplerAnyare? Villars’ AllHome, AllDay confirm store closuresCollider‘Carrie’s Mike Flanagan Confirms Why He Made a Major Change From Stephen King’s BookSouth China Morning PostChinese consortium to build Latin America’s longest cable-stayed bridge in BrazilZDF heuteAktuelle Pressemitteilungen des ZDFVariety‘In the Shadows’ Producers to Self-Release British Boxing Biopic Following Collapse of U.K. Distributor True Brit Entertainment (EXCLUSIVE)UN NewsWHO releases first global guidelines on child obesity as cases surgeTagesschauFrüherer BND-Präsident Hanning muss in Untersuchungshaft
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

Jev от TypeSafe: модель, с которой нельзя поговорить

Translate

Главное про Jev: с ней нельзя разговаривать. Текст она не генерирует вообще. На вход идёт состояние (строка или JSON) и набор заранее описанных вопросов, на выходе для каждого вопроса типизированный ответ с распределением вероятностей. Компанию основал Диогу Алмейда, бывший исследователь OpenAI, работавший над ChatGPT и RLHF.

Зачем это нужно

Типичная схема с LLM в роутинге тикетов: просим модель выбрать категорию, получаем текст, парсим, ловим случаи, когда модель ответила «скорее всего, это биллинг, но возможно…». Плюс ждём секунды там, где решение нужно для следующей строчки кода.

Jev закрывает ровно этот кусок. Вопросов три типа:

  • Choice выбирает один вариант из вашего списка;

  • Score ставит оценку по шкале, которую вы описали;

  • Noul возвращает вероятность того, что утверждение истинно.

В одном запросе их можно смешивать, все считаются параллельно по одному и тому же состоянию. Ответить чем-то вне вашего списка модель не может, отсюда у TypeSafe «0% галлюцинаций». Цифра взята из устройства API, замеров за ней нет.

Цифры вендора

TypeSafe заявляет 70–500 мс на ответ и $0.042 за миллион входных токенов, выходные бесплатно. В их же сравнениях Jev быстрее фронтирных LLM до 193 раз и дешевле до 444 раз. К этим числам две поправки из заметки Нженги: workflow для бенчмарков строила команда TypeSafe, а то, что цена не субсидирована, вендор, по его словам, пока доказать не может. Серверы на западном побережье США, так что из Европы и тем более из России задержка будет другой.

Что вышло у тестировавшего

Тикет «три дня не могу подключить Stripe, теряю продажи, помогите срочно» с тремя вопросами сразу дал за 72 мс:

  • отдел: технический, уверенность 72%;

  • срочность: 99%;

  • раздражение клиента: 1 по шкале до 2.

Интереснее сверка с документацией. В доках TypeSafe к Noul-вопросу «просит ли клиент живого оператора» приложены записанные ответы модели на шесть фраз. Нженга повторил три из них, две совпали точно: «Спасибо, помогло!» дала 0.02, «Я уже третий раз прошу, дайте поговорить с человеком» дала 0.99. А вот «Вы бот?» вместо заявленных в доках 0.40 получила 0.26.

Одна точка ничего не говорит о калибровке: для этого нужна размеченная выборка. Но воспроизводимость примеров страдает, а на вероятностях в Jev построено всё: документация прямо предлагает строить логику на порогах (высокая уверенность — действуем сами, средняя — переспрашиваем, низкая — отдаём человеку). Если ответ на пример из собственных доков сдвигается на 14 пунктов, пороги придётся подбирать на своих данных. Вероятно, это просто разница версий модели (сейчас 1.13), но проверить это снаружи нельзя.

Ограничения

Их TypeSafe перечисляет сама:

  • никакого многошагового рассуждения, модель рассчитана на быстрые суждения уровня «человек ответит за пару секунд» (отсюда название System One, по Канеману);

  • только текст; основной язык обучения английский, остальные, по словам вендора, работают хуже, и их советуют проверять на своих данных;

  • 64k токенов на весь запрос, но состояние вместе с самым длинным вопросом не больше 32k, и точность плывёт, когда состояние растёт;

  • лимиты вендор меняет на ходу: в заметке Нженги 250 тыс. токенов в секунду и 1200 запросов в минуту, в документации на 7 октября уже 100 тыс. токенов и 80 запросов в секунду;

  • доступ пока по листу ожидания.

Для русскоязычных команд второй пункт главный: публичных замеров на русском я не нашёл. Если у вас поддержка на русском, первая проверка — прогнать сотню реальных тикетов с известной разметкой и посмотреть, держится ли калибровка. 72 мс качество на русских тикетах не подтверждают.

Ниша при этом понятная: роутинг обращений, модерация, гардрейлы для ответов других LLM, разметка больших массивов текста. Везде, где сейчас стоит хрупкий if на регулярках или дорогой вызов чат-модели ради одного слова в ответе.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.