ESPN DeportesMéxico: Alan Cervantes causa baja por lesiónESPNNWSL: Denver the big movers as Gotham retain top spotDaily MaverickGROUNDUP: Police and NPA liable for Gqeberha murder by man out on bailInquirer EntertainmentCeleste Legaspi recalls Lea Salonga’s early theater days before Walk of Fame starInquirerPNP: 2 vandalism suspects in martial law rally pacified, not arrestedCBS NewsBill Gates says Trump's AI views point to societal blind spotGlobal NewsEd Sheeran breaks down during 1st concert amid Macklemore tour fallout01netLa Switch OLED revient d’entre les morts : à ce prix, elle va se vendre par camions 🚛Screen RantPlayStation Officially Unveils Brand-New Hardware And Redesigned ControllerTagesschauMarktbericht: Entspannung am Ölmarkt stützt den DAXVarietyAmerican Film Market Partners With AMC A-List and B-List Movie Club to Offer Screenings to Frequent MoviegoersBusiness AMAmerikaans scheepsbouwbedrijf begint met voorbereidende werk voor de bouw van nieuw vliegdekschip USS William J. Clinton
The Daily Newsstand · Free, Always
Monday, September 21, 2026

[Перевод] Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?

Translate

Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

TypeSafe открыла ранний доступ к Jev 15 сентября. Впечатляющие цифры в анонсе получены при сравнении с флагманской моделью, которая генерирует текст. Но большинство команд не используют флагманские модели для классификации. Тысячи повседневных решений в рабочих процессах — стоит ли читать страницу, содержит ли письмо запрос, к какой категории отнести объект — уже принимают небольшие быстрые модели: модели класса flash‑lite, gpt-5.4-mini, gpt-5.6-luna. Именно их Jev должен превзойти. С ними я его и сравнивал.

Jev не пишет текст. Вы передаёте ему текст и вопрос с фиксированными вариантами ответа, а он возвращает вероятность для каждого варианта. Один вызов выглядит так:

POST https://api.typesafe.ai/v1/systemone

{
  "model": "jev-latest",
  "state": {"text": "i am sorry that i was unable to get the full brunt of the comedy ."},
  "questions": {
    "sentiment": {
      "type": "choice",
      "instructions": "Is this movie review positive or negative?",
      "criteria": {"negative": "Unfavourable", "positive": "Favourable"}
    }
  }
}
{
  "answers": {
    "sentiment": {
      "choice": "negative",
      "probabilities": {"negative": 0.97, "positive": 0.03},
      "confidence": 0.93
    }
  },
  "usage": {"input_tokens": 336},
  "model": "jev-1.13.0"
}

С моего ноутбука этот вызов занял 850 мс и стоил $0,000014: 336 входных токенов по $0,042 за миллион. Выход бесплатный, поскольку выходных токенов нет. Вопрос типа choice может содержать до 255 вариантов. В ответе приходит вероятность каждого варианта и показатель confidence — уверенность в сделанном выборе. Вопрос типа noul (так TypeSafe называет вопросы «да/нет») возвращает одно число: вероятность ответа «да». Поэтому 0,05 означает уверенное «нет», а 0,95 — уверенное «да». Один вызов может включать много вопросов.

TypeSafe не объясняет, как вычисляется confidence. Это не максимальная вероятность: в примере выше они равны 0,93 и 0,97 соответственно. Однако отбор по максимальной вероятности дал на открытых датасетах ту же картину с расхождением в пределах одного процентного пункта. В этой статье «уверенный ответ» означает значение не дальше 0,1 от одного из концов диапазона для вопросов «да/нет» либо значение от 0,9 для выбора одного варианта.

Я потратил два дня и около 16 000 вызовов, чтобы выяснить, для чего Jev полезен. Сначала проверил его на четырёх открытых датасетах для классификации: две небольшие модели OpenAI отвечали на те же вопросы. Затем — на нескольких тысячах реальных решений из рабочих процессов, которыми я занимаюсь. Правильность оценивал по тому, что произошло на самом деле, а не по мнению другой модели.

Главное

— На классификации коротких текстов Jev не уступает gpt-5.4-mini и gpt-5.6-luna или превосходит их на трёх из четырёх открытых датасетов. При этом он в 5–56 раз дешевле, а медианное время ответа составляет меньше секунды.

— Его вероятностям можно доверять вблизи 0 и 1. На задачах, с которыми он справляется, уверенные ответы оказывались верными в 90–100% случаев. В середине диапазона результат сравним с броском монеты.

— Лучше всего он работает с короткими входными данными и чёткими метками классов. Чем длиннее вход, размытее метки и больше бизнес‑логики в вопросе, тем сильнее одновременно падают точность и уверенность. При анализе целого документа он уступает небольшой модели, которую мы используем сейчас. Никакой промпт этого не исправил.

— Поэтому он работает как фильтр, а не как полная замена: берёт на себя уверенные решения на обоих концах диапазона, а остальные передаёт модели, которую вы уже используете.

Четыре открытых датасета

Для проверки я случайно выбрал по 300 примеров из четырёх открытых датасетов: Enron spam — для распознавания спама в письмах, AG News — для определения тональности кинорецензий и Banking77 — для определения причин обращений в банковскую поддержку. Каждая модель получала одинаковый вопрос и одинаковое однострочное описание каждой метки. От неё требовалось вернуть вероятность каждого варианта: без этого не построить отбор по уверенности. Обе модели OpenAI вызывались через Responses API с уровнем рассуждений low. gpt-5.6-luna также входит в собственную таблицу оценок TypeSafe.

Датасет

Jev,%

gpt-5.4-mini,%

gpt-5.6-luna,%

Точность уверенных ответов Jev,% (доля примеров)

Enron: спам, 2 варианта

98,7

97,7

98,0

99,6 (90%)

SST-2: тональность, 2 варианта

95,7

92,7

93,0

98,8 (82%)

AG News: тема, 4 варианта

91,3

88,3

89,7

94,7 (88%)

Banking77: намерение, 77 вариантов

76,0

78,7

81,7

89,9 (66%)

Здесь «уверенный ответ» относится к выбору одного варианта: уверенность Jev в своём выборе была не ниже 0,9. Jev без проблем принял все 77 вариантов Banking77 в одном вопросе. Это же оказался единственный датасет, на котором обе LLM его обошли.

Время одного вызова

Jev

gpt-5.4-mini

gpt-5.6-luna

Медиана

0,8–0,9 с

1,4–4,2 с

1,4–5,0 с

95-й перцентиль

0,9–1,1 с

2,1–5,9 с

2,1–6,8 с

Самый медленный из 300

1,4–1,8 с

3,9–16,0 с

3,6–10,5 с

Jev тратит примерно одинаковое время независимо от задачи. LLM замедляются с ростом числа вариантов, потому что записывают вероятность для каждого из них. Все измерения проводились при 20 одновременных вызовах — так, как это бывает в рабочем процессе. Впрочем, хвост задержек у Jev не всегда такой аккуратный: при 100 одновременных вызовах на наших страницах несколько запросов из каждой тысячи занимали от 10 до 35 секунд.

Два замечания о стоимости. В счёт за LLM входят выходные токены, и именно требование вернуть вероятность каждого варианта делает вызовы дорогими. На Banking77 это около 700 выходных токенов на вызов, поэтому тысяча вызовов gpt-5.4-mini стоит $3,81. Если попросить только выбранный вариант, счёт уменьшится в несколько раз, но тогда не будет оценки уверенности, по которой можно принимать решение. Кроме того, разрыв зависит от того, с чем сравнивать: 5–15 раз относительно gpt-5.6-luna, 100 раз и больше относительно модели с интенсивными рассуждениями или агента. К этому ещё вернёмся.

Все примеры, ответы каждой из трёх моделей на каждый пример и код оценки опубликованы на github.

Проверка на нашем рабочем процессе

Открытые датасеты нужны для базовой проверки. Нас интересовало, может ли Jev взять на себя часть работы классификаторов, которые уже принимают у нас тысячи небольших решений в неделю. Здесь эталоном служил результат дальнейшей обработки: удалось ли извлечь со страницы полезные данные и сохранил ли человек созданную агентом задачу, сочтя её нужной.

Решение

Примеров

Совпадение с результатом

Точность уверенных ответов (доля примеров)

Возможное применение

Полезна ли страница для маршрутизации документа?

1 005

97,8%

100% (63%)

Отсеивающий фильтр: 60% страниц ниже порога, потерь нет

Содержит ли страница административные сведения?

1 005

95,8%

99,8% (86%)

Отсеивающий фильтр: 52% ниже порога, потерь нет

Содержит ли страница перечень объектов?

1 005

98,0%

99,3% (94%)

Отсеивающий фильтр: 25% ниже порога, потерь нет

Есть ли на странице значение для одной из 135 строк отчёта?

1 005

68,6%

78% (57%)

Оставить текущей модели

Нужно ли создать задачу по входящему письму?

800

87,4%

96% (69%)

Фильтр с явно оговорёнными потерями

«Совпадение с результатом» — это ответ Jev “да/нет” с порогом P(да) = 0,5, сопоставленный с тем, что произошло дальше. Для маршрутизации сравнение проводилось с текущим классификатором: у этих страниц нет собственного последующего результата. «Точность уверенных ответов» — точность при P(да) ≤ 0,1 или P(да) ≥ 0,9; в скобках указана доля примеров в этом диапазоне. Для страниц большинство таких примеров находится у нижней границы.

На простых типах страниц Jev действительно полезен. Он совпадал с фактическим результатом в 96–98% случаев, а с нашим действующим классификатором — в 95–97%. Его вероятности почти не менялись: если спросить об одной странице дважды, разница составляет около 0,01. Мы поставили его перед классификатором как отсеивающий фильтр: любая страница с P(да) ниже порога, выбранного описанным ниже способом, не отправляется модели. Остальные обрабатываются как раньше.

Мы повторили пять производственных прогонов с фильтром и без него. Итог на всех 1 005 страницах остался тем же, но вызовов для маршрутизации стало на 50–67% меньше, для административных страниц — на 45–74%, для перечней объектов — на 8–13%. Последний выигрыш скромнее, потому что классификатор читает страницы парами. Пропустить пару можно, только если обе страницы оказались ниже порога.

Со сложным типом страниц Jev не справился. Вопрос «Есть ли на странице значение для одной из 135 строк отчёта?» требует отличить упоминание чего‑либо от конкретного значения, а Jev срабатывает уже на упоминание. Чтобы достичь нашей полноты, понадобилось примерно вдвое больше заданий на извлечение данных. Вероятность для одной и той же страницы между прогонами могла измениться на 0,5. Универсальная LLM ошибалась на том же вопросе точно так же: дело в задаче, а не в модели.

Самое интересное получилось с почтой. Сейчас для каждого письма в общем служебном ящике запускается сессия агента. Он решает, содержит ли письмо запрос, которым нам нужно заняться. По медиане это стоит около 12 центов и занимает 94 секунды. В большинстве случаев ответ — «нет». Получив то же письмо и те же письменные правила, Jev совпадал с зафиксированным результатом в 87% случаев. Для писем, по которым он был уверен, точность составляла 96%; таких писем было 69%.

Но некоторые настоящие запросы получали вероятность, близкую к нулю, — уверенное «нет». Например, обычный запрос с упоминанием третьей стороны модель воспринимала как изменение правил. Поэтому порога без потерь здесь нет. Есть компромисс: если отбрасывать всё ниже 0,03, исчезают 78% писем без запросов, но вместе с ними теряются 5 из 231 настоящего запроса в этом наборе.

Эти пять случаев — в основном короткие пересылки от коллег и письма, в которых вся значимая информация находится на фотографии, а Jev её прочитать не может. Если оба вида писем всегда отправлять агенту, среди остальных теряется примерно один запрос из 140.

Сколько сейчас стоит каждое решение

Решение

Сейчас, за 1 000

Только вызов Jev, за 1 000

Время вызова сейчас

Время вызова Jev

Разобрать одно входящее письмо

$120: отдельная сессия агента для каждого

15 центов; в 800 раз дешевле

94 с

~1 с

Проверить страницу перед маршрутизацией документа

$1,50: небольшая LLM

11 центов; в 14 раз дешевле

2–3 с, под нагрузкой больше

~1 с

Проверить страницу перед извлечением административных сведений

$3,50: небольшая LLM

6 центов; в 58 раз дешевле

До 20 с под нагрузкой

~1 с

В процессе обработки документов экономия в долларах скромная: несколько процентов стоимости прогона. Зато заметно сокращается число вызовов: исчезает около четверти всех обращений к провайдеру, у которого есть ограничение частоты запросов. С почтой всё наоборот: вызовов мало, но каждый из них — целая сессия агента, поэтому важна именно экономия денег.

Доверяйте краям диапазона, а не середине

Ценность этого числа в том, что у границ диапазона оно соответствует действительности. На открытых датасетах 82% ответов пришли с уверенностью не ниже 0,9; 96% этих ответов оказались верными. При уверенности ниже 0,9 доля правильных ответов составляла от 55 до 72% в зависимости от интервала.

Для наших страниц это число — P(да), поэтому два края означают уверенное «нет» и уверенное «да». Оба работают: у 82% страниц вероятность была ниже 0,1, и только 0,3% из них оказались нужны. У 4% страниц вероятность была не ниже 0,9, и нужны были 97% из них. Оставшиеся 14% находились в середине, где доля нужных страниц варьировалась от 6 до 83% в зависимости от интервала. Единого порога здесь недостаточно. Поэтому доверяйте краям, а середину передавайте модели, которая действительно способна разобраться в содержимом.

График страниц объединяет три фильтра: всего 2 559 вызовов. От фильтра маршрутизации в него вошли только 549 страниц, у которых есть собственный последующий результат.

Порог отбрасывания не нужно выбирать на глаз. Возьмите все примеры, о которых точно известно, что они положительные, найдите минимальную P(да), которую Jev присвоил хотя бы одному из них, и установите порог на половине этого значения. Подберите его на одной части данных, проверьте на другой и перепроверяйте по мере появления новых данных. В следующем месяце может встретиться настоящий положительный пример с вероятностью ниже всех, которые вы видели раньше.

Для наших фильтров я подбирал порог на четырёх из пяти производственных прогонов, а проверял на пятом, по очереди меняя проверочный прогон. Ни на одном разбиении страницы не терялись. Получились пороги 0,12, 0,065 и 0,025 для маршрутизации, административных сведений и перечней объектов соответственно. Они были рассчитаны по 187, 124 и 61 положительному примеру и позволяли отсеивать от 25 до 60% страниц.

Порог определяется вашими положительными примерами, а не диапазоном высокой уверенности, поэтому он может оказаться как выше, так и ниже 0,1. Для писем этот способ почти ничего не отсекал: полезного порога без потерь там нет, только описанный выше компромисс.

В 100 раз дешевле — по сравнению с чем?

С чем сравниваем

Во сколько раз дешевле

Во сколько раз быстрее

gpt-5.6-luna, рассуждения low, 2–4 варианта; измерения выше

5–6

1,7–1,9

gpt-5.6-luna, 77 вариантов; измерения выше

15

6

gpt-5.4-mini, рассуждения low; измерения выше

23–56

1,7–5

Terra с рассуждениями, собственная таблица TypeSafe

~75

~25

Флагманская модель, тест Every

~580

~25

Полная сессия агента для той же классификации, вызов за вызовом

~800

~100

Выходные токены LLM стоят в 4–8 раз дороже входных. При включённых рассуждениях большая часть токенов уходит на размышления. У Jev выходных токенов нет. Снизьте интенсивность рассуждений и ограничьте ответ несколькими токенами — большая часть разрыва из громких заголовков исчезнет. Останутся более дешёвые входные токены и один проход модели.

Что видят другие

Через три дня после запуска большая часть шума всё ещё была реакцией на анонс. В обсуждении на Hacker News почти 500 комментариев, но очень немногие написаны людьми, которые действительно вызывали API.

Спор идёт о том, как представлены результаты. Цифры «в 193 раза быстрее» и «в 444 раза дешевле» получены при сравнении Jev с флагманской моделью, записывающей ответ текстом. «Не может галлюцинировать» означает, что результат типизирован, а не что он верен. А собственная таблица оценок TypeSafe сравнивает ответы со средним результатом GPT-6 Astra и Claude Fable 5.1, а не с истинными ответами. В ней у Jev 67,8% против 74,1% у лучшей LLM: он нигде не первый по точности, зато в 200 раз дешевле.

Когда один из комментаторов назвал его «по сути, zero‑shot‑классификатором», гендиректор ответил: «Совершенно верно». Это самое полезное предложение во всём обсуждении. За два дня появились открытые аналоги на GitHub и Hugging Face, а также подборка из 70 репозиториев.

Отчёты с измерениями, в которых Jev и LLM запускали на одной задаче, делятся по характеру задачи.

Короткий вход, чёткие метки: Jev выигрывает или показывает сопоставимый результат. Near Here проверили объявления о мероприятиях, сравнив его с Mistral Small 4 и Gemini 3.5 Flash‑Lite с высоким уровнем рассуждений. Результат: 48 правильных ответов из 50 против 42 и 43; ни одно из 13 настоящих мероприятий не отсеяно; 0,6 с против 2,9 и 3,4 с; 4 цента за тысячу вызовов против 37 центов и $2,50. Технический директор Vercel запустил Jev на существующем тесте классификатора, в котором использовалась Gemini 2.5 Flash Lite. Jev “выиграл и по качеству — достиг потолка теста, — и по скорости: в 6 раз”.

HiringCafe оценивает соответствие резюме описаниям вакансий по человеческой разметке: корреляция Спирмена 0,79 при цене 2 цента за тысячу вызовов против 0,77 у DeepSeek V4 Flash за 14 центов и 0,72 у Gemini 3.1 Flash‑Lite за 29 центов. Проверка спама на 19 500 письмах дала точность 98,3% без дообучения — на уровне логистической регрессии, обученной на 15 000 из этих писем. Калибровка совпадает с моими наблюдениями: 0,1% спама при вероятности ниже 0,1, 99,9% при вероятности от 0,9 и 38% в диапазоне 0,5–0,6.

Маршрутизатор моделей от Classmethod: 40 из 40 при цене 2,5 цента за тысячу вызовов; в среднем классе моделей уверенность ниже. Every: обнаружены 6 из 7 специально внесённых дефектов за 0,35 с на фрагмент. Claude Fable 5.1 нашла все 7 за 8,8 с.

Более длинный вход, размытые метки или решение, требующее рассуждений: Jev проигрывает, а способ исправления каждый раз один и тот же. В тесте на 2 000 фишинговых писем у Jev было 62,6% против 81,3% у Claude Haiku 4.5, хуже калибровка и колебание результата на 5 процентных пунктов только из‑за формулировки вопроса. Пять узких признаков «да/нет» вместе с логистической регрессией дали 95%, а Haiku на тех же пяти признаках — 93%.

Samuel Sacco проверил 800 примеров возрастающей сложности. Вероятности были завышены в нижней части диапазона и занижены в верхней. При этом все ответы с уверенностью не ниже 0,9 оказались правильными; таких ответов было от 21 до 32%. Его совет — воспринимать число как оценку и подбирать собственные пороги на нескольких сотнях размеченных примеров. К этому же пришёл и я. В исследовании покера ответы сравнивали с солвером: 63% на случайных ситуациях, 94% на простых.

Самый слабый сценарий Jev в собственной таблице TypeSafe — обработка счетов: 61,8% против 79,1%. Это тот же анализ документа целиком, на котором он провалился у меня.

Вердикт

Фильтр. Jev дешёвый и быстрый, отвечает только на вопросы «да/нет» и на вопросы с выбором одного варианта. На концах диапазона его вероятности соответствуют действительности. Этого достаточно, чтобы поставить его перед классификатором, но недостаточно, чтобы заменить классификатор.

Ниже порога отбрасывания на наших данных он не ошибался ни разу. Такие примеры пропускают классификатор, а дальше в процессе ничего не меняется. Наши фильтры страниц отсекали таким образом от 25 до 60% страниц. Выше 0,9 он прав в 97% случаев на наших страницах и в 90–99,6% на каждом из открытых датасетов. Поэтому там, где большинство примеров попадает в верхнюю часть диапазона, можно действовать по ответу Jev и вообще не вызывать классификатор.

Для страниц нам это не понадобилось: настолько высокие значения получают только 3–9% из них. Но у спам‑фильтра верхняя часть диапазона гораздо больше. На Enron 90% примеров получили уверенность не ниже 0,9 при точности 99,6% — девять вызовов классификатора из десяти больше не нужны. Всё, что находится посередине, передаётся модели, которую вы уже используете, как и раньше.

Закономерность сохранялась во всех тестах — моих и чужих. Короткий вход, чёткие метки: почти идеальные результаты и высокая уверенность. Длинный вход, размытые метки или правило, требующее рассуждений: точность и уверенность падают вместе. Решение — разбить вопрос на узкие признаки «да/нет» и объединить их в коде. В тесте на фишинг это подняло результат с 63 до 95%.

Именно за этим пределом возможностей стоит следить. Все ошибки Jev в этих примерах связаны с длинным входом, а в собственных заметках TypeSafe сказано, что точность падает по мере увеличения состояния. Если следующая версия будет справляться с целой страницей или перепиской так же хорошо, как нынешняя с одним предложением, фильтр превратится в классификатор даже для сложных задач, а передача другой модели станет исключением.

Подбирайте оба порога по собственным зафиксированным результатам и проверяйте на данных, которые не участвовали в подборе. Не поручайте Jev вопросы, на которые нельзя ответить без осмысления документа целиком. На вопрос из заголовка можно ответить одним словом. Основная работа — определить, где провести две границы.

Открытая часть эксперимента находится в указанном выше репозитории, вплоть до ответов на каждый пример. Цифры для рабочих процессов получены на нашем производственном коде и наших данных.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.