The Daily Newsstand · Free, Always
Friday, October 2, 2026

Как пользоваться LMArena (arena.ai): как читать рейтинг и выбрать лучшую модель под свою задачу

Translate

LMArena помогает сравнивать нейросети по результатам реальных пользовательских голосований — в рейтинге можно посмотреть, какие модели лучше справляются с текстом, кодом, изображениями, поиском и другими задачами. Проблема в том, что общий Rank сам по себе мало что говорит: модель из топа Overall вполне может уступать конкурентам именно в вашем сценарии.

Чтобы нормально пользоваться LMArena, нужно разобраться в интерфейсе, категориях рейтинга и дополнительных показателях, иначе легко выбрать модель по красивой цифре в общей таблице и получить посредственный результат.

В этой статье разберём LMArena по шагам: что показывает каждый раздел, как читать рейтинг и позиции моделей, зачем переключать категории и как в итоге выбрать нейросеть под конкретную задачу.

Короткий ответ

LMArena, сейчас Arena.ai, — сервис для сравнения ИИ-моделей по голосам пользователей. В Battle Mode две модели получают один запрос анонимно, пользователь выбирает лучший ответ, а после голосования их названия раскрываются. Результаты таких сравнений формируют публичные рейтинги Arena.

Чтобы выбрать модель под свою задачу, сначала откройте подходящий рейтинг: например, Text для работы с текстом, Code для программирования, Text-to-Image для генерации изображений и т.д. Если внутри есть категории, выбирайте ближайшую к своему сценарию — лидер общего рейтинга может занимать другое место в рамках конкретной задачи.

В таблице смотрите на четыре показателя: Score, Rank, Rank Spread и Votes. Чем уже Rank Spread и больше данных, тем увереннее можно судить о позиции модели.

После этого отберите 2-3 подходящие модели и проверьте их на своих запросах — в Side-by-Side можно напрямую сравнить две выбранные модели, а в Direct — отдельно поработать с каждой. 

При финальном выборе учитывайте также цену, контекстное окно, доступность API, скорость и нужные функции: рейтинг Arena показывает предпочтения пользователей в сравнительных тестах, поэтому первое место не гарантирует лучший результат именно в вашем сценарии.

BotHub

После сравнения моделей в LMArena следующий шаг — протестировать подходящий вариант на реальной задаче. Для этого необязательно оформлять отдельные подписки на ChatGPT, Claude, Gemini и другие сервисы.

В BotHub разные нейросети доступны в одном интерфейсе без VPN: можно выбрать нужную модель для генерации видео, аудио, текста или изображений, а при необходимости переключаться между ними прямо во время работы. 

Как устроен интерфейс LMArena

На странице Leaderboard сначала выберите раздел под нужный вам тип задачи. Их распределение интуитивно понятно — Text Arena отвечает за текст, Code — за программирование, Image — за изображения, Video — за видео. В верхнем меню Arena эти разделы вынесены отдельно.

Расположение раздела «Leaderboard» в интерфейсе Arena.ai

Расположение раздела «Leaderboard» в интерфейсе Arena.ai

=

Внутри некоторых разделов есть свои категории. В Text Arena, например, Creative Writing показывает результаты на задачах с текстом, Instruction Following — насколько хорошо модели следуют подробным инструкциям, Coding — как они справляются с кодом, а Multi-Turn — как ведут длинный диалог с несколькими сообщениями. Если нужной категории нет в списке, нажмите «+ View more» и поищите там. 

Отдельно есть блок Occupational: он группирует модели по профессиональным сценариям — IT, тексты и языки, бизнес, математика, право, медицина и другие области. 

Ниже находятся дополнительные настройки рейтинга. Style Control уменьшает влияние предпочтений пользователей к стилю ответа, а Factuality сильнее учитывает фактическую точность. Здесь же можно ограничить список моделей по типу лицензии: показать все, только проприетарные или только open source.

Есть и более практичные фильтры. Можно задать диапазон Score, ограничить цену входных и выходных токенов, а также выбрать минимальную или максимальную длину контекстного окна. 

Например, если модель нужна для обработки больших документов через API, высокий Score мало поможет, если она слишком дорогая или не вмещает нужный объём текста. 

Режим Pareto показывает соотношение качества и стоимости: выше расположены модели с большим Arena Score, левее — более дорогие, правее — более дешёвые. Зелёная линия выделяет модели с лучшим балансом цены и результата.

Помимо рейтингов, в Arena есть несколько режимов работы с моделями. В Battle две анонимные модели отвечают на один запрос, после чего вы голосуете за лучший вариант. Side-by-Side позволяет заранее выбрать две конкретные модели и сравнить их на одинаковом запросе, а Direct — протестировать одну выбранную модель.

Для выбора модели по рейтингу удобнее сначала составить шорт-лист в Leaderboard, а затем проверить финальных кандидатов через Side-by-Side. 

Что показывает рейтинг LMArena

Для примера в Text Arena пользователь отправляет один запрос и получает ответы двух анонимных моделей. Затем человек сам выбирает лучший вариант и из множества таких сравнений Arena рассчитывает относительный Arena Score. 

Однако важно понимать, что Arena Score — это показатель пользовательских предпочтений, но никак не доля правильных ответов, ведь текст может выглядеть убедительно и всё равно содержать фактическую ошибку. Ниже разберем каждый из столбцов, что они показывают, что учитывать при анализе и как выбирать нужную модель.

Rank — текущее место модели в выбранном рейтинге. Оно зависит от раздела, категории и включённых настроек, поэтому одна и та же модель может быть первой в одном сценарии и заметно ниже в другом. Сам по себе Rank лучше использовать как быстрый ориентир: соседние места моделей далеко не всегда означают заметную разницу в качестве. 

Rank Spread — диапазон мест, которые модель может занимать с учётом статистической неопределённости. «1–7», к примеру, означает, что первое место нельзя считать настолько же уверенным, как при диапазоне 1–1. Это буквально показатель того, насколько Arena уверена в месте модели в рейтинге.

Допустим, у модели указан следующий рейтинг:

Rank: 10
Rank Spread:
4–18

Это значит, что по текущей оценке модель стоит на 10-м месте, но данных недостаточно, чтобы считать именно 10-е место надёжным. С учётом статистической неопределённости её позиция может находиться примерно в диапазоне от 4-го до 18-го места.

Rank показывает текущее место, а Rank Spread показывает, насколько этому месту можно доверять. Чем уже диапазон, тем увереннее позиция модели. 

Model — конкретная версия модели и режим, в котором она участвовала в рейтинге. Помните, что здесь важно смотреть на название целиком: варианты «high», max и т.д. демонстрируют совершенно разные режимы и могут идти отдельными строками с разными результатами. Рядом также указываются разработчик и тип лицензии.

Score — относительная оценка модели, рассчитанная по результатам сравнений в Arena пользователями. Число рядом с ± показывает неопределенность оценки, поэтому небольшую разницу в Score лучше рассматривать вместе с этим диапазоном и Rank Spread. Сам Score нельзя трактовать как процент правильных ответов или напрямую сравнивать между разными разделами рейтинга. 

Например, если у одной модели Score 1501 ± 9, а у другой 1501 ± 6, их диапазоны составляют примерно 1492–1510 и 1495–1507 и почти полностью пересекаются. В таком случае по Score нельзя уверенно сказать, что одна модель сильнее другой. 

Votes — количество голосований, в которых участвовала модель. Это показатель объёма накопленных данных, а не количества побед, поэтому модель с 10 000 голосов вовсе не обязательно будет лучше модели с 5 000. При небольшом числе голосов и широкой неопределённости позицию в целом стоит воспринимать сильно осторожнее.

Price $/M — стоимость миллиона входных и выходных токенов при работе через API. Обычно в таблице указаны две цифры, поэтому учитывать нужно обе: модель может быть дешёвой по входу, но заметно дороже при генерации ответа.

Context — заявленный размер контекстного окна модели, то есть объём информации, который она может учитывать за один запрос или диалог. Этот параметр важно учитывать если вы работаете с большими документами, длинным кодом и продолжительными переписками. При этом большое контекстное окно ничего не говорит о качестве обработки этого объёма, так что будьте внимательны.

Какие фильтры и режимы есть в рейтинге

Панель фильтров находится рядом с таблицей. Меняйте по одному параметру, чтобы видеть, как он повлиял на список.

Настройка

Когда включить

Style Control

Хотите уменьшить влияние длины и оформления ответа на предпочтения пользователей.

Factuality

Важна фактическая точность. Рейтинг получит дополнительный сигнал проверки утверждений из выборки; каждый ваш ответ переключатель не проверяет.

License Type

Для проекта подходит лишь определённый тип лицензии. Условия конкретной модели всё равно прочитайте отдельно.

Input / Output Price

Есть предел расходов на входные и выходные токены API.

Context Length

Нужно вместить объёмный документ.

Ranking / Pareto

Хотите сопоставить оценку и цену вместо обычной сортировки по месту.

Как выбрать модель под свою задачу: пошагово

  1. Определите конкретный результат. Например «исправить ошибку в Python» или «найти свежий документ».

  2. Выберите раздел. Для статьи — Text, для разработки — Code, для поиска — Search, для изображения — Image.

  3. Откройте профильную категорию. Для текста — Creative Writing; при строгом ТЗ дополнительно проверьте Instruction Following. Overall оставьте ориентиром.

  4. Возьмите три-пять моделей из верхней части таблицы. Запишите полные названия версий и режимов.

  5. Сравните Score, ±, Rank Spread и Votes. Если оценки близки, а диапазоны пересекаются, место выше не даёт уверенного победителя.

  6. Проверьте ограничения. Цена входа и выхода, контекст, лицензия, доступность нужной версии. При смене Style Control или Factuality сравнивайте модели при одинаковых настройках.

  7. Оставьте две-три модели. Для каждой запишите причину: оценка, цена или подходящие условия использования.

  8. Дайте им свой запрос. Один и тот же текст и ТЗ покажут, сколько правок потребуется именно вам. Arena оценивает чужие сравнения, а эту работу за вас не сделает.

Пример 1. Выбираем модель для подготовки статьи

Допустим, нужно написать черновик статьи, а затем сократить его по редакторскому ТЗ. Сначала открываем Text —> Creative Writing и берём несколько моделей с близкими результатами. После этого можно проверить тех же кандидатов в Instruction Following: Creative Writing показывает качество работы с текстом, но отдельно не оценивает, насколько точно модель соблюдает длинное ТЗ.

ВАЖНО: дата среза имеет большое значение, поскольку Arena регулярно пересчитывает рейтинг по мере поступления новых голосов. Поэтому при сравнении моделей фиксируйте дату, категорию и включённые настройки. Если рядом с результатом стоит Preliminary, оценка ещё предварительная и может заметно измениться. 

В обоих примерах взяли срез за 25 сентября 2026 года.

Первый пример: Text, Creative Writing; Adjustments: None; License Type: All; фильтры цены и контекста выключены; режим Ranking. 

Модель

Rank; Score ±; Rank Spread

Votes

Price $/M; Context

Gemini 3.1 Pro Preview

10; 1480 ± 6; 4–18

21 305

$1 / $6; 1M

Claude Opus 4.6

11; 1478 ± 6; 4–22

13 722

$5 / $25; 1M

Claude Sonnet 4.6

38; 1449 ± 7; 20–62

12 132

$1.50 / $7.50; 1M

У Gemini 3.1 Pro Preview и Claude Opus 4.6 разница всего два балла, а Rank Spread почти полностью пересекается. Поэтому Rank 10 против Rank 11 не говорит, что Gemini обязательно лучше напишет или отредактирует конкретную статью.

Зато цена уже демонстрирует практическую разницу: в этом срезе Gemini стоит заметно дешевле Opus по входным и выходным токенам ($1 / $6 против $5 / $25), поэтому при большом объёме текста её имеет смысл проверить первой и отдать предпочтение в целом. 

Claude Sonnet 4.6 стоит в Creative Writing ниже этих двух моделей, но остаётся полезным третьим кандидатом. Его можно прогнать на том же тексте и затем посмотреть позиции всех трёх моделей в Instruction Following. 

Пример 2. Выбираем модель для фронтенда

Допустим, нужно выбрать модель для генерации и правки фронтенд-кода — открываем Code —> WebDev —> Frontend. В этой категории Arena сравнивает модели на задачах, связанных с HTML, React, использованием инструментов и многошаговой работой над интерфейсом.

Модель

Rank; Score ±; Rank Spread

Votes

Price $/M; Context

Сlaude-opus-5.5-max

1; 1863 ± 22; 1–1

1 238

$4 / $20; 1M

gpt-6-astra-max

2; 1810 ± 12; 2–2

4 202

$10 / $50; 1.1M

Claude-fable-5.1-max

3; 1785 ± 12; 3–3

4 310

$10 / $50; 1M


Здесь ситуация заметно понятнее, чем в примере с Creative Writing: у первых трёх моделей Rank Spread не пересекается вообще: Opus занимает диапазон 1–1, Astra — 2–2, Fable — 3–3. В рамках этого среза Arena разделяет их довольно уверенно.

Claude Opus 5.5 Max стоит первым со Score 1863. Голосов у него меньше, чем у двух следующих моделей, но разница в Score достаточно большая, а Rank Spread зафиксирован на первом месте. Для фронтенд-задачи это сильный кандидат для первого теста.

GPT-6 Astra Max занимает второе место со Score 1810 и набрала 4 202 голоса. При этом она заметно дороже Opus по API: $10 за миллион входных токенов и $50 за миллион выходных против $4 / $20 у лидера.

Claude Fable 5.1 Max идёт третьей со Score 1785 и 4 310 голосами. Цена у неё такая же, как у Astra, поэтому по этому срезу у неё нет преимущества ни по позиции, ни по стоимости. Но её всё равно можно оставить третьим кандидатом для проверки на своём коде.

В этом примере Rank уже даёт больше информации, чем в Creative Writing, потому что диапазоны мест не пересекаются. Но финальный выбор всё равно лучше делать на своей задаче и там уже оценивать, какая из моделей лучше отработает.

Какие выводы нельзя делать по Arena

  • Первое место в Overall не гарантирует лучший результат на вашей задаче. Близкие Score и пересекающиеся Rank Spread тоже не дают однозначного победителя.

  • Score разных разделов нельзя сравнивать как одну шкалу: в них разные задачи и методики.

  • Цена токенов API не равна цене подписки или работе через агрегатор. Смотрите тариф там, где будете использовать модель.

  • Рейтинг поможет составить короткий список, но окончательный выбор сделайте самостоятельно после проверки моделей на своём запросе. 

У Agent Arena другая методика: там оценивают многошаговую работу по сигналам результата с помощью causal tracing, а не по парным голосованиям Text Arena.

Может быть интересно:

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.