The Daily Newsstand · Free, Always
Saturday, October 10, 2026

[Перевод] Qwen3.8 27B обошла GPT-5.6 в SQL-бенчмарке. И всё это — локально на ноутбуке

Translate

Производительность агентного SQL на уровне передовых моделей теперь помещается прямо на ноутбуке – даже если ему почти пять лет и у него всего 16 ГБ оперативной памяти. В связке Qwen 3.8 27B и DuckDB всё работает локально. А если понадобится масштабирование, достаточно изменить одну настройку, чтобы перенести обработку запросов в MotherDuck.

Как это меняет наш подход к работе? Что это говорит о будущем искусственного интеллекта в работе с данными? И раз уж мы здесь, заодно всё настроим на вашей машине. Это не займёт много времени.

Граница Парето сдвинулась

Мы использовали собственную обвязку агента и OpenRouter, чтобы прогнать бенчмарк DABstep на разных моделях и сравнить их с Qwen3.8 27B, запущенной локально на моих ноутбуках. Чуть позже разберём детали, а пока посмотрим на результат.

cost_vs_accuracy.png

Сказать, что Qwen 3.8 меня впечатлила, – ничего не сказать. Посмотрите, насколько далеко она забралась в левый верхний угол!

Бесплатно – или менее чем за $0,50, если учитывать электричество, – Qwen обошла OpenAI GPT 5.6 Luna Max, запуск которой обошёлся более чем в $8. Разница в стоимости – больше чем в 17 раз. Всего несколько недель назад мы восхищались Luna и тем, насколько сильно она меняет правила игры. Она по-прежнему очень мощная. Просто в мире ИИ всё меняется очень быстро.

4-битную версию Qwen я запускал на MacBook Air с M5 и 32 ГБ оперативной памяти, а 3-битную – на моём более старом MacBook Pro с M1 Pro и 16 ГБ. При этом Air потребляет всего 30 Вт против 100 Вт у Pro, так что по энергоэффективности он ещё выгоднее.

Gemini-3-Flash по-прежнему остаётся самой точной моделью, но стоит в 2,3 раза дороже Luna. В результатах этих бенчмарков есть некоторый разброс, поэтому не исключено, что небольшая доработка промптов позволит ещё сильнее сократить разницу в качестве.

У Sonnet 5 здесь дела выглядят не лучшим образом. Более высокая цена при заметно худшей точности – не самая удачная комбинация.

Если взять ещё одну модель с открытыми весами для сравнения, Kimi K3 показывает довольно высокую точность, но и стоит дорого. Если не считать её открытость, на фоне Gemini-3-Flash она выглядит менее выгодно.

Результаты можно изучить в этом MotherDuck Dive

Как Qwen3.8 меняет наш подход к работе

Вот уж действительно интеллект, стоимость которого почти нет смысла считать. По сути, платить приходится только за электричество, а MacBook Air с потреблением 30 Вт расходует примерно столько же, сколько одна обычная лампочка. Оставили вчера вечером свет включённым? За ту же энергию можно было бы получить ответы на целую пачку вопросов по данным.

В этом бенчмарке мы проверяли, как модель отвечает на вопросы по данным, но есть немало похожих задач, где такие модели тоже полезны. Например, исследовательская работа в фоне устроена очень похоже. В обоих случаях сначала нужно разобраться в вопросе с учётом бизнес-контекста, а затем использовать инструменты для поиска информации. Только вместо локального запроса к DuckDB агент идёт искать данные в интернете. SQL также неплохо отражает возможности модели в других несложных задачах программирования: написании скриптов или автоматизации. Теперь такие задачи практически ничего не стоят, поэтому их можно спокойно запускать в фоне, даже если есть лишь шанс, что результат пригодится.

Когда локальная модель настолько хороша, а на столе уже стоит достаточно мощный ноутбук, каждый день без такой настройки означает, что вы зря тратите деньги на токены. Если ноутбук достаточно производительный, он может ежедневно приносить вам несколько долларов пользы – больше $100 в месяц – при затратах на электричество в считаные центы.

Но дело не только в деньгах. Когда полностью исчезает риск случайно получить огромный счёт за ночь, работать становится заметно спокойнее. В худшем случае большая задача просто будет выполняться медленно, а не сожжёт все ваши кредиты. (Кстати, биллинг MotherDuck устроен по тому же принципу: вы не можете случайно запустить запрос сразу на тысячах машин.)

Одна из моих любимых задач с данными, которая отлично вписывается в этот подход, – оптимизация запросов. «Эй, Qwen! Посмотри на все запросы, которые я сегодня запускал, и ускорь их. У тебя есть следующие 12 часов на эксперименты. Используй лучшие практики data science. Поехали!»

Мощные открытые модели дают и другие возможности: можно самостоятельно разворачивать модели с открытыми весами, при необходимости дообучать их или даже подключаться к децентрализованной сети независимо принадлежащих Mac для дешёвого инференса.

Заставим вентиляторы ноутбука пошуметь

Итак, как всё это настроить локально и получить те же преимущества? Для начала разберёмся, какое железо понадобится.

Нужен ноутбук с более чем 16 ГБ унифицированной памяти либо дискретная видеокарта с 16 ГБ видеопамяти. Для более комфортной работы 32 ГБ памяти дают заметное преимущество. У Mac, особенно MacBook Pro, также выше пропускная способность памяти GPU, поэтому в таких задачах они обычно быстрее других ноутбуков.

До этого я вообще не работал с локальными моделями, но мне понадобился всего примерно час проб и ошибок, чтобы разобраться с основами. А вам теперь можно пропустить этот этап и запустить всё за несколько минут.

  1. Установите DuckDB

  2. Установите LM Studio

  3. Скачайте квантованную, то есть более компактную, версию Qwen3.8 27B

    1. Для MacBook с 32 ГБ памяти я рекомендую 4-битную версию, например Qwen3.8-27B-MLX-4bit

    2. Для MacBook с 16 ГБ памяти понадобится 3-битная версия. Мне нравится IQ3_XXS из семейства моделей unsloth

  4. [Необязательно] Скачайте MTP для предсказания нескольких токенов – в некоторых случаях он ускоряет генерацию

  5. Попросите агента запустить в LM Studio сервер с OpenAI-совместимым эндпоинтом и загруженной моделью. Для этого бенчмарка хорошо сработали такие настройки:

    1. Контекст на 16 384 токена

    2. MTP, если вы его скачали

    3. Режим рассуждений – low или off

  6. Подключите к этому серверу свою любимую обвязку агента: OpenCode или другую

    1. Либо используйте собственную обвязку, как в нашем репозитории с бенчмарком

  7. Подключите DuckDB к своим данным и задайте вопрос по данным.

Я провёл ещё несколько небольших тестов, чтобы подобрать настройки и выжать из машины максимум. Лучше всего сработал такой подход: я попросил агента составить план эксперимента (DOE, design of experiments) и проверить разные комбинации настроек. Это важно. Параметры сильно влияют друг на друга, поэтому настраивать их по одному – не лучший путь к нужному результату. Я также следил за нагрузкой на память и использованием подкачки – точнее, попросил Claude измерять их за меня – и заодно искал способы снизить расход памяти.

При запуске локальной модели память – самый дефицитный ресурс, поэтому перед бенчмарками я бы рекомендовал просто перезагрузить ноутбук. Ну или хотя бы закройте все вкладки Chrome…

На MacBook Air с M5 у меня получилось примерно 5–7 токенов в секунду, если считать по полному времени выполнения. Это довольно близко к 8,8 токена в секунду, которые можно ожидать исходя из пропускной способности памяти.

На более старом MacBook Pro с M1 Pro и 16 ГБ памяти я использовал 3-битную версию. В ней веса модели округлены ещё агрессивнее, чтобы сэкономить память. Точность немного снизилась: 96,4% против 98,6% у 4-битной версии. Но модель всё равно работала – даже на железе почти пятилетней давности. По полному времени выполнения я получал около 5 токенов в секунду. Дело в том, что пропускная способность памяти у M1 Pro на самом деле выше, чем у обычного M5 без приставки Pro в MacBook Air, но у M5 есть неплохие нейронные ускорители, которые дают ему преимущество.

Что вообще такое MTP?

MTP, или предсказание нескольких токенов, – интересный способ ускорить генерацию: модель заранее пытается угадать несколько следующих токенов, а затем проверяет, оказались ли эти предсказания верными. Ближайшая аналогия – спекулятивное выполнение в CPU. Процессор использует предсказание переходов, чтобы заранее начать вычисления по наиболее вероятной ветке – например, по той, в которую чаще всего попадает условие if. Если предсказание оказалось верным, всё выполняется быстрее. Если нет, процессор просто возвращается к обычному последовательному выполнению.

Поскольку предсказанные токены затем проверяются, точность от этого не страдает. Люблю ускорение без риска!

На более новом MacBook MTP оказался полезен при размере чернового предсказания 3: прирост составил примерно 30%.

А вот на старом MacBook Pro MTP, наоборот, замедлял работу. Узкое место находилось в другой части системы – железо просто не проектировали под такую нагрузку. На то, чтобы сделать дополнительные предсказания и затем их проверить, уходило слишком много времени.

Как мы проводили бенчмарк?

context-layer-eval-loop-local-model-sql.png

Все подробности есть в нашем репозитории на GitHub.

Наша собственная обвязка агента использует бенчмарк DABStep, чтобы смоделировать, как команда по данным должна работать со слоем контекста. Сначала общую документацию, включая несколько фрагментов SQL, передают Claude Fable 5, который преобразует её в MotherDuck Guides. Guides – это обычные Markdown-документы, которые хранятся рядом с данными и связаны между собой. Если вы хотите работать локально, вполне может оказаться, что вам хватит Markdown-файлов и нескольких ссылок между ними.

Так что да, на одном из этапов мы действительно используем крупную передовую модель, но это быстрая и недорогая часть процесса. Основные расходы начинаются при оценивании наборов вопросов и ответов – и именно здесь в дело вступают локальные модели.

Когда начальный слой контекста готов, его итеративно тестируют на меньшей ИИ-модели с помощью 26 пар «вопрос – ответ», которые выступают в роли обучающей выборки. На каждый вопрос модель должна выдать строго заданный текст. Если меньшая модель отвечает на какой-то вопрос неправильно, слой контекста дорабатывают: добавляют недостающие предположения и бизнес-правила. Для этой доработки используют более крупную модель, чтобы как можно точнее отшлифовать центральный набор определений.

Когда цикл обучения и доработки заканчивается результатом 26 из 26, запускают полную тестовую выборку из более чем 400 вопросов и подсчитывают итоговый результат. Здесь тоже используется меньшая модель, потому что только так такой процесс можно масштабировать в продакшене.

Никому не стоит гонять Fable для eval-тестов в большом масштабе – разве что название вашей компании рифмуется с «gyroscopic». Ну а Sol, пожалуй, можно использовать, если оно рифмуется с «orange banzai».

Остальная часть истории

Я окончательно убедился, что локальные модели наконец дошли до точки, где ими действительно можно пользоваться. Особенно меня поразила Qwen3.8 27B – она заставила меня пересмотреть представления о том, на что вообще способна модель с 27 млрд параметров.

Но кое в чём разница всё ещё заметна. Начнём со скорости работы:

runtime_vs_accuracy.png

В среднем Qwen требовалось 5–6 минут на ответ на один вопрос, тогда как Gemini-3-Flash справлялась примерно за 25 секунд, а GPT 5.6 Luna – за 40. Но здесь есть несколько оговорок. Думаю, настройки ещё можно немного дожать и получить дополнительные 20–30% производительности. К тому же постоянно появляются новые варианты квантования, которые позволяют выжать из Qwen ещё больше.

При этом огромное значение имеет железо. У MacBook Pro с M5 Max пропускная способность памяти примерно в четыре раза выше, чем у MacBook Air. Если это даст четырёхкратный прирост производительности – вполне разумное предположение, – то 90 секунд уже гораздо ближе к результатам передовых моделей крупных AI-лабораторий.

Но локально я мог нормально запускать только по одному промпту за раз. В этом бенчмарке я регулярно отправлял через OpenRouter сразу по 15 вопросов, а в облаке можно параллельно запускать столько промптов, сколько позволяет бюджет. Субагенты здесь особенно удобны: их можно запускать одновременно.

Этот подход подходит только тем, у кого достаточно мощное железо. По приблизительной оценке Claude, более 16 ГБ оперативной памяти есть примерно у трети ноутбуков, а значит, большинство пользователей всё ещё не смогут в полной мере воспользоваться этим подходом. Если же считать только Mac с 16 ГБ памяти и больше, где помогает высокая пропускная способность памяти, доля снижается примерно до одного ноутбука из тридцати.

Но среди читателей этой статьи таких наверняка больше 3%, так что если мощности хватает – обязательно попробуйте.

Кроме того, в этом бенчмарке построением слоя контекста по-прежнему занималась крупная передовая модель – в нашем случае Fable 5. Локальные модели пока вряд ли способны закрыть вообще все сценарии, по крайней мере на потребительском железе среднего уровня.

И наконец, до сих пор мы учитывали только стоимость электричества, предполагая, что ноутбук у вас уже есть. Если добавить амортизацию самого ноутбука, локальная модель обойдётся примерно в $6 на 1000 ответов. Откуда эта цифра? Допустим, ноутбук стоит $2000 и служит четыре года. Тогда шесть минут амортизации на каждый вопрос дают примерно $5,70 затрат на тысячу ответов.

Так что покупать MacBook Air исключительно ради запуска Qwen не стоит. Всё-таки ноутбук неплохо бы использовать ещё и как ноутбук.

Пусть ноутбук закрякает!

Локальные модели уже достаточно хороши, чтобы потратить час на их настройку. Добавьте к ним DuckDB – и получите мощный бесплатный набор инструментов для исследования и анализа данных прямо на своей рабочей машине.

Если данных слишком много для локального анализа, архитектура Hypertenancy в MotherDuck выделяет каждому агенту собственную изолированную среду в облаке. Это даёт хорошую изоляцию вычислительных ресурсов: ни один агент не сможет затормозить дашборд CEO. Заодно обеспечивается изоляция данных – данные вашего агента по умолчанию остаются приватными. Кроме того, оплата идёт за каждую отдельную среду, поэтому один неудачный запрос не сможет разрастись на множество серверов и резко увеличить расходы. А MotherDuck Guides позволяют без лишних усилий держать бизнес-контекст под рукой у агентов именно тогда, когда он им понадобится.

Qwen3.8 27B и DuckDB – необычно мощная связка, которая позволяет использовать уже имеющийся ноутбук для работы с данными вашей компании. А если ресурсов станет не хватать, всегда можно подключить MotherDuck.

Удачного анализа!

В эксперименте с Qwen3.8 27B стоимость запросов оказалась минимальной, но возникли вопросы к скорости работы. При использовании ИИ-агентов приходится учитывать и другие моменты: подключение внешних инструментов, контроль качества ответов и затраты на выполнение задач. Несколько смежных тем — на бесплатных вебинарах:

  • 12 октября, 20:00. «Сколько стоит один ответ вашего AI-агента — и почему он думал 40 секунд?» Записаться

  • 20 октября, 20:00. «Tool Calling и MCP: интеграция ИИ-агентов с корпоративными системами». Записаться

  • 27 октября, 18:00. «Langfuse в AgentOps: наблюдаемость и оценка LLM-агентов». Записаться

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.