The Jerusalem PostBoy George announces second concert in Israel dedicated to Nova music festival survivorsCNN TürkTürkiye otomotiv ihracatı 9 ayda 31,1 milyar dolara ulaştıESPNThrough Dak Prescott's eyes: The Cowboys QB breaks down a play and all he seesPunchFirst Niger Bridge set to reopen soon – Federal controllerBollywood HungamaRhea Chakraborty launches ‘Caught Blushin’ with Staze Beauty, inspired by her viral The Traitors lookInquirerWalang pasok: Earthquake prompts work, class suspensions in GenSanCollider‘Twilight’ Star Jackson Rathbone Rejects “Soulless” AI-Generated Art [Exclusive]ZDF heuteAktuelle Pressemitteilungen des ZDFSouth China Morning PostIndia aims to anchor military ties with US as Indo-Pacific ‘resident power’Sky TG24L'esorcista: Martiri, il teaser trailer dell'horrorThe South AfricanTransfer boost: Bafana star wins award as England, Spain, Germany, France and Italy watchThe IndependentThree sisters who drowned off Brighton beach took their own lives, coroner rules
The Daily Newsstand · Free, Always
Thursday, October 8, 2026

Дал девяти популярным скиллам для Claude Code плацебо: два лучше пустышки, один хуже

Translate

Скиллы для Claude Code и Codex сейчас ставят пачками. У самых популярных сотни тысяч звёзд на GitHub, а в README встречаются конкретные цифры: «на 65% меньше токенов», «примерно на 20% дешевле». Мне захотелось проверить их так, как проверяют лекарства: против плацебо. Ниже рассказываю, как я это устроил и что получилось, включая ошибку, которую нашёл у себя в день публикации.

Почему «со скиллом и без» мало что доказывает

Скилл это текст. Агент получает его в контекст целиком или в виде короткого описания, по которому потом подгружает остальное. Лишний текст в контексте сам по себе меняет поведение модели: она иначе планирует и по-другому тратит токены.

Когда автор скилла сравнивает работу со скиллом и без него, в разнице смешаны две вещи: эффект содержания скилла и эффект того, что в контексте просто стало больше текста. Разделить их можно только третьей группой. В медицине это плацебо, таблетка, которая выглядит так же, но без действующего вещества.

Какие скиллы

Я взял самые популярные по звёздам скиллы и плагины на 28 сентября, которые в теории могут влиять на любую задачу программирования: дисциплина работы, планирование, тесты, краткость, инженерные правила. Доменные скиллы (дизайн, документация, SEO), системы памяти и оркестраторы не брал. Под правило подошли девять:

Скилл

Звёзд на 28.09

superpowers

292 189

mattpocock/skills

270 709

andrej-karpathy-skills

215 547

ponytail

146 942

caveman

108 076

agent-skills

99 510

i-have-adhd

51 606

planning-with-files

27 154

compound-engineering

25 299

Каждый ставился так, как написано в его README, на зафиксированном коммите.

Как устроено плацебо

Плацебо здесь это нейтральный текст про окружение. Вот кусок одного из них:

Some commands finish quickly and some take longer. Long-running commands may be stopped by a time limit. Commands can read environment variables.

Советов, как работать, в нём нет: ни про планирование, ни про тесты, ни про краткость. Слов из названий скиллов тоже нет.

Длину я подгонял под ту часть скилла, которая всегда сидит в контексте. Скиллы похожей длины объединил в группы так, чтобы плацебо отличалось от каждого своего скилла не больше чем на 10%, а потом проверил по фактическим токенам в первом запросе. Получилось пять плацебо на девять скиллов. Ставится плацебо тем же способом, что и скилл: плагином, хуком или через CLAUDE.md. Так скилл и его плацебо отличаются только содержанием.

Стенд

  • Claude Code 2.1.282, модель claude-opus-5-5 на среднем уровне рассуждений, это его настройка по умолчанию.

  • 15 задач из SWE-bench Verified, Terminal-Bench 2.1 и OpenThoughts-TBLite, отобранных из пула в 40 задач. Решение проверяют собственные тесты задачи, без LLM-судей.

  • На каждый скилл три группы: без скилла, с плацебо, со скиллом. Каждый запуск идёт в чистом Docker-контейнере через Harbor.

  • По 30 запусков на группу, всего 450.

  • Стоимость считал по токенам и публичным ценам API. Сами запуски шли по подписке, поэтому это оценка, а не счёт. Для сравнения групп это неважно: формула для всех одна.

  • Доверительные интервалы через бутстрап по задачам, поправка Холма на девять скиллов.

Метод записан до первого запуска

Всё, что выше, вместе с правилом вердикта я закоммитил в METHOD.md до первого запуска. Каждое изменение после этого записано отдельной поправкой с датой и пометкой, видел ли я к тому моменту результаты.

Поправок набралось девятнадцать, и две из них хорошо показывают, зачем это нужно.

Первая про объём. План был по пять запусков на задачу и группу, это 1 125 запусков. Прогон шёл на моём Mac, который всё это время заметно тормозил, и я остановил его на двух запусках, то есть на 450. Решение принято до того, как кто-то смотрел результаты по группам, и это записано в поправке 17. Без такой записи остановка выглядела бы как «остановился, когда цифры понравились».

Вторая неприятнее. В день публикации, когда репозиторий уже был открыт, я нашёл ошибку в подсчёте. По методу запуск, где агент не уложился в лимит 20 минут, считается проваленным. А код засчитывал его как успешный, если тесты после таймаута всё равно проходили. Таких запусков было два. После исправления planning-with-files перешёл из «не лучше плацебо» в «хуже плацебо». Стоимость не поменялась нигде. Всё это записано в поправке 19 вместе с номерами задач.

Результаты

R здесь отношение средней стоимости со скиллом к средней стоимости с его плацебо. Меньше единицы значит, что скилл дешевле.

Стоимость каждого скилла относительно плацебо той же длины, 95% ДИ

Стоимость каждого скилла относительно плацебо той же длины, 95% ДИ

Скилл

Стоимость против плацебо, R [95% ДИ]

Решено задач, скилл / плацебо

Вердикт

ponytail

0.88 [0.76, 0.97]

90% / 87%

лучше плацебо

i-have-adhd

0.92 [0.86, 0.98]

87% / 87%

не лучше

agent-skills

0.95 [0.90, 0.99]

83% / 83%

лучше плацебо

superpowers

0.98 [0.91, 1.06]

83% / 87%

не лучше

caveman

0.99 [0.91, 1.06]

90% / 83%

не лучше

compound-engineering

1.04 [0.91, 1.23]

87% / 87%

не лучше

planning-with-files

1.05 [0.91, 1.19]

80% / 100%

хуже плацебо

mattpocock

1.05 [0.99, 1.12]

83% / 87%

не лучше

karpathy

1.09 [0.93, 1.23]

83% / 87%

не лучше

Лучше плацебо оказались два скилла, ponytail и agent-skills, оба по стоимости: на 12% и 5% дешевле своих пустышек. Скорректированное p у обоих 0.049, на самой границе. Я бы читал это как «скорее всего, есть небольшой эффект», без фанфар.

Хуже плацебо planning-with-files: с ним решено 80% задач, с его пустышкой 100%. По стоимости разницы нет.

У i-have-adhd интервал по стоимости тоже не захватывает единицу, но после поправки Холма p = 0.095, и по заранее записанному правилу это «не лучше». Правило я специально оставил как есть. Иначе пришлось бы решать, какие исключения допустимы, уже глядя на цифры.

Остальные шесть, включая самый популярный superpowers, от пустышки не отличаются.

Против работы без скилла

Вторая часть сравнения, против работы вообще без скилла, получилась неприятнее для всех.

Одно плацебо, нейтральный текст без единого совета, поднимало стоимость на 2-16%. Ни один из девяти скиллов не оказался заметно дешевле работы без скилла. Ближе всех ponytail: 0.99 [0.81, 1.13], то есть примерно столько же. agent-skills, который обошёл свою пустышку, против работы без скилла стоит на 9% дороже: 1.09 [1.02, 1.19].

Часть того, что вы платите за скилл, это просто его длина. Постоянно подключённый скилл сидит в контексте каждого запроса, а в агентной работе основную массу токенов как раз составляют вход и кеш.

Что обещают README и что получилось

Цифры в README есть у трёх скиллов из девяти.

caveman обещает «на 65% меньше токенов» за счёт того, что агент отвечает как пещерный человек. Это про токены ответов агента, и на наших задачах их стало меньше на 2% [−9%, +6%] против работы без скилла, в пределах шума. Общий расход токенов при этом вырос на 18%, а стоимость на 14%: сам скилл добавляет в каждый запрос около 3 900 токенов.

ponytail обещает «примерно на 20% дешевле» и «на 54% меньше кода». У нас стоимость против работы без скилла −1% [−19%, +13%], а размер итогового диффа −13% [−27%, +12%]. По диффу запусков мало, это самая слабая цифра в таблице.

У planning-with-files цифры про другое (точность следования файловому шаблону и число ходов после очистки контекста), на нашем стенде они не меряются.

Оговорка: авторы мерили на своих задачах, своих моделях и своих базовых линиях. В README caveman, например, описан тест на десяти вопросах разработчика на claude-opus-4-6. Расхождение не значит, что их цифра ложная. Оно показывает, насколько цифра меняется в другой обстановке, а агентная работа над реальными задачами как раз та обстановка, где скиллы обычно используют.

Codex

На Codex (gpt-6-sol) был только пилот: три скилла на пяти задачах, по 10 запусков на группу. Там agent-skills и compound-engineering оказались дороже своих плацебо на 24% и 42%. Выборка маленькая, основной прогон Codex в эту версию не вошёл, поэтому выводов по нему я не делаю.

Ограничения

  • Модель одна. На других моделях и других уровнях рассуждений всё может быть иначе.

  • Задачи публичные, и Opus их, скорее всего, видел при обучении. На все группы это влияет одинаково, но абсолютные проценты решённых задач мало что говорят.

  • Большинство задач Opus решал почти всегда, поэтому главная метрика здесь стоимость. Интервал для разницы в доле решённых при 30 запусках около ±10 пунктов, скиллы по нему не ранжируешь.

  • Задачи на минуты. Скиллы, которые окупаются на длинных сессиях, с памятью и многодневными планами, этот стенд не меряет.

Как повторить

Записи каждого запуска лежат в репозитории, полные логи агентов в релизе. Любой из девяти скиллов перепроверяется одной командой:

uvx skill-placebo run DietrichGebert/ponytail

Если вы автор одного из скиллов и считаете, что я поставил его неправильно, откройте issue по шаблону. Подтверждённая ошибка установки значит полный перезапуск этого скилла и отдельную поправку в методе.

Репозиторий: https://github.com/simonether/skill-placebo

Что дальше

После поста на Reddit мне подсказали две идеи, которые я хочу проверить. Первая: скиллы-знания, то есть справочники по конкретной библиотеке или API, на задачах, где эти знания действительно нужны. Вторая: ещё одна контрольная группа, где в тексте скилла перемешаны предложения. Те же слова и та же тема, но без рабочей процедуры. Это отделит «тема скилла настраивает модель» от «инструкции работают».

Стенд и анализ во многом написаны вместе с Claude Code. Ни с одним из авторов скиллов я не связан, денег за эту работу ни от кого не получал.

Какие скиллы проверить следующими? И если считаете, что моё плацебо нечестное по отношению к скиллам, напишите, каким бы вы его сделали.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.