Inquirer1 dead, 1 missing after jeepney swept away in BatangasThe Jerusalem PostIsrael to close West Bank, Gaza crossings for October 7 remembrance ceremonies, COGAT saysPunchUS Marine arrested in Japan on suspicion of murderESPNIs this finally Milwaukee's year? Examining why Brewers' way will (or won't) workDaily MaverickIn defiance of chaos — why your choice in this election mattersRTP DesportoMax Verstappen vence GP do Bahrain de Fórmula 1ZDF heuteAktuelle Pressemitteilungen des ZDFFootball ItaliaPjanic claims: ‘Roma are Scudetto contenders but too early for Juventus’RTL BoulevardGersjes strandt in achtste finales op openingsdag WK judoCBS NewsMore details emerge about FlyDubai co-pilot who tried to crash planeStraits Times SportRussell's championship dreams hit by cruel power unit failure in SepangAntara NewsIndonesia bars Chinese national suspected of Starlux theft
The Daily Newsstand · Free, Always
Sunday, October 4, 2026

[Перевод] Отключение мозга ничего хорошего не сулит

Translate

Ещё в начале 2025 года я начал замечать, как люди при использовании ИИ переводят мозг в пассивный режим.1 Они просят ИИ выполнить какую-то задачу (обобщить текст, написать код и т.д.), принимая результат за чистую монету.2 В то время такой подход работал очень плохо, и результаты зачастую оказывались несуразными.

Но искусственный интеллект развивался, и я стал замечать такое поведение всё чаще. Иногда люди просто просят ИИ написать им код, который безоговорочно принимают как рабочий.3 В других случаях в цикле присутствует человек, который контролирует результат и при обнаружении проблем с кодом просит агента их устранить. Никлас Грюн даже придумал таким людям название — кожаный передатчик (meat proxy).4

Сегодня такие кожаные передатчики отрабатывают лучше, чем в начале 2025, и создаваемое таким образом ПО даже типа работает. Успешным, конечно, его назвать сложно, и желания пользоваться оно не вызывает. Но я всё равно впечатлён, насколько эффективными стали эти передатчики к сентябрю 2026. Можно даже пофантазировать, что в обозримом будущем ИИ разовьётся настолько, что при подобном методе разработки они начнут создавать ПО уже среднего качества. Или того круче — возможно, ИИ прокачается так, что научиться создавать прекрасное ПО вообще без участия человека.

Предположим, так и произойдёт. Какой тогда вообще резон компаниям нанимать себе кожаных передатчиков? Они могут просто гонять ИИ по кругу, а ненужных сотрудников уволить. Так что для самих сотрудников это явно ничего хорошего не сулит.5

1. Я наблюдаю это уже полтора года. И в последнее время всё чаще, так как ИИ совершенствуется, и при работе с ним люди всё охотнее отключают свой мозг. ↩

2. Люк Бартон прокомментировал это так:

«Мне кажется, способность работать в таком режиме говорит о характере выполняемой работы больше, чем считают сами работники. Лично я готов отказаться от самостоятельного решения задачи и поручить её ИИ, только если она не имеет особой ценности, и её провал ни на что не повлияет.

Если же говорить о серьёзных задачах, то вероятность их успешного решения моделью с первого раза намного ниже. В этом случае мне нужно принять на себя роль тестировщика, технического менеджера и архитектора. Такая работа в режиме цикла while (пока не заработает) ощущается как аврал. У меня возникает устойчивое чувство, что я что-то упустил, и что неудачный промпт может привести к архитектурной ошибке, из-за которой потом всё придётся переделывать.

Ещё я замечаю, что ускоренные темпы работы заставляют меня поднимать собственную планку по объёму выполняемых задач. Если раньше я мог выпустить MVP и потом его постепенно допиливать, то теперь у меня есть агенты, которые доводят продукт до ума и решают пограничные случаи гораздо быстрее. Вот только без грамотного промпта толку от них мало.

Возможно, это натолкнёт людей на неприятные размышления, но у меня есть пара вопросов к тем кожаным передатчикам, у которых агенты так легко со всем справляются: «А не кажется ли вам, что вы и до этого особо не напрягались?» и «Почему вы не ставите агентам более сложные задачи?»

К примеру, мы в своей работе решали задачу из разряда таких, которые вы бы сочли пригодными для полной автоматизации с помощью ИИ — переводили [вырезано] на сборку с помощью Bazel. И даже с использованием агентов на реализацию ушло несколько месяцев. Внутри неё кроется огромное число едва заметных и сложных для определения требований, решение которых с помощью агентов требует постоянного надзора. Уровень, при котором можно будет просто попросить их «Переведи это на Bazel» и спокойно заняться своими делами, ещё только предстоит достичь. Возможно, на это уйдут месяцы, годы, а то и вечность. В этом процессе слишком много точек решений и слишком много неизвестных неизвестных.

Как часто вы оказываетесь в сценарии, когда вам попадается некий код, принцип работы которого понять крайне сложно, но от этого понимания зависят дальнейшие действия. Тут может быть масса вариантов. Возможно, он завязан с процессами разработки, или вы сомневаетесь, а не начали ли этой функцией пользоваться клиенты. Как в таком случае вы будете решать проблему через ИИ?

Или другой пример. Допустим, вы делаете ревью своей работы с одним из стейкхолдеров, который вдруг говорит: «О, а это тут зачем? Это лишняя функция, мы ей уже давно не пользуемся». И какое здесь решение было принято из ложного предположения о необходимости этого элемента?»

Момент, в котором необходимость принятия решений становится более явной — это когда агент сталкивается с задачей, информации по которой в обучающей выборке не было. В лёгкой форме это проявилось, когда мы сравнивали, насколько хорошо агенты умеют использовать разные языки программирования. Намного хуже они справлялись с малоизвестными языками, на которых обучались существенно меньше, чем на популярных. Более же удачным примером будет попытка сыграть с ИИ в настольную игру (особенно в современную, а не классическую вроде шахмат или Го). В целом, если взять игру вроде «Затерянные города» или «Доминион», то передовая (SOTA) модель с необходимой программной обвязкой справится хуже человека, который в общих чертах с настолками знаком, но конкретно в эту никогда не играл.

Если вы спросите агента об этой игре, то окажется, что он многое о ней знает и может заявлять такие вещи, которые для несведущего покажутся разумными. Вот только для любого понимающего игрока все эти рекомендации покажутся полным ошибок бредом. Недавно я играл в Доминион с новичком, который думал, что ChatGPT поможет ему понять эту игру и освоить её механики. Честно говоря, я скептично отнёсся к этой идее и предположил, что получится наоборот (судя по моим наблюдениям, так и вышло).

Сыграв с оппонентом пару игр, я посмотрел, что конкретно ему советует ChatGPT. Не все советы были ошибочными, но конкретно ошибочная их часть уводила игрока в гораздо худшие ситуации, чем зашёл бы обычный человек, который хорошо играет в настолки и знаком с общими игровыми механиками. К слову, в сети полно открытой информации. Так что даже человек вообще без игрового опыта, который решился выделить пять часов на подробное ознакомление с игрой или даже просто предварительно о ней почитал (минут 30 с разрешением обращаться к подсказкам в процессе), мог бы легко войти в топ 1%. Это, конечно, убивает всё веселье, и я бы не советовал так делать. Но с учётом того, что агенты уже умеют выполнять поиск, запрашивать API и прочее, это показывает их сегодняшнее отставание от человека в задачах, выходящих за рамки обучающей выборки. Насколько мне известно, в следующем поколении моделей ситуация кардинально изменится, но на сегодня этот разрыв ещё велик.

Как бы то ни было, мой посыл в том, что даже при решении задач по программированию, вы зачастую сталкиваетесь с нештатными вопросами, с которыми ИИ-агент справится хуже, чем просто здравомыслящий человек. Если вы хотите добиваться высоких результатов сегодня, то вам нужно уметь замечать такие ситуации и разбираться в них самим. ↩

3. В качестве примеров того, что может пойти не так, когда человек об этом не подозревает, приведу два случая — этот и этот. В первом агенты (иногда) сильно подстраивались под тесты, а во втором под метрику. Я слышал гипотезу, что агенты чаще хитрят на задачах, имеющих чёткие критерии для оценки (eval-shaped). В этом я не уверен. Но даже если такое предположить, то я в работе и личных проектах создаю больше инструкций с чёткими критериями, чем другие исследователи (даже если сами проверки не провожу). При этом я видел, что у тех, кто не заморачивается с прописыванием критериев, возникает та же проблема (похоже, даже более серьёзная), когда они пишут общие инструкции и дают агентам полную свободу без присмотра. Мне удавалось удачно провернуть такое с минимальным надзором, но всё равно при некотором ограждении ИИ. А это уже делает процесс более похожим на формат с чёткими критериями, чем у большинства других исследователей.

Когда я пробую софт от людей, которые при его создании делегировали весь мыслительный процесс ИИ, то обнаруживаю в нём серьёзные проблемы. Мне неоднократно заявляли, что такой подход работает. Вот только ПО от таких разработчиков я точно не могу назвать соответствующим стандарту, о котором говорил здесь.

Возьмём забавный пример. Один авторитетный программист заявил в Twitter, что вопрос программирования закрыт — типа он попробовал реализовать всевозможные проекты с помощью Claude, и агент справился не хуже эксперта. Тогда я решил заглянуть в его репозиторий GitHub, чтобы увидеть результаты своими глазами. В итоге все примеры, которые я изучил, работали очень плохо, либо не работали вовсе. На тот момент я как раз занимался разработкой ИИ для настолок и искал подходящего агента в качестве соперника для своего. Его агент, написанный в стиле AlphaZero, оказался слабее, чем примитивный бот на базе минимакса, которого можно сгенерировать с помощью ИИ, оптимизировав его эвристику через несколько дополнительных итераций. Хотя по идее в этой игре такого бота должна была порвать даже посредственная версия агента, сделанного по образу AlphaZero.

В качестве ещё одного нелепого примера приведу случай, в котором человек, следуя стандартному пользовательскому сценарию (реального коммерческого продукта) попадал в замкнутый цикл. Технически из этого цикла можно было выйти — большинство программистов наверняка бы разобрались. Но вот рядовой пользователь, на которого и было ориентировано ПО, наверняка бы застрял и до нужных ему функций уже бы не добрался.

Я и сам клепаю много всякого ПО чисто для себя, и его качество тоже является весьма условным — если рассматривать его с точки зрения коммерческого продукта, то я бы сказал, что по существу оно не работает. Поэтому я не думаю, что такое ПО обязательно является плохим. Например, я как-то рассказывал про движок регулярных выражений, который мне написал агент для ускорения поиска через ripgrep на ПК. Аналогичным способом я создал интерпретатор Rust, чтобы ускорить итерации агента в некоторых проектах. Ещё я рассказывал, что мне нравится при анализе данных гонять агента в цикле — он выдаёт неверные результаты, а я указываю ему, что и как нужно исправить.

Однако между этими подходами есть огромная разница. Одно дело — создавать софт под свои узкие задачи, прекрасно понимая, что он будет работать только при правильном подходе, либо же генерировать заведомо сырые результаты, которые ты потом сам вручную доводишь до ума. И совсем другое — написать кучу нерабочего хлама и на этом основании заявлять, что программирование стало плёвым делом. Или, хуже того, пихать поделки такого качества в реальные коммерческие продукты.

Когда Томас Дуллиен (известный как Halvarflake) читал черновик этой статьи, я спросил его, стоит ли вообще публиковать этот мой клубок мыслей. Он ответил мне:

«Отличный пост! Конечно публикуй. Когда я говорю кому-то, что LLM не решают всех проблем в программировании, человек обычно смотрит на меня как на неадеквата. А я точно так же смотрю на него».

И вот совпадение: как только я закончил черновик, Гэри Бернхард написал в Twitter:

«Это такой сюр — сравнивать реальный результат работы ИИ-агентов с тем, что люди пишут о них здесь. В своих повседневных ревью я часто сокращаю сгенерированный ИИ код до четверти от его исходного объёма. Чего там только нет — куча бесполезных тестов, какая-то паранойя и извращённая логика. А потом я открываю Twitter и читаю, что 'программирование теперь плёвое дело'».

Затем он добавил:

«Вот вам пример, который я наблюдал буквально через час после своего твита. Я поручил агенту исправить управление DATABASE_URL. В итоге он добавил условия if прямо внутрь скриптов NPM, а в CI запихнул условный вызов Node, который запускал встроенный JS-скрипт. Всего получилось около 20 разбросанных правок. Когда я взялся за дело сам, то всё обошлось добавлением лишь одного слова и ни одной новой строки».

Мне кажется, любой, кто относится к софту так же, как Томас и Гэри, уже давно испытывает подобные чувства. Одно время я даже задумывался: может, люди, заявляющие о колоссальном росте продуктивности за счёт ИИ, умудряются вытягивать из него гораздо больше пользы, чем все мои знакомые? Но, как мы уже обсуждали, по мере появления новых свидетельств я всё больше убеждаюсь, что люди просто обманывают самих себя.

В примере с настольной игрой мне нравится то, что вы можете чётко измерить, насколько хорош получившийся ИИ. В каком-то крайнем случае можно столкнуться с ситуацией по типу «камень-ножницы-бумага», когда вы наблюдаете что-то вроде А > B > С > A. Если же код представляет собой обычный ИИ-бред, то это становится очевидным на объективном уровне.

То же касается и коммерческого софта. Вы всегда можете либо пообщаться с сотрудниками компании, либо самостоятельно заглянуть в данные, которые покажут, что конверсия упала, клиенты уходят, недовольство пользователей зашкаливает и т.д.

Вот вам ещё один забавный пример, только уже не о софте. Как-то раз читатель решил проверить одну из моих статей на факты с помощью ChatGPT и прислал мне «разоблачающие» результаты вместе с язвительным комментарием об ошибках. Но фишка в том, что я и сам уже проверял этот пост через ChatGPT и все реальные ошибки исправил. Так что в присланном списке остались только ошибки самого ИИ.

Если говорить в целом, то я заметил, что в подобных задачах (причём при анализе любого контента, не только моего) число ложных срабатываний очень велико, то есть точность ИИ оставляет желать лучшего. В то же время пропускает он ошибки довольно часто, то есть полнота (recall) у него весьма посредственная. Но если в процессе хоть немного включать мозг, то проводить такие проверки фактов всё равно стоит. Всё же быстро пробежаться глазами по списку с кучей ложных ошибок мне намного «дешевле», чем просить другого человека вычитывать черновик.

Ну и ещё один идиотский пример. Недавно tpatcek поднял интересную тему. Он пишет, что не стоит вестись на лесть ИИ, который нахваливает выполненную вами работу. В том случае речь шла конкретно про написание текстов, но это справедливо и для других видов деятельности.

Если вы разделяете отношение Гэри или Halvarflake, то это разумеется само собой. Однако некоторые люди не хотят этого знать. Мне кажется, нужно реально постараться, чтобы такое не замечать, но я нередко вижу, как люди доказывают величие своей работы тем, что её похвалил ИИ.

Возможно, ещё наступит день, когда слова ИИ о том, что ваша работа гениальна, или что ваши аргументы полностью разбивают доводы оппонента, будут иметь реальный вес. Но сегодня мы ещё слишком от этого далеки — как минимум в плане точности, насчёт времени сказать сложнее.

Поэтому, если кто-то пытается доказать качество своей работы или весомость аргументов на основе похвалы от ИИ, то это прежде всего признак того, что человек отключил мозг, и сильный сигнал о том, что сама работа или аргументы на самом деле никуда не годятся. ↩

4. Формально он в своём посте не приводит случаев, когда человек действовал бы по принципу цикла while или for. Однако подобное поведение, которое я замечаю всё чаще, полностью соответствует духу его публикации. ↩

5. Возможно, такой подход и сработает для основателей компаний, крупных акционеров и им подобных. Но когда я наблюдал такие вещи лично, то это всегда были наёмные сотрудники или авторы личных проектов. И именно они заявляли о том, как круто всё работает и что теперь кадровые разработчики могут щёлкать ПО как орешки.

Ещё один аргумент может звучать примерно так: «Мы все скоро останемся не у дел, так почему бы просто не сдаться?» Лично я смотрю на это с обратной стороны. Так можно рассуждать, только если ты уверен, что этот момент уже буквально наступает. Если в финансовом плане вы уже готовы выйти на пенсию, то можете спокойно отключать мозг. Хотя, честно говоря, так можно было делать всегда, и во все времена хватало людей, которые работали на отвали. Если же к пенсии вы пока не готовы, то логичнее заняться тем, что принесёт вам больше денег, а это вряд ли получится сделать с выключенной головой.

Если впереди сценарий будущего, где ИИ нас не заменит, то гнаться за заработком большой нужды нет. Но если вы искренне верите, что тотальная автоматизация уже на пороге и вам срочно нужно успеть заработать денег, то как раз сейчас самое время поднажать и делать всё точно наоборот — выжимать из своего мозга максимум.

Существует и другой взгляд: «Зачем вообще напрягаться и делать работу как надо, если больше за это всё равно не заплатят?» Тоже не могу с этим согласиться. Я сам, да и мои друзья, постоянно получали повышения и бонусы как раз за то, что прикладывали усилия, находили проблемы и решали их. Исключением может быть, разве что, какое-то токсичное и деструктивное место, где за хорошую работу вознаграждать не принято. Но в таком случае люди просто увольняются и уходят туда, где их ценят.

Возможен и ещё один аргумент: «Из-за инертности крупных компаний появится удачный момент, чтобы спокойно встроиться в роль кожаного передатчика уже после того, как LLM станут достаточно хороши для замены программистов».

Но если смотреть на вещи реалистично и учесть, с каким восторгом компании сейчас всех сокращают, то этот довод кажется полной противоположностью правде. Если ваша цель — работать как можно меньше, то лучшее время для этого уже прошло. Не общались на подобные темы с людьми, работающими в крупных компаниях? Если да, то наверняка слышали истории о сотрудниках, которые вообще не выходят на работу (и даже удалённо не работают), а на их увольнение уходят месяцы или даже годы. В последние пару лет я слышал такие байки реже, зато знаю случай из первых рук — так поступил один из моих коллег по команде. Насколько помню, у компании ушло шесть месяцев, чтобы уволить его после того, как он решил выйти на пенсию и сообразил, что может получить ещё несколько зарплат, если просто перестанет приходить в офис. Это ещё доковидная история из компании, где удалёнки не было в принципе.

А один мой друг рассказывал ещё более весёлый случай. Он работал в другой компании, и там на увольнение его коллеги, который провернул тот же финт ушами, у компании ушло аж два года.

Причём довольно долго никто даже не начинал процесс его увольнения. Затем последовала неспешная процедура вынесения всё более строгих предупреждений, после чего уже человека исключили из штата. По словам моего друга их менеджер потом признался, что если бы тот чел захотел ещё больше обмануть систему, то есть просто начал бы приходить и изображать хоть какую-то активность, то отсчёт времени пошёл бы заново.

Будь он профессиональным тунеядцем, то при тогдашних условиях мог бы сохранять за собой рабочее место бесконечно. Лично я не понимаю, как компании вообще могли находиться в таком состоянии. Хотя сейчас они уже вовсю от неё уходят, используя ИИ как отличный предлог. Из-за этого нынешнее время, да и наверняка ближайшее будущее, явно станут худшим периодом для тех, кто желает удержаться на работе, не прикладывая особых усилий и не принося пользы. Несомненно, останутся отдельные компании, где подобное может сойти с рук. Но если ваша цель — ничего не делать и просто получать лёгкие бабки, то вы немного припоздали. Такую схему можно было успешно крутить годами, когда условия были гораздо мягче тех, что ждут нас в ближайшем будущем (разве что не стоило борзеть и вообще переставать приходить на работу). ↩

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.