InquirerCastro: Sara Duterte camp’s inattention leaves VP ‘clueless’The Jerusalem PostEditor's Notes: The IDF needs to be accountable for unanswered military queriesESPNSources: FA chief demands docs on FIFA equity planESPN DeportesDodgers: Snell se lesiona la ingle en el 1er inningוואלההתרעות הופעלו במנרה ובמרגליות שבגליל העליוןRTP DesportoTorreense estreia-se esta quinta-feira na Liga EuropaColliderHans Zimmer Reveals the A-List Stars Who "Bullied" Him Into Going on Tour [Exclusive]DeadlineCBS News Expands ‘The Takeout’ Segments, Partners With VoteHub In Advance Of MidtermsAnime News NetworkThis Week in Anime - Made in JapanRolling StoneLizzy McAlpine on New Album ‘Angel’ and Making Peace With Her Early TikTok Fame
The Daily Newsstand · Free, Always
Thursday, September 17, 2026

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Translate

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ-модели. Оказывается, есть такой параметр “Cost per Task”, и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max). При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз. Как я понимаю, бенчмарк “Cost per Task” высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате “из ХЗ сделаю ТЗ”, а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты? У меня перестали кончаться 5-часовые лимиты и недельные лимиты. На тарифе за 20 баксов в месяц, Карл! :) Притом что я программист, Codex не водит меня по кругу, и мне не требуется переключаться на более умную модель, чтобы она все-таки смогла выполнить задачу, о которой я прошу уже в пятый раз. Я вижу, как многие вайбкодеры-непрограммисты всегда выходят из ситуации: если ИИ водит тебя по кругу, включи более умную модель, и она точно решит проблему. Да, это правда: для неквалифицированных программистов это работает, а для квалифицированных лишено смысла, если они, конечно, не обленились и вообще не выключили мозг.

То есть ситуация такая: даже самые дешевые и самые тупые фронтирные модели стали достаточно умными. Если ты разбираешься в теме, их уровня хватает за глаза. Похоже, гонка за тем, у кого модель умнее, подходит к концу. Но я столкнулся с другой проблемой: скоростью. Особенно это заметно на DeepInfra и OpenRouter. Сейчас средняя скорость генерации на более-менее нормальных моделях составляет 25-50 токенов в секунду. Даже Luna у меня в Codex выполняет задачу в среднем за 5-15 минут. Для агентского режима это очень медленно. Это начинает раздражать. Если взять модель DeepSeek-V4.1-Flash напрямую через API DeepSeek, скорость там достигает 300 токенов в секунду. Заметьте: задача выполняется не за 5 минут, а меньше чем за минуту. А если задача тяжелая, вместо 15 минут уходит всего 5. Когда ты программист, ты запускаешь задачу и хочешь, чтобы ИИ выполнил ее как можно быстрее. Так гораздо комфортнее, чем ждать 5-15 минут. При этом Artificial Analysis Intelligence Index у DeepSeek-V4.1-Flash равен 40, что на 2 пункта выше, чем у Luna.

В общем, следующим этапом развития агентского ИИ становится скорость. На текущий момент китайские модели выигрывают. Но, как я понял, нас ждут сюрпризы от американских LLM-провайдеров. У Anthropic, вроде, с этим проблемы, но OpenAI, похоже, скоро получит дата-центры, где скорость будет измеряться тысячами токенов в секунду. Представьте: раньше вы ставили задачу и ждали минуты, а теперь все готово за 10-30 секунд. Бизнес со скоростью мысли :) Только придумал, подумал, а результат уже можно проверять :)

Вы же помните, какой была гонка за размером контекстного окна? “У нас 65 тыс. токенов!” “У нас 250 тыс.!” “У нас полмиллиона!” “У нас контекст размером в 1 млн токенов!” Так вот, ребята, я думаю, гонка завершена. Дальше наращивать его смысла нет. Кстати, именно с ростом контекста и появились ИИ-агенты для кодинга, которые в цикле, решая задачу, итеративно наращивали контекст и успевали за 20-30 циклов сделать что-то полезное, дойдя до 500 тыс. или 1 млн токенов. Сейчас главная проблема в том, что ИИ-агент при каждой новой задаче заново изучает код и правила работы с репозиторием, чтобы выполнить вашу задачу. 80% его работы уходит на то, чтобы заново разобраться, что тут происходит, и только 20% составляют правки в коде. А все это из-за долбаного контекстного окна в 1 млн токенов, которое приходится постоянно сбрасывать в ноль и начинать заново. То есть у всех уже пришло понимание, что в идеале нужна некая долгосрочная память. Тогда контекстное окно становится бесконечным.

То есть, если модели не требуется из-за переполнения контекстного окна начинать с нуля, получается, что чем дольше модель работает с кодовой базой, тем больше у нее накапливается общее представление о том, где что находится в этом проекте. В общем, давай stateful LLM, надоели твои stateless LLM! И, кстати, такие работы уже ведутся, и есть несколько проектов. В общем, рынок созрел, и, я думаю, это будет следующим этапом, а не увеличение контекстного окна до 2 или 3 млн токенов.

Кстати, вопрос. А у вас как трансформировались привычки программирования в связи с последними событиями? Например, из-за того, что мне перестали быть нужны крутые средства IDE, я перестал оплачивать подписки JetBrains и перешел на Zed IDE. Он бесплатный, поддерживает шорткаты, как у JetBrains, и я, по сути, использую его, чтобы смотреть diff кода и навигироваться в дереве исходников. И, кстати, я что-то все меньше использую Codex или Claude Code: они тянут слишком много лишнего и раздувают контекст, что отвлекает LLM от задачи. Перешел на Pi harness. У него минимальный набор тулов: редактирование кода, запуск команд и т. д. В итоге в среднем один самый простой запрос к LLM, типа “привет”, у Pi занимает 3 тыс. токенов. У Codex 18 тыс., у Claude Code 30 тыс. Тут даже неважно, что меньше. Важно, что модель хуже понимает задачу, отвлекаясь на более раздутый контекст.

А у вас какой стек в итоге образовался? И вообще, как думаете, что дальше будет? Чего ждать от ИИ-продуктов в сфере программирования? Куда дальше все идет?

Только зарегистрированные пользователи могут участвовать в опросе. Войдите, пожалуйста.

100%Я фанатик, программирую с самого детства 20+ лет вся отрасль развивалась на моих глазах3

0%Я вайбкодер, либо только что выпустился с универа и не программист либо вообще левый чувак0

0%Я студент которого учили на программиста и мне сейчас надо будет искать работу0

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.