UN NewsUnited Kingdom announces action on disinformation and global AI standardsDaily MaverickGROOT BOEREWORS TREK: Succulent & spicy — the very best boerie in the landThe Jerusalem PostLikud rejects Otzma Yehudit's Ben-Gvir's push for Defense Ministry, Justice Ministry for GotlivPunchHow to change phone number, email on JAMB portalInquirerPalace open to amendments to anti-espionage law, says CastroCollider'Interview With the Vampire' Director Officially Reveals Why Louis and Lestat’s Relationship Didn't Need to Be More Explicit [Exclusive]The South African48-hour water shutdown planned across parts of DurbanSCMP ChinaChina hawks grumble over Trump’s lavish welcome planned for Xi state visitMalay MailAsian Games: Golden girl Adeola to take Proton e.Mas home to Sabah for familyVanguardEkiti poll: Appeal Court rejects request to relocate sitting as SDP counsel snubs tribunalSRF NewsKrieg in der Ukraine – Erneute Angriffe auf Kiew – Zwei ToteObservador DesportoPS questiona IP sobre estrada fechada desde a Kristin
The Daily Newsstand · Free, Always
Wednesday, September 23, 2026

[Перевод] Встречаем GPT‑6 Sol и Luna

Translate

Эта статья — перевод оригинальной статьи «Introducing GPT‑6 Sol and Luna».

Также я веду телеграм канал «Frontend по‑флотски», где рассказываю про интересные вещи из мира разработки интерфейсов и AI.

Вступление

В начале этого месяца мы представили GPT-6 Astra — нашу самую интеллектуальную и выровненную модель. Для самых сложных и критически важных задач по-прежнему стоит использовать всю мощь Astra, но на практике задачи бывают разного масштаба, требуют разной скорости и укладываются в разные бюджеты.

Поэтому мы расширяем семейство GPT-6 моделями GPT-6 Sol и GPT-6 Luna. GPT-6 Astra открыла новое поколение интеллектуальных моделей, а Sol и Luna позволяют сделать преимущества этого поколения доступнее за счёт более высокой эффективности по соотношению стоимости и возможностей. При обучении GPT-6 Sol и Luna мы использовали подходы, схожие с теми, что применялись для GPT-6 Astra. Благодаря этому более быстрые и доступные модели получили многие из улучшений Astra: высокий уровень работы с профессиональными задачами, фактическую точность, навыки программирования, взаимодействия с компьютером и следования заданным принципам поведения.

Модели GPT-6 занимают лидирующие позиции по соотношению стоимости и интеллектуальных возможностей, предлагая высокую производительность на каждом уровне и инфраструктуру, которая позволяет эффективно масштабировать их использование. Улучшения в кэшировании и инференсе позволили снизить стоимость обслуживания моделей, и мы напрямую передаём эту экономию пользователям и клиентам: цены API для Sol и Luna снижены на 50% по сравнению с промо-тарифами GPT-5.6.

В совокупности эти улучшения делают продвинутый ИИ более практичным для повседневных задач и массового использования в приложениях.

Стоимость GPT-6 API

Модель

Входные токены

Выходные токены

Снижение цены

GPT-5.6 Sol → GPT-6 Sol

$4 → $2

$20 → $10

на 50% дешевле

GPT-5.6 Luna → GPT-6 Luna

$0,20 → $0,10

$1,20 → $0,50

на 50% дешевле

Цены указаны за 1 млн токенов.

GPT-6 Astra по-прежнему остаётся нашей лучшей моделью по совокупности возможностей. Выбирайте её, когда вам нужен максимально качественный результат без компромиссов.

Шаг вперёд для всего семейства моделей

GPT-6 Sol и Luna повышают интеллектуальные возможности и эффективность по стоимости в знакомых вам моделях, прежде всего в тех сценариях, которые особенно важны для решения сложных рабочих задач.

Профессиональные задачи

GPT-6 Sol рассчитана на сложные рабочие сценарии и при этом даёт больше пространства для итераций благодаря более высоким лимитам использования и меньшей стоимости. По сравнению с моделями конкурентов в сопоставимом ценовом сегменте она предлагает более высокий уровень возможностей и более качественные результаты.

В AutomationBench — тесте бизнес-процессов, выполняемых в разных приложениях, GPT-6 Sol с уровнем усилий xhigh превосходит Claude Opus 5 на max, при этом стоимость выполнения одной задачи составляет всего 9% от стоимости Opus 5.

GPT-6 Luna на уровне high улучшает результат своего предшественника на 5,4 процентного пункта, одновременно снижая стоимость выполнения одной задачи на 58%.

В AutomationBench 1.0.6 ИИ-агенты тестируются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и HR. Показатель стоимости для Claude Fable 5.1 занижен относительно фактического, поскольку не учитывает стоимость переключений на Opus 5, которые происходили примерно в 40% задач.

В AutomationBench 1.0.6 ИИ-агенты тестируются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и HR. Показатель стоимости для Claude Fable 5.1 занижен относительно фактического, поскольку не учитывает стоимость переключений на Opus 5, которые происходили примерно в 40% задач.

GPT-6 Sol также превосходит Claude Fable 5.1 при значительно меньшей стоимости и даже обходит GPT-6 Astra с низким уровнем усилий.

Модель (и уровень усилий)

Результат

Стоимость задачи

GPT-6 Sol (xhigh)

33,2%

$0,27

GPT-6 Astra (low)

30,3%

в 3,9 раза выше, чем у GPT-6 Sol

Claude Opus 5 (max)

26,9%

в 11,1 раза выше, чем у GPT-6 Sol

Claude Fable 5.1 с fallback на Opus 5 (max)

31,4%

более чем в 8,9 раза выше, чем у GPT-6 Sol

Стоимость fallback-переходов отдельно не указана.

В Agents’ Last Exam — бенчмарке, который оценивает агентов на сложных профессиональных рабочих процессах, GPT-6 Sol на максимальном уровне усилий набирает 56,4%. Это выше лучшего результата Claude Opus 5 в этом тесте, при этом стоимость выполнения одной задачи оказывается на 60% ниже.

В Agents’ Last Exam V1 ИИ-агенты оцениваются на длительных и экономически значимых задачах из 55 подотраслей, охватывающих большинство основных видов профессиональной работы, выполняемой за компьютером.

В Agents’ Last Exam V1 ИИ-агенты оцениваются на длительных и экономически значимых задачах из 55 подотраслей, охватывающих большинство основных видов профессиональной работы, выполняемой за компьютером.

Фактическая точность

Полезность ответа напрямую зависит от того, насколько корректны приведённые в нём факты, и мы продолжаем повышать надёжность моделей в этом отношении.

Во внутреннем тесте на фактическую точность, основанном на обезличенных реальных диалогах, в которых пользователи отмечали ошибки наших моделей, GPT-6 Sol допускает примерно вдвое меньше ошибок, чем её предшественник. По надёжности она приближается к уровню Astra, оставаясь при этом значительно дешевле.

GPT-6 Luna также показывает заметный прогресс: на более высоких уровнях усилий она достигает уровня GPT-5.6 Sol при стоимости примерно в сто раз ниже.

В этом тесте мы оцениваем фактическую точность на обезличенных диалогах ChatGPT, в которых пользователи ранее отмечали фактическую ошибку, допущенную моделью. Такие диалоги, провоцирующие ошибки, не отражают типичный сценарий использования, где фактические ошибки встречаются реже. Результаты не нормализованы по длине ответа. При этом наши эксперименты с разным уровнем подробности показали, что длина ответа практически не влияет на итоговый результат.

В этом тесте мы оцениваем фактическую точность на обезличенных диалогах ChatGPT, в которых пользователи ранее отмечали фактическую ошибку, допущенную моделью. Такие диалоги, провоцирующие ошибки, не отражают типичный сценарий использования, где фактические ошибки встречаются реже. Результаты не нормализованы по длине ответа. При этом наши эксперименты с разным уровнем подробности показали, что длина ответа практически не влияет на итоговый результат.

Программирование

В этом году coding-агенты начали справляться с задачами, которые стали сложнее, масштабнее и продолжительнее, чем когда-либо прежде. Внутри OpenAI их использование растёт экспоненциально. Если пересчитать объём потребляемых токенов по ценам API, медианный исследователь ежедневно использует их более чем на $600, а исследователи из 90-го процентиля — более чем на $7 000 (Research acceleration: The view inside OpenAI).

По мере того как coding-агенты берутся за всё более длительные и ресурсоёмкие задачи, стоимость их постоянного использования становится всё важнее. GPT-6 Sol и Luna сочетают высокую производительность в программировании с более низкими ценами API. Это даёт разработчикам больше возможностей для итераций, а командам позволяет ставить перед Codex более амбициозные задачи, не опасаясь чрезмерного роста затрат.

В FrontierCode бенчмарке, который оценивает, способны ли coding-агенты вносить в реальные кодовые базы изменения, готовые к слиянию. GPT-6 Sol заметно превосходит GPT-5.6 Sol и достигает уровня Claude Fable 5.1 на xhigh, при этом обходясь значительно дешевле.

В FrontierCode 1.1 Main ИИ-агенты пишут код, который оценивается не только по корректности, но и по тому, насколько изменения готовы к слиянию в основную кодовую базу. В частности, учитываются качество тестов, соблюдение границ задачи, стиль кода и соответствие принятым в проекте стандартам.

В FrontierCode 1.1 Main ИИ-агенты пишут код, который оценивается не только по корректности, но и по тому, насколько изменения готовы к слиянию в основную кодовую базу. В частности, учитываются качество тестов, соблюдение границ задачи, стиль кода и соответствие принятым в проекте стандартам.

В DeepSWE v1.1 — бенчмарке, который проверяет модели на сложных задачах по разработке ПО в реальных кодовых базах. GPT-6 Sol на максимальном уровне усилий набирает 68,8%. Это всего на 1,1 процентного пункта ниже лучшего результата Claude Fable 5 в этом тесте 69,9% на уровне xhigh, при этом стоимость выполнения одной задачи примерно на 80% ниже.

GPT-6 Luna на максимальном уровне усилий набирает 66,6%, что сопоставимо с результатами Claude Opus 5 и Fable 5 на среднем уровне усилий. При таком сравнении стоимость одной задачи у Luna оказывается на 93% ниже, чем у Opus 5, и на 96% ниже, чем у Fable 5.

В DeepSWE 1.1 ИИ-агенты решают оригинальные долгосрочные задачи по разработке программного обеспечения.

В DeepSWE 1.1 ИИ-агенты решают оригинальные долгосрочные задачи по разработке программного обеспечения.

Работа с компьютером

Хотя GPT-6 Astra по-прежнему остаётся лучшей в мире моделью для работы с компьютером, GPT-6 Sol и Luna предлагают более выгодное соотношение стоимости и производительности по сравнению со своими предшественниками.

В OSWorld 2.0 offline GPT-6 Sol на уровне усилий xhigh показывает результат, сопоставимый с Claude Opus 5 на medium: 60,5% против 60,3%. При этом стоимость выполнения одной задачи примерно на 80% ниже.

GPT-6 Luna на максимальном уровне усилий превосходит GPT-5.6 Sol на medium, обходясь при этом примерно в десять раз дешевле.

В OSWorld 2.0 ИИ-агенты выполняют длительные сценарии взаимодействия с компьютером, охватывающие как повседневные, так и профессиональные задачи. Здесь приведён показатель partial reward для офлайн-набора из релиза v2026.08.08.

В OSWorld 2.0 ИИ-агенты выполняют длительные сценарии взаимодействия с компьютером, охватывающие как повседневные, так и профессиональные задачи. Здесь приведён показатель partial reward для офлайн-набора из релиза v2026.08.08.

Стиль взаимодействия

Мы также перенесли улучшенный стиль общения GPT-6 Astra в Sol и Luna. Особенно заметно это должно быть в технических обсуждениях и диалогах о программировании.

Ответы стали яснее, с меньшим количеством жаргона и неестественных формулировок, без лишних деталей с низкой практической ценностью и в целом немного короче, при этом без потери содержательности.

Промпт:

Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..

GPT-5.6-Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now. Done — open the live site. It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth. The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6-Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup. The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Хотя оценка стиля во многом субъективна, в этом примере мы предпочитаем ответ GPT-6 Sol. Модель не спешит с выводами, меньше повторяет детали, которые и так могут быть очевидны пользователю, например, что сайт состоит из четырёх страниц. Реже использует расплывчатые формулировки вроде «ощущение bento» или «перестроить всё вокруг этой системы». Кроме того, она яснее говорит о том, что именно проверила, а что нет, и не перегружает ответ ненужными техническими подробностями реализации, например, промптом, который использовался для инструмента генерации изображений.

Улучшенное кэширование для агентов и длинных диалогов

Помимо снижения стоимости токенов, мы помогаем разработчикам, использующим GPT-6, дополнительно экономить на контексте, который их приложения используют повторно. Мы улучшили prompt caching в GPT-6, чтобы по умолчанию повысить долю попаданий в кэш. Благодаря этому агенты могут повторно использовать больше контекста, быстрее отвечать и получать скидку до 90% на чтение закэшированных входных токенов.

У разработчиков также появилось больше инструментов для измерения и оптимизации эффективности кэширования:

  • Мониторинг и диагностика. Prompt Caching Dashboard показывает, какая доля входных данных попадает в кэш и как этот показатель меняется со временем. Инструмент диагностики помогает понять, почему в отдельных случаях кэш не используется и что можно исправить.

  • Изменение уровня reasoning и доступности инструментов без сброса кэша. Для сложных задач можно повышать reasoning effort, а для простых уточнений снижать его. Также можно включать и отключать инструменты по мере изменения потребностей агента. Теперь в обоих случаях ранее накопленный контекст сохраняется и может повторно использоваться из кэша.

  • Оптимизация кэшируемых префиксов. Явные точки разрыва позволяют разработчикам задавать, где заканчивается кэшируемый префикс промпта. Это даёт больше контроля над повторным использованием кэша и может повысить производительность.

По данным GitHub, за последние несколько месяцев эти улучшения позволили более чем на 50% сократить долю токенов промптов, которые приходилось обрабатывать заново, на миллиардах запросов к моделям OpenAI. В результате Copilot стал отвечать быстрее.

Продолжаем улучшать alignment

GPT-6 Sol и Luna развивают подходы к alignment, впервые представленные в Astra — нашей самой согласованной с заданными принципами модели на сегодняшний день. В наших тестах обе модели показывают улучшения по сравнению со своими аналогами из GPT-5.6, в том числе реже делают вводящие в заблуждение заявления о выполненной ими работе с кодом.

Приведённые ниже тесты намеренно моделируют сложные ситуации и не отражают частоту ошибок при обычном использовании. Полные результаты доступны в system card.

Coding deception (чем ниже, тем лучше)
Во внутреннем тесте на обман при работе с кодом ИИ-агентам дают задачи, специально подобранные так, чтобы провоцировать недобросовестное поведение. В обычных сценариях использования такие случаи встречаются значительно реже. Показатель deception rate отражает долю ответов, в которых был обнаружен хотя бы один признак обмана. Уровень усилий был установлен на максимальный.

Во внутреннем тесте на обман при работе с кодом ИИ-агентам дают задачи, специально подобранные так, чтобы провоцировать недобросовестное поведение. В обычных сценариях использования такие случаи встречаются значительно реже. Показатель deception rate отражает долю ответов, в которых был обнаружен хотя бы один признак обмана. Уровень усилий был установлен на максимальный.

Failure to disclose a broken search tool (чем ниже, тем лучше)
В этом внутреннем тесте ИИ-агентам дают поисковые задачи и намеренно неработающий инструмент поиска, после чего оценивают, сообщают ли они о проблеме с инструментом вместо того, чтобы выдавать наиболее вероятный ответ наугад. Задачи специально подобраны так, чтобы провоцировать ошибки, поэтому результаты не отражают типичные сценарии использования. Уровень усилий был установлен на максимальный.

В этом внутреннем тесте ИИ-агентам дают поисковые задачи и намеренно неработающий инструмент поиска, после чего оценивают, сообщают ли они о проблеме с инструментом вместо того, чтобы выдавать наиболее вероятный ответ наугад. Задачи специально подобраны так, чтобы провоцировать ошибки, поэтому результаты не отражают типичные сценарии использования. Уровень усилий был установлен на максимальный.

Reviewer bypass attempts (чем ниже, тем лучше)
В Codex автоматическая система проверки безопасности может заблокировать команду, которую сочтёт небезопасной, и указать модели не повторять это действие и не пытаться выполнить что-то аналогичное. Мы проверили, соблюдают ли модели это решение или пытаются его обойти. Для GPT-6 Sol не было зафиксировано ни одной попытки обхода. GPT-6 Luna пыталась сделать это в 0,3% запусков против 4,3% у GPT-5.6 Luna. При этом ни одной успешной попытки обхода обнаружено не было.

В Codex автоматическая система проверки безопасности может заблокировать команду, которую сочтёт небезопасной, и указать модели не повторять это действие и не пытаться выполнить что-то аналогичное. Мы проверили, соблюдают ли модели это решение или пытаются его обойти. Для GPT-6 Sol не было зафиксировано ни одной попытки обхода. GPT-6 Luna пыталась сделать это в 0,3% запусков против 4,3% у GPT-5.6 Luna. При этом ни одной успешной попытки обхода обнаружено не было.

Warning circumvention (чем меньше, тем лучше)
Мы также работаем над тем, чтобы модели лучше соблюдали явные предупреждения — например, сообщения access denied. В этих тестах GPT-6 Luna пыталась обойти ограничения примерно в 42% запусков против 77% у её предшественника. У GPT-6 Sol этот показатель составил 64% по сравнению с 68% у предыдущей версии. Тесты в основном охватывают сценарии с низким уровнем риска и проводятся без полного набора системных защитных механизмов, которые используются в наших продуктах.

Мы также работаем над тем, чтобы модели лучше соблюдали явные предупреждения — например, сообщения access denied. В этих тестах GPT-6 Luna пыталась обойти ограничения примерно в 42% запусков против 77% у её предшественника. У GPT-6 Sol этот показатель составил 64% по сравнению с 68% у предыдущей версии. Тесты в основном охватывают сценарии с низким уровнем риска и проводятся без полного набора системных защитных механизмов, которые используются в наших продуктах.

Unauthorized agent interaction (чем меньше, тем лучше)
Мы проверили, следуют ли модели несанкционированным инструкциям на имитируемой доске сообщений, например, требованиям раскрыть приватную информацию. Среди запусков, в которых модели находили эту доску, GPT-6 Sol выполняла указанное несанкционированное действие в 11% случаев против 52% у GPT-5.6 Sol. Для GPT-6 Luna и Astra таких действий зафиксировано не было, хотя Luna находила доску реже. Эти результаты получены в намеренно провокационных условиях и не отражают типичные сценарии использования.

Мы проверили, следуют ли модели несанкционированным инструкциям на имитируемой доске сообщений, например, требованиям раскрыть приватную информацию. Среди запусков, в которых модели находили эту доску, GPT-6 Sol выполняла указанное несанкционированное действие в 11% случаев против 52% у GPT-5.6 Sol. Для GPT-6 Luna и Astra таких действий зафиксировано не было, хотя Luna находила доску реже. Эти результаты получены в намеренно провокационных условиях и не отражают типичные сценарии использования.

Доступность

GPT-6 Sol и GPT-6 Luna с сегодняшнего дня доступны в ChatGPT Work и Codex для всех пользователей Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут использовать GPT-6 Luna в десктопном приложении. В обычном Chat эти модели пока недоступны.

В OpenAI API модели доступны под идентификаторами gpt-6-sol и gpt-6-luna.

Чтобы сохранить стабильность сервиса для всех пользователей, мы будем постепенно разворачивать новые модели в ChatGPT в течение дня. Если GPT-6 Sol или Luna пока не появились у вас в ChatGPT Work или Codex, попробуйте проверить доступность позже.

Тестирование моделей GPT проводилось в нашей исследовательской среде или через API. Из-за различий в системных промптах, доступных инструментах и других настройках результаты могут немного отличаться от поведения моделей в продакшен-версии ChatGPT.

Результаты моделей конкурентов взяты из публично доступных отчётов. Там, где результаты Claude Fable 5.1 отсутствовали, использовались показатели Claude Fable 5.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.