OpenAI представила GPT-5.6 Sol, Terra и Luna — новые флагманские модели, превосходящие Claude Mythos
Флагманские модели нового поколения
OpenAI объявила о выпуске GPT-5.6 — preview-релиза линейки новейших флагманских ИИ-моделей, производительность которых настолько велика, что США пришлось наложить на них ограничения свободного использования. В линейку вошли три нейросети: флагманская Sol, сбалансированная Terra и быстрая бюджетная Luna. Компания называет GPT-5.6 Sol своей самой мощной ИИ-моделью в мире, которая обходит предыдущего лидера Claude Mythos 5 от Anthropic.
Результаты тестирования и производительность
Новые модели построены по-новому: цифра обозначает поколение нейросетей, а названия Sol, Terra и Luna — постоянные уровни, которые развиваются каждый в своем темпе. На кодинг-тесте Terminal-Bench 2.1 Sol устанавливает новый SOTA-рекорд: обычная Sol набирает 88,8%, а в режиме ultra — 91,9%. Для сравнения: Claude Mythos 5 — 88,0%, GPT-5.5 — 83,4%, Claude Opus 4.8 — 78,9%, Gemini 3.1 Pro Preview — 70,7%.
В тесте GeneBench v1 на геномные исследования Sol обходит GPT-5.5, тратя при этом намного меньше токенов. В тесте ExploitBench на задачи кибербезопасности Sol сопоставима с Mythos Preview, расходуя примерно втрое меньше токенов. Модель способна без человека почти полностью писать приложения, искать уязвимости, проводить многочасовые исследования и выполнять длинные цепочки задач.
Новые режимы и возможности
Чтобы раскрыть весь потенциал передовых нейросетей GPT-5.6, OpenAI добавили два новых режима работы: Max дает модели максимум времени на размышление, а Ultra подключает субагентов для сложных задач. В этих режимах ИИ подключает сразу несколько агентов и разносит сложную задачу по этапам.
При разработке также уделялось внимание безопасности. Нейросеть не позволит использовать свои возможности для вредоносных задач. В компании выстроили механизм защиты модели GPT-5.6 Sol в несколько рубежей: добавили классификаторы, следящие за генерацией в реальном времени, проверку аккаунтов на подозрительные паттерны и наказали нейронке отказывать в ответе при запрещенных кибер-запросах. Однако на холоде модель получила высокий уровень риска — в тестах на Chromium и Firefox она находила баги и заготовки для эксплойтов, но не смогла собрать рабочую цепочку атаки целиком.
Ограниченный запуск и цены
На старте доступ к Sol открыт лишь ограниченному кругу компаний исключительно через API и Codex, причем все партнеры согласованы с властями США. Это первый случай, когда американское правительство превентивно вмешалось в запуск ИИ-модели еще до ее полноценного выхода. Широкий запуск нейронок в ChatGPT и API обещают в ближайшие недели, если США не забракуют их релиз из-за киберугроз.
По словам OpenAI, согласование релизов с государством не должно становиться нормой, потому что отрезает от лучших инструментов разработчиков, бизнес и защитников. К августу власти должны выстроить закрытую процедуру оценки кибер-способностей моделей и определить, какие из них считаются рискованными и подпадают под особый контроль.
OpenAI уже раскрыла ценники: у Sol — $5 на входе и $30 на выходе, у Terra — $2,50 и $15, у Luna — $1 и $6. При этом Sol стоит примерно вдвое дешевле, чем Claude Fable 5 от Anthropic ($10/$50).
Контекст регулирования
Американская технологическая компания в области искусственного интеллекта OpenAI представила сразу три новые модели Chat GPT-5.6. По ряду показателей они превосходят модели Claude Mythos 5 и Fable 5, сообщает пресс-служба компании. Компания откладывала официальный релиз новой модели с июня. Белый дом потребовал от OpenAI сначала предоставить доступ организациям, которые одобрило правительство.
В начале июня Дональд Трамп подписал указ, призывающий разработчиков мощных ИИ-моделей в добровольном порядке передавать свои новинки на проверку госструктурам США за 30 дней до их вывода на рынок. Аналогичные требования в том же месяце получила и компания Anthropic (разработчик Claude). 13 июня правительство Соединенных Штатов ограничили работу Fable 5 и Mythos 5 для всех иностранцев, сочли их слишком опасными из-за рисков в области биобезопасности и кибербезопасности.