Skip to content
OpenAI представила GPT-5.6 Sol, Terra и Luna — новые флагманские модели, превосходящие Claude Mythos
10 июля 15:26 13 Просмотров Новости

OpenAI представила GPT-5.6 Sol, Terra и Luna — новые флагманские модели, превосходящие Claude Mythos

Флагманские модели нового поколения

OpenAI объявила о выпуске GPT-5.6 — preview-релиза линейки новейших флагманских ИИ-моделей, производительность которых настолько велика, что США пришлось наложить на них ограничения свободного использования. В линейку вошли три нейросети: флагманская Sol, сбалансированная Terra и быстрая бюджетная Luna. Компания называет GPT-5.6 Sol своей самой мощной ИИ-моделью в мире, которая обходит предыдущего лидера Claude Mythos 5 от Anthropic.

Интерфейс нейросети GPT-5.6 Sol

Результаты тестирования и производительность

Новые модели построены по-новому: цифра обозначает поколение нейросетей, а названия Sol, Terra и Luna — постоянные уровни, которые развиваются каждый в своем темпе. На кодинг-тесте Terminal-Bench 2.1 Sol устанавливает новый SOTA-рекорд: обычная Sol набирает 88,8%, а в режиме ultra — 91,9%. Для сравнения: Claude Mythos 5 — 88,0%, GPT-5.5 — 83,4%, Claude Opus 4.8 — 78,9%, Gemini 3.1 Pro Preview — 70,7%.

В тесте GeneBench v1 на геномные исследования Sol обходит GPT-5.5, тратя при этом намного меньше токенов. В тесте ExploitBench на задачи кибербезопасности Sol сопоставима с Mythos Preview, расходуя примерно втрое меньше токенов. Модель способна без человека почти полностью писать приложения, искать уязвимости, проводить многочасовые исследования и выполнять длинные цепочки задач.

График результатов тестирования в Terminal-Bench 2.1

Новые режимы и возможности

Чтобы раскрыть весь потенциал передовых нейросетей GPT-5.6, OpenAI добавили два новых режима работы: Max дает модели максимум времени на размышление, а Ultra подключает субагентов для сложных задач. В этих режимах ИИ подключает сразу несколько агентов и разносит сложную задачу по этапам.

При разработке также уделялось внимание безопасности. Нейросеть не позволит использовать свои возможности для вредоносных задач. В компании выстроили механизм защиты модели GPT-5.6 Sol в несколько рубежей: добавили классификаторы, следящие за генерацией в реальном времени, проверку аккаунтов на подозрительные паттерны и наказали нейронке отказывать в ответе при запрещенных кибер-запросах. Однако на холоде модель получила высокий уровень риска — в тестах на Chromium и Firefox она находила баги и заготовки для эксплойтов, но не смогла собрать рабочую цепочку атаки целиком.

Ограниченный запуск и цены

На старте доступ к Sol открыт лишь ограниченному кругу компаний исключительно через API и Codex, причем все партнеры согласованы с властями США. Это первый случай, когда американское правительство превентивно вмешалось в запуск ИИ-модели еще до ее полноценного выхода. Широкий запуск нейронок в ChatGPT и API обещают в ближайшие недели, если США не забракуют их релиз из-за киберугроз.

По словам OpenAI, согласование релизов с государством не должно становиться нормой, потому что отрезает от лучших инструментов разработчиков, бизнес и защитников. К августу власти должны выстроить закрытую процедуру оценки кибер-способностей моделей и определить, какие из них считаются рискованными и подпадают под особый контроль.

OpenAI уже раскрыла ценники: у Sol — $5 на входе и $30 на выходе, у Terra — $2,50 и $15, у Luna — $1 и $6. При этом Sol стоит примерно вдвое дешевле, чем Claude Fable 5 от Anthropic ($10/$50).

Сравнение ценовых категорий моделей GPT-5.6

Контекст регулирования

Американская технологическая компания в области искусственного интеллекта OpenAI представила сразу три новые модели Chat GPT-5.6. По ряду показателей они превосходят модели Claude Mythos 5 и Fable 5, сообщает пресс-служба компании. Компания откладывала официальный релиз новой модели с июня. Белый дом потребовал от OpenAI сначала предоставить доступ организациям, которые одобрило правительство.

В начале июня Дональд Трамп подписал указ, призывающий разработчиков мощных ИИ-моделей в добровольном порядке передавать свои новинки на проверку госструктурам США за 30 дней до их вывода на рынок. Аналогичные требования в том же месяце получила и компания Anthropic (разработчик Claude). 13 июня правительство Соединенных Штатов ограничили работу Fable 5 и Mythos 5 для всех иностранцев, сочли их слишком опасными из-за рисков в области биобезопасности и кибербезопасности.

Логотипы конкурирующих компаний OpenAI и Anthropic

Поделиться

Похожие публикации