Nvidia показала, как программная оболочка повысила эффективность Claude Opus 5 в три раза на тесте ARC-AGI-3
Исследователи Nvidia продемонстрировали смену парадигмы в развитии ИИ-агентов: ключевую роль в автономности и надежности начинает играть не размер базовой модели, а программная среда её выполнения. В эксперименте корпорации языковая модель Claude Opus 5 компании Anthropic, оснащенная внешней системой управления памятью и модулем-супервизором, решила 100% задач сложного бенчмарка ARC-AGI-3, тогда как «сырая» модель справлялась лишь с 30%.
Суть эксперимента: от 30% к 100% на ARC-AGI-3
В качестве базового интеллекта инженеры Nvidia использовали передовую модель Claude Opus 5. Тестирование проводилось на публичном бенчмарке ARC-AGI-3 — наборе абстрактных логических 2D-задач и игр без жестких инструкций, где ИИ должен самостоятельно понять правила и научиться побеждать. Без дополнительной программной надстройки модель показала результат всего 30% правильных решений.
Ситуация кардинально изменилась после добавления внешней программной оболочки (wrapper). В её состав вошли два ключевых компонента: система управления долгосрочной памятью и компонент «супервизора» — координатора, который следит за ходом рассуждений, корректирует шаги и подключает необходимые инструменты. Благодаря этой архитектуре результативность модели выросла более чем в три раза, достигнув 100%: модель безошибочно справилась со всеми 183 логическими головоломками теста.
Главные выводы: софт важнее «весов» модели
Исследование Nvidia наглядно подтвердило, что автономность, надежность и глубина решения долгосрочных задач ИИ-агентами на 70–80% зависят от того, как организована среда вокруг модели, а не только от самой нейросети. Грамотное распределение памяти, логики исполнения и подключение специализированных навыков позволяют даже относительно компактным или комбинированным моделям обходить дорогостоящие «сырые» флагманы по качеству решения сложных задач.
Этот подход переводит фокус индустрии с бесконечной гонки за количеством параметров базовых моделей на разработку надежных сред выполнения (runtime), управляющих структур и инструментов оркестрации. Именно программная «обвязка» становится определяющим фактором применимости ИИ в реальных сценариях, требующих планирования, самокоррекции и работы с контекстом на длительных горизонтах.
Экосистема Nvidia: OpenShell и Agent Toolkit
Результаты эксперимента логично вписываются в стратегию Nvidia по построению инфраструктуры для ИИ-агентов. Корпорация активно развивает такие инструменты, как NVIDIA OpenShell — защищенную среду выполнения (sandbox) с политиками безопасности и контролем на уровне ядра. OpenShell позволяет ИИ-агентам вроде Claude Code безопасно эволюционировать, ставить задачи и использовать внешние навыки в изолированной обстановке.
Дополняет экосистему NVIDIA Agent Toolkit — набор инструментов для подключения специализированных навыков и управления памятью агентов. Комбинация этих технологий создает фундамент для построения надежных автономных систем, где базовая языковая модель выступает лишь как движитель рассуждений, а за планирование, безопасность и исполнение отвечает программная оболочка.
Реакция сообщества и перспективы
Новость о результатах исследования широко отреагировала в профильных изданиях. Подробные обзоры эксперимента Nvidia опубликовали 3DNews и ixbt.com 22 августа 2026 года. Эксперты отмечают, что продемонстрированный подход может стать стандартом де-факто для внедрения ИИ-агентов в продакшн-среде, где критичны предсказуемость, безопасность и способность к самообучению в процессе работы.
Смещение акцента на программную инженерию вокруг моделей открывает путь к более экономичным и контролируемым решениям. Вместо обучения всё более гигантских моделей компаниям становится выгоднее инвестировать в качественные рантаймы, системы памяти и супервизоры, которые раскрывают потенциал уже существующих базовых моделей.