Skip to content
Рассуждающие ИИ-модели достигли беспрецедентных результатов, но AGI всё ещё недостижим
28 июля 12:57 1 Просмотров Новости

Рассуждающие ИИ-модели достигли беспрецедентных результатов, но AGI всё ещё недостижим

Новые возможности больших рассуждающих моделей

Современные передовые ИИ-модели верифицируют факты, рассуждают последовательно и проверяют свои ответы перед выдачей оператору. Осенью 2024 года OpenAI представила большую языковую модель под названием o1, которая сразу же стала сенсацией, продемонстрировав удивительные результаты на сложных тестах логического мышления. Интерфейс модели OpenAI o1

Результаты на интеллектуальных тестах

Флагманская модель GPT-4o справилась лишь с 12% задач престижного математического экзамена AIME, который предоставляет право участвовать в Международной математической олимпиаде. Модель o1 в режиме «одна попытка на задачу» набрала на этом тесте 74%, после активации консенсусного выбора корректного ответа из нескольких генераций — 83%, а с использованием функции переранжирования — до 93%.

На тесте GPQA Diamond, оценивающем научное мышление на уровне кандидата наук в областях биологии, физики и химии, модель o1 получила 78% при использовании консенсусного сопоставления множества вариантов решений — это превышает показатели среднего «мокрого» эксперта, который набирает чуть менее 70%.

Психология рассуждений машин

Поясню, что в популяризированной парадигме Даниэля Канемана человеческий мозг оперирует сразу на двух уровнях. «Система 1» обеспечивает быстрое мышление и автоматическое формирование реакций без приложения сознательных усилий. Энергоёмкая «система 2» реализует медленное мышление, сознательный контроль, глубокий анализ и концентрацию внимания.

Современные большие рассуждающие модели (Large Reasoning Models, LRM) чрезвычайно убедительно имитируют работу «системы 2», выстраивая логические цепочки и фильтруя галлюцинации до генерации текста для пользователя.

Рынок современных рассуждающих моделей

Почти два года существует ряд больших рассуждающих моделей: o1 и её прямая наследница o3 от OpenAI, модели Anthropic — Claude Fable 5/Mythos 5 и Opus 4.8, а также Google Gemini 3.1 Pro, DeepSeek R1, GLM-5.2. Их способности делают их отличными собеседниками для мозгового штурма или анализа сложных тем.

Однако, несмотря на возросшую точность и аналитические способности, современный искусственный интеллект всё ещё не достиг уровня AGI (Artificial General Intelligence) — полноценного сильного ИИ, способного мыслить как человек во всех аспектах. Работы над общим искусственным интеллектом продолжаются, но сверхумопомрачительных результатов до сих пор не достигнуты, за исключением успеха Mythos в поиске уязвимостей в программном коде.

График сравнения производительности ИИ-моделей на тестах AIME и GPQA Diamond

Практическое применение и перспективы

Способность моделей к дедукции и аргументации открывает новые возможности для бизнеса и науки. ИИ может стать надёжным помощником при решении сложных технических проблем, написании эссе или оценке перспектив технологий. Тем не менее пользователи должны помнить, что ИИ может ошибаться и важно проверять его ответы.

Вопрос остаётся открытым: стоит ли развивать рассуждающие модели, если главной целью отрасли считается получение именно AGI? Такой путь может оказаться тупиковым или стать важным промежуточным этапом на пути к созданию истинного искусственного интеллекта.

Сравнение концепций систем мышления Канемана и ИИ-моделей

Поделиться

Похожие публикации