Skip to content
Исследователи Беркли: современные ИИ‑модели провалили экзамен по реальной работе
30 июля 11:42 9 Просмотров Новости

Исследователи Беркли: современные ИИ‑модели провалили экзамен по реальной работе

Исследователи Калифорнийского университета в Беркли провели масштабное тестирование ведущих языковых моделей и пришли к неутешительным выводам: несмотря на инвестиции индустрии ИИ, превысившие $1,6 трлн, ни одна из проверенных систем не справилась со сложными профессиональными задачами. Лучший результат — 24% успешных решений — показала GPT-5.5 от OpenAI, а на самом сложном уровне все модели без исключения получили 0%.

тест Agents' Last Exam интерфейс

Бенчмарк Agents' Last Exam: 1500 задач из 55 профессий

Для проверки ученые из Center for Responsible, Decentralized Intelligence создали собственный тест Agents' Last Exam (ALE). В него вошло более 1500 реалистичных заданий, подготовленных экспертами, распределенных по 55 профессиям. Список охватывает сферы, где ИИ уже применяется активно — разработку программного обеспечения, графический дизайн, — и области, где его потенциал изучен слабо: сельское хозяйство, морская инженерия, звукорежиссура, общественное здравоохранение и другие.

Над созданием теста работали более 300 специалистов. Среди них преподаватели и исследователи Массачусетского технологического института, Гарвардского и Стэнфордского университетов, а также сотрудники Goldman Sachs, JPMorgan, Morgan Stanley и Adobe. Каждый участник предоставил реальную рабочую задачу, требовавшую несколько дней или недель, вместе с исходными файлами и программами, в которых выполнялась работа.

график результатов GPT-5.5 Fable 5 Composer 2.5 Gemini 3.1 Pro

Четыре коммерческие модели и два открытых решения

В тестировании участвовали GPT-5.5 (OpenAI), Fable 5 (Anthropic), Composer 2.5 (Cursor) и Gemini 3.1 Pro (Google), а также две открытые китайские модели. Результаты оказались слабыми: GPT-5.5 успешно выполнила 24% заданий, остальные модели показали еще более низкие показатели. На самом сложном уровне, где требовались глубокие знания предмета, длительное рассуждение и работа с большим объемом информации, ни одна система не смогла решить ни одной задачи.

Особое внимание исследователи уделили экономической эффективности. Fable 5 продемонстрировала результат, сопоставимый с GPT-5.5 и Composer 2.5, но стоимость выполнения одной задачи у неё оказалась в 4–12 раз выше. По словам авторов работы, это делает такие модели непрактичными для массового внедрения даже при достижении приемлемого качества.

сравнение стоимости задач Fable 5 и GPT-5.5

Алгоритмическая оценка вместо человеческой

Ключевое отличие ALE от популярных бенчмарков — метод оценки. Результаты проверяли не люди и не другие нейросети, а специальные детерминированные алгоритмы, которые всегда выдают одинаковый вердикт. Благодаря этому тест оказался намного строже существующих рейтингов, где модели давно показывают близкие к максимальным оценки.

Разница проявилась наглядно: та же GPT-5.5 набирает 82% в бенчмарке Terminal-Bench, однако в самом сложном разделе Agents' Last Exam не выполнила ни одного задания. Авторы исследования считают, что высокие места в публичных рейтингах плохо отражают готовность ИИ справляться с настоящими долгими и сложными профессиональными проектами. Индустрия годами оптимизировала показатели в тестах, где результат легко измерить, но такие достижения не гарантируют работоспособность в реальных условиях.

сравнение бенчмарков Terminal-Bench и Agents' Last Exam

Автоматизация сначала придет за рутиной

Соавтор исследования Дон Сон подчеркивает: нейросети уже умеют закрывать значительную часть профессиональных задач, но проблемы начинаются там, где нужно долго удерживать контекст, опираться на узкие знания и последовательно доводить проект до конца. По его прогнозу, автоматизация в первую очередь затронет профессии с четкими и повторяющимися процедурами. Там же, где приходится принимать сложные решения и постоянно учитывать меняющиеся обстоятельства, люди еще долго сохранят преимущество.

Ученые предупреждают, что текущие ИИ‑системы могут претендовать на базовые «должности» и справляются с рутинными, чётко определёнными процессами. Однако для задач, требующих длительного логического мышления, глубокой экспертизы и надёжного выполнения в долгосрочной перспективе, они всё ещё далеки от человеческого уровня.

Поделиться

Похожие публикации