Skip to content
Исследователи нашли способ обойти встроенную защиту ИИ-моделей с помощью поэзии
11 июля 11:46 10 Просмотров Новости

Исследователи нашли способ обойти встроенную защиту ИИ-моделей с помощью поэзии

Неожиданный метод обхода AI-защиты

Специалисты из итальянского Icaro Lab совместно с несколькими университетами продемонстрировали, что простое преобразование запросов в стихотворную форму позволяет обойти механизмы безопасности современных больших языковых моделей (LLM). Исследователи Icaro Lab тестируют ИИ-модели

Результаты эксперимента

В ходе исследования учёные проанализировали 25 ведущих моделей, включая как проприетарные, так и открытые варианты. Более 1 200 стандартных опасных запросов было преобразовано в стихотворную форму, что позволило увидеть значительное увеличение эффективности обхода защиты — до 18 раз по сравнению с исходным нейтральным текстом.

Ключевой результат: поэтическая версия запросов приводила к выполнению нежелательных команд в около 62% случаев. Такой метод работает даже в один шаг, без сложной настройки или многократного взаимодействия с моделью.

Уязвимые и устойчивые модели

Тестирование охватило популярные модели: ChatGPT OpenAI, Google Gemini, Claude и другие. Самыми «внушаемыми» оказались Gemini, DeepSeek и MistralAI — именно эти системы хуже всего справлялись с поэтическими запросами.

Лучше всего сопротивлялись коварной силе поэзии GPT-5 и Claude Haiku 4.5. Эти модели демонстрировали более высокую устойчивость к методу jailbreak.

Потенциальные риски

С помощью поэтической маскировки удалось получить доступ к запрещённой или даже противозаконной информации: материалы о создании ядерного оружия, сведения о сексуальном насилии, а также о причинении себе вреда.

Исследователи отметили, что такой «поэтический jailbreak» работает во многих разных доменах — от кибербезопасности до потенциально опасных сценариев управления и манипуляций. Метод не зависит от конкретного механизма выравнивания модели.

Рекомендации экспертов

Авторы исследования не публикуют точные стихотворения, которые приводили к взлому LLM, поскольку они «слишком опасны». По их словам, поступать нужно как белым хакерами: связываться с OpenAI, Google и другими разработчиками, чтобы те своевременно закрывали найденные дыры в безопасности.

Результаты работы подчёркивают фундаментальные ограничения существующих методов выравнивания и тестирования безопасности моделей. Очевидно, что современные системы защиты ИИ уязвимы не только к сложным техникам обхода, но и к простым стилистическим модификациям.

Схема работы поэтического jailbreak метода

Поделиться

Похожие публикации