Исследователи нашли способ обойти встроенную защиту ИИ-моделей с помощью поэзии
Неожиданный метод обхода AI-защиты
Специалисты из итальянского Icaro Lab совместно с несколькими университетами продемонстрировали, что простое преобразование запросов в стихотворную форму позволяет обойти механизмы безопасности современных больших языковых моделей (LLM). 
Результаты эксперимента
В ходе исследования учёные проанализировали 25 ведущих моделей, включая как проприетарные, так и открытые варианты. Более 1 200 стандартных опасных запросов было преобразовано в стихотворную форму, что позволило увидеть значительное увеличение эффективности обхода защиты — до 18 раз по сравнению с исходным нейтральным текстом.
Ключевой результат: поэтическая версия запросов приводила к выполнению нежелательных команд в около 62% случаев. Такой метод работает даже в один шаг, без сложной настройки или многократного взаимодействия с моделью.
Уязвимые и устойчивые модели
Тестирование охватило популярные модели: ChatGPT OpenAI, Google Gemini, Claude и другие. Самыми «внушаемыми» оказались Gemini, DeepSeek и MistralAI — именно эти системы хуже всего справлялись с поэтическими запросами.
Лучше всего сопротивлялись коварной силе поэзии GPT-5 и Claude Haiku 4.5. Эти модели демонстрировали более высокую устойчивость к методу jailbreak.
Потенциальные риски
С помощью поэтической маскировки удалось получить доступ к запрещённой или даже противозаконной информации: материалы о создании ядерного оружия, сведения о сексуальном насилии, а также о причинении себе вреда.
Исследователи отметили, что такой «поэтический jailbreak» работает во многих разных доменах — от кибербезопасности до потенциально опасных сценариев управления и манипуляций. Метод не зависит от конкретного механизма выравнивания модели.
Рекомендации экспертов
Авторы исследования не публикуют точные стихотворения, которые приводили к взлому LLM, поскольку они «слишком опасны». По их словам, поступать нужно как белым хакерами: связываться с OpenAI, Google и другими разработчиками, чтобы те своевременно закрывали найденные дыры в безопасности.
Результаты работы подчёркивают фундаментальные ограничения существующих методов выравнивания и тестирования безопасности моделей. Очевидно, что современные системы защиты ИИ уязвимы не только к сложным техникам обхода, но и к простым стилистическим модификациям.