Alibaba Cloud представила систему DualLane для снижения затрат на ИИ в техподдержке
Подразделение Alibaba Cloud разработало систему DualLane, которая анализирует запросы клиентов в службу технической поддержки и в ряде случаев позволяет не подключать большие языковые модели (LLM) при решении типовых проблем. Как сообщает 3DNews со ссылкой на The Register, новый подход позволяет компании действовать быстрее, точнее и с существенно меньшими затратами на вычислительные ресурсы. 
Проблема: ошибки автономных ИИ-агентов
Ранее Alibaba пыталась массово подключить ИИ-агентов к обработке заявок в техподдержку. Живые операторы работают медленно и их труд обходится дорого, однако полная автоматизация выявила системные недостатки. В компании выделяют три основных типа ошибок, допускаемых ИИ-агентами:
- ИИ-агент не подключает нужные инструменты для решения задачи;
- При подключении инструментов не использует всех необходимых параметров задачи, а после выполнения одного из шагов не извлекает требуемые параметры из результатов для передачи на следующий этап;
- При формировании итогового ответа ИИ-агент неверно интерпретирует результаты или пропускает ключевую информацию.
Кроме того, прогон каждого запроса через тяжелую LLM требовал колоссального количества токенов — до 3000 на одну заявку, что делало процесс экономически неэффективным. 
Архитектура DualLane: «быстрый» и «медленный» пути
Система DualLane обрабатывает каждый входящий запрос параллельно по двум сценариям. «Быстрый путь» использует легкий классификатор, который проверяет, относится ли проблема к известным высокочастотным рутинным сценариям. Если совпадение найдено, система мгновенно подбирает готовое превалидированное решение по шаблону, при этом «медленный путь» принудительно отключается. Затраты на токены при этом минимальны — всего несколько единиц.
«Медленный путь» задействует полноценного LLM-агента с потреблением тысяч токенов, но только для действительно сложных или нестандартных задач («длинный хвост» распределения). Когда по «медленному» сценарию выявляется группа схожих проблем, они объединяются в «кластер» и формируется предложение перенести этот класс в «быстрый» способ — окончательное решение о переносе принимает человек.
Результаты тестирования и внедрение
По данным Alibaba Cloud, DualLane превзошла по качеству другие средства координации ИИ-моделей, такие как LLMCompiler и React. Точность маршрутизации и решения тикетов составила 96,5% при минимальной задержке. Благодаря этому компания уже включила систему в промышленную эксплуатацию.
Такой подход позволил снизить затраты на тяжелые вычисления, повысить скорость ответа клиентам и ограничить использование ресурсоемких нейросетей только теми случаями, где они действительно необходимы. ИИ здесь применяется на этапе быстрой фильтрации, чтобы тяжелые модели включались исключительно по реальной потребности. 