Сбер представил экспериментальную диффузионную языковую модель GFusion в открытый доступ
Новое направление в генеративном искусственном интеллекте
Сбер выложил в открытый доступ экспериментальную диффузионную языковую модель GFusion, созданную на базе GigaChat. Это первый в России опенсорс-проект такого масштаба в области диффузионных языковых моделей. Разработка ориентирована на исследователей и разработчиков, работающих с генеративным искусственным интеллектом, и стала важным шагом в одном из самых динамичных направлений современного ИИ.

Измененный подход к генерации текста
В отличие от классических больших языковых моделей (LLM), которые генерируют текст последовательно — слово за слово через авторегрессию, — GFusion использует диффузионный подход. Модель сначала формирует черновой вариант ответа, а затем постепенно уточняет его, аналогично тому, как современные нейросети создают изображения и видео. Этот метод позволяет избежать необходимости переписывать весь ответ заново при обнаружении ошибок.
Благодаря параллельной генерации текст создается значительно быстрее. По данным Сбера, производительность GFusion достигает до 45% выше по сравнению с GigaChat 3, на базе которого модель обучалась. Такой подход дает сразу несколько преимуществ: диффузионные модели способны генерировать сразу группы токенов, самостоятельно определять порядок формирования различных частей текста и эффективнее использовать обучающие данные, многократно извлекая из них полезную информацию.
Технические особенности и преимущества
Диффузионные модели обеспечивают более гибкую генерацию текста: в отличие от авторегрессионных моделей, текст не обязательно пишется строго слева направо — модель сама выбирает, какую часть ответа дополнить на каждом шаге. Это открывает новые возможности для создания более структурированных и логически выверенных текстов.
Кроме того, диффузионные модели способны извлекать больше информации из ограниченного объема данных, обучаясь на одном и том же датасете несколько раз. Такой подход особенно ценен в условиях, когда доступ к обучающим данным ограничен или дорого стоит.

Автор проекта и поддержка сообщества
Автором проекта стал инженер машинного обучения Сбера Даниил Тихонов. Работу над моделью он начал во время стажировки в команде фундаментальных моделей банка, будучи студентом четвертого курса факультета компьютерных наук НИУ ВШЭ. Проект лег в основу его дипломной работы, после успешной защиты Тихонов присоединился к команде Сбера уже в качестве штатного специалиста.
Вместе с релизом GFusion компания опубликовала инструменты, позволяющие ускорить обучение диффузионных моделей и снизить требования к вычислительным ресурсам. Это первый в России опенсорс-проект, направленный на ускорение обучения диффузионных моделей, который позволяет разработчикам обучать свои модели быстрее и с меньшим числом видеокарт.
Интеграция с международными инструментами
Разработчики также внесли изменения в SGLang — один из самых популярных в мире опенсорс-инструментов для запуска языковых моделей. В него была добавлена поддержка GFusion и нового алгоритма генерации, который способен повысить качество работы диффузионных моделей. Эти доработки сделают технологию более доступной для международного сообщества разработчиков.
По словам Даниила Тихонова, направление диффузионных языковых моделей пока остается во многом исследовательским и не имеет устоявшихся архитектурных стандартов, что открывает широкие возможности для создания новых решений. Он выразил надежду, что публикация GFusion поможет другим командам быстрее развивать эту технологию.
Перспективы развития
Федор Минькин, технический директор фундаментальных моделей GigaChat, отметил, что диффузионные языковые модели представляют одно из самых перспективных и сложных направлений в генеративном искусственном интеллекте. Успешное создание проекта стажером в команде свидетельствует о высоком уровне поставленных задач и доверии молодым исследователям.
Мировое сообщество разработчиков видит в диффузионных языковых моделях огромный потенциал. Направление активно развивается с конца 2025 года — сегодня такие модели уже обеспечивают автодополнение кода в реальном времени, агентные сценарии и поддерживают приложения, критичные к задержкам. Приоритетная задача — обеспечить в диффузионных языковых моделях высокое качество ответов и способность к рассуждению на уровне традиционных LLM.
