Alibaba представила экономичную ИИ-модель Qwen3.8-Flash на новой архитектуре
Команда Qwen компании Alibaba анонсировала выпуск языковой модели Qwen3.8-Flash и предварительной версии архитектуры Qwen3.8-Flash-Next. Релиз позиционируется как ключевой этап на пути к будущему поколению линейки Qwen4, с акцентом на экстремальную экономичность инференса, мультимодальность и принципиально новые архитектурные подходы.
Архитектура и ключевые параметры
Основа модели — разреженная архитектура Mixture-of-Experts (MoE). Общий объем основной сети составляет 125 млрд параметров, однако за счет разреженной структуры на генерацию каждого токена активируется всего около 6 млрд параметров. Дополнительно задействована отдельная таблица N-gram эмбеддингов на 51 млрд параметров, дополняющая основную сеть.
Контекстное окно поддерживает нативно 262 тыс. токенов, с возможностью расширения до 1 млн токенов с помощью технологии YaRN. По заявлению разработчиков, обучение модели стоило примерно 1/9 часть от затрат на Qwen3.7-Plus, при этом Qwen3.8-Flash превосходит предшественника в задачах программирования и офисных сценариях.
Архитектурные инновации Qwen3.8-Flash-Next
Предварительная версия архитектуры Qwen3.8-Flash-Next вносит изменения в четыре базовых компонента, нацеленные на стабильность обучения и удешевление работы с длинным контекстом:
- Attention (Внимание): гибридная архитектура GDN + QSA. Gated DeltaNet (GDN) эффективно сжимает предысторию, а Qwen Sparse Attention (QSA) применяет легкий индексер для отбора ключевого контекста на уровне микро-блоков, снижая вычислительные затраты на длинные последовательности.
- Residual (Остаточные связи): внедрен Gated Residual (GR), расширяющий остаточный поток до 4 ветвей с динамическим управлением через гейты, что усиливает обмен информацией между слоями.
- Embedding: оптимизация работы с емкостью памяти и представлением токенов.
- Optimization: общая стабилизация процесса тренировки гибридных слоев.
Доступность и стоимость API
Производственная версия Qwen3.8-Flash уже доступна через API платформы QwenCloud. Тарификация установлена на уровне $0,16 за миллион входных токенов и $0,47 за миллион выходных токенов. Открытые веса превью-версии Qwen3.8-Flash-Next опубликованы на платформах Hugging Face и ModelScope для исследований и тестирования сообществом.
Релиз стал событием 26 августа 2026 года и демонстрирует курс Alibaba на создание высокоэффективных моделей нового поколения, способных конкурировать с решениями таких игроков, как DeepSeek и Anthropic, при значительно меньших вычислительных затратах.