Skip to content
Alibaba представила экономичную ИИ-модель Qwen3.8-Flash на новой архитектуре
27 августа 01:04 4 Просмотров Новости

Alibaba представила экономичную ИИ-модель Qwen3.8-Flash на новой архитектуре

Команда Qwen компании Alibaba анонсировала выпуск языковой модели Qwen3.8-Flash и предварительной версии архитектуры Qwen3.8-Flash-Next. Релиз позиционируется как ключевой этап на пути к будущему поколению линейки Qwen4, с акцентом на экстремальную экономичность инференса, мультимодальность и принципиально новые архитектурные подходы.

логотип модели Qwen3.8-Flash от Alibaba

Архитектура и ключевые параметры

Основа модели — разреженная архитектура Mixture-of-Experts (MoE). Общий объем основной сети составляет 125 млрд параметров, однако за счет разреженной структуры на генерацию каждого токена активируется всего около 6 млрд параметров. Дополнительно задействована отдельная таблица N-gram эмбеддингов на 51 млрд параметров, дополняющая основную сеть.

Контекстное окно поддерживает нативно 262 тыс. токенов, с возможностью расширения до 1 млн токенов с помощью технологии YaRN. По заявлению разработчиков, обучение модели стоило примерно 1/9 часть от затрат на Qwen3.7-Plus, при этом Qwen3.8-Flash превосходит предшественника в задачах программирования и офисных сценариях.

Архитектурные инновации Qwen3.8-Flash-Next

Предварительная версия архитектуры Qwen3.8-Flash-Next вносит изменения в четыре базовых компонента, нацеленные на стабильность обучения и удешевление работы с длинным контекстом:

  • Attention (Внимание): гибридная архитектура GDN + QSA. Gated DeltaNet (GDN) эффективно сжимает предысторию, а Qwen Sparse Attention (QSA) применяет легкий индексер для отбора ключевого контекста на уровне микро-блоков, снижая вычислительные затраты на длинные последовательности.
  • Residual (Остаточные связи): внедрен Gated Residual (GR), расширяющий остаточный поток до 4 ветвей с динамическим управлением через гейты, что усиливает обмен информацией между слоями.
  • Embedding: оптимизация работы с емкостью памяти и представлением токенов.
  • Optimization: общая стабилизация процесса тренировки гибридных слоев.
схема архитектуры Qwen3.8-Flash-Next с модулями GDN и QSA

Доступность и стоимость API

Производственная версия Qwen3.8-Flash уже доступна через API платформы QwenCloud. Тарификация установлена на уровне $0,16 за миллион входных токенов и $0,47 за миллион выходных токенов. Открытые веса превью-версии Qwen3.8-Flash-Next опубликованы на платформах Hugging Face и ModelScope для исследований и тестирования сообществом.

Релиз стал событием 26 августа 2026 года и демонстрирует курс Alibaba на создание высокоэффективных моделей нового поколения, способных конкурировать с решениями таких игроков, как DeepSeek и Anthropic, при значительно меньших вычислительных затратах.

интерфейс QwenCloud с моделью Qwen3.8-Flash

Поделиться

Похожие публикации