Alibaba представила Qwen3.8-Max — модель с 2,4 трлн параметров, способную работать автономно до 16 дней
Китайская корпорация Alibaba анонсировала флагманскую языковую модель Qwen3.8-Max, содержащую 2,4 триллиона параметров. Главная особенность новой системы — способность непрерывно работать более десяти дней без вмешательства человека и самостоятельно выполнять сложные задачи: от написания программного кода до проектирования микросхем. 
Архитектура и технические характеристики
Модель построена на архитектуре смеси экспертов (Mixture of Experts, MoE). Из 2,4 трлн параметров на каждом токене постоянно активируются 95 млрд. Контекстное окно составляет 1 млн токенов, что позволяет загружать большие кодовые базы, крупные технические документы, телесериалы и прямые трансляции. Новая архитектура, по словам разработчиков, сокращает вычислительные затраты и задержку при решении сложных задач.
Qwen3.8-Max обладает нативной мультимодальностью: умеет анализировать изображения и визуальные данные. В тесте BabyVision, проверяющем возможности компьютерного зрения, модель обошла всех конкурентов, включая Claude Fable 5.
Автономная работа и агентные способности
Ключевое заявление Alibaba — Qwen3.8-Max способна к длительному автономному планированию и исполнению задач без участия пользователя. Во внутренних тестах модели поручили создать проект с нуля и развивать его в течение более чем десятидневного автономного цикла. По данным команды Qwen, за один непрерывный запуск модель выполнила около 500 итераций и 71 оценку по 13 ключевым этапам.
- Автономное программирование в течение 16 дней
- Самостоятельный полный цикл разработки: от архитектуры до документации
- Планирование задач, написание кода, тестирование, принятие пулл-реквестов, исправление багов
- Глубокая архитектурная переработка, включая проектирование чипов
- Работа в сферах биоинженерии, экономики, адвокатуры, дизайна
В рекламном ролике Alibaba демонстрирует сценарии, где специалисты отдыхают, пока Qwen3.8-Max выполняет работу в фоновом режиме. 
Результаты бенчмарков и сравнение с конкурентами
По заявлению разработчиков, по ряду тестов Qwen3.8-Max демонстрирует производительность на уровне Claude Fable, Claude Opus 4.8 и GPT-5.6 Sol. В отдельных проверках модель превосходит решения Anthropic и OpenAI.
В тесте SWE-bench-Pro, оценивающем способность ИИ-агентов самостоятельно решать сложные инженерные задачи в реальном коде, Qwen3.8-Max превосходит GPT-5.6 Sol и Claude Opus 4.8, но уступает Claude Fable 5. Ранние версии семейства Qwen (в частности Qwen 2.5-Max в начале 2025 года) уже заявляли превосходство над DeepSeek-V3 и Llama-3.1-405B по задачам на понимание текста, программирование и логические рассуждения.
Доступность, цены и открытые веса
Новая модель уже доступна всем пользователям бесплатно в веб-версии Qwen, а также через Qwen Studio и API. Стоимость использования API составляет 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов.
Важный момент: уже на следующей неделе Alibaba планирует открыть доступ к весам моделей Qwen3.8-Max и Qwen3.8-27B. Это позволит запускать их локально и использовать в собственных проектах без зависимости от облачной инфраструктуры. 
Контекст: экосистема Qwen
Qwen — семейство больших языковых моделей и одноименное приложение, разработанное облачным подразделением Alibaba Cloud. Проект ранее носил название Tongyi Qianwen. Модели используются для генерации и анализа текста, программирования, работы с документами и решения корпоративных задач.
В феврале 2025 года Alibaba также выпустила модель RynnBrain для управления роботами. Она создана на основе мультимодальной системы Qwen3-VL, которая анализирует текст и изображения, помогая машинам распознавать предметы, рассчитывать движения и выполнять команды.