Microsoft выпустила собственные ИИ-модели для изображений и речи — они дешевле OpenAI
Новые модели Microsoft AI
Microsoft представила две новые искусственные модели собственной разработки: MAI-Image-2.5-Pro для генерации и редактирования изображений высокого качества, а также MAI-Voice-2-Flash для распознавания речи в корпоративных нагрузках. Обе модели доступны в публичном предварительном просмотре и позиционируются как более экономичные аналоги решений OpenAI.
Технические характеристики и стоимость
MAI-Image-2.5-Pro представляет собой флагманский генератор изображений с возможностью детального редактирования и точной отрисовки текста. Стоимость использования через API составляет $5 за 1 млн текстовых токенов на вводе, $8 за 1 млн токенов изображений на вводе и $106 за млн токенов изображений на выводе. Базовая версия MAI-Image-2.5 недавно заняла второе место в рейтинге моделей для редактирования изображений на платформе Arena.
MAI-Voice-2-Flash работает вдвое быстрее, чем базовая версия, и стоит на 32% дешевле — $15 за 1 млн знаков. Модель оптимизирована для массовых голосовых сценариев: кол-центров, голосовых агентов и приложений в реальном времени.
Экономия ресурсов и производительность
Собственные модели Microsoft уже активно внедряются в продукты компании. Сервис Bing Image Creator полностью переведён на MAI-Image-2.5. В PowerPoint использование модели позволило снизить затраты на ресурсы графического процессора на 84% по сравнению с OpenAI GPT-Image-2.
В облачном хранилище OneDrive модель стала основной для инструментов редактирования изображений: доля сохранённых результатов выросла на 26%, задержка сократилась примерно на четверть, а эффективность увеличилась в 2,5 раза при средней нагрузке. MAI-Voice-2-Flash развернута на платформе Dynamics 365 Contact Center, снизив затраты на GPU до 89%.
Расширенное применение и стратегия
Медицинский сервис Microsoft Dragon Copilot, используемый 170 000 медицинских учреждений, переведён на модель MAI-Transcribe-1.5 с поддержкой 58 языков. За первый квартал система обработала 28 млн обращений пациентов.
Облегчённая модель MAI-Code-1-Flash для написания кода в GitHub Copilot обеспечивает на 10% более высокое принятие кода при сниженном на 10% медианном потреблении токенов. Пользователи на 6% чаще выбирают её повторно по сравнению с GPT-5.4 Mini, и на 11% чаще, чем Claude Haiku 4.5. Модель адаптирована для работы в Excel и может функционировать на устаревших ускорителях Nvidia H100 и даже A100.
По словам руководителя отдела моделей Microsoft Мустафы Сулеймана, переход на собственные технологии обусловлен стремлением к ускорению, снижению затрат и улучшению удержания пользователей. Компания подчеркивает: «Каждое из этих улучшений — шаг к одной и той же цели: продукты Microsoft должны работать на моделях Microsoft».