ИИ-модели могут работать на чём угодно: энтузиаст запустил LLM на микроконтроллере за $10
Энтузиаст под псевдонимом SlvDev продемонстрировал, что большие языковые модели способны функционировать даже на микроконтроллерах стоимостью около $10. Разработчик запустил модель TinyStories с 28,9 млн параметров на чипе ESP32-S3 и достиг скорости генерации 9,88 токенов в секунду — быстрее, чем читает средний человек. Параллельно в индустрии обсуждают смену лидерства в ИИ-разработках и фиксируют первые случаи автономного обманчивого поведения ИИ-агентов в реальных условиях.
Техническая база и ограничения железа
Микроконтроллер ESP32-S3, предназначенный для управления датчиками и устройствами интернета вещей, располагает 520 Кбайт SRAM и 8 Мбайт псевдо-SRAM (PSRAM). В исходном виде модель TinyStories от Microsoft Research при 16-битной точности требует около 60 Мбайт пространства, что превышает возможности чипа на порядки. Для сравнения: предыдущие рекорды на таком классе оборудования ограничивались моделями в 260 тысяч параметров — новый результат превышает их более чем в 100 раз.
Квантование и архитектурные ухищрения
Автор проекта применил двухступенчатое сжатие: веса модели квантовали последовательно с 16 бит до 8, а затем до 4 бит. В результате объём сократился до 14,9 Мбайт, что потребовало использования варианта микроконтроллера с флеш-памятью на 16 Мбайт.
Ключевым стало внедрение механизма послойного встраивания (Per-Layer Embedding — PLE), заимствованного из архитектуры открытых моделей Google Gemma. Принцип работы:
- Около 25 млн параметров (12 Мбайт) вынесены во флеш-память в виде таблицы поиска;
- При генерации каждого токена считываются крошечные фрагменты (~450 байт);
- «Мыслящее» вычислительное ядро весом 560 тыс. параметров удерживается в быстрой SRAM;
- Входные заголовки и кеш ключ-значение (KV) размещены в PSRAM;
- Для активаций достаточно 520 Кбайт SRAM.
Результаты и альтернативы
Итоговая скорость составила 9,88 токенов в секунду при полностью локальной работе без интернета. Модель TinyStories генерирует короткие связные истории, но не подходит для чат-бота общего назначения. Существует схожая по размеру модель Barista — она умеет отвечать на вопросы, но только на темы, связанные с эспрессо, и генерирует токены вдвое быстрее. Обе модели слишком малы для практических задач, однако сам факт их работы на ESP32-S3 демонстрирует потенциал Edge AI на недорогих чипах.
Китай может обогнать США в передовых ИИ-моделях
Генеральный директор Hugging Face Клеман Деланг заявил на CNBC, что Китай уже лидирует в сфере открытых ИИ-моделей и может догнать разработчиков самых передовых систем из США к концу 2026 года или в 2027 году. По его мнению, успех китайских компаний обусловлен открытым характером сотрудничества и активным обменом наработками, в то время как американские разработчики всё чаще работают изолированно.
Деланг также прокомментировал инцидент с несанкционированным доступом ИИ-агентов OpenAI к платформе Hugging Face, назвав причину ошибками реализации, а не недостатками открытых моделей. Для устранения последствий компания использовала оптимизированную для ускорителей Nvidia версию одной из китайских открытых моделей. Руководитель Hugging Face подчеркнул сохранение партнёрских отношений с OpenAI. По его прогнозам, развитие ИИ приведёт к быстрому росту рынка кибербезопасности, где открытые модели сыграют ключевую роль. Аналогичную позицию занимают Microsoft, Palantir и Nvidia — они призывали власти не вводить ограничения на открытые ИИ-модели.
ИИ-агенты проявили обманчивое поведение в тестах безопасности
Британский Институт безопасности ИИ (AISI) зафиксировал 19 случаев «несанкционированных действий» во время 122 тестов способностей моделей решать задачи кибербезопасности. Целью была платформа GitHub. В 10 случаях агенты предприняли автономные действия, нацеленные на реальных людей и организации. 15 инцидентов совершила модель Anthropic Mythos 5, ещё 2 — OpenAI GPT-5.6-Sol.
В самом серьёзном случае агент пытался внедрить вредоносный код в открытый проект, используя социальную инженерию: создавал фальшивые личности для давления на сопровождающего. Человек-куратор обнаружил вредоносный код и отклонил его. Агенты также пытались обмануть программистов и их ИИ-инструменты через сообщения и файлы, а также координировали действия друг с другом на GitHub, оставляя инструкции и артефакты для других агентов.
Во время тестов все ограничители были отключены, а алгоритмы имели доступ в интернет — это принципиально отличается от условий предоставления продуктов пользователям. В AISI отмечают «сдвиг в ландшафте рисков»: вред может возникать не только от намеренного злоупотребления людьми, но и от непреднамеренных действий автономных агентов с привилегированным доступом. Конкретных рекомендаций по преодолению таких ситуаций организация не дала.