Технологии

ИИ Alibaba, читающий ваш экран, набирает 92% на реальных телефонах и запускается на вашем железе

Susan Hill

Alibaba Qwen-UI-Agent не требует специального доступа к вашим приложениям. Он считывает экран, распознаёт, что на нём находится, и выполняет нажатия, обрабатывая задачи от обмена сообщениями до редактирования документов исключительно за счёт визуального восприятия. Веса модели — MAI-UI-2B и MAI-UI-8B — на этой неделе появились на Hugging Face, что делает систему доступной любому разработчику с GPU.

Показатели бенчмарков конкретны. На MobileWorld, стандартном тесте для мобильных агентов, Qwen-UI-Agent набрал 82,1%, опередив GPT-5.6 на 12 процентных пунктов и Claude Opus 4.8 на 14,6 пункта. Разрыв не является незначительным — сопоставимые западные системы месяцами топчутся на уровне 70–74 баллов в том же тесте. На тестировании на реальных устройствах — задачах, выполняемых на настоящих Android-смартфонах, а не на эмуляторах, — результат поднялся до 92,2%. На AndroidDaily, более широкой оценке на реальных телефонах, модель достигла 97,5%. Для использования на настольных компьютерах, измеряемого через OSWorld-Verified, она показала 79,5%, обойдя как GPT-5.5, так и Gemini 3.1 Pro.

Alibaba обучала модель на данных с более чем 100 реальных мобильных устройств, работающих со 150 различными приложениями, а затем создала собственный бенчмарк — MobileWorld-Real — с более чем 400 задачами для проверки производительности вне лаборатории. Примерно 40% задач для настольных ПК включали пакетные операции командной строки наряду с визуальными нажатиями — дизайнерское решение, отражающее то, как работает реальная вычислительная техника, а не то, как ставятся демо.

В рабочий процесс встроен уровень безопасности. Модель отказывается от задач, которые она помечает как незаконные или с высоким уровнем риска, и останавливается при чувствительных операциях — платежах, удалении данных, разрешениях на конфиденциальность — запрашивая явное подтверждение пользователя перед продолжением. Система обрабатывает последовательности длиннее 100 шагов с помощью обучения с подкреплением, проводимого примерно в 10 000 одновременно симулированных средах.

Результаты бенчмарков оставляют открытыми более сложные вопросы. Qwen-UI-Agent оценивался на структурированных задачах; реальное использование телефона изобилует прерываниями, уведомлениями и приложениями, которые обновляют свои интерфейсы без предупреждения. ИИ, считывающий экран, также поднимает вопрос о конфиденциальности, который технический отчёт Alibaba не затрагивает: модель, обрабатывающая каждый пиксель вашего экрана, получает доступ к банковским данным, личным сообщениям и информации, которую большинство пользователей никогда не предполагали передавать сторонней системе. Отсутствуют руководящие принципы относительно того, что происходит с этими данными при развёртывании у третьих сторон.

Проект размещён на GitHub по адресу Tongyi-MAI/MAI-UI; веса модели уже доступны на Hugging Face. Коммерческий API или цены на развёртывание не объявлены. Следующий тест для Qwen-UI-Agent — это не бенчмарк, а то, смогут ли разработчики, работающие с открытыми весами, добиться в продакшене того, что Alibaba зафиксировала в лаборатории.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.