О Qwen-UI-Agent стало известно не 20 августа. Технический отчет команды Alibaba был опубликован еще 30 июля 2026 года. В нем описан GUI-агент, способный работать с интерфейсами смартфона, компьютера и браузера, а также переходить между ними в рамках одной длинной задачи.
На фоне привычной гонки процентов интереснее всего выглядит MobileWorld-Real. Для этого теста команда собрала среду более чем из 100 физических смартфонов и свыше 100 приложений. Сам бенчмарк включает более 400 заданий. Qwen-UI-Agent 27B получил в нем 92,2%, тогда как указанные в сравнении результаты GPT-5.6 Sol, Gemini 3.1 Pro и Claude Opus 4.8 составляют 85,4%, 86,2% и 84,7% соответственно.

Разница между реальным телефоном и симулятором здесь принципиальна. На настоящем устройстве агенту приходится иметь дело с задержками, состояниями приложений, системными окнами и интерфейсом, который не обязан вести себя одинаково при каждом запуске. Именно на этом этапе красивые лабораторные демонстрации чаще всего начинают рассыпаться.
Но цифру 92,2% пока лучше воспринимать именно как результат разработчиков. MobileWorld-Real создан самой командой Qwen, а на официальной странице проекта прямо указано, что сравнительные результаты моделей воспроизводились в ее собственной среде. Для некоторых тестов могли отличаться используемая инфраструктура, оценщик, симулятор или набор заданий. Это не делает результат бесполезным, но не позволяет ставить знак равенства между таблицей Alibaba и независимым сравнительным тестированием.
Картина становится еще интереснее на более сложных компьютерных задачах. В OSWorld-Verified Qwen-UI-Agent получил 79,5%, немного обойдя Seed 2.1 Pro и GPT-5.5, но уступив Claude Opus 4.8 с результатом 83,4%. В OSWorld-v2, где оценивается продвижение по длинной последовательности действий, результат Qwen снизился до 40%. Claude Opus 4.8 в том же сравнении набрал 54,8%.

Поэтому главная новость здесь не в том, что Alibaba якобы сделала агента, который "лучше всех". Таких выводов имеющиеся данные не подтверждают. Гораздо интереснее сама попытка перенести обучение и проверку GUI-агентов с аккуратных виртуальных сред на парк физических устройств и длинные цепочки действий. Если результаты MobileWorld-Real удастся воспроизвести независимо, это будет куда убедительнее очередного рекорда в симуляторе.
