IA

L’IA d’Alibaba qui lit votre écran atteint 92 % sur téléphones réels — et tourne sur votre propre hardware

Susan Hill

L’agent Qwen-UI d’Alibaba n’a pas besoin d’un accès spécial à vos applications. Il lit l’écran, identifie son contenu et clique, accomplissant des tâches allant de la messagerie à l’édition de documents par la seule perception visuelle. Les poids du modèle — MAI-UI-2B et MAI-UI-8B — sont arrivés sur Hugging Face cette semaine, mettant le système à la portée de tout développeur disposant d’un GPU.

Les benchmarks sont concrets. Sur MobileWorld, l’évaluation standard des agents mobiles, Qwen-UI-Agent a obtenu 82,1 %, battant GPT-5.6 de 12 points de pourcentage et Claude Opus 4.8 de 14,6 points. L’écart n’est pas marginal — des systèmes occidentaux comparables stagnent dans les bas-milieux des 70 % sur le même test depuis des mois. Sur des tests sur appareils réels — des tâches exécutées sur de vrais smartphones Android plutôt que sur des émulateurs — le score est monté à 92,2 %. Sur AndroidDaily, une évaluation plus large sur téléphones réels, le modèle a atteint 97,5 %. Pour une utilisation sur ordinateur de bureau, mesurée via OSWorld-Verified, il a affiché 79,5 %, devant GPT-5.5 et Gemini 3.1 Pro.

Alibaba a entraîné le modèle sur des données provenant de plus de 100 appareils mobiles réels exécutant 150 applications distinctes, puis a construit son propre benchmark — MobileWorld-Real — avec plus de 400 tâches pour vérifier les performances en dehors du laboratoire. Environ 40 % des tâches de bureau impliquaient des opérations en ligne de commande par lots en plus des clics visuels, un choix de conception qui reflète la façon dont l’informatique réelle fonctionne plutôt que la façon dont les démos sont mises en scène.

Une couche de sécurité est intégrée au flux de travail. Le modèle refuse les tâches qu’il juge illégales ou à haut risque, et s’arrête lors d’opérations sensibles — paiements, suppression de données, autorisations de confidentialité — en demandant une confirmation explicite de l’utilisateur avant de continuer. Le système gère des séquences de plus de 100 étapes en utilisant l’apprentissage par renforcement entraîné sur environ 10 000 environnements simulés simultanés.

Les scores des benchmarks laissent les questions les plus difficiles en suspens. Qwen-UI-Agent a été évalué sur des tâches structurées ; l’utilisation réelle du téléphone est lourde d’interruptions, encombrée de notifications et implique des applications qui mettent à jour leurs interfaces sans prévenir. L’IA de lecture d’écran soulève également une question de confidentialité que le rapport technique d’Alibaba n’aborde pas : un modèle qui traite chaque pixel de votre écran a accès aux détails bancaires, aux messages privés et aux données que la plupart des utilisateurs n’ont jamais envisagé de confier à un système tiers. Les directives concernant ce qu’il advient de ces données dans les déploiements tiers sont absentes.

Le projet est hébergé sur Tongyi-MAI/MAI-UI sur GitHub ; les poids du modèle sont sur Hugging Face maintenant. Aucun prix d’API commerciale ou de déploiement n’a été annoncé. Le prochain test pour Qwen-UI-Agent n’est pas un benchmark — c’est de savoir si les développeurs construisant sur les poids ouverts peuvent égaler en production ce qu’Alibaba a enregistré en laboratoire.

Étiquettes: , , , , ,

Discussion

Il y a 0 commentaire.