Comme une boussole trouvant le vrai nord dans un vaste paysage numérique, les benchmarks servent de guides fiables pour les entreprises naviguant dans les eaux inexplorées de l'automatisation agentique. À une époque où l'intelligence artificielle promet de transformer notre façon de travailler, la question de la fiabilité et de la performance dans le monde réel flotte souvent dans l'air comme la brume du matin—visible mais pas encore claire. C'est dans ce contexte qu'une récente réalisation dans le domaine offre un point de référence significatif.
Le benchmark vérifié par OSWorld se présente comme un terrain de test unique, construit comme un environnement informatique réel et évolutif qui reflète les tâches diverses et les flux de travail inter-applications des lieux de travail modernes. Avec 369 tâches réelles couvrant Windows, macOS et Ubuntu, il agit comme une règle de mesure commune pour les agents d'IA à usage général et spécialisés. Pendant des mois, les modèles ont été mis à l'épreuve ici, leurs capacités à interpréter des interfaces, exécuter des commandes et gérer des flux de travail complexes soigneusement évaluées. Dans cet espace arrive l'agent d'écran UiPath, alimenté par Claude Opus 4.5, qui a maintenant revendiqué le meilleur classement dans l'évaluation indépendante du benchmark. En tant que partie intégrante de UiPath Screenplay, l'agent utilise le langage naturel pour construire et exécuter des processus automatisés, comblant le fossé entre l'intention humaine et l'action machine. Cela fait suite à la deuxième place de la plateforme en septembre 2025 avec une version alimentée par OpenAI GPT-5, marquant une montée constante en capacité. Des partenaires comme SimpleTire ont noté un potentiel précoce dans la manière dont une telle technologie pourrait étendre les efforts d'automatisation, réduire les charges de maintenance et libérer les équipes pour se concentrer sur la croissance. Pour les organisations pesant des investissements en IA à grande échelle, des benchmarks comme celui-ci offrent un certain degré de clarté, aidant à traduire la promesse technique en confiance tangible.
Le 14 janvier 2026, UiPath a annoncé le meilleur classement, Mircea Neagovici-Negoescu, vice-président senior de l'IA et de la recherche chez UiPath, soulignant le rôle d'une telle validation dans l'autonomisation des entreprises. Le groupe de recherche OSWorld, qui a développé le benchmark avec des contributions d'institutions telles que l'Université de Hong Kong et Salesforce Research, l'a positionné comme un outil pour faire avancer le domaine des agents multimodaux. Alors que l'industrie continue d'évoluer, des jalons comme celui-ci fournissent à la fois un instantané des progrès actuels et une base pour le développement futur.
DÉCLARATION SUR LES IMAGES AI
"Les graphiques sont générés par IA et destinés à la représentation, pas à la réalité."
SOURCE
1. UiPath, Inc. 2. Groupe de recherche OSWorld 3. Business Wire 4. StockTitan.net 5. EuropeSays.com
Publié par Banx Network. Cet article fait partie du programme de médias décentralisés Banx, propulsé par le jeton BXE sur le XRP Ledger.




