La concurrence des agents IA se déplace de la capacité de manipulation des ordinateurs vers des systèmes opérationnels pouvant être intégrés en toute sécurité dans les tâches d'entreprise. Il est analysé qu'il est nécessaire de disposer non seulement de performances de modèle, mais aussi de gestion du contexte et des autorisations spécifiques à l'entreprise, de récupération d'erreurs et de systèmes de validation pour pouvoir confier des tâches réelles.
Andreessen Horowitz a déclaré dans un article publié le 28 août 2025 que les agents utilisant des ordinateurs élargissent la portée de l'automatisation des tâches en manipulant directement les navigateurs et les environnements de bureau. Sur le terrain, il a été évalué que l'orchestration, qui coordonne le contexte spécifique à l'entreprise et la conception de la fiabilité, est plus importante que le modèle universel lui-même.
Les agents utilisant des ordinateurs sont des systèmes d'IA qui reconnaissent l'écran utilisé par l'utilisateur humain et effectuent des actions telles que des clics, des saisies et des déplacements d'écran. Contrairement à l'automatisation des processus robotisés (RPA) traditionnelle qui répète des procédures fixes, ces agents choisissent les outils nécessaires après avoir reçu un objectif et traitent plusieurs étapes en séquence.
Les applications concernent des tâches qui traversent plusieurs programmes, telles que la recherche de documents, la saisie dans les systèmes de gestion de la relation client, les notifications via des messageries internes et la rédaction de rapports. Dans les tâches d'entreprise, des éléments tels que les autorisations d'accès, le traitement des exceptions, les enregistrements d'audit et les procédures d'approbation humaine sont impliqués, rendant difficile l'automatisation complète du processus uniquement par la capacité de manipulation de l'écran.
Selon un article officiel d'OSWorld, le taux de réussite des humains dans 369 tâches informatiques réelles était de 72,36 %, tandis que le taux de réussite du meilleur modèle à l'époque était de 12,24 %. OSWorld est un benchmark qui mesure la capacité à manipuler des fichiers, des applications et des pages web dans un environnement de système d'exploitation réel.
OpenAI a déclaré que l'agent utilisant un ordinateur (Computer-Using Agent, CUA) a enregistré 38,1 % dans OSWorld, 58,1 % dans WebArena et 87 % dans WebVoyager, selon un article publié le 23 janvier 2025. Ces chiffres montrent que les modèles manipulant directement des ordinateurs sont passés de la phase de recherche à celle de la commercialisation.
Cependant, même si la même capacité de manipulation de l'ordinateur est mesurée, il est difficile de comparer simplement les résultats si les versions de benchmark, la configuration des tâches et les environnements d'exécution diffèrent. Les réévaluations des entreprises individuelles et les résultats vérifiés par OSWorld appliquent des conditions différentes, il est donc nécessaire de préciser les critères d'évaluation avec les chiffres de performance.
C'est aussi pourquoi il est difficile d'expliquer le goulet d'étranglement des agents IA pour les entreprises uniquement par les scores des modèles. Même si un modèle puissant est acquis, sans un système capable de fournir le contexte nécessaire à temps, de valider les résultats d'exécution et de récupérer les tâches échouées, il est difficile de fonctionner de manière stable dans un environnement de production.
Microsoft a déclaré dans un article publié le 2 juin 2026 que ce dont les entreprises ont besoin n'est pas seulement de modèles puissants ou de ressources de calcul, mais aussi d'un système pour construire, déployer, observer et contrôler les agents. Il a présenté le contexte, la gouvernance, la visibilité et l'amélioration continue comme des conditions clés pour l'introduction dans un environnement de production.
OpenAI a également expliqué dans un article publié le 25 juin 2026 que la manière d'utiliser les agents évolue d'une requête ponctuelle vers une délégation de tâches à long terme. Plus le temps de travail est long, plus l'importance de la validation des résultats intermédiaires, des restrictions d'autorisation et des procédures de transfert aux humains en cas d'échec augmente.
La sécurité est un autre défi que les agents pour entreprises doivent résoudre. Lorsque les agents peuvent lire et écrire des documents internes et des systèmes de travail, la capacité à utiliser le contexte nécessaire et le risque d'exposer des informations sensibles augmentent également.
La recherche CI-Work de Microsoft Research a présenté un taux de violation de la vie privée des agents de modèles de langage de grande taille (LLM) pour les entreprises de 15,8 à 50,9 %, et un taux de fuite d'informations pouvant atteindre 26,7 %. Les chercheurs ont conclu qu'il est difficile de résoudre le problème de fuite d'informations contextuelles simplement en augmentant la taille du modèle ou la profondeur de l'inférence.
Dans l'industrie, il existe des opinions divergentes sur le fait de considérer les agents passant par des écrans et des navigateurs comme une méthode transitoire pour se connecter aux logiciels existants, et que la manière dont les agents manipulent directement les outils existants comme des humains deviendra dominante. Les deux positions s'accordent sur le fait que l'introduction réelle nécessite un contrôle d'accès, des garde-fous et une validation des résultats d'exécution.
Au sein des entreprises, des tentatives se poursuivent pour établir une structure d'exploitation des agents. Le système interne d'IA de Coinbase a appliqué une structure de sandbox cloud, une coordination des sous-agents et une génération automatique de tâches, et cette conception de système devient la base pour distinguer la portée d'exécution et les responsabilités au cours du processus où le modèle exécute des tâches à plusieurs étapes.
Dans le domaine des actifs virtuels, la question de savoir comment concevoir l'identité, les autorisations et le système d'audit des agents IA est un point de contact direct, plus que les bénéfices liés aux prix. Étant donné qu'une recherche conjointe pour vérifier l'identité et la portée des agents de trading autonomes a également été lancée, l'importance des systèmes de contrôle augmente à mesure que les agents pénètrent dans les tâches d'entreprise et l'infrastructure des actifs numériques.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.














![[Exclusif] Les échanges de cryptomonnaies étrangers 'non recherchables' en Corée... 65 sur Google et 56 sur Apple](/public-static/22_d448f7b258.png?format=avif)














