Si vous n'êtes pas venu, vous devez regarder ; si vous êtes venu mais n'avez pas regardé, c'est comme si vous n'étiez pas venu du tout.
Auteurs : Baishi, Zhou Yongliang, Geek Park
Éditeurs : Zhou Yongliang, Li Yuan
Le 19 août, une étrange excitation remplissait l'air à Yizhuang, Pékin, marquant le jour d'ouverture de la Conférence mondiale sur les robots de 2026. Plus de 300 entreprises et plus de 2 000 expositions ont présenté presque tout ce que l'industrie de l'intelligence incarnée a à offrir : grands modèles, entités, composants clés et données, tous disponibles.
Le jour de l'ouverture, Yushu Technology est devenue publique, avec une valeur de marché dépassant brièvement 400 milliards de yuans, marquant peut-être le jour le plus proche d'une "frénésie capitalistique" pour l'industrie de la robotique en Chine au cours de la dernière décennie. Par le passé, les entreprises de robotique existaient principalement dans des laboratoires, des nouvelles de financement et des vidéos de démonstration ; l'introduction en bourse de Yushu a établi un ancrage capitalistique pour ce domaine encore naissant.
De plus, Yunshe Technology est entrée dans la phase d'acceptation ou d'examen à la bourse, tandis que Zhiyuan Robotics a confirmé le lancement de son processus de cotation à Hong Kong en juillet 2026. La chaleur du marché primaire se transmet maintenant au marché secondaire ; l'intelligence incarnée n'est plus seulement une imagination technique, mais doit répondre à des questions sur les revenus, la livraison, le bénéfice brut et l'évolutivité.
Après avoir parcouru l'ensemble de la zone d'exposition, comme nous l'avions anticipé, il n'y avait pas de moments "wow" cette année ; au lieu de cela, il y avait plus de démonstrations. Yushu n'a pas présenté son "Superman" récemment lancé, capable de sauter 2 mètres et de courir à une vitesse de 12,66 mètres par seconde ; au lieu de cela, le stand mettait en avant des produits existants débloquant de nouveaux mouvements. Zhongqing a apporté une cage octogonale dans le hall, tandis que Weita Power a captivé le public avec une approche d'idole en deux dimensions... C'était en effet animé, mais peu discutaient encore de l'expression "percée disruptive".
Plutôt que de continuer à demander : "Quand y aura-t-il un miracle ?", il est plus utile de questionner plusieurs problèmes plus simples : Les robots peuvent-ils seulement ressembler à des humains ? À quel point la "universalité" de l'intelligence incarnée a-t-elle progressé ? Les données passent-elles d'une entreprise d'algorithmes à une entreprise de matériel ? Combien d'étapes les composants clés cachés dans les doigts, les articulations et les moteurs ont-ils avancé ?
Avec ces questions en tête, nous avons parcouru le hall d'exposition et eu des discussions approfondies avec plusieurs entreprises représentatives. Elles ne sont peut-être pas toutes les plus bruyantes, mais chacune représente des changements clés se produisant dans ce domaine : différenciation des formes d'entités, concurrence entre modèles généraux, reconstruction des boucles de données et composants clés s'approchant du "dernier centimètre".
Au stand de Galaxy General, trois formes de robots complètement différentes — à roues, lourds et bipèdes — fonctionnent sur le même grand modèle fondamental d'intelligence incarnée. Weita Power, en revanche, a commencé à partir de scénarios d'utilisation réels pour rétroconcevoir son premier robot humanoïde, Vbot ATOM. Zivariable a atteint une efficacité de 1 816 articles par heure avec un taux de précision dépassant 98 % dans des scénarios de tri logistique. Pacini a élargi sa solution pour la technologie "tactile" en un réseau de perception couvrant l'ensemble du corps...
L'intelligence incarnée est encore à ses débuts, même plus tôt que beaucoup ne l'attendent. Elle entre dans une phase plus difficile mais plus précieuse ; quiconque peut former une boucle fermée de modèles, d'entités, de composants et de capacités d'ingénierie pourrait devenir l'entreprise véritablement précieuse à la prochaine étape.
Au cours des deux dernières années, le récit de l'intelligence incarnée a été fortement dominé par les robots humanoïdes : dansant, courant, boxant, marathons — presque tous les événements marquants présentent une apparence humaine.
Cependant, après avoir assisté à la WRC de cette année, vous constaterez que le concept de robots humanoïdes est toujours en expansion, avec des formes géantes, bioniques et centaures... "Ressembler à un humain" n'a plus de réponse standard unique. Pendant ce temps, au-delà des formes humanoïdes, de plus en plus d'entreprises commencent à redessiner les formes de robots en fonction des tâches réelles. **(Remarque : Les vidéos peuvent être visionnées dans le lien original.)*
Cette année, la WRC a présenté des robots humanoïdes de Yushu s'affrontant avec vigueur, introduisant de nouveaux mouvements de combat. Le robot G1 effectue des combats avec une combinaison de coups de poing, de coups de pied tournants et de coups de pied volants, s'appuyant sur la coordination en temps réel de toutes les articulations ; le H2, plus grand avec une sortie d'articulation plus forte, délivre des coups de poing et des coups de pied avec plus de poids. Lorsqu'ils sont placés côte à côte, ils représentent deux styles : "agilité" et "force".
L'interaction de tennis de table vaut également le coup d'œil ; le robot doit d'abord "comprendre" la balle entrante avant de décider comment répondre, ce qui teste la coordination de la perception et de la prise de décision plus que simplement l'exécution de routines. Couplé à un système de combat télécommandé à corps entier, les mouvements de l'opérateur peuvent être reproduits avec précision, montrant les efforts de Yushu pour construire une boucle de données pour l'intelligence incarnée.
Cependant, le plus accrocheur est le GD01, un mécha de trois mètres de haut, transformable et habité. Il n'est ni humanoïde ni un quadrupède traditionnel, mais mélange la technologie robotique avec des formes d'équipement, ciblant directement des scénarios comme le tourisme culturel et les opérations spéciales.
Lors de la WRC de cette année, Vbot Weita Power a officiellement lancé son terminal d'intelligence incarnée humanoïde, Vbot ATOM, et a ouvert les précommandes simultanément. Notamment, ATOM ne part pas d'un prototype conceptuel mais s'appuie sur la définition du produit, la livraison en masse et les capacités d'opération utilisateur déjà validées dans le robot quadrupède "Big Head" de Vbot.
En mai de cette année, le robot cargo AI "Big Head" a atteint la livraison en masse. À ce jour, ce produit est devenu le meilleur vendeur d'intelligence incarnée de niveau consommateur, complétant 1,26 million d'interactions de grands modèles, 23 700 kilomètres de kilométrage de compagnonnage utilisateur et 131 500 heures de compagnonnage dans le monde réel, avec quatre mises à jour OTA au cours des trois derniers mois. Pour l'industrie de l'intelligence incarnée, la signification de ces données réside non seulement dans les ventes, mais dans la preuve que Vbot a intégré des robots dans la vie réelle des utilisateurs, formant une boucle de produit de la livraison, des retours d'expérience utilisateur à l'itération continue.
Basé sur la pratique de "Big Head", Vbot ATOM ne suit pas l'approche traditionnelle du robot humanoïde industriel, mais définit les formes de produits à partir de scénarios tels que la maison, le commerce de détail, les espaces publics et les services de bureau. Avec une hauteur de 160 cm, une envergure de 180 cm, une longueur de jambe de 95 cm et 31 degrés de liberté, il possède des capacités de service proches de l'échelle humaine ; le revêtement en tissu, le design interactif et les pieds silencieux le rendent plus amical dans les environnements domestiques et publics, facilitant l'acceptation par les gens.
Sur le plan technique, Vbot a également lancé le système de modèle "Vbot Embodied Genome" et trois modèles clés pour soutenir la compréhension des interactions, la prise de décision du modèle mondial, l'évolution inter-entity et le flux de retour d'information réel.
Ainsi, l'arrivée de Vbot ATOM signifie non seulement l'extension de Vbot des robots quadrupèdes aux robots humanoïdes, mais aussi ses efforts pour apporter des capacités de produit validées dans des espaces de vie plus larges, poussant les robots humanoïdes de l'affichage d'entité à la productisation.
Les robots Future Not Far sont entièrement conçus autour des besoins familiaux, capables d'effectuer des tâches ménagères de base, de fournir de la compagnie aux enfants, de s'occuper des personnes âgées et de prendre soin des animaux de compagnie. Ils sont déjà entrés dans plus de 500 foyers payants, accumulant plus de 50 000 heures de service.
Les robots Future Not Far ont également montré leurs capacités d'itération rapide dans des scénarios familiaux ; il y a un mois à WAIC, ils se concentraient sur des tâches de base comme la lessive, le pliage des vêtements et le rangement, tandis qu'à la WRC, ils ont élargi le scénario à la cuisine : le corps de robot entièrement auto-développé de deuxième génération F2, équipé d'un nouveau modèle d'action WAM auto-évolutif de nouvelle génération, a préparé des pâtes de manière autonome.
Le processus de cuisson complet nécessite des niveaux élevés de collaboration, de précision et de jugement de la part du robot : il nécessite une coordination synchrone de haute précision des deux bras ; il doit s'appuyer sur des indices visuels pour un jugement précis instantané des quantités lors de la manipulation d'opérations de fluides irréversibles ; il doit également passer de manière flexible, saisir et remplacer divers ustensiles de cuisine tout en apprenant de manière autonome à faire sauter avec le bon timing, ce qui n'a pas de réponse standard. La démonstration continue de cuisine par les robots Future Not Far a montré leur remarquable stabilité.
Future Not Far a déclaré qu'ils adoptent une approche de recherche autonome complète, du corps au cerveau en passant par le matériel, permettant des itérations plus rapides dans de nouveaux scénarios. En plus d'élargir progressivement des tâches légères à des tâches plus lourdes, la compréhension par Future Not Far des besoins en scénarios familiaux inclut également la couverture de scénarios essentiels pour les enfants, les personnes âgées et les animaux de compagnie. Ils ont également démontré diverses opérations d'échecs, l'ouverture de boissons, des jeux interactifs et un travail collaboratif à double machine, créant des scénarios solides sur le terrain et une interactivité qui ont maintenu leur stand bondé.
Les robots Zivariable se concentrent actuellement sur les scénarios familiaux et logistiques. Dans le scénario logistique, ils n'utilisent pas un robot humanoïde complet avec des mains habiles, mais emploient plutôt deux bras robotiques avec des griffes standard pour manipuler de véritables colis de formes, poids et matériaux variés.
Leurs robots décident comment manipuler les colis en fonction des caractéristiques physiques des colis eux-mêmes : les petits objets sont directement saisis, les boîtes lourdes peuvent être poussées, et pour des objets irréguliers comme un ours en peluche sans étiquette d'expédition, ils jugeront également le processus suivant et le traiteront de manière autonome. Lors d'une précédente diffusion en direct, ce système a fonctionné en continu pendant une heure, atteignant une efficacité de tri de 1 816 articles par heure avec un taux de précision dépassant 98 %.
Zivariable a souligné lors d'une interview sur place que ses robots sont déjà entrés dans des applications pratiques : les robots familiaux servent maintenant de manière à grande échelle les foyers utilisateurs ; le tri logistique a également été intégré dans des entreprises leaders.
L'universalité de l'intelligence incarnée, ou sa capacité à effectuer des tâches générales, fait référence à la capacité des robots d'intelligence incarnée à compléter des tâches complexes à travers des objets, des environnements et des instructions, et s'ils peuvent replanifier dans de nouveaux scénarios.
En termes de capacité, l'intelligence incarnée a déjà franchi la phase de "démonstration d'action unique" ; maintenant, les robots avancés peuvent effectuer des chaînes de compétences multiples, suivre des états et même replanifier après avoir subi des perturbations.
En termes d'intelligence, l'universalité des robots incarnés est clairement liée aux modèles, et les voies techniques pour les modèles sont loin de converger. Les entreprises leaders développent des voies telles que le modèle VLA (Vision-Language-Action) de bout en bout, le modèle d'action mondial (WAM), les systèmes d'exploitation d'agents incarnés hiérarchiques et les modèles fondamentaux incarnés inter-entity.
Parmi eux, les représentants du modèle VLA/WAM de bout en bout incluent Galaxy General, Qianxun Intelligent et Future Not Far. La caractéristique commune de cette approche est d'intégrer la vision, le langage, l'action et certaines prédictions d'état dans un modèle ou une représentation unifiée.
Le robot humanoïde bipède Galbot ET1 "Galaxy Star Boy" de Galaxy General, présenté à la WRC, utilise des compétences d'auto-apprentissage interactif d'Agent pour observer directement les actions humaines et imiter la danse et les mouvements dynamiques en temps réel. Il intègre également le cadre d'apprentissage de contrôle adversarial de tennis à haute dynamique "LATENT" de Galaxy General, permettant une pratique de tennis semblable à celle d'une personne réelle.
Soutenant ET1 dans l'imitation en temps réel d'actions humanoïdes continues telles que danser et jouer au tennis, AstraBrain WBC est le modèle de base cérébelleux responsable du contrôle du mouvement en temps réel de tout le corps au sein du système Galaxy Brain.
Plus précisément, lorsqu'un danseur fournit de nouveaux mouvements, ET1 reconnaît et extrait la trajectoire de mouvement en temps réel de la personne grâce à la reconnaissance visuelle, puis mappe les mouvements sur son propre corps. Il mime véritablement en temps réel, plutôt que de sélectionner une trajectoire d'une bibliothèque d'actions préchorégraphiées et de la rejouer.
Galaxy General possède actuellement le robot humanoïde bipède Galbot ET1, ainsi que d'autres robots comme Galbot G1 et S1 sous différentes formes. Il met l'accent sur l'utilisation d'"un cerveau à travers des corps, des tâches et des scènes". Ces robots ont leurs propres applications dans des scénarios tels que les maisons, le commerce de détail et l'industrie, mais partagent le même modèle fondamental d'intelligence incarnée. Différentes formes de robots possèdent leurs propres systèmes de contrôle de mouvement, tandis que leurs capacités de perception, de compréhension des tâches, de modélisation du monde et de planification des actions sont réutilisables.
Dans une interview, Galaxy General a mentionné qu'auparavant, lorsque les robots entraient dans une nouvelle scène, ils devaient souvent recollecter des données et se réentraîner autour de cette scène ; maintenant, le même modèle fondamental a commencé à être réutilisé à travers différents corps et tâches. Avec des données minimales pour l'adaptation, des robots à roues peuvent être utilisés, des robots lourds peuvent être utilisés, et lorsqu'ils sont passés à des robots bipèdes, le cerveau n'a pas besoin d'être réentraîné depuis le début.
Dans un avenir proche, basé sur AVLA, une boucle fermée de vision, de langage et d'action sera construite, lançant davantage le modèle d'action mondial auto-évolutif (WAM), permettant aux robots non seulement de comprendre et d'exécuter des tâches, mais aussi de prédire les résultats d'actions et d'itérer continuellement le modèle en utilisant des données d'exécution provenant de foyers réels.
Galaxy General a déclaré que, par exemple, dans un scénario de lessive, son modèle a été formé sur des dizaines de machines à laver et peut se généraliser à des centaines de modèles différents, types de portes et types de boutons. Des capacités de généralisation similaires sont également appliquées à des objets ménagers comme les vêtements et les jouets, permettant aux robots de compléter des tâches dynamiquement changeantes dans différents environnements domestiques.
La variable met en avant la polyvalence de son modèle WALL-B : il utilise le même modèle dans deux scénarios très différents — service à domicile et tri logistique. WALL-B intègre la vision, le langage, le toucher, l'action et la prédiction physique dans un réseau unifié, permettant aux robots de comprendre des lois physiques telles que la gravité, l'inertie et la friction, et d'anticiper les résultats d'actions.
Les explorations représentatives de l'architecture d'intelligence incarnée hiérarchique incluent la dynamique inter-articulaire COSA.
COSA 0.5 divise le cerveau du robot en trois couches : le Système 2 est responsable de la compréhension de la scène, de la mémoire, du raisonnement et de la planification des tâches ; le Système 1 appelle des compétences opérationnelles comme VLA ; le Système 0 effectue le contrôle du mouvement de tout le corps à jusqu'à 1000 Hz.
L'un des représentants des modèles fondamentaux incarnés inter-corporels est le Galaxy Map G0.5. Sur le site de la WRC, le R1 Lite équipé de G0.5 a complété des tâches nécessitant une compréhension de l'environnement, une décomposition des tâches, une opération à deux bras et une récupération d'anomalies pendant le mouvement. G0.5 adapte le même modèle à différents corps de robots grâce à un encodage d'action unifié.
Qianxun Intelligent utilise son Moz1 pour relever des défis de tâches à longue portée, comme "organiser un restaurant". Après avoir reçu un ordre, le robot doit continuellement compléter une série d'actions, y compris scanner l'environnement, récupérer un cola, se déplacer vers le réfrigérateur, ouvrir la porte pour le placer à l'intérieur, fermer la porte, puis envoyer la vaisselle sale au lave-vaisselle ; si l'objet cible est déplacé, obstrué ou si l'environnement déjà organisé est perturbé à nouveau, il percevra à nouveau et planifiera.
En termes de scénarios d'application, permettre aux robots d'entrer dans des maisons et des espaces publics comme des humains pour accomplir des tâches complexes est encore relativement immature, surtout lorsqu'il s'agit d'interaction directe avec les gens, où la sécurité doit être prise en compte. Cependant, dans des usines, des entrepôts et d'autres scénarios relativement fermés, les robots ont déjà été capables de compléter certaines tâches relativement complexes à longue portée.
Par exemple, l'ère Star Motion du Star Motion M7 a continuellement complété des actions telles que la reconnaissance aléatoire de colis, la saisie, le retournement de l'étiquette d'expédition et l'envoi dans le lien de convoyeur ; cette capacité a déjà été mise en œuvre dans des centres logistiques comme China Post, atteignant un maximum de 1200 articles par heure.
Les capacités générales de l'intelligence incarnée et les capacités de scène verticales ne sont pas mutuellement exclusives. Les robots peuvent s'adapter à diverses opérations non standard dans des scènes verticales du monde réel et fonctionner de manière stable, ce qui peut en fait alimenter l'amélioration des capacités générales.
De plus, les efforts de diverses entreprises dans l'évolution des modèles progressent des compétences uniques aux tâches à longue portée inter-corporelles et à la généralisation des environnements dynamiques.
Que ce soit la performance générale de l'intelligence incarnée ou la performance de scène verticale, les modèles nécessitent une grande quantité de données de haute qualité.
Les méthodes principales de collecte de données pour les robots incluent actuellement l'opération à distance, l'UMI non corporel et les gants de données, la collecte de perspective à la première personne et la capture de mouvement, et la collecte de corps de machine réelle, presque chacune d'entre elles impliquant du matériel. Certains plaisantent en disant que la collecte de données pour l'intelligence incarnée est devenue une entreprise matérielle.
En fait, l'importance des données ne réside pas dans les données elles-mêmes, mais dans le modèle, dans l'intelligence. Ce n'est que lorsque les données sont abondantes, de haute qualité et peuvent alimenter l'évolution du modèle, formant une boucle de données fermée et un flywheel de données dans la scène, que leur signification se manifeste véritablement.
Light Wheel Intelligence est l'une des entreprises leaders dans le domaine des données d'intelligence incarnée indépendante, construisant une boucle de données Real2Sim2Real autour des données de perspective à la première personne humaine, de la simulation physique, de l'évaluation à grande échelle et du retour d'information de la machine réelle.
Lors de cette WRC, Light Wheel Intelligence s'est concentré sur la présentation du système de simulation SimFoundry et du système d'évaluation RoboFinals. SimFoundry améliore la précision de simulation d'objets flexibles comme les vêtements et les câbles grâce à la mesure des paramètres d'objets réels et à des solveurs physiques auto-développés ; RoboFinals est utilisé pour les tests et évaluations à grande échelle des modèles de robots, permettant aux modèles de subir une vérification systématique avant d'entrer dans des scènes réelles.
L'opération à distance, l'UMI et la capture de mouvement sont des méthodes d'acquisition de données de haute qualité centrées sur l'humain, mais leurs coûts restent encore trop élevés et difficiles à répondre aux exigences de volume de données du modèle.
Il existe de nombreuses autres façons d'obtenir des données incarnées, comme s'appuyer sur des données vidéo, des données de jeux et les modèles du monde qui ont émergé au cours des 1-2 dernières années.
Excellent Vision suit la voie du modèle du monde, utilisant le modèle du monde comme un "amplificateur de données". GigaWorld génère en masse des données interactives nécessaires pour l'entraînement et les tests en déduisant les changements environnementaux basés sur les actions du robot ; GigaWorld-1 incorpore davantage la modélisation d'action et l'estimation des paramètres physiques pour améliorer la crédibilité des opérations telles que la saisie et la simulation de collision.
Ainsi, les données ne sont pas simplement une entreprise matérielle, mais englobent divers types et formes. De plus, par rapport à la simple collecte de données, fournir des données pour les modèles peut améliorer de manière plus significative les modèles d'intelligence incarnée en formant un flywheel de données, ce qui est difficile à réaliser pour des entreprises individuelles axées sur la collecte de données incarnées.
Pour former une boucle de données fermée et un flywheel de données, il est essentiel d'entrer dans des scènes spécifiques, de collaborer avec des robots et d'itérer et d'optimiser des modèles en utilisant des données générées réelles.
Par exemple, Galaxy General a construit la base de données "Galaxy Star Data (AstraData)", unifiant les données d'internet, les données de comportement humain, les données synthétiques de simulation, l'opération à distance de la machine réelle et les données de retour d'expérience de scène pour l'entraînement des modèles, et intégrant la vérification de scène et l'optimisation des retours d'expérience dans une boucle fermée. Son modèle cérébelleux général AstraBrain-WBC 0.5 a été formé en utilisant environ 20 000 heures et 2 milliards de cadres de données d'action humaine, avec des optimisations d'ingénierie résultant en une latence d'inférence de moins de 1,5 millisecondes et une latence de chaîne de capture de mouvement entière de moins de 20 millisecondes.
Le système de collecte de données 2.0 de Zhiyuan Robotics construit une pyramide de données réelles, non corporelles et multi-sources basée sur plus de 430 scènes réelles, plaçant l'évaluation des modèles, la mise en œuvre de scènes, les tests d'adaptation de scènes réelles et le retour d'expérience opérationnelle au sein du même système.
De plus, certaines startups à l'étranger permettent aux travailleurs sur site dans des environnements d'usine de corriger les robots sur place, puis de continuer à intégrer de nouveaux comportements dans le processus tout en collectant des données pour l'entraînement postérieur des modèles incarnés.
Des entreprises chinoises comme Galaxy General, Zhiyuan Robotics et d'autres progressent également dans cette direction. La tendance commune future des données incarnées pourrait être : la collecte de données passera de "usines de collecte de données centralisées" à "sites de déploiement de robots".
Des mains habiles, la perception tactile, la perception visuelle, les moteurs et les articulations — les progrès des composants clés montrent souvent à quel point l'industrie a réellement avancé. Dans le domaine des composants clés pour l'intelligence incarnée, les aspects les plus importants sont la manipulation fine et la perception, la perception tactile et visuelle étant les plus cruciales au sein de la perception.
Les mains habiles sont essentielles pour que les robots effectuent des opérations fines. Par exemple, les mains habiles Lingxin démontrent le cas de "l'assemblage d'une main habile avec une main habile" : le robot complète la saisie et l'assemblage de composants dans un espace confiné grâce à la reconnaissance visuelle, à la coordination des deux mains et à un contrôle de force précis, faisant avancer les mains habiles de la saisie à des opérations industrielles fines.
En même temps, les mains habiles Lingxin continuent d'améliorer les capacités des modèles. Elles nous informent qu'actuellement, dans des scénarios relativement définis tels que les supermarchés, les usines et la logistique, un certain degré de généralisation peut être atteint pour divers outils et processus, mais passer à des scénarios complètement différents nécessite encore un apprentissage supplémentaire.
Les mains habiles Lingxin se sont également aventurées dans les données incarnées ; le système Open TeleDex peut simultanément collecter des données visuelles, tactiles et proprioceptives pour former des modèles d'opération habile. Il résume la main habile idéale comme "ayant à la fois une main humaine et un cervelet humain" : en fin de compte, elle ne devrait pas seulement être capable de saisir différents objets, mais aussi de comprendre et d'utiliser différents outils.
La capacité principale de Paxini est la perception tactile. Elle utilise une puce de perception tactile 6D auto-développée, et cette fois Paxini a également présenté le capteur tactile multidimensionnel PX-FOOTRIX pour les semelles des pieds, ainsi que les produits tactiles multidimensionnels de quatrième génération basés sur la puce GEN4 FUSE, couvrant des formes comme les pinces et la peau électronique corporelle entière, élargissant encore la perception à l'ensemble du corps.
Derrière cela se trouve la recherche autonome complète de Paxini en conception structurelle, systèmes matériels et modèles algorithmiques. Sur cette base, Paxini a établi un lien complet de l'acquisition de signaux de perception tactile à la sortie de force tridimensionnelle et de force à six dimensions, permettant aux robots d'obtenir des informations tactiles de force plus stables, répétables et quantifiables.
L'application de la perception tactile revient à l'opération. Pacini a démontré sur place comment un robot humanoïde assemble de manière autonome un petit cheval avec la participation combinée de la vision et du toucher : d'abord en identifiant différentes formes de pièces, puis en jugeant la stabilité de la prise et l'exactitude de l'insertion en fonction de l'état de contact, et en ajustant dynamiquement la force.
Pacini a également étendu la perception tactile à la collecte de données. Le gant d'échantillonnage à cinq index PXCap Pro peut simultanément collecter des données visuelles, tactiles et de posture de la main, remappant le même ensemble de démonstrations humaines à différentes mains habiles, atteignant "une collecte unique, une réutilisation multi-machine".
De plus, Pacini a incorporé des données tactiles dans la base de données OmniSharing DB, un ensemble de données multimodales massif, en les utilisant aux côtés de données visuelles, de trajectoire, de posture, de voix et de texte pour l'entraînement des modèles incarnés. Notamment, les données tactiles multidimensionnelles peuvent enregistrer les changements de force et d'état lorsqu'une personne interagit avec un objet.
En termes de perception visuelle, Orbbec a présenté la série de caméras 3D à double lentille Gemini 330 destinée à l'intelligence incarnée, équipée de la puce moteur de profondeur auto-développée MX6800. Le dernier produit de vision robotique, Physis, est conçu spécifiquement pour les robots humanoïdes et les bras robotiques collaboratifs nécessitant une opération à long terme, fournissant des capacités de perception visuelle semblables à celles des humains et atteignant un équilibre optimal entre large champ de vision, imagerie de haute qualité, perception spatiale réelle et haute fiabilité.
En même temps, Orbbec a étendu ses capacités visuelles à la collecte de données incarnées, lançant une plateforme de collecte de données non corporelles qui intègre quatre formes : EGO, UMi, Wrsicam et Hub dans le même système : EGO enregistre la perspective à la première personne, WristCam capture la perspective proche du poignet, et UMi complète les actions d'interaction main-objet, formant un lien de données multi-perspective pour l'apprentissage par imitation et l'entraînement du modèle du monde.
Les mains habiles, la perception visuelle et d'autres capacités sensorielles sont cruciales car elles représentent le dernier centimètre pour la mise en œuvre pratique de l'intelligence incarnée. Même si un modèle est hautement intelligent, sans une bonne main habile, un robot ne peut pas effectuer des opérations délicates comme un humain. Sans perception, un robot devient aveugle, complètement inconscient de ce qu'il doit faire.
Nous observons également que les entreprises dans les domaines des mains habiles et de la perception traversent vers les données d'intelligence incarnée, indiquant la soif intense de données de l'industrie.
La vague d'intelligence incarnée nous rappelle le boom de la vision par ordinateur et de la conduite autonome d'il y a une décennie. À cette époque, le marché croyait également que la technologie deviendrait rapidement répandue en quelques années, mais il y avait un écart significatif entre les capacités de laboratoire et les produits stables, à faible coût et évolutifs.
Il a fallu plus d'une décennie pour que la conduite autonome commence à fonctionner commercialement dans Robotaxi dans quelques villes et régions. Bien que cela ne prouve pas que l'intelligence incarnée répétera le même processus, cela met en évidence un modèle :
Les boums technologiques conduisent souvent les gens à surestimer la vitesse de mise en œuvre récente tout en sous-estimant potentiellement l'impact à long terme sur l'industrie.
L'intelligence incarnée est encore à un stade précoce de transition de la validation des prototypes à la validation des produits. Dans les années à venir, elle pourrait d'abord se concrétiser dans des scénarios structurés tels que les usines, la logistique, l'inspection et les services commerciaux, tandis que l'entrée véritable dans les foyers et la vie quotidienne prendra plus de temps. Cela est dû au fait que l'intelligence incarnée combine matériel et logiciel et est une ingénierie système avec une longue chaîne industrielle, rendant les percées dans des domaines individuels difficiles à propulser rapidement l'ensemble de l'industrie.
D'autre part, la Chine dispose d'une chaîne d'approvisionnement robotique relativement complète, de capacités de fabrication, de talents en ingénierie et d'une richesse de scénarios du monde réel, ce qui peut raccourcir les cycles de production d'essai de machines, de réduction des coûts, de déploiement de scènes, d'acquisition de données et d'itération de produits.
Ces conditions ne garantissent pas qu'une entreprise ou une voie particulière réussira, mais elles permettent à la Chine de continuer à pousser les robots dans des scénarios du monde réel, complétant la validation technologique, d'ingénierie et commerciale.
Le boom finira par s'estomper, et l'entrée de l'intelligence incarnée dans la vie des gens ordinaires pourrait prendre plus de temps que le marché ne l'attend. Cependant, lorsque les robots commenceront réellement à travailler dans des usines, des entrepôts et des maisons, l'histoire de l'intelligence incarnée ne fait que commencer.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























