Rapport de CoinWorld :
Faire apprendre à un robot à "prendre un verre" semble être une instruction simple, mais en réalité, cela implique une longue série de tâches complexes.
D'abord, une personne doit porter un appareil de collecte et effectuer la tâche. La caméra enregistre la première personne, et l'appareil trace le mouvement de la main, la position et l'orientation de la pince. Après le retour de la vidéo, il faut corriger la distorsion de l'objectif fisheye, restaurer la position et l'orientation, découper les actions "tendre la main --- approcher --- saisir --- soulever" en plusieurs segments, puis attribuer des étiquettes utilisables par la machine à chaque segment. Si une seule étape échoue, cette démonstration pourrait être inutile.
Les grands modèles de langage ont au moins une vaste base de données Internet à leur disposition. Les robots, eux, n'en ont pas. Comment ouvrir une porte, plier une serviette, où saisir un emballage souple, chaque mouvement doit d'abord se produire dans le monde physique.
Qingche Intelligent a récemment établi une ligne de traitement de données robotiques dans le cloud avec Alibaba Cloud, cherchant à relier la calibration, la reconstruction, la découpe, l'annotation et l'entraînement des données collectées. Bien que les nouvelles ne soient pas aussi captivantes que les robots effectuant des acrobaties, elles se rapprochent davantage des goulots d'étranglement de cette industrie.
Un ou deux chercheurs peuvent traiter des vidéos de plusieurs dizaines de minutes en utilisant des scripts et des dossiers. Lorsque les données atteignent plusieurs centaines d'heures, les problèmes commencent : faut-il recalculer toute une tâche après un échec ? Combien de fois le même fichier a-t-il été modifié ? Quelle version des données a été utilisée pour quel modèle ? Si les résultats de l'entraînement ne sont pas satisfaisants, peut-on retracer un type spécifique d'action de collecte ?
Ces questions ressemblent à la routine quotidienne d'un département informatique d'entreprise, mais les entreprises d'intelligence incarnée ne peuvent pas les éviter. Les données des robots proviennent du monde réel, et si une erreur de collecte se produit, on ne peut pas simplement rafraîchir la page pour recommencer ; elles sont également étroitement liées au matériel. Changer un bras robotique, un ensemble de caméras, ou même une pince, peut rendre des mouvements auparavant fluides inefficaces.
Ce que la chaîne de production dans le cloud peut faire, c'est transformer une série de tâches éparpillées en un processus structuré. Elle peut activer des ressources lorsque des GPU sont nécessaires et les libérer une fois le traitement terminé ; si une étape échoue, elle peut reprendre à partir du point d'arrêt ; les données, les paramètres matériels et les versions de traitement sont conservés dans le même enregistrement. Cela ne rendra pas les mauvaises données meilleures, mais cela permettra aux ingénieurs de savoir où se situe le problème.
Prenons l'exemple de la calibration de la caméra : si une même série de vidéos utilise des paramètres incorrects, la récupération de la position et la découpe des actions suivantes seront contaminées. La méthode traditionnelle pourrait attendre que l'entraînement du modèle échoue avant de revenir en arrière pour enquêter ; avec une chaîne de production complète, le système peut au moins localiser quel appareil, quelle collecte, et quelle version des paramètres a posé problème, ne recalculant que la partie affectée. Pour une équipe qui ajoute quotidiennement une grande quantité de données, cette traçabilité est plus importante que de gagner quelques minutes sur un traitement unique.
Les données nécessitent également un ensemble de "contrôle de qualité". Les démonstrations humaines ne sont pas intrinsèquement correctes : les mouvements peuvent être hésitants, des étapes clés peuvent être cachées par le corps, et la description verbale d'une même tâche peut également être incohérente. L'annotation entièrement automatique peut accélérer le processus, mais elle peut également reproduire des erreurs à une échelle plus grande. Une approche plus réaliste consiste à laisser la machine traiter la majorité des échantillons réguliers, puis à confier les trajectoires à faible confiance, les anomalies et les cas d'échec à une vérification humaine.
Les résultats du contrôle de qualité doivent également guider la collecte. Si une certaine lumière ne permet pas de voir clairement, il faut refaire des prises dans cette lumière ; si un certain angle de saisie échoue fréquemment, l'opérateur doit le couvrir spécifiquement. La collecte ne doit plus être une accumulation de temps sans but, mais plutôt un renforcement autour des points faibles du modèle.
Ces deux dernières années, l'industrie des robots aime rapporter "combien d'heures de données réelles" ont été accumulées. Ce chiffre ressemble de plus en plus aux anciens paramètres de modèle : grand, mais pas nécessairement révélateur.
Dix mille heures à déplacer des caisses ne sont pas forcément plus utiles que cent heures à couvrir soigneusement les limites d'échec. La démonstration la plus fluide peut être rapidement apprise, mais le défi réside dans la gestion des situations où le verre glisse, le sac se dégonfle, ou la lumière change. C'est seulement en ramenant les échecs sur le terrain dans le système d'entraînement et en renvoyant les nouvelles stratégies aux robots que les données commencent à former une boucle fermée.
Cette boucle fermée pourrait devenir l'élément le plus difficile à reproduire pour les entreprises d'intelligence incarnée. Les vidéos de démonstration peuvent être apprises, les bras robotiques peuvent être achetés, et les modèles de base peuvent même être open source. Cependant, les anomalies accumulées sur le terrain, les enregistrements de calibration, les échantillons d'échec et l'expérience de déploiement ne seront pas automatiquement diffusés avec un article de recherche.
L'outil public de Qingche couvre tout, de la collecte de données à l'entraînement et au déploiement des modèles, ce qui montre qu'il ne parie pas seulement sur un "cerveau universel pour robots". Il veut également vendre des pelles : permettre aux robots d'autres entreprises de collecter des données, d'entraîner des modèles et de faire des déploiements dans cet ensemble d'outils.
La viabilité de cette entreprise de "vente de pelles" dépend de la volonté des clients de confier leurs données essentielles à la même plateforme. Les grandes entreprises peuvent préférer construire leurs propres systèmes, craignant que les processus de production et les flux de travail ne soient divulgués ; les entreprises de robots de plus petite taille ont du mal à maintenir une équipe d'ingénierie de données. La plateforme doit offrir un choix entre efficacité et contrôle, par exemple, un déploiement privatisé, une isolation des permissions, et des limites claires sur l'utilisation des données pour des modèles spécifiques.
Les risques sont également réels. Les vidéos et les données des capteurs envoyées dans le cloud peuvent rencontrer des problèmes de confidentialité et de sécurité des données dans les usines ; la puissance de calcul nécessaire pour la reconstruction à grande échelle n'est pas bon marché ; et il n'y a pas encore de réponse standard sur combien de données peuvent être réutilisées entre différents matériels.
Mais une chose est déjà difficile à éviter : pour que les robots entrent dans les usines et les foyers, les ingénieurs ne peuvent pas toujours compter sur le transfert manuel de fichiers en arrière-plan.
La prochaine fois que vous verrez une entreprise annoncer "combien d'heures de données ont été accumulées", n'hésitez pas à poser trois questions supplémentaires : combien de temps une compétence met-elle à être mise en ligne, combien de jours un échantillon d'échec peut-il être réintégré, et combien de données restent utilisables si une machine est remplacée. C'est cela qui représente réellement ce que cette chaîne de production produit chaque jour.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
![[Exclusif] Les échanges de cryptomonnaies étrangers 'non recherchables' en Corée... 65 sur Google et 56 sur Apple](/public-static/35_4563712fa2.png?format=avif)




























