Si no viniste, definitivamente debes verlo; si viniste y no lo miraste, fue en vano.
Autores: Bai Shi, Zhou Yongliang, Geek Park
Editores: Zhou Yongliang, Li Yuan
El 19 de agosto, en Beijing, el aire de Yizhuang estaba impregnado de una extraña emoción, ya que era el día de apertura de la Conferencia Mundial de Robótica 2026. Más de 300 empresas y más de 2000 exhibiciones casi abarcaron todo lo que la industria de la inteligencia encarnada puede ofrecer: grandes modelos, entidades, componentes clave, datos, todo lo que se puede imaginar.
El día de la apertura, Yushu Technology salió a bolsa, alcanzando un valor de mercado de más de 400 mil millones de yuanes en su punto más alto, lo que podría ser el día más cercano a una "fiebre del capital" en la industria robótica china en la última década. En el pasado, las empresas de robótica existían más en laboratorios, noticias de financiamiento y videos de demostración; sin embargo, la salida a bolsa de Yushu marcó un punto de anclaje de capital en esta pista que aún se encuentra en sus inicios.
Además, Cloud Deep Technology ha entrado en la etapa de aceptación o revisión en la bolsa; mientras que Zhiyuan Robotics confirmó en julio de 2026 que iniciaría el proceso de salida a bolsa en Hong Kong. El entusiasmo del mercado primario se está transmitiendo al mercado secundario, y la inteligencia encarnada ya no es solo una imaginación técnica, sino que también se le exige responder preguntas sobre ingresos, entregas, márgenes de beneficio y escalabilidad.
Al recorrer toda la exhibición, como habíamos anticipado, este año no hubo momentos que hicieran que todos dijeran "wow"; más bien, se trató de demostraciones de productos. Yushu no mostró el "superhombre" que acaba de lanzar, capaz de saltar 2 metros y correr a 12.66 metros por segundo; en su lugar, la exhibición se centró más en productos existentes desbloqueando nuevos movimientos; Zhongqing llevó una jaula octogonal al evento, y Weita Power utilizó ídolos de dos dimensiones para atraer atención... La animación fue real, pero pocas personas volvieron a hablar de "rupturas disruptivas".
En lugar de seguir preguntando "¿cuándo habrá un milagro?", es más valioso cuestionar algunas preguntas más simples: ¿los robots solo pueden parecerse a los humanos? ¿Hasta dónde ha llegado la "universalidad" de la inteligencia encarnada? ¿Los datos están pasando de ser un negocio de algoritmos a un negocio de hardware? ¿Cuántos pasos han avanzado los componentes clave que se esconden en los dedos, articulaciones y motores?
Con estas preguntas en mente, recorrimos el pabellón y tuvimos conversaciones profundas con varias empresas representativas. No todas ellas son las más ruidosas, pero cada una representa cambios clave que están ocurriendo en esta pista: la diversificación de las formas de las entidades, la competencia de modelos universales, la reconstrucción de bucles de datos y la aproximación de componentes clave a "el último centímetro".
En el stand de Galaxy Universal, tres tipos de robots completamente diferentes: de ruedas, de carga pesada y bípedos, utilizan el mismo gran modelo básico encarnado; Weita Power, por su parte, partió de escenarios de uso real para desarrollar su primer robot humanoide, Vbot ATOM; Self Variable, en el escenario de clasificación logística, logró una eficiencia de 1816 piezas por hora con una precisión superior al 98%; y Pacini ha ampliado su solución técnica para resolver la "tacto" en una red de percepción que cubre todo el cuerpo...
La inteligencia encarnada sigue siendo temprana, incluso más de lo que muchos esperaban. Está entrando en una fase más difícil y valiosa; quien pueda formar un ciclo cerrado entre modelos, entidades, componentes y capacidades de ingeniería, será quien pueda convertirse en una empresa verdaderamente valiosa en la próxima etapa.
En los últimos dos años, la narrativa de la inteligencia encarnada ha sido dominada por los robots humanoides: bailando, corriendo, boxeando, maratones, casi todos los eventos destacados tienen una apariencia humana.
Pero tras asistir a esta WRC, te darás cuenta de que el concepto de robot humanoide sigue expandiéndose: gigantes, biomiméticos, centauros... "parecer humano" ya no tiene una única respuesta estándar. Al mismo tiempo, más empresas están comenzando a rediseñar la forma de los robots según tareas reales. (Nota: el video se puede ver en el enlace original)
Este año, en la WRC, Yushu realmente compitió ferozmente en el lado humanoide, trayendo nuevos movimientos de combate. G1 lucha, combinando puñetazos, patadas giratorias y patadas voladoras, todo gracias a la coordinación en tiempo real de todas las articulaciones; H2, con un tamaño mayor y una salida de articulaciones más fuerte, tiene un golpe y una patada que se sienten más contundentes. Al observar los dos robots juntos, se puede ver claramente la diferencia entre "agilidad" y "fuerza".
La interacción de ping-pong también es digna de ver; el robot debe "entender" la pelota que viene antes de decidir cómo responder, lo que requiere más que simplemente seguir un patrón, sino una combinación de percepción y toma de decisiones. Además, con el sistema de combate de control remoto de cuerpo completo, los movimientos del operador pueden ser reproducidos con precisión, lo que en realidad es parte del ciclo de datos de inteligencia encarnada que Yushu está construyendo.
Pero lo más llamativo es el GD01, un mecha de tres metros de altura que puede transformarse y llevar personas. No es humanoide, ni cuadrúpedo tradicional, sino que combina tecnología robótica y formas de equipamiento, dirigido directamente a escenarios de turismo cultural y operaciones especiales.
En esta WRC, Vbot Weita Power lanzó oficialmente su terminal de inteligencia encarnada humanoide Vbot ATOM y comenzó a aceptar reservas. Es importante notar que no comenzó como un prototipo conceptual, sino que se basa en la definición de producto, entrega en masa y capacidad operativa de usuarios que ya se ha validado en el robot cuadrúpedo "Datuo".
En mayo de este año, el perro robot de carga AI "Datuo" logró producción en masa y entrega. Hasta ahora, este producto se ha convertido en el número uno en ventas de inteligencia encarnada de consumo, completando un total de 1.26 millones de interacciones con el gran modelo, 23,700 kilómetros de acompañamiento de usuarios y 131,500 horas de compañía, y en los últimos tres meses ha completado 4 actualizaciones OTA. Para la industria de la inteligencia encarnada, el significado de estos datos no solo radica en las ventas, sino que demuestra que Vbot ha llevado a los robots a la vida real de los usuarios, formando un ciclo de producto desde la entrega, retroalimentación de uso hasta iteración continua.
Basado en la práctica de "Datuo", Vbot ATOM no ha seguido el enfoque tradicional de los robots humanoides industriales, sino que ha redefinido la forma del producto desde escenarios de vida como el hogar, el comercio minorista, los espacios públicos y los servicios de oficina. Con una altura de 160 cm, una envergadura de 180 cm, una longitud de pierna de 95 cm y 31 grados de libertad, se determina que tiene una capacidad de servicio cercana a la escala humana; el recubrimiento de tela, el diseño de interacción de estado y la base silenciosa lo hacen parecer más amigable en entornos familiares y públicos, además de ser más fácil de aceptar por las personas.
En términos técnicos, Vbot también lanzó el sistema de modelos encarnados "Vbot Embodied Genome" y tres modelos centrales, que apoyan la comprensión de la interacción, la toma de decisiones del modelo del mundo, la evolución entre entidades y el retroceso de retroalimentación real.
Por lo tanto, la llegada de Vbot ATOM no solo significa que Vbot se ha extendido de robots cuadrúpedos a robots humanoides, sino que también implica que está llevando su capacidad de producto validada a un espacio de vida más grande, impulsando a los robots humanoides desde la exhibición de entidades hacia un momento de comercialización.
El robot de Future Not Far está completamente diseñado en torno a las necesidades del hogar, capaz de realizar tareas domésticas básicas, acompañar a niños, cuidar a ancianos y atender mascotas. Actualmente, ya han ingresado a más de 500 hogares de pago, acumulando más de 50,000 horas de servicio.
Future Not Far también mostró su capacidad de iteración rápida en escenarios familiares; hace un mes en WAIC, se centraron en tareas domésticas básicas como lavar, doblar y almacenar ropa, mientras que en el evento de WRC, ampliaron el escenario a la cocina: el segundo robot de pila completa, F2, que incorpora el nuevo modelo de acción WAM, completó de manera autónoma la preparación de pasta.
El proceso completo de cocción requiere una alta capacidad de colaboración, precisión y juicio del robot: necesita sincronización de alta precisión entre ambos brazos; debe hacer juicios instantáneos sobre las cantidades basándose en la visión para manejar operaciones de fluidos irreversibles; al mismo tiempo, necesita cambiar, agarrar y reemplazar diversos utensilios de cocina de manera flexible, y aprender de manera autónoma sobre el tiempo de cocción, que no tiene una respuesta estándar de "sensibilidad humana". El robot de Future Not Far demostró su increíble estabilidad al cocinar de manera continua en el evento.
Future Not Far indicó que desde la entidad, el cerebro hasta el hardware, adoptan un enfoque de desarrollo de pila completa de hardware y software, por lo que la iteración en nuevos escenarios es más rápida. Además de expandirse gradualmente de tareas ligeras a tareas más pesadas, su comprensión de las necesidades en escenarios familiares también incluye cubrir necesidades básicas para niños, ancianos y mascotas; en el evento, también mostraron operaciones de varios juegos de mesa como el Go y el ajedrez, abrir bebidas, juegos interactivos, así como trabajo colaborativo entre dos máquinas, etc. La fuerte aplicabilidad y la interactividad de su stand siempre atrajeron multitudes.
Self Variable Robotics actualmente se centra en dos escenarios: el hogar y la logística. En el escenario logístico, no utilizan un robot humanoide completo y una mano hábil de cinco dedos, sino que emplean dos brazos mecánicos con un garfio común para manejar paquetes reales con formas, pesos y materiales aleatorios.
Su robot decide cómo manejar los paquetes según las características físicas del paquete: los artículos pequeños se agarran directamente, las cajas pesadas se empujan, y cuando se encuentran con objetos de forma irregular como un oso de peluche sin etiqueta, también juzgará el proceso posterior y lo manejará de forma autónoma. En una transmisión en vivo anterior, este sistema funcionó continuamente durante una hora, logrando una eficiencia de clasificación de 1816 piezas por hora y una precisión superior al 98%.
Self Variable enfatizó en una entrevista en el evento que su robot ya está en aplicación práctica: los robots domésticos ya están sirviendo a los hogares de los usuarios a gran escala; la clasificación logística también ha sido adoptada por empresas líderes.
La universalidad de la inteligencia encarnada, o la capacidad de tareas generales, se refiere a si los robots de inteligencia encarnada pueden completar tareas complejas a través de objetos, entornos e instrucciones, y si pueden replanificar en nuevos escenarios.
Desde la perspectiva de capacidades, la inteligencia encarnada ha superado la fase de "demostración de acción única"; ahora, los robots avanzados pueden completar una serie de habilidades múltiples, seguimiento de estados, e incluso pueden replanificar después de experimentar perturbaciones.
En términos de inteligencia, la universalidad de los robots encarnados está claramente relacionada con los modelos, y actualmente, la ruta técnica de los modelos aún no se ha consolidado. Las principales empresas están desarrollando rutas como VLA (modelo de visión-lenguaje-acción) de extremo a extremo, WAM (modelo de acción del mundo), sistemas operativos de agentes encarnados jerárquicos, y modelos básicos encarnados entre entidades, entre otros.
Entre ellos, los representantes de VLA/WAM de extremo a extremo son Galaxy Universal, Qianxun Intelligent y Future Not Far. El punto en común de este enfoque es intentar integrar visión, lenguaje, acción y parte de la predicción de estado en un modelo o representación unificada.
Galaxy Universal presentó en la WRC su robot humanoide bípedo Galbot ET1 "Galaxy·Star Boy", que utiliza habilidades de autoaprendizaje interactivas de agente para observar directamente los movimientos humanos y luego imitar en tiempo real danzas y movimientos dinámicos; también integra el marco de aprendizaje de movimiento de control de tenis de alta dinámica "LATENT" de Galaxy Universal, lo que permite entrenar a los usuarios en tenis con una sensación real.
El ET1, que apoya la imitación en tiempo real de movimientos continuos como bailar y jugar al tenis, es el AstraBrain WBC, un modelo de base del cerebelo responsable del control del movimiento corporal en el sistema de cerebro estelar.
En concreto, cuando un bailarín presenta un nuevo movimiento, el ET1 lo reconoce visualmente y extrae la trayectoria de movimiento en tiempo real, mapeando luego el movimiento a su propio cuerpo. Realmente está imitando en tiempo real, no simplemente seleccionando una trayectoria de un banco de movimientos preprogramados para reproducirla.
Galaxy General actualmente cuenta con el robot humanoide bípede Galbot ET1, así como otros robots de diferentes formas como Galbot G1 y S1. Se enfatiza el uso de "un cerebro que cruza cuerpos, tareas y escenarios". Estos robots tienen aplicaciones en entornos domésticos, minoristas e industriales, pero comparten un mismo modelo de inteligencia corporal básico. Aunque los diferentes tipos de robots tienen sus propios sistemas de control de movimiento, sus capacidades de percepción, comprensión de tareas, modelado del mundo y planificación de acciones son reutilizables.
En una entrevista, Galaxy General mencionó que anteriormente, cuando un robot entraba en un nuevo escenario, a menudo necesitaba recopilar datos y reentrenarse en torno a ese escenario; ahora, el mismo modelo básico ha comenzado a reutilizarse entre diferentes cuerpos y tareas. Con una pequeña cantidad de datos para la adaptación, los robots de ruedas pueden funcionar, los robots de carga pesada pueden funcionar, y al cambiar a un robot bípede, el cerebro no necesita ser reentrenado desde cero.
El futuro no está lejos. Anteriormente, se construyó un bucle cerrado de extremo a extremo basado en AVLA que integra visión, lenguaje y acción, y sobre esta base se lanzará el Self-Evolving WAM (Modelo de Acción Mundial Autoevolutivo), permitiendo que los robots no solo comprendan y ejecuten tareas, sino que también predigan los resultados de las acciones y utilicen datos de ejecución en hogares reales para iterar continuamente el modelo.
Tomando como ejemplo el escenario de lavandería, su modelo, tras entrenarse con decenas de tipos de lavadoras, ya puede generalizarse a cientos de modelos diferentes, tipos de apertura de puertas y tipos de botones. Una capacidad de generalización similar también se aplica a prendas, juguetes y otros objetos domésticos, permitiendo que los robots completen tareas dinámicamente cambiantes en diferentes entornos familiares.
El modelo WALL-B de la empresa se centra en su versatilidad: en dos escenarios muy diferentes, como el servicio doméstico y la clasificación logística, se ejecuta el mismo modelo. WALL-B fusiona visión, lenguaje, tacto, acción y predicción física en una red unificada, permitiendo que el robot comprenda leyes físicas como la gravedad, la inercia y la fricción, y prediga los resultados de las acciones.
Una exploración representativa de la arquitectura de inteligencia corporal jerárquica incluye la dinámica COSA.
COSA 0.5 divide el cerebro del robot en tres capas: el Sistema 2 se encarga de la comprensión del escenario, la memoria, el razonamiento y la programación de tareas; el Sistema 1 invoca habilidades operativas como VLA; y el Sistema 0 controla el movimiento corporal a una frecuencia máxima de 1000Hz.
Uno de los modelos básicos corporales trans-cuerpo es el G0.5 de Star Sea Map. En el sitio de WRC, el R1 Lite equipado con G0.5 completó la comprensión del entorno necesaria para la organización de tareas, la descomposición de tareas, la operación con dos brazos y la recuperación de anomalías durante su movimiento. G0.5 adapta el mismo modelo a diferentes cuerpos de robots a través de una codificación de acción unificada.
Xunqi Intelligent desafía tareas de largo alcance con su Moz1, como "organizar un restaurante"; tras recibir una instrucción, el robot debe completar una serie de acciones como observar el entorno, tomar una Coca-Cola, moverse hacia el refrigerador, abrir la puerta para colocarla, cerrar la puerta y luego llevar los platos sucios al lavavajillas. Si el objeto objetivo es movido, bloqueado o el entorno ya organizado se desordena nuevamente, también volverá a percibir y planificar.
En términos de escenarios de aplicación, hacer que los robots ingresen a espacios domésticos y públicos como humanos para completar tareas complejas aún tiene un nivel de madurez relativamente bajo, especialmente cuando se trata de interacciones directas con personas, donde se debe considerar la seguridad. Sin embargo, en fábricas, almacenes y otros escenarios relativamente cerrados, los robots ya pueden completar algunas tareas complejas de largo alcance.
Por ejemplo, el Star M7 de Star Motion Epoch completó en el sitio acciones como identificación de paquetes aleatorios, captura, inversión de etiquetas y envío a la cadena de transmisión; esta capacidad ya se ha implementado en centros logísticos como China Post, alcanzando hasta 1200 piezas por hora.
Las capacidades generales de la inteligencia corporal y las capacidades en escenarios verticales no son mutuamente excluyentes; los robots en escenarios verticales del mundo real se adaptan a diversas operaciones no estándar y pueden operar de manera estable, lo que en realidad puede retroalimentar la mejora de las capacidades generales.
Además, los esfuerzos de las empresas en la evolución de modelos avanzan desde habilidades individuales hacia la generalización en tareas de largo alcance y entornos dinámicos.
Tanto el rendimiento general de la inteligencia corporal como el rendimiento en escenarios verticales requieren grandes cantidades de datos de alta calidad.
La recopilación de datos de robots, actualmente, se realiza principalmente a través de teleoperación, UMI sin cuerpo y guantes de datos, captura desde el primer punto de vista y captura de movimiento, así como recopilación de datos de cuerpos reales; casi cada uno de estos métodos implica hardware, y algunos bromean diciendo que la recopilación de datos de inteligencia corporal se está convirtiendo en un negocio de hardware.
En realidad, la importancia de los datos no radica en los datos en sí, sino en el modelo, en la inteligencia. Solo cuando los datos son suficientes, de alta calidad, pueden retroalimentar la evolución del modelo y formar un bucle cerrado de datos y un volante de datos en el escenario, su significado se manifiesta verdaderamente.
Light Wheel Intelligent es una de las principales empresas en el campo de la recopilación de datos de inteligencia corporal, construyendo un bucle cerrado Real2Sim2Real en torno a datos de primera persona, simulación física, evaluación a gran escala y retroalimentación de máquinas reales.
En esta WRC, Light Wheel Intelligent destacó el sistema de simulación SimFoundry y el sistema de evaluación RoboFinals. SimFoundry mejora la precisión de la simulación de objetos flexibles como ropa y cables mediante la medición de parámetros de objetos reales y un solucionador físico desarrollado internamente; RoboFinals se utiliza para pruebas y evaluaciones a gran escala de modelos de robots, permitiendo que los modelos sean verificados sistemáticamente antes de ingresar a escenarios reales.
La teleoperación, UMI y la captura de movimiento son métodos de adquisición de datos de alta calidad centrados en el ser humano, pero sus costos siguen siendo demasiado altos, lo que dificulta satisfacer la demanda de datos del modelo.
Existen muchas otras formas de obtener datos de inteligencia corporal, como a través de datos de video, datos de juegos y los modelos del mundo que han surgido en los últimos 1-2 años.
Excellent Vision sigue la ruta del modelo del mundo, utilizando el modelo del mundo como "amplificador de datos". GigaWorld genera en masa datos de interacción necesarios para el entrenamiento y la prueba al deducir cambios en el entorno según los movimientos del robot; GigaWorld-1 agrega modelado de acciones y estimación de parámetros físicos, mejorando la credibilidad de las simulaciones de operaciones como captura y colisión.
Por lo tanto, los datos no son simplemente un negocio de hardware, sino que existen en múltiples tipos y formas. Además, en comparación con la simple recopilación de datos, proporcionar datos para el modelo puede ser más significativo para la mejora del modelo de inteligencia corporal, ya que puede formar un volante de datos, algo que es difícil de lograr para una sola empresa centrada en la recopilación de datos de inteligencia corporal.
Para formar un bucle cerrado de datos y un volante de datos, es necesario ingresar a escenarios específicos y colaborar con los robots, utilizando los datos generados en la realidad para iterar y optimizar el modelo.
Por ejemplo, Galaxy General ha construido la base de datos "AstraData", unificando datos de internet, datos de comportamiento humano, datos sintéticos de simulación, teleoperación de máquinas reales y datos de retroalimentación de escenarios reales para el entrenamiento de modelos, y accediendo a la verificación de escenarios y la optimización de retroalimentación en un bucle cerrado. Su modelo de cerebro general AstraBrain-WBC 0.5 se entrenó utilizando aproximadamente 20,000 horas y 2,000 millones de cuadros de datos de acciones humanas, y tras la optimización de ingeniería, la latencia de inferencia es inferior a 1.5 milisegundos, y la latencia de toda la cadena de captura de movimiento es inferior a 20 milisegundos.
El sistema de recopilación de datos 2.0 de Zhiyuan Robot se basa en más de 430 escenarios reales para construir una pirámide de datos de máquinas reales, sin cuerpo y de múltiples fuentes, y coloca la evaluación del modelo, la implementación de escenarios, las pruebas de adaptación en el mundo real y la retroalimentación de datos en el mismo sistema.
Más allá de eso, hay empresas emergentes en el extranjero que permiten a los trabajadores en el entorno de la fábrica corregir a los robots en el lugar, luego integran el nuevo comportamiento en el proceso y recopilan datos para realizar un entrenamiento posterior en el modelo de inteligencia corporal.
Galaxy General, Zhiyuan y otras empresas chinas también están avanzando en esta dirección, y la tendencia futura de los datos de inteligencia corporal podría ser: la recopilación de datos pasará de "fábricas de recopilación de datos centralizadas" a "escenarios de despliegue de robots".
Las mejoras en componentes clave como manos hábiles, percepción táctil, percepción visual, motores y articulaciones suelen mostrar más claramente los verdaderos avances de la industria. En el campo de los componentes clave de la inteligencia corporal, las operaciones precisas y la percepción son las más importantes, siendo la percepción táctil y visual las más relevantes.
Las manos hábiles son clave para que los robots realicen operaciones precisas. Por ejemplo, Lingxin Qiaoshou mostró un caso de "ensamblar manos hábiles con manos hábiles": el robot, a través de reconocimiento visual, colaboración de ambas manos y control de fuerza preciso, completó la captura y el ensamblaje de componentes en un espacio reducido, llevando las manos hábiles de la captura a operaciones industriales precisas.
Al mismo tiempo, Lingxin Qiaoshou también está mejorando continuamente las capacidades del modelo. Nos dice que actualmente, en escenarios relativamente claros como supermercados, fábricas y logística, ya se puede lograr un cierto grado de generalización para múltiples herramientas y procesos, pero aún se necesita seguir aprendiendo para cruzar a escenarios completamente diferentes.
Lingxin Qiaoshou también se ha involucrado en datos corporales; el sistema Open TeleDex puede recopilar simultáneamente datos visuales, táctiles y de percepción corporal para entrenar modelos de operaciones hábiles. Resume la mano hábil ideal como "debe tener una mano humana y también un cerebro humano": al final, no solo debe poder agarrar diferentes objetos, sino también comprender y utilizar diferentes herramientas.
La capacidad central de Pashini Perception es la percepción táctil. Utiliza un chip de percepción táctil 6D desarrollado internamente, y esta vez Pashini también mostró un sensor táctil multidimensional PX-FOOTRIX para la planta del pie, así como productos táctiles multidimensionales de cuarta generación basados en el chip GEN4 FUSE, cubriendo formas como pinzas y piel electrónica corporal, ampliando aún más la percepción a todo el cuerpo.
Detrás de esto está el desarrollo completo de Pashini en diseño estructural, sistemas de hardware y modelos algorítmicos. Sobre esta base, Pashini ha conectado la cadena completa desde la captura de señales de percepción táctil hasta la salida de fuerzas tridimensionales y seis dimensiones, permitiendo que los robots obtengan información de fuerza táctil más estable, repetible y cuantificable.
La aplicación del sentido del tacto regresa a la operación, donde Pasini mostró en vivo cómo un robot humanoide ensambla de forma autónoma un pequeño caballo, utilizando tanto la visión como el tacto: primero identifica las diferentes formas de las piezas, luego determina si el agarre es estable y si la inserción está en su lugar según el estado de contacto, ajustando dinámicamente la fuerza.
Pasini también extendió el sentido del tacto a la recolección de datos, presentando el guante PXCap Pro que puede recopilar simultáneamente datos visuales, táctiles y de postura de la mano, y re-mapeando la misma demostración humana a diferentes manos hábiles, logrando "una recolección, múltiples reutilizaciones".
Además, Pasini incorporó los datos táctiles en la base de datos OmniSharing DB, un conjunto de datos multimodal de miles de millones, que se utiliza junto con datos visuales, de trayectoria, postura, voz y texto para el entrenamiento de modelos corporales. Un aspecto notable es la recopilación de datos táctiles multidimensionales, que puede registrar la fuerza y los cambios de estado al contacto entre humanos y objetos.
En cuanto a la percepción visual, Orbbec presentó la serie Gemini 330 de cámaras 3D estéreo orientadas a la inteligencia corporal, equipadas con su propio chip de motor de profundidad MX6800; el último producto de visión robótica, Physis, diseñado específicamente para aplicaciones de inteligencia corporal que requieren funcionamiento prolongado, proporciona capacidades de percepción visual cercanas a las humanas, logrando un equilibrio extremo entre un amplio campo de visión, imágenes de alta calidad, percepción espacial real y alta fiabilidad.
Al mismo tiempo, Orbbec también extendió sus capacidades visuales a la recolección de datos corporales, lanzando una plataforma de recolección de datos sin cuerpo, integrando cuatro formas: EGO, UMi, Wrsicam y Hub en un mismo sistema: EGO registra la perspectiva en primera persona, WristCam captura la perspectiva cercana de la muñeca, y UMI complementa las acciones de interacción entre la mano y los objetos, formando un enlace de datos multivista para el aprendizaje por imitación y el entrenamiento de modelos del mundo.
Las manos hábiles, la percepción visual y otras capacidades sensoriales son cruciales, ya que representan el último centímetro de la verdadera implementación de la inteligencia corporal. Incluso si el modelo es muy inteligente, sin una buena mano hábil, el robot no puede realizar operaciones delicadas como lo haría un humano; sin percepción, el robot se convierte en ciego, sin saber qué hacer.
También hemos observado que las empresas en el ámbito de las manos hábiles y la percepción están cruzando fronteras para desarrollar datos de inteligencia corporal, lo que demuestra el hambre de datos en toda la industria de la inteligencia corporal.
El auge de la inteligencia corporal recuerda a la visión por computadora y la conducción autónoma de hace diez años. En ese momento, el mercado también creía que la tecnología se generalizaría rápidamente en unos pocos años, pero había una gran distancia entre las capacidades del laboratorio y los productos estables, de bajo costo y escalables.
La conducción autónoma tardó más de diez años en comenzar a operar comercialmente en algunas ciudades y regiones con Robotaxi. Esto no prueba que la inteligencia corporal repetirá el mismo proceso, pero indica una tendencia:
Las olas tecnológicas a menudo llevan a las personas a sobreestimar la velocidad de implementación a corto plazo, pero pueden subestimar el impacto industrial a largo plazo.
La inteligencia corporal aún se encuentra en una etapa temprana de transición de la validación de prototipos a la validación de productos. En los próximos años, es probable que se implemente primero en escenarios estructurados como fábricas, logística, inspección y servicios comerciales, y su verdadera entrada en los hogares y la vida cotidiana requerirá más tiempo. Esto se debe a que la inteligencia corporal es una ingeniería de sistemas que combina hardware y software, y los avances en un solo campo son difíciles de traducir en un avance rápido para toda la industria.
Sin embargo, por otro lado, China cuenta con una cadena de suministro de robots bastante completa, capacidades de fabricación, talento en ingeniería y una gran cantidad de escenarios reales, lo que puede acortar los ciclos de prueba de máquinas completas, reducir costos, desplegar escenarios, obtener datos y iterar productos.
Estas condiciones no garantizan que una empresa o un enfoque específico tenga éxito, pero permiten que China continúe introduciendo robots en escenarios reales, completando la validación técnica, de ingeniería y comercial.
La euforia eventualmente disminuirá, y la inteligencia corporal puede tardar más en entrar en la vida de las personas comunes de lo que el mercado espera, pero cuando los robots realmente comiencen a trabajar en fábricas, almacenes y hogares, la historia de la inteligencia corporal apenas comenzará.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























