Informe de CoinWorld:
Hacer que un robot aprenda a "levantar una taza" suena como una simple instrucción, pero en realidad es un proceso complicado.
Primero, una persona debe usar un dispositivo de captura para realizar la tarea. La cámara graba desde una perspectiva en primera persona, mientras que el dispositivo registra la trayectoria de la mano, la posición y la postura de la pinza. Después de grabar el video, es necesario corregir la distorsión de ojo de pez, restaurar la posición y orientación, dividir el proceso de "extender la mano --- acercarse --- agarrar --- levantar" en varias etapas, y etiquetar cada etapa con etiquetas que el robot pueda usar. Si hay un error en cualquiera de estos pasos, la demostración puede ser en vano.
Los grandes modelos de lenguaje tienen al menos un vasto internet del cual extraer información. Los robots no tienen eso. Cómo abrir una puerta, cómo doblar una toalla, de dónde agarrar un paquete blando, cada acción debe ocurrir primero en el mundo físico.
Qingche Intelligent ha establecido recientemente una línea de procesamiento de datos de robots en la nube con Alibaba Cloud, con la intención de conectar la calibración, reconstrucción, segmentación, etiquetado y entrenamiento de los datos recopilados. Aunque las noticias no son tan llamativas como un robot haciendo acrobacias, están más cerca del cuello de botella de este negocio.
Uno o dos investigadores pueden manejar videos de decenas de minutos con scripts y carpetas. Pero cuando los datos aumentan a cientos de horas, surgen problemas: ¿debería recalcular todo el lote después de que una tarea falla? ¿Cuántas veces se ha modificado el mismo archivo? ¿Qué versión de los datos se alimentó a qué versión del modelo? Si los resultados del entrenamiento no son buenos, ¿se puede rastrear a qué tipo de acción de captura pertenecía?
Estos problemas suenan como el día a día del departamento de TI de una empresa, pero las compañías de inteligencia encarnada no pueden evitarlos. Los datos de los robots provienen del mundo real, y si se capturan incorrectamente, no se puede refrescar la página y empezar de nuevo; además, están muy ligados al hardware. Cambiar un brazo robótico, un conjunto de cámaras, o incluso una pinza, puede hacer que los movimientos previamente suaves fallen.
Lo que puede hacer una línea de producción en la nube es transformar un montón de tareas dispersas en un proceso con estado. Cuando se necesita GPU, se activan los recursos, y una vez que se termina el procesamiento, se liberan; si un paso falla, se puede continuar desde el punto de interrupción; los datos, los parámetros de hardware y las versiones de procesamiento se mantienen en el mismo registro. No hará que los datos malos se conviertan en buenos, pero permitirá que los ingenieros sepan dónde está el problema.
Tomando la calibración de la cámara como ejemplo, si un lote de videos utiliza parámetros incorrectos, la recuperación de posición y la segmentación de acciones posteriores se contaminarán. El enfoque tradicional podría esperar hasta que el entrenamiento del modelo falle para investigar; con una línea de producción completa, el sistema al menos puede localizar qué dispositivo, qué captura y qué versión de parámetros tuvo el problema, y solo volver a ejecutar la parte afectada. Para un equipo que agrega grandes cantidades de datos diariamente, esta trazabilidad es más importante que ahorrar unos minutos en el procesamiento único.
Los datos también necesitan un conjunto de "control de calidad". La demostración humana no es inherentemente correcta: los movimientos pueden ser vacilantes, pasos clave pueden estar bloqueados por el cuerpo, y la descripción verbal de la misma tarea puede ser inconsistente. La anotación automática puede acelerar el proceso, pero también puede replicar errores a gran escala. Una forma más realista es que la máquina procese la mayoría de las muestras regulares primero, y luego pase los casos de baja confianza, trayectorias anómalas y casos fallidos a revisión humana.
Los resultados del control de calidad también deben retroalimentar la captura. Si en ciertas condiciones de luz no se ve bien, se deben volver a grabar en esas condiciones; si un ángulo de agarre falla con frecuencia, se debe pedir al operador que lo cubra específicamente. La captura ya no es una acumulación de tiempo sin rumbo, sino que se centra en reforzar las debilidades del modelo.
En los últimos dos años, la industria robótica ha estado reportando "cuántas horas de datos reales" se han acumulado. Este número se asemejará cada vez más a los parámetros de modelo de años anteriores: grande, pero no necesariamente indicativo de un problema.
Diez mil horas repitiendo el movimiento de cajas puede no ser más útil que cien horas cubriendo cuidadosamente los límites de fallo. La demostración más fluida puede aprenderse rápidamente, pero lo difícil es qué hacer cuando la taza se desliza, la bolsa se aplana o la luz cambia. Solo cuando los fracasos en el sitio se devuelven al sistema de entrenamiento y las nuevas estrategias se envían de vuelta al robot, los datos comienzan a formar un ciclo cerrado.
Este ciclo cerrado puede convertirse en lo más difícil de replicar para las compañías de inteligencia encarnada. Los videos de demostración se pueden aprender, los brazos robóticos se pueden comprar, e incluso los modelos básicos pueden ser de código abierto. Sin embargo, las anomalías acumuladas en el sitio, los registros de calibración, las muestras fallidas y la experiencia de implementación no se difundirán automáticamente con un artículo académico.
La cadena de herramientas pública de Qingche abarca desde la captura de datos hasta el entrenamiento y la implementación del modelo, lo que indica que su apuesta no se limita a un "cerebro robótico universal". También quiere vender palas: permitir que los robots de otros también capturen datos, entrenen modelos y realicen implementaciones en esta misma herramienta.
La viabilidad de este negocio de "vender palas" depende de si los clientes están dispuestos a entregar los datos centrales a la misma plataforma. Las grandes empresas pueden optar por construir sus propias soluciones, preocupadas por la filtración de procesos de producción y flujos de trabajo; las compañías de robótica más pequeñas tienen dificultades para mantener un equipo de ingeniería de datos por sí solas. La plataforma necesita ofrecer opciones entre eficiencia y control, como implementación privada, aislamiento de permisos y límites claros sobre el uso de datos solo para modelos específicos.
Los riesgos también son muy reales. Los videos y los datos de sensores enviados a la nube enfrentarán problemas de privacidad y seguridad de datos en la fábrica; la potencia de cálculo consumida por la reconstrucción a gran escala no es barata; y aún no hay respuestas estándar sobre cuántos datos se pueden reutilizar entre diferentes hardware.
Pero hay un punto que ya es difícil de evitar: para que los robots entren en fábricas y hogares, el backend no puede seguir dependiendo de ingenieros moviendo archivos manualmente.
La próxima vez que vea a una empresa anunciar "cuántas horas de datos ha acumulado", no dude en preguntar tres cosas más: ¿cuánto tiempo tarda en implementarse una habilidad?, ¿cuántos días puede volver a procesar muestras fallidas?, ¿cuánto se puede reutilizar al cambiar de máquina? Esa es la verdadera producción diaria de esta línea de producción.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























