اگر نیامدهاید حتماً ببینید، اگر آمدهاید و نمیبینید، به معنای بیهوده آمدن است.
نویسندگان: بایشی، ژو یونگلیانگ، پارک فناوری
ویرایشگر: ژو یونگلیانگ، لی یوان
در تاریخ ۱۹ آگوست، هوای بیجینگ یژوانگ پر از هیجان عجیبی بود، زیرا روز افتتاحیه کنفرانس جهانی رباتیک ۲۰۲۶ بود. بیش از ۳۰۰ شرکت و بیش از ۲۰۰۰ محصول در اینجا گرد هم آمدهاند و تقریباً تمام آنچه را که صنعت هوش بدنی میتواند ارائه دهد، به نمایش گذاشتهاند: مدلهای بزرگ، موجودات، قطعات کلیدی، دادهها و غیره.
در روز افتتاحیه، شرکت یوشو فناوری با زنگ افتتاحیه به بورس رفت و ارزش بازار آن در طول روز به بیش از ۴۰۰ میلیارد یوان رسید، که ممکن است نزدیکترین روز به "شور و شوق سرمایه" در صنعت رباتیک چین در ده سال گذشته باشد. در گذشته، شرکتهای رباتیک بیشتر در آزمایشگاهها، اخبار تأمین مالی و ویدیوهای نمایشی زندگی میکردند؛ اما ورود یوشو به بورس، برای اولین بار یک نقطه مرجع سرمایهای برای این مسیر که هنوز در مراحل اولیه است، فراهم کرد.
علاوه بر این، شرکت یوندنچو فناوری وارد مراحل پذیرش یا بررسی بورس شد؛ و شرکت ژیوان رباتیک در ژوئیه ۲۰۲۶ تأیید کرد که فرآیند ورود به بورس هنگ کنگ را آغاز کرده است. گرمای بازار اولیه به بازار ثانویه منتقل میشود و هوش بدنی دیگر تنها یک تصور فنی نیست، بلکه اکنون از آن خواسته میشود که به سوالاتی درباره درآمد، تحویل، سود ناخالص و مقیاسپذیری پاسخ دهد.
پس از بازدید از کل نمایشگاه، همانطور که پیشبینی کرده بودیم، امسال لحظهای که همه را شگفتزده کند وجود نداشت و بیشتر به نمایشهای نمایشی مربوط میشد. یوشو محصول جدیدی که به تازگی منتشر شده، یعنی "سوپرمن" که میتواند ۲ متر بپرد و با سرعت ۱۲.۶۶ متر در ثانیه بدود، را به نمایش نگذاشت؛ در عوض، بیشتر محصولات موجود در حال باز کردن حرکات جدید بودند؛ شرکت زونگچینگ قفس هشتضلعی را به محل نمایش آورد و شرکت ویتا پاور با استفاده از شخصیتهای انیمهای فعالیتهایی را انجام دادند... این نمایش واقعاً شلوغ بود، اما دیگر کسی درباره "شکستهای انقلابی" صحبت نمیکند.
به جای ادامه پرسش درباره "چه زمانی معجزهای رخ خواهد داد؟"، سوالات سادهتری وجود دارد که باید پرسیده شوند: آیا رباتها فقط میتوانند به شکل انسان باشند؟ واقعاً "عمومیت" هوش بدنی به کجا رسیده است؟ آیا دادهها در حال تبدیل شدن از یک تجارت الگوریتمی به یک تجارت سختافزاری هستند؟ آن اجزای کلیدی که در نوک انگشتان، مفاصل و موتورهای رباتها پنهان شدهاند، چه مقدار پیشرفت کردهاند؟
با این سوالات، ما در نمایشگاه گشتی زدیم و با چندین شرکت نماینده به گفتگو پرداختیم. آنها ممکن است بهترین سازندگان صدا نباشند، اما هر یک نمایانگر تغییرات کلیدی هستند که در این مسیر در حال وقوع است: تفکیک اشکال موجودات، رقابت مدلهای عمومی، بازسازی حلقههای داده و نزدیک شدن اجزای کلیدی به "آخرین سانتیمتر".
در غرفه شرکت گالاکسی، رباتهای سه شکل کاملاً متفاوت شامل رباتهای چرخشی، سنگین و دوپا، از یک مدل بزرگ پایه استفاده میکنند؛ ویتا پاور از سناریوهای واقعی استفاده کرده و اولین ربات انساننمای خود یعنی Vbot ATOM را توسعه داده است؛ شرکت خودمتغیر در سناریوهای تفکیک لجستیک، کارایی را به ۱۸۱۶ قطعه در ساعت و دقت را به بیش از ۹۸ درصد رسانده است؛ و شرکت پاسینی، راهحلهای تکنولوژیکی برای "حس لامسه" را به یک شبکه ادراکی سراسری گسترش داده است...
هوش بدنی هنوز در مراحل اولیه است و حتی زودتر از آنچه بسیاری انتظار داشتند. این صنعت وارد مرحلهای دشوارتر و با ارزشتر میشود؛ هر کسی که بتواند مدلها، موجودات، اجزا و قابلیتهای مهندسی را به یک حلقه بسته تبدیل کند، احتمالاً میتواند به شرکت واقعی با ارزش در مرحله بعد تبدیل شود.
در دو سال گذشته، روایت هوش بدنی به شدت تحت سلطه رباتهای انساننما بوده است: رقصیدن، دویدن، مشت زدن، ماراتن، تمام رویدادهای برجسته تقریباً به شکل انسان بودهاند.
اما پس از دیدن این دوره از WRC، متوجه خواهید شد که مفهوم ربات انساننما همچنان در حال گسترش است: غولپیکر، بیونیک، نیمهانسان... "شکل انسان" دیگر تنها یک پاسخ استاندارد نیست. در عین حال، خارج از شکل انسان، شرکتهای بیشتری شروع به طراحی مجدد اشکال رباتها بر اساس وظایف واقعی کردهاند. (توجه: ویدیو را میتوان در لینک اصلی مشاهده کرد)
امسال در WRC، یوشو واقعاً در بخش انساننما رقابت شدیدی داشت و حرکات جدیدی را به نمایش گذاشت. ربات G1 در مبارزات، با ترکیب مشتها، لگدهای چرخشی و پرشهای هوایی، به هماهنگی زمان واقعی تمام مفاصل بدن وابسته بود؛ ربات H2 که سر بزرگتری دارد و قدرت بیشتری در مفاصل دارد، مشت زدن و بالا بردن پا را با احساس بیشتری انجام میدهد. وقتی دو ربات را کنار هم میگذارید، دقیقاً دو سبک "چابکی" و "قدرت" را مشاهده میکنید.
تعامل با پینگپنگ نیز بسیار جالب است، ربات ابتدا باید "درک کند" که توپ چگونه میآید و سپس تصمیم بگیرد که چگونه پاسخ دهد، این کار بیشتر از صرفاً نمایش حرکات، به هماهنگی ادراکی و تصمیمگیری نیاز دارد. به علاوه، با سیستم مبارزه از راه دور، حرکات اپراتور به دقت بازتولید میشود و این سیستم در واقع حلقه دادههای هوش بدنی یوشو را تشکیل میدهد.
اما بارزترین ربات GD01 است، که سه متر ارتفاع دارد و میتواند به شکل انسان تغییر شکل دهد. این ربات نه انساننما است و نه چهارپای سنتی، بلکه تکنولوژی رباتیک و شکل تجهیزات را با هم ترکیب کرده و به طور مستقیم به سمت سناریوهای فرهنگی و گردشگری و عملیات ویژه میرود.
در این دوره از WRC، ویتا پاور به طور رسمی ربات انساننمای هوش بدنی Vbot ATOM را معرفی کرد و همزمان پیشسفارش آن را آغاز کرد. نکته قابل توجه این است که ATOM از نمونههای مفهومی آغاز نمیشود، بلکه از تعریف محصول، تحویل انبوه و قابلیتهای عملیاتی Vbot در ربات چهارپای "سر بزرگ" که قبلاً تأیید شده است، ادامه مییابد.
در ماه مه امسال، ربات سگ بارگذاری AI "سر بزرگ" به تولید انبوه رسید. تا کنون، این محصول به عنوان پرفروشترین هوش بدنی مصرفی شناخته شده و در دنیای واقعی ۱.۲۶ میلیون تعامل با مدل بزرگ، ۲۳۷۰۰ کیلومتر مسافت همراهی کاربر و ۱۳۱۵۰۰ ساعت همراهی را تکمیل کرده است و در سه ماه گذشته ۴ بار بهروزرسانی OTA انجام داده است. برای صنعت هوش بدنی، این دادهها تنها به معنای فروش نیست، بلکه نشان میدهد که Vbot توانسته رباتها را به زندگی واقعی کاربران وارد کند و حلقه بستهای از تحویل، بازخورد استفاده و تکرار مداوم محصول را شکل دهد.
بر اساس تجربه "سر بزرگ"، Vbot ATOM از رویکرد سنتی رباتهای انساننما پیروی نکرده، بلکه از سناریوهای زندگی مانند خانواده، خردهفروشی، فضای عمومی و خدمات اداری شروع کرده و شکل محصول را به طور معکوس تعریف کرده است. قد ۱۶۰ سانتیمتر، دامنه بازو ۱۸۰ سانتیمتر، طول پا ۹۵ سانتیمتر و ۳۱ درجه آزادی بدنه، توانایی خدماتی نزدیک به اندازه واقعی انسان را تعیین میکند؛ پوشش پارچهای، طراحی تعامل وضعیت و پایههای بیصدا، آن را در محیطهای خانوادگی و عمومی دوستانهتر و قابل قبولتر میکند.
در سطح تکنولوژی، Vbot همچنین سیستم مدل هوش بدنی "Vbot Embodied Genome" و سه مدل اصلی را منتشر کرده است که برای پشتیبانی از درک تعامل، تصمیمگیری مدل جهانی، تکامل بین موجودات و بازخورد واقعی طراحی شدهاند.
از این رو، ورود Vbot ATOM تنها به معنای گسترش Vbot از ربات چهارپای به ربات انساننما نیست، بلکه نشاندهنده این است که آنها در حال انتقال قابلیتهای محصول تأیید شده به فضای زندگی بزرگتر هستند و رباتهای انساننما را از نمایش موجودات به لحظه تولید میبرند.
رباتهای آینده نزدیک به طور کامل بر اساس نیازهای خانوادگی طراحی خواهند شد و قادر به انجام کارهای خانگی پایه، همراهی کودکان، مراقبت از سالمندان و مراقبت از حیوانات خانگی خواهند بود. در حال حاضر، آنها به بیش از ۵۰۰ خانواده پرداختی وارد شده و بیش از ۵۰۰۰۰ ساعت خدمات ارائه کردهاند.
رباتهای آینده نزدیک همچنین توانایی تکرار سریع خود را در سناریوهای خانوادگی نشان دادهاند، یک ماه پیش در WAIC، آنها بر روی کارهای خانگی پایه مانند شستشو، تا کردن و ذخیرهسازی تمرکز کردند، اما در محل WRC، سناریو را به آشپزخانه گسترش دادند: ربات نسل دوم خود را که به مدل حرکتی خودتکامل WAM مجهز است، به طور خودکار و به صورت انتها به انتها، تهیه ماکارونی را انجام داد.
فرآیند کامل پخت و پز نیاز به هماهنگی، دقت و قضاوت بالایی از ربات دارد: نیاز به هماهنگی دقیق دو بازو؛ برای انجام عملیات مایعات غیرقابل برگشت، نیاز به قضاوت بصری دقیق در لحظه دارد؛ همچنین نیاز به تغییر، گرفتن و جایگزینی انعطافپذیر انواع ظروف آشپزی دارد و باید به طور خودکار یاد بگیرد که چگونه حرارت را تنظیم کند، که هیچ پاسخ استانداردی ندارد. رباتهای آینده نزدیک در نمایشگاه، پخت و پز مداوم بدون وقفه را با ثبات شگفتانگیز خود نشان دادند.
آینده نزدیک اعلام کرد که آنها از بدنه، مغز تا سختافزار، یک رویکرد تحقیق و توسعه نرمافزاری و سختافزاری کامل را اتخاذ کردهاند، بنابراین در تکرار سناریوهای جدید سریعتر هستند. علاوه بر گسترش تدریجی از کارهای سبک به کارهای سنگین، آینده نزدیک همچنین نیازهای سناریوهای خانوادگی را شامل نیازهای اساسی کودکان، سالمندان و حیوانات خانگی میداند و در محل، آنها همچنین انواع بازیهای تختهای مانند پنجتایی، شطرنج، باز کردن نوشیدنیها، بازیهای تعاملی و کارهای مشترک دو ربات را به نمایش گذاشتند. سناریوهای بسیار قوی و تعاملات آنها باعث شد که غرفه آنها همیشه پر از جمعیت باشد.
رباتهای خودمتغیر در حال حاضر بر روی دو سناریوی خانوادگی و لجستیکی تمرکز دارند. در سناریوی لجستیک، آنها از ربات انساننما کامل و دستهای چنگکی استفاده نکردهاند، بلکه از دو بازوی مکانیکی با چنگکهای معمولی برای پردازش بستههای واقعی با اشکال، وزن و مواد تصادفی استفاده میکنند.
ربات آنها بر اساس ویژگیهای فیزیکی بستهها تصمیم میگیرد که چگونه با آنها رفتار کند: بستههای کوچک را به سادگی میگیرد، جعبههای سنگین را هل میدهد و در مواجهه با اشیاء غیرمعمول مانند خرس عروسکی بدون برچسب، فرآیندهای بعدی را تشخیص داده و به طور خودکار پردازش میکند. در یک پخش زنده قبلی، این سیستم به مدت یک ساعت به طور مداوم کار کرد و کارایی تفکیک به ۱۸۱۶ قطعه در ساعت و دقت به بیش از ۹۸ درصد رسید.
شرکت خودمتغیر در مصاحبهای در محل تأکید کرد که رباتهای آنها به کاربرد واقعی وارد شدهاند: رباتهای خانگی به طور گسترده به خانوادههای کاربران خدمات ارائه میدهند؛ تفکیک لجستیک نیز به شرکتهای پیشرو وارد شده است.
عمومیت هوش بدنی، یا به عبارتی توانایی انجام وظایف عمومی، به این اشاره دارد که آیا رباتهای هوش بدنی میتوانند وظایف پیچیده را در محیطهای مختلف و با دستورات مختلف انجام دهند و آیا میتوانند در سناریوهای جدید دوباره برنامهریزی کنند.
از نظر توانایی، هوش بدنی در عمومیت از مرحله "نمایش یک عمل واحد" عبور کرده است و اکنون رباتهای پیشرفته قادر به انجام زنجیرهای از مهارتها، پیگیری وضعیت و حتی برنامهریزی مجدد پس از تجربه اختلال هستند.
از نظر هوش، عمومیت رباتهای هوش بدنی به وضوح با مدل مرتبط است و در حال حاضر مسیر تکنولوژیکی مدلها هنوز به هم نزدیک نشده است. شرکتهای پیشرو مسیرهایی را توسعه دادهاند که شامل مدلهای VLA (مدل بینایی-زبان-عمل)، WAM (مدل حرکتی جهانی)، سیستمهای عملیاتی هوش بدنی لایهای و مدلهای پایه هوش بدنی بین موجودات است.
از جمله، نمایندگان مدلهای VLA/WAM شامل گالاکسی، چینیون هوشمند و آینده نزدیک هستند. نقطه مشترک این رویکرد این است که سعی میکند بینایی، زبان، عمل و برخی پیشبینیهای وضعیت را در یک مدل یا نمایش واحد قرار دهد.
گالاکسی در WRC ربات انساننمای دوپای Galbot ET1 "گالاکسی·ستاره" را معرفی کرد، که از مهارتهای یادگیری خودکار تعامل با عامل استفاده میکند و میتواند به طور مستقیم حرکات انسان را مشاهده کرده و به طور آنی رقص و حرکات دینامیک بالا را تقلید کند. همچنین این ربات چارچوب یادگیری حرکتی کنترلشده با دینامیک بالای گالاکسی "LATENT" را ادغام کرده است که میتواند به عنوان یک مربی تنیس واقعی عمل کند.
مدل AstraBrain WBC که مسئول کنترل حرکات بدن در زمان واقعی در سیستم مغز کهکشان است، از ET1 پشتیبانی میکند که میتواند حرکات پیوسته انسانی مانند رقص و تنیس را تقلید کند.
به طور خاص، وقتی یک رقصنده حرکات جدیدی را ارائه میدهد، ET1 با استفاده از شناسایی بصری و استخراج مسیر حرکتی واقعی فرد، حرکات را به بدن خود منتقل میکند. این واقعاً در حال تقلید در زمان واقعی است و نه اینکه از یک کتابخانه حرکات از پیش تعیین شده یک مسیر را انتخاب و دوباره پخش کند.
شرکت Galaxy Universal در حال حاضر رباتهای انساننمای دوپایی به نام Galbot ET1 و همچنین رباتهای با اشکال مختلف مانند Galbot G1 و S1 را دارد. این شرکت بر این نکته تأکید دارد که "یک مغز میتواند در بین اشکال، وظایف و صحنهها حرکت کند". این رباتها در صحنههای خانگی، خردهفروشی و صنعتی کاربردهای خاص خود را دارند، اما همه آنها از یک مدل هوش بدنی پایه مشترک استفاده میکنند. رباتهای با اشکال مختلف دارای سیستمهای کنترل حرکتی خاص خود هستند، اما تواناییهای ادراک، درک وظیفه، مدلسازی جهان و برنامهریزی عمل آنها قابل استفاده مجدد است.
Galaxy Universal در مصاحبهای اشاره کرد که در گذشته، وقتی رباتها وارد یک صحنه جدید میشدند، معمولاً نیاز به جمعآوری مجدد دادهها و آموزش مجدد در مورد آن صحنه داشتند؛ اما اکنون همان مدل پایه در حال استفاده مجدد در بین اشکال و وظایف مختلف است. با استفاده از دادههای کم، رباتهای چرخدار و رباتهای سنگین میتوانند از این مدل استفاده کنند و حتی وقتی به رباتهای دوپایی منتقل میشوند، مغز نیازی به آموزش مجدد از ابتدا ندارد.
آیندهای نزدیک، بر اساس AVLA، حلقه بستهای از بینایی، زبان و عمل ایجاد خواهد کرد و بر این اساس، مدل Self-Evolving WAM (مدل عمل جهانی خودتکاملیابنده) را معرفی خواهد کرد که به رباتها این امکان را میدهد که نه تنها وظایف را درک و اجرا کنند، بلکه نتایج حرکتی را پیشبینی کرده و با استفاده از دادههای واقعی از خانهها، مدل را به طور مداوم بهروزرسانی کنند.
به عنوان مثال، در صحنه شستشوی لباس، مدل آنها پس از آموزش بر اساس دهها نوع ماشین لباسشویی، اکنون میتواند به صدها نوع مختلف از مدلها، روشهای باز کردن در و نوع دکمهها تعمیم یابد. توانایی مشابهی نیز برای لباسها، اسباببازیها و سایر اشیاء خانگی وجود دارد که به رباتها این امکان را میدهد تا در محیطهای خانوادگی مختلف وظایف متغیر را انجام دهند.
متغیر WALL-B مدل خود را به نمایش میگذارد: دو صحنه کاملاً متفاوت، خدمات خانگی و جداسازی لجستیک، از یک مدل واحد استفاده میکنند. WALL-B بینایی، زبان، حس لامسه، عمل و پیشبینی فیزیکی را در یک شبکه یکپارچه ادغام میکند و به رباتها این امکان را میدهد که قوانین فیزیکی مانند گرانش، اینرسی و اصطکاک را درک کرده و نتایج حرکتی را پیشبینی کنند.
تحقیقات نمایشی در زمینه هوش بدنی شامل COSA است که یک ساختار هوش بدنی لایهای است.
COSA 0.5 مغز ربات را به سه لایه تقسیم میکند: System 2 مسئول درک صحنه، حافظه، استدلال و زمانبندی وظایف است، System 1 مهارتهای عملی مانند VLA را فراخوانی میکند و System 0 کنترل حرکات کل بدن را با حداکثر 1000Hz انجام میدهد.
یکی از نمایندگان مدلهای پایه هوش بدنی بین اشکال، G0.5 است. در محل WRC، R1 Lite که به G0.5 مجهز است، در حین حرکت، درک محیط، تجزیه وظایف، عملیات دو دستی و بازیابی از خطا را انجام میدهد. G0.5 با استفاده از کدگذاری حرکتی یکپارچه، به یک مدل واحد اجازه میدهد تا با رباتهای مختلف سازگار شود.
ChianXun Intelligent با Moz1 خود چالشهای طولانیمدت را به عهده میگیرد، مانند "مرتبسازی رستوران"، که در آن ربات پس از دریافت یک دستور، باید به طور مداوم محیط را بررسی کرده، نوشابه را بردارد، به یخچال برود، در را باز کند و بگذارد، در را ببندد و سپس ظرفهای کثیف را به ماشین ظرفشویی ببرد؛ اگر هدف جابجا شود، مسدود شود یا محیط مرتب شده دوباره به هم بریزد، آنها دوباره ادراک و برنامهریزی میکنند.
در زمینههای کاربردی، اجازه دادن به رباتها برای ورود به فضاهای خانگی و عمومی و انجام وظایف پیچیده، هنوز به بلوغ کافی نرسیده است، به ویژه در مواردی که با انسانها به طور مستقیم تعامل دارند و نیاز به در نظر گرفتن ایمنی دارند. اما در کارخانهها، انبارها و سایر صحنههای نسبتاً بسته، رباتها قادر به انجام برخی وظایف پیچیده طولانیمدت هستند.
به عنوان مثال، Star Motion Era M7 در محل به طور مداوم اقداماتی مانند شناسایی بستههای تصادفی، گرفتن، برگرداندن برچسب و ارسال به زنجیره انتقال را انجام میدهد؛ این توانایی در مراکز لجستیکی مانند China Post پیادهسازی شده و به حداکثر 1200 بسته در ساعت رسیده است.
تواناییهای عمومی و تواناییهای صحنهای عمودی هوش بدنی با یکدیگر تضاد ندارند. رباتها در صحنههای عمودی واقعی، به انواع عملیات غیر استاندارد سازگار میشوند و میتوانند به طور پایدار عمل کنند، که در واقع میتواند به بهبود تواناییهای عمومی کمک کند.
علاوه بر این، تلاشهای شرکتهای مختلف در تکامل مدلها، از مهارتهای تکبعدی به سمت تعمیم بین اشکال، وظایف طولانیمدت و محیطهای پویا پیشرفت میکند.
چه عملکرد عمومی هوش بدنی و چه عملکرد صحنهای عمودی، مدلها به دادههای با کیفیت بالا و زیادی نیاز دارند.
روشهای جمعآوری دادههای رباتها، شامل کنترل از راه دور، UMI بدون بدنه و دستکشهای داده، جمعآوری از دید اول و حرکتسنجی، و جمعآوری بدنه واقعی است، تقریباً هر یک از اینها شامل سختافزار است و برخی میگویند که جمعآوری دادههای هوش بدنی به یک تجارت سختافزاری تبدیل شده است؟
در واقع، اهمیت دادهها در خود دادهها نیست، بلکه در مدل و هوش است. تنها زمانی که دادهها به اندازه کافی زیاد و با کیفیت بالا باشند و بتوانند به تکامل مدل کمک کنند و در صحنهها یک حلقه بسته دادهای و چرخ دادهای ایجاد کنند، معنی واقعی آنها نمایان میشود.
Light Wheel Intelligent یکی از شرکتهای پیشرو در زمینه دادههای هوش بدنی مستقل است که بر اساس دادههای دید اول انسانی، شبیهسازی فیزیکی، ارزیابی مقیاسپذیر و بازخورد واقعی، حلقه بسته Real2Sim2Real را ایجاد کرده است.
در این WRC، Light Wheel Intelligent به طور خاص شبیهسازی SimFoundry و سیستم ارزیابی RoboFinals را به نمایش گذاشت. SimFoundry با اندازهگیری پارامترهای اشیاء واقعی و حلکنندههای فیزیکی خود، دقت شبیهسازی اشیاء نرم مانند لباس و کابل را افزایش میدهد؛ RoboFinals برای آزمایش و ارزیابی مقیاسپذیر مدلهای رباتیک استفاده میشود و به مدلها این امکان را میدهد که قبل از ورود به صحنههای واقعی، ابتدا از طریق تأیید سیستم عبور کنند.
کنترل از راه دور، UMI و حرکتسنجی، روشهای جمعآوری دادههای با کیفیت بالا هستند که بر محور انسان متمرکز شدهاند، اما هزینه آنها هنوز بسیار بالا است و به سختی میتواند نیاز مدل به حجم داده را برآورده کند.
روشهای زیادی برای جمعآوری دادههای بدنی وجود دارد، مانند استفاده از دادههای ویدیویی، دادههای بازی و مدلهای جهانی که در 1-2 سال اخیر به وجود آمدهاند.
Giga World از مسیر مدل جهانی پیروی میکند و مدل جهانی را به عنوان "تقویتکننده داده" معرفی میکند. GigaWorld بر اساس حرکات ربات، تغییرات محیط را پیشبینی کرده و به طور انبوه دادههای تعاملی مورد نیاز برای آموزش و آزمایش را تولید میکند؛ GigaWorld-1 همچنین مدلسازی حرکتی و تخمین پارامترهای فیزیکی را اضافه کرده و قابلیتهای شبیهسازی عملیات مانند گرفتن و برخورد را افزایش میدهد.
بنابراین دادهها یک تجارت صرفاً سختافزاری نیستند، بلکه شامل انواع و اشکال مختلفی هستند. و همچنین، نسبت به جمعآوری صرف دادهها، ارائه دادهها برای مدل، برای بهبود مدلهای هوش بدنی بیشتر، ممکن است تشکیل حلقه دادهای باشد، و این کار برای یک شرکت متمرکز بر جمعآوری دادههای بدنی دشوار است.
برای تشکیل حلقه بسته دادهای و چرخ دادهای، باید به صحنههای خاص وارد شده و با رباتها همکاری کرد و از دادههای واقعی تولید شده برای بهروزرسانی و بهینهسازی مدل استفاده کرد.
به عنوان مثال، Galaxy Universal "Galaxy Star Data (AstraData)" را ایجاد کرده است که دادههای اینترنتی، دادههای رفتار انسانی، دادههای شبیهسازی ترکیبی، کنترل از راه دور واقعی و دادههای بازگشتی از صحنههای واقعی را برای آموزش مدلها یکپارچه میکند و به حلقه بستهای برای تأیید صحنه و بهینهسازی بازگشتی متصل میشود. مدل مغز کوچک عمومی آنها AstraBrain-WBC 0.5 با استفاده از حدود 20 هزار ساعت و 2 میلیارد فریم دادههای حرکتی انسانی آموزش دیده است و پس از بهینهسازی مهندسی، تأخیر استنتاج کمتر از 1.5 میلیثانیه و تأخیر کل زنجیره حرکتسنجی کمتر از 20 میلیثانیه است.
سیستم جمعآوری دادههای 2.0 شرکت Zhiyuan Robot بر اساس بیش از 430 صحنه واقعی، هرم دادههای واقعی، بدون بدنه و چندمنبع را ایجاد کرده و ارزیابی مدل، پیادهسازی صحنه، آزمایش سازگاری واقعی و بازخورد دادههای عملی را در یک سیستم واحد قرار داده است.
علاوه بر این، شرکتهای استارتاپ خارجی در محیطهای کارخانهای به کارگران محلی اجازه میدهند تا رفتار رباتها را اصلاح کنند و سپس رفتارهای جدید را به فرآیند اضافه کرده و دادهها را برای آموزش مجدد مدلهای هوش بدنی جمعآوری کنند.
شرکتهای چینی مانند Galaxy Universal، Zhiyuan Robot و Zhiyuan نیز در حال پیشرفت در این زمینه هستند و روند مشترک دادههای بدنی در آینده ممکن است به این شکل باشد: جمعآوری دادهها از "کارخانههای جمعآوری داده متمرکز" به "محل استقرار رباتها" منتقل میشود.
دستهای چابک، حس لامسه، حس بینایی، موتور و مفاصل، پیشرفت اجزای کلیدی معمولاً میتواند نشاندهنده پیشرفت واقعی صنعت باشد. و در زمینه اجزای کلیدی هوش بدنی، مهمترین موارد عملیات دقیق و ادراک هستند، که در ادراک، حس لامسه و حس بینایی از اهمیت بیشتری برخوردارند.
دستهای چابک کلید انجام عملیات دقیق رباتها هستند. به عنوان مثال، سیستم دست چابک، نمونهای از "دست چابک که دست چابک را مونتاژ میکند" را نشان میدهد: ربات با استفاده از شناسایی بصری، همکاری دو دستی و کنترل دقیق نیرو، در فضای محدود، اجزای مختلف را گرفته و مونتاژ میکند و دست چابک را از گرفتن به سمت عملیات صنعتی دقیق پیش میبرد.
در عین حال، سیستم دست چابک نیز به طور مداوم در حال ارتقاء تواناییهای مدل است. این سیستم به ما میگوید که در حال حاضر در صحنههای نسبتاً مشخص مانند فروشگاههای بزرگ، کارخانهها و لجستیک، میتوان به درجاتی از تعمیم برای ابزارها و فرآیندهای مختلف دست یافت، اما برای انتقال به صحنههای کاملاً متفاوت هنوز نیاز به یادگیری بیشتری وجود دارد.
سیستم دست چابک همچنین به دادههای بدنی پرداخته و سیستم Open TeleDex میتواند دادههای بصری، لمسی و ادراک بدنی را به طور همزمان جمعآوری کند تا برای آموزش مدلهای عملیات چابک استفاده شود. این سیستم دست چابک ایدهآل را به عنوان "باید هم مانند دست انسان باشد و هم مانند مغز انسان" خلاصه میکند: در نهایت نه تنها باید بتواند اشیاء مختلف را بگیرد، بلکه باید بتواند ابزارهای مختلف را درک و استفاده کند.
توانایی اصلی شرکت Parsini در حس لامسه است. این شرکت از چیپ حس لامسه 6D خود استفاده میکند و در این نمایشگاه، حسگر چندبعدی PX-FOOTRIX را نیز معرفی کرده و محصولات چندبعدی نسل چهارم مبتنی بر چیپ GEN4 FUSE را ارائه کرده است که شامل چنگک، پوست الکترونیکی کل بدن و غیره میشود و حس را به کل بدن گسترش میدهد.
این پیشرفتها در طراحی ساختاری، سیستم سختافزاری و مدلهای الگوریتمی Parsini به صورت کامل انجام شده است. بر اساس این، Parsini زنجیره کامل از جمعآوری سیگنالهای حس لامسه تا خروجی نیروهای سهبعدی و ششبعدی را ایجاد کرده است و به رباتها این امکان را میدهد که اطلاعات لمسی و نیروی قابل اندازهگیری و پایدار و تکرارپذیر را به دست آورند.
کاربرد حس لامسه به عملیات بازمیگردد، و "پاسیینی" در نمایش زنده، ربات انساننما را نشان داد که با مشارکت بینایی و حس لامسه، بهطور خودکار یک اسب کوچک را مونتاژ میکند: ابتدا اشکال مختلف قطعات را شناسایی میکند، سپس بر اساس وضعیت تماس، ثبات گرفتن و قرارگیری صحیح را ارزیابی کرده و بهطور دینامیک قدرت را تنظیم میکند.
"پاسیینی" همچنین حس لامسه را به جمعآوری دادهها گسترش داد، دستکش PXCap Pro با پنج حس میتواند بهطور همزمان بینایی، حس لامسه و وضعیت دست را جمعآوری کند و همان مجموعه از نمایشهای انسانی را به دستهای چابک مختلف بازنقشهبرداری کند و به این ترتیب "یک بار جمعآوری، چندین بار استفاده" را محقق کند.
"پاسیینی" همچنین دادههای حس لامسه را به پایگاه داده OmniSharing DB که شامل دادههای چندمدلی با حجم میلیاردی است، اضافه کرد و این دادهها را با بینایی، مسیر، وضعیت، صدا و متن برای آموزش مدلهای بدنی ترکیب کرد. یکی از ویژگیهای خاص دادههای حس لامسه چندبعدی است که میتواند تغییرات نیرو و وضعیت را هنگام تماس انسان با اشیاء ثبت کند.
در زمینه ادراک بصری، "اوبیژونگکوانگ" دوربینهای دوگانه 3D سری Gemini 330 را برای هوش بدنی معرفی کرد که دارای چیپست موتور عمق MX6800 است؛ جدیدترین محصول بینایی رباتیک "فیزیس"، بهطور خاص برای رباتهای انساننما و بازوهای همکاری طراحی شده است و توانایی ادراک بصری نزدیک به انسان را ارائه میدهد و تعادل فوقالعادهای بین میدان دید وسیع، کیفیت تصویر بالا، ادراک واقعی از فضا و قابلیت اطمینان بالا برقرار میکند.
همچنین، "اوبیژونگکوانگ" توانایی بصری را به جمعآوری دادههای بدنی گسترش داد و پلتفرم جمعآوری دادههای بدون بدنه را معرفی کرد که چهار شکل EGO، UMi، Wrsicam و Hub را در یک سیستم واحد قرار میدهد: EGO زاویه دید اول شخص را ثبت میکند، Wrsicam زاویه نزدیک به مچ دست را جمعآوری میکند، UMi حرکات تعامل دست و اشیاء را تکمیل میکند و زنجیره دادههای چند زاویهای را تشکیل میدهد که برای یادگیری تقلیدی و آموزش مدلهای جهانی استفاده میشود.
دستهای چابک، ادراک بصری و سایر تواناییهای ادراکی اهمیت زیادی دارند زیرا آنها آخرین سانتیمتر واقعی در تحقق هوش بدنی هستند. حتی اگر مدل بسیار هوشمند باشد، بدون دستهای چابک خوب، ربات نمیتواند مانند انسان عملیات دقیق را انجام دهد و بدون ادراک، ربات به مانند یک فرد نابینا میشود و نمیداند چه باید بکند.
همچنین مشاهده کردیم که شرکتهای فعال در زمینه دستهای چابک و ادراک، در حال ایجاد دادههای هوش بدنی هستند که نشاندهنده شدت تشنگی کل صنعت هوش بدنی برای دادهها است.
شور و شوق هوش بدنی یادآور موجی است که ده سال پیش در زمینه بینایی کامپیوتری و رانندگی خودکار وجود داشت. در آن زمان، بازار نیز به این باور بود که فناوری در چند سال بهسرعت گسترش خواهد یافت، اما فاصله زیادی بین تواناییهای آزمایشگاهی و محصولات پایدار، کمهزینه و قابل مقیاس وجود داشت.
رانندگی خودکار بیش از ده سال طول کشید تا در چند شهر و منطقه به عملیات تجاری Robotaxi وارد شود. اگرچه این نمیتواند ثابت کند که هوش بدنی همان روند را تکرار خواهد کرد، اما یک قاعده را نشان میدهد:
شور و شوق فناوری اغلب باعث میشود مردم سرعت تحقق نزدیکمدت را بیش از حد ارزیابی کنند، در حالی که ممکن است تأثیرات بلندمدت صنعتی را کمتر از حد برآورد کنند.
هوش بدنی در حال حاضر هنوز در مرحله ابتدایی انتقال از تأیید پروتوتایپ به تأیید محصول قرار دارد. در سالهای آینده، ممکن است ابتدا در صحنههای ساختاری مانند کارخانهها، لجستیک، بازرسی و خدمات تجاری به کار گرفته شود و ورود واقعی به خانوادهها و زندگی روزمره به زمان بیشتری نیاز دارد. زیرا هوش بدنی ترکیبی از نرمافزار و سختافزار است و یک مهندسی سیستم با زنجیره صنعتی طولانی است و پیشرفت در یک حوزه به سختی میتواند کل صنعت را به سرعت پیش ببرد.
اما از سوی دیگر، چین دارای زنجیره تأمین رباتیک نسبتاً کاملی، تواناییهای تولید، نیروی کار مهندسی و تعداد زیادی صحنه واقعی است که میتواند دورههای آزمایش کامل، کاهش هزینهها، استقرار صحنه، جمعآوری دادهها و تکرار محصول را کوتاه کند.
این شرایط نمیتواند تضمین کند که یک شرکت خاص یا یک مسیر خاص حتماً موفق خواهد شد، اما میتواند به چین کمک کند تا رباتها را به صحنههای واقعی وارد کند و تأیید فناوری، مهندسی و تجاری را انجام دهد.
شور و شوق نهایتاً کاهش خواهد یافت و ورود هوش بدنی به زندگی افراد عادی ممکن است بیشتر از آنچه بازار انتظار دارد طول بکشد، اما زمانی که رباتها واقعاً در کارخانهها، انبارها و خانوادهها کار کنند، داستان هوش بدنی تازه آغاز شده است.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























