در زمانی که رباتهای انساننما در اوج توجه قرار دارند، به نظر میرسد که رهبر "اولین سهام ربات انساننما" در بازار سهام چین (A-shares) آب سردی بر روی صنعت میریزد.
در تاریخ 20 آگوست، در کنفرانس جهانی رباتیک 2026، بنیانگذار یوشو تکنولوژی، وانگ شینگ شینگ، در اولین سخنرانی عمومی خود پس از عرضه عمومی، صریحاً بیان کرد که لحظه چتجیپیتی هوش بدنی هنوز نرسیده است و ممکن است سریعاً در دو تا سه سال آینده یا به آرامی در پنج یا ده سال آینده به وقوع بپیوندد.
در دو سال گذشته، رباتهای انساننما به یکی از "محصولات مد روز" فناوری تبدیل شدهاند. در صحنههای مختلف از جمله نمایشهای بزرگ، نمایشگاههای بازی و حتی در ورودی فروشگاهها، مردم به راحتی میتوانند این رباتهای آیندهنگر را ببینند. این رباتها یا به طرز چابکی میرقصند، یا به طرز کمی دست و پا چلفتی راه میروند و با تماشاگران دست میدهند و در حال حاضر به سرعت از آزمایشگاهها به دید عموم منتقل میشوند.
اما در پس این نمایشهای شلوغ، توانایی واقعی این رباتها به وضوح با تصورات مردم از "رباتهای آینده" فاصله دارد. حداقل در انتظارات عمومی، رباتها نباید فقط به عنوان نمایشگر یا برای انجام وظایف بازاریابی عمل کنند، بلکه باید واقعاً به کارخانهها و خانهها وارد شوند و وظایف حمل و نقل، سازماندهی، کار با ابزار و یا انجام بخشی از کارهای خانگی و مراقبت را بر عهده بگیرند. سوال مردم همیشه مشخص و مستقیم بوده است: رباتها چه زمانی واقعاً میتوانند کار کنند؟
در زمینه مدلهای زبانی بزرگ، چتجیپیتی یک پاسخ نمادین بسیار مهم ارائه داده است. این مدل اولین مدل زبانی نیست، اما برای اولین بار به تعداد زیادی از کاربران عادی این آگاهی را داده است که هوش مصنوعی از یک نقطه عطف خاص عبور کرده است. اینکه چنین لحظهای چه زمانی در زمینه هوش بدنی رخ خواهد داد، به تدریج به یکی از مهمترین سوالات صنعت رباتیک تبدیل شده است.
در کنفرانس جهانی رباتیک 2026، بنیانگذار یوشو تکنولوژی، وانگ شینگ شینگ، بزرگترین مانع فعلی هوش بدنی را به یک سوال که قبلاً در صنعت به طور مکرر مورد بحث قرار گرفته است، اشاره کرد - توانایی عمومی.
به نظر او، در حال حاضر بسیاری از مدلهای رباتها در صحنههای ثابت، به محض اینکه دادههای کافی جمعآوری و آموزش ببینند، نرخ موفقیت وظایف میتواند به نزدیک 100 درصد برسد. اما به محض اینکه شیء مورد عمل تغییر کند یا محیط کمی تغییر کند، نرخ موفقیت ربات ممکن است به وضوح کاهش یابد.
این نیز یکی از مهمترین موانع ورود رباتها به زندگی و خانوادهها است.
وانگ شینگ شینگ یک استاندارد نسبتاً مشخص ارائه داد: اگر روزی یک ربات را به یک خانواده یا محیط کاملاً ناشناخته ببرید و آن تنها با استفاده از دستورات صوتی یا زبانی بتواند حدود 80 درصد از وظایف را انجام دهد، آنگاه هوش بدنی تقریباً به "لحظه چتجیپیتی" خود رسیده است. از نظر زمانی، او معتقد است که ممکن است سریعاً به 2 تا 3 سال نیاز باشد و در غیر این صورت ممکن است 5 سال یا حتی 10 سال طول بکشد.
وانگ شینگ شینگ به ویژه تأکید کرد که واقعاً دشوار نیست که رباتها "به طور کلی بدانند چه کار باید انجام دهند"، بلکه مشکل واقعی در آخرین چند سانتیمتر یا حتی میلیمتر است.
به عنوان مثال، اگر رباتی بخواهد یک شیء را بردارد، مدل ممکن است کل حرکت را به درستی برنامهریزی کرده باشد و بازوی مکانیکی نیز به نزدیکی شیء منتقل شده باشد، اما اگر خطای موقعیتی نهایی، بازخورد لمسی یا قدرت گرفتن به درستی اصلاح نشود، ممکن است کل وظیفه شکست بخورد.
این نیز یکی از تفاوتهای بزرگ رباتها با مدلهای زبانی بزرگ است.
ورودی و خروجی مدلهای زبانی همیشه در فضای دیجیتال اتفاق میافتد، در حالی که هر بار که ربات احساس میکند و عمل میکند، باید با دنیای فیزیکی واقعی تعامل داشته باشد. حسگرها دارای نویز هستند، عملگرها دارای خطا هستند و موقعیت، جنس و وزن اشیاء نیز به طور مداوم تغییر میکند و این خطاها با اجرای وظیفه به تدریج انباشته میشوند. بنابراین، برای هوش بدنی، حرکت از "به طور اساسی میتواند انجام دهد" به "به طور پایدار درست انجام دهد" ممکن است از یادگیری اولیه یک وظیفه دشوارتر باشد.
تقریباً همزمان با بیان این قضاوت توسط وانگ شینگ شینگ، وانگ هه، بنیانگذار و CTO گالاکسی جنرال، نیز یک سال مشخصتر ارائه داد. وانگ هه بیان کرد که با ادامه جمعآوری دادهها و پیشرفتهای بیشتر فناوری، هوش بدنی انتظار میرود در سال 2028 به "لحظه چتجیپیتی" برسد. او این نقطه را به عنوان: رباتها بدون نیاز به آموزش ویژه برای یک وظیفه خاص، بتوانند حدود 70 تا 80 درصد از وظایف روزمره را انجام دهند، تعریف کرد.
این دو قضاوت در واقع بسیار نزدیک هستند. وانگ شینگ شینگ به نرخ تکمیل وظایف رباتها در محیطهای ناشناخته توجه دارد، در حالی که وانگ هه به توانایی عمومی مدلهای پایه بدون آموزش ویژه توجه دارد، اما هر دو نقطه عطف را در حدود 70 تا 80 درصد نرخ موفقیت وظایف ناشناخته قرار دادهاند.
این همچنین به این معنی است که "لحظه چتجیپیتی" که آنها به آن اشاره میکنند، نه توانایی حرکتی است که امروز رباتهای انساننما نشان میدهند و نه موفقیت بالای 99 درصدی که یک دمو ثابت با آموزش زیاد میتواند به دست آورد. تغییر واقعی باید زمانی رخ دهد که رباتها شروع به رهایی از وابستگی به صحنههای ثابت، اشیاء ثابت و آموزش ویژه کنند.
تنها یک ماه پیش، در کنفرانس جهانی هوش مصنوعی 2026 (WAIC)، یک میز گرد همین سوال را به شش کارآفرین و محقق برتر در زمینه هوش بدنی ارائه داد.
در تاریخ 19 ژوئیه، در یک رویداد "فوروم هوش بدنی" که توسط Zhiyuan Robotics و Mifeng Technology برگزار شد، در آخرین بخش میز گرد، مجری از شش مهمان خواست تا به یک سوال بسیار مستقیم پاسخ دهند: لحظه چتجیپیتی رباتها چند سال دیگر خواهد بود؟
نتیجه به طرز عجیبی متمرکز بود. یائو مائوچینگ، شریک Zhiyuan Robotics و رئیس و CEO Mifeng Technology، پاسخ خود را 2 سال اعلام کرد؛ تونی ژائو، همبنیانگذار و CEO Sunday Robotics، آن را در کمتر از 3 سال دانست؛ ژانگ ژنگیو، دانشمند ارشد Tencent و مدیر آزمایشگاه Robotics X، 3 تا 5 سال را اعلام کرد؛ ما یچنگ، همبنیانگذار و دانشمند ارشد Dyna Robotics، حدود 4 سال را پیشبینی کرد؛ رن ژیئی، دانشمند تحقیقاتی Physical Intelligence، 4 تا 5 سال را تخمین زد؛ و ژو دانفی، استاد دانشگاه جورجیا تک، پاسخ خود را 5 سال اعلام کرد.
این شش نفر از شرکتها و مؤسسات تحقیقاتی کاملاً متفاوتی آمدهاند و مسیرهای فناوری نیز متفاوت است، اما در نهایت پاسخهای ارائه شده همه در آینده 2 تا 5 سال متمرکز شدهاند.
در میان آنها، یائو مائوچینگ خوشبینترین بود. قضاوت او عمدتاً بر اساس رشد مقیاس دادهها است. به نظر یائو مائوچینگ، محدودیتهای فعلی در توسعه بیشتر هوش مصنوعی فیزیکی را میتوان به سه دیوار "داده، نمایش و حلقه بسته" خلاصه کرد. در مقایسه با حجم عظیم متن و تصویر که به راحتی در دنیای اینترنت قابل دسترسی است، دادههای واقعی تعامل رباتها نه تنها گران است، بلکه تحت تأثیر تفاوتهای ربات، وظیفه و صحنه قرار دارد.
رباتهایی که واقعاً میتوانند به راحتی استفاده شوند، باید دستورات زبان طبیعی باز را درک کنند و در وظایف رایج به حدود 70 تا 80 درصد نرخ موفقیت پایه برسند. برای دستیابی به این هدف، هوش بدنی به مقیاس دادهای بسیار فراتر از سطح فعلی نیاز دارد. او حتی پیشنهاد کرد که ممکن است در آینده به مقیاس دادهای در سطح میلیارد ساعت نیاز باشد.
به عبارت دیگر، در چارچوب قضاوت یائو مائوچینگ، "لحظه چتجیپیتی" تا حد زیادی یک مسئله مقیاس است: وقتی دادههای واقعی، دادههای شبیهسازی، ویدیوهای اینترنتی، دادههای دید اول و دادههای بازگشتی از استقرار رباتها به تدریج به مقیاس برسند، توانایی مدل نیز ممکن است از نقطه عطف عبور کند.
تونی ژائو از Sunday Robotics زمان را در کمتر از 3 سال فشرده میکند. او به جای اینکه به دنبال رباتهای پیچیدهتر باشد، بیشتر به این موضوع توجه دارد که "مغز" رباتها چه زمانی واقعاً میتواند به بلوغ برسد. Sunday Robotics به طور مداوم بر روی رباتهای خانگی و مدلهای پایه تمرکز دارد و ایده او این است که اگر یک مدل پایه رباتی به اندازه کافی قوی باشد تا محیط و وظایف پیچیده را درک کند، حتی اگر ربات از چنگالهای نسبتاً ساده و کمهزینه استفاده کند، ممکن است ابتدا بسیاری از مشکلات واقعی را حل کند.
ژانگ ژنگیو رویکردی بسیار محتاطانهتر دارد. او پاسخ خود را 3 تا 5 سال اعلام کرد، اما تأکید کرد که این بازه زمانی به این معنا نیست که صنعت فقط باید منتظر ظهور یک مدل بزرگتر باشد. یکی از پیشنیازهای مهمی که مدلهای زبانی بزرگ میتوانند به سرعت به توانایی مقیاسپذیر برسند، این است که ترنسفورمر به تدریج به عنوان یک معماری نسبتاً یکپارچه تبدیل شده است. اما هوش رباتیک هنوز چنین الگوی فناوری روشنی را شکل نداده است.
از شناخت سطح بالا، ادراک بصری و برنامهریزی وظایف، تا کنترل حرکتی در زمان واقعی، بازخورد بدنی و واکنشهای ایمنی، یک ربات باید به طور همزمان مسائل مختلفی را در مقیاسهای زمانی مختلف پردازش کند. بنابراین، واقعیترین پیشرفت ممکن است نیاز به پیشرفت همزمان در جمعآوری دادهها، شبیهسازی، استقرار واقعی، بازیابی از شکست، سختافزار و مدل داشته باشد و نه فقط کپی کردن قانون مقیاس مدلهای زبانی بزرگ. به همین دلیل، ژانگ ژنگیو هنگام ارائه قضاوت خود، به ویژه تأکید کرد که صنعت هنوز نیاز به "کار کردن به طور جدی" دارد.
ما یچنگ زمان را حدود 4 سال اعلام کرد. قضاوت او بیشتر از استقرار تجاری ناشی میشود. برای یک دمو آزمایشگاهی، نرخ موفقیت 80 یا 90 درصد ممکن است به اندازه کافی برای اثبات کارایی مسیر فناوری باشد؛ اما برای یک کارخانه واقعی یا یک شرکت خدماتی که رباتها را خریداری میکند، چنین قابلیت اطمینانی معمولاً به شدت ناکافی است. بنابراین، "لحظه چتجیپیتی" هوش بدنی نه تنها به این معنی است که رباتها میتوانند وظایف بیشتری را درک کنند، بلکه به این معنی است که باید به سطح قابل قبولی از قابلیت اطمینان برسند که بتواند در محیطهای تجاری واقعی پذیرفته شود.
رن ژیئی نیز 4 تا 5 سال را پیشبینی کرد. او بیان کرد که قبل از پیوستن به Physical Intelligence، به شدت فکر میکرد که این فرآیند ممکن است 10 سال طول بکشد، اما با پیشرفت مدلهای پایه رباتیک در سال گذشته، پیشبینی او به وضوح جلوتر آمده است.
Physical Intelligence خود نیز یکی از شرکتهای نماینده در مسیر "مدلهای پایه رباتیک" است که هدف آن از طریق آموزش دادههای بینبدنی و بینوظیفهای، به یک مدل واحد تواناییهای عملیاتی گستردهتری بدهد. در این منطق، واقعاً مهم است که آیا توانایی رباتها میتواند با افزایش مقیاس مدل و دادهها به طور مداوم ظهور کند و در نهایت اثر مشابهی از انتقال بدون نمونه مدلهای زبانی بزرگ ایجاد کند.
پاسخ ژو دانفی، استاد دانشگاه جورجیا تک، محافظهکارترین بود، اما او نیز تنها 5 سال را پیشبینی کرد. او به جای اینکه بر روی یک مسیر مدل خاص شرطبندی کند، بیشتر به سه معیار اساسی توجه دارد: آیا مدل واقعاً میتواند از دادهها یاد بگیرد، آیا تواناییهای یادگرفته شده میتواند به محیطها و وظایف جدید تعمیم یابد و آیا سرعت استدلال میتواند نیازهای عملیاتی زمان واقعی رباتها در دنیای واقعی را برآورده کند.
ما قضاوتهای وانگ شینگ شینگ "سریعترین 2 تا 3 سال"، وانگ هه "2028" و پاسخهای شش مهمان WAIC را در کنار هم قرار میدهیم، یک پدیده روزافزون واضح است: صنعت هوش بدنی در حال فشردهسازی جدول زمانی "رباتهای عمومی" که قبلاً دور به نظر میرسید، به یک چرخه فناوری آینده است.
با این حال، اگرچه این کارآفرینان و محققان پیشبینیهای زمانی خود را به هم نزدیکتر میکنند، اما در واقع آنها از یک استاندارد یکسان برای بحث در مورد "لحظه چتجیپیتی" استفاده نمیکنند.
وانگ هه به پیشرفت توانایی مدلهای پایه توجه دارد. در تعریف او، زمانی که رباتها دیگر نیازی به آموزش ویژه برای هر وظیفه جدید نداشته باشند و تنها با استفاده از مدل پایه بتوانند 70 تا 80 درصد از وظایف روزمره را انجام دهند، هوش بدنی از یک نقطه عطف مشابه چتجیپیتی عبور کرده است. این استاندارد ابتدا توانایی مدل را از "هوش ویژه" برای وظایف خاص به "هوش عمومی" با توانایی انتقال قویتر ارزیابی میکند.
معیار وانگ شینگ شینگ به عملکرد واقعی رباتها در دنیای واقعی نزدیکتر است. او نیز نرخ تکمیل حدود 80 درصد را به عنوان یک مانع مهم در نظر میگیرد، اما تأکید میکند که آیا رباتها میتوانند تنها با استفاده از دستورات زبانی، بیشتر وظایف را در محیطهای ناشناخته انجام دهند. به نظر او، امروز بسیاری از رباتها میتوانند در محیطهای ثابت و آموزشدیده با موفقیت بالا عمل کنند، اما واقعاً دشوار است که پس از تغییر محیط، شیء یا وظیفه، مدل همچنان کار کند.
این دو تعریف به نظر نزدیک میآیند، اما در واقع سطوح توجه آنها کاملاً یکسان نیست. یک مدل حتی اگر تواناییهای خوبی در انتقال بدون نمونه یا بین وظیفه داشته باشد، به این معنا نیست که رباتی که آن را حمل میکند، به یک ابزار تولید قابل اعتماد تبدیل شده است. وانگ شینگ شینگ در WRC اشاره کرد که یوشو در واقع در کارخانههای خود و همچنین در کارخانههای خود رباتها را مستقر کرده است و میتواند برخی از وظایف ساده مونتاژ را انجام دهد، اما در حال حاضر هنوز به طور گستردهای گسترش نیافته است، یکی از دلایل مهم این است که کارایی رباتها هنوز کمتر از انسان است و در مواجهه با وظایف جدید معمولاً به آموزش مجدد نیاز دارند.
جیتیسای CEO، گائو جییانگ، به این سوال یک قضاوت دوگانه جالب ارائه داد. در نقشه راه صنعتی که در WRC نمایش داده شد، گائو جییانگ سال 2027 را به عنوان "لحظه GPT" در سطح فناوری مشخص کرد و معتقد است که قانون مقیاس توانایی مدلهای پایه را از نقطه عطف عبور میدهد و کاربردهای صحنهای عمودی به سرعت آغاز میشود؛ اما نقطه عطف واقعی "تجاریسازی" در سال 2028 قرار داده شده است و سپس باید از نفوذ عمیق در سال 2029 و استقرار گسترده در سال 2030 عبور کند.
اما وقتی به این موضوع میپردازد که آیا هوش بدنی میتواند نقاط تاریخی مشابه چتجیپیتی را کپی کند، گائو جییانگ به وضوح بیان میکند که او معتقد است "احتمالاً چنین لحظهای وجود نخواهد داشت". دلیل این است که هوش بدنی به طور ناگهانی از طریق یک محصول نرمافزاری که برای همه قابل دسترسی است، گسترش نخواهد یافت، بلکه احتمالاً از صحنههای B2B شروع میشود و به تدریج یک صنعت و یک وظیفه را باز میکند.
و پیشرفتهای فناوری و درک عمومی به سختی میتوانند همزمان اتفاق بیفتند. زیرا انفجار GPT به این بستگی دارد که همه بتوانند به راحتی از طریق تلفن همراه یا کامپیوتر خود تجربه کنند، در حالی که صحنههای اولیهای که هوش بدنی در آن مستقر میشود، کارخانهها، انبارها و سایر نقاط تولید هستند که عموم مردم به سختی میتوانند به طور مستقیم درک کنند. بنابراین، نقطه عطف صنعتی به طور تدریجی به صورت "به آرامی و بیصدا" ظاهر خواهد شد و وقتی مردم ناگهان متوجه آن شوند، این فناوری در همه جا وجود دارد.
این دو بیان کاملاً متناقض نیستند. گائو جییانگ در واقع تواناییهای مدل را از نقطه عطف فناوری و گسترش اجتماعی صنعت را از نقطه عطف اجتماعی تفکیک کرده است: اولی ممکن است در یک سال نسبتاً واضح ظاهر شود، اما دومی نیاز به تأیید صحنه، تولید در مقیاس، کاهش هزینهها و بلوغ مدلهای تجاری دارد تا به تدریج به دنیای واقعی منتقل شود.
این نیز یکی از بارزترین تفاوتهای رباتها با مدلهای زبانی بزرگ است. پس از انتشار چتجیپیتی در نوامبر 2022، تغییرات توانایی مدل تقریباً میتواند در همان روز به کاربران جهانی منتقل شود. برای یک محصول نرمافزاری، تا زمانی که سرورها و قدرت محاسباتی بتوانند تحمل کنند، هزینه اضافه کردن یک کاربر نسبتاً محدود است و کاربر با باز کردن وبسایت و وارد کردن سوال، میتواند به سرعت تغییر توانایی مدل را احساس کند. بنابراین، پیشرفت فناوری، انتشار محصول و پذیرش گسترده کاربران تقریباً در یک بازه زمانی واحد در چتجیپیتی فشرده شده است.
اما رباتها باید از طریق یک بدن واقعی وارد دنیای فیزیکی شوند. حتی اگر یک مدل پایه فردا به طور ناگهانی تواناییهای به مراتب قویتری در انتقال داشته باشد، این توانایی هنوز باید از طریق تراشهها، حسگرها، مفاصل، دستهای چابک و عملگرها به حرکات واقعی تبدیل شود و با دقت، ثبات، ایمنی، عمر، نگهداری و هزینهها مواجه شود.
بنابراین، هوش بدنی در نهایت ممکن است به سختی بتواند یک نقطه تاریخی واضح مانند 30 نوامبر 2022 را کپی کند. بلکه بیشتر به صورت یک سری نقاط عطف تدریجی ظاهر خواهد شد. شاید در آینده، حتی اگر مردم به گذشته نگاه کنند و "لحظه چتجیپیتی هوش بدنی" را تأیید کنند، نتوانند برای آن یک نقطه مشخص و مورد تأیید همه پیدا کنند.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.
![[مصاحبه نهایی SCAN 2026] ⑫ Lv1x: دانشجوی امنیت سایبری مالزی، چالش در مرحله نهایی](/public-static/10_5acc261b9b.png?format=avif)




























