**چین با یک گلوگاه جدید در رقابت هوش مصنوعی مواجه است: کمبود دادههای آموزشی به زبان چینی. در حالی که تراشهها در کانون بحث قرار دارند، کارشناسان هشدار میدهند که ۱.۳٪ از محتوای وب به زبان چینی میتواند توسعه مدلهای هوش مصنوعی در کشور را متوقف کند.
رقابت چین در زمینه هوش مصنوعی (AI) با محدودیتی جدید مواجه است که به نیمههادیها وابسته نیست. در حالی که کنترلهای صادراتی ایالات متحده بر روی تراشههای پیشرفته توجه را جلب کرده است، این کشور در حال کمبود دادههای آموزشی با کیفیت بالا به زبان چینی است. این کمبود میتواند به همان اندازه محدودکننده باشد و بر خلاف سختافزار، هیچ راهحل فناوری سادهای وجود ندارد.
بر اساس ردیاب اینترنتی W3Techs، زبان چینی تنها ۱.۳٪ از محتوای وب جهانی را تشکیل میدهد. در مقابل، زبان انگلیسی تقریباً نیمی از محتوا را به خود اختصاص داده است، زبان اسپانیایی به ۶٪ و زبان ژاپنی به ۵٪ میرسد. این عدم تعادل به طور مستقیم بر توانایی چین در توسعه مدلهای زبان پیشرفته تأثیر میگذارد.
کمبود دادهها مختص چین نیست، اما غول آسیایی آن را با شدت بیشتری تجربه میکند. Epoch AI تخمین میزند که عرضه جهانی متن عمومی با کیفیت بالا ممکن است در شش سال آینده به طور کامل تمام شود. اندری کرباتی، یکی از بنیانگذاران OpenAI، درباره یک "دیوار داده" هشدار داده است که ممکن است در اواخر این دهه به وقوع بپیوندد.
توسعهدهندگان چینی در حال حاضر برای هر توکن مفید بیشتر از همتایان غربی خود پرداخت میکنند. دلیل آن ساده است: مدلهای آنها باید با مواد کمتری به زبان مادری خود کار کنند که هزینه آموزش را افزایش میدهد. این شکاف در عملکرد مدلهای چینی در مقایسه با مدلهای آمریکایی در وظایف پیچیده مشهود است.
این مشکل تشدید میشود زیرا اکوسیستم دیجیتال چین بسته است. پلتفرمهایی مانند WeChat و Douyin دادهها را با توسعهدهندگان خارجی به اشتراک نمیگذارند و آزمایشگاههای هوش مصنوعی را با منابع با کیفیت پایینتر مواجه میکنند. بر خلاف غرب، که دسترسی بیشتری به دادههای عمومی از شبکههای اجتماعی و فرومها وجود دارد، چین با موانع داخلی روبرو است.
این وضعیت باعث شده است که کارشناسان بر این باور باشند که کمبود دادهها به اندازه محدودیتهای تراشهها جدی است. هیچ راهحل سختافزاری وجود ندارد که کمبود متن به زبان چینی را حل کند. این مشکل ساختاری است و نیاز به استراتژیهای بلندمدت دارد.
پکن در حال حاضر دادهها را به عنوان زیرساختی استراتژیک در نظر میگیرد. در ماه ژوئن، اداره ملی دادهها یک طرح ملی برای ساخت مجموعههای داده آموزشی تأیید شده برای هوش مصنوعی تا سال ۲۰۲۸ ارائه داد. این مجموعهها شامل بخشهایی مانند تولید، انرژی، بهداشت، مالی، کشاورزی، رانندگی خودکار و هوش مصنوعی یکپارچه خواهد بود.
یو شیاوهویی، رئیس آکادمی فناوری اطلاعات و ارتباطات چین، وابسته به دولت، اعلام کرده است که "رقابت در عصر هوش مصنوعی نه تنها بر سر مدلها و قدرت محاسباتی، بلکه همچنین بر سر سیستمهای تأمین دادههای با کیفیت بالا است." این دیدگاه نشاندهنده آگاهی رسمی از شدت مشکل است.
دانشمند کامپیوتر دانشگاه Tsinghua، سان ماوسونگ، از مقامات خواسته است تا آرشیوهای تاریخی، دستنوشتههای قدیمی، ادبیات علمی و گویشهای محلی را دیجیتالی کنند. این منابع، که تا کنون به طور کمتری مورد استفاده قرار گرفتهاند، میتوانند به طور قابل توجهی مجموعه موجود برای آموزش مدلهای هوش مصنوعی را گسترش دهند.
با این حال، دیجیتالیسازی مواد تاریخی یک فرآیند پرهزینه و زمانبر است. همه محتواها به صورت دیجیتال در دسترس نیستند و بسیاری نیاز به پردازش ویژه دارند. با وجود تلاشهای دولتی، شکاف با زبان انگلیسی در کوتاهمدت همچنان بزرگ خواهد بود.
موانع دیگری نیز وجود دارد، از جمله مقاومت بخش انتشارات. به عنوان مثال، انتشارات هوشیا به تازگی هشدار جدیدی به یک ترجمه جدید اضافه کرده است: "استفاده از محتوای این کتاب برای آموزش هوش مصنوعی ممنوع است. متخلفان مسئولیت قانونی خواهند داشت." این اقدام که توسط سایر ناشران نیز تکرار شده، منابع موجود را بیشتر کاهش میدهد.
در ایالات متحده، وضعیت به طور رادیکالی متفاوت است. شرکت آنتروپیک، خالق کلاود، پروژه پاناما را راهاندازی کرده است که میلیونها کتاب فیزیکی را خریداری و نابود کرده تا آنها را اسکن کند و به عنوان دادههای آموزشی استفاده کند. این استراتژی تهاجمی با کمبودهایی که چین با آن مواجه است، در تضاد است.
این مقایسه نشان میدهد که دسترسی به دادهها به یک مزیت رقابتی کلیدی تبدیل شده است. در حالی که ایالات متحده یک مجموعه وسیع به زبان انگلیسی دارد، چین تنها ۱.۳٪ از محتوای وب را به زبان خود دارد. این تفاوت به مدلهای قویتر و بهتر آموزشدیده در غرب منجر میشود.
عددها قاطع هستند: زبان انگلیسی ۴۹٪ از محتوای وب را تشکیل میدهد، در حالی که این رقم برای زبان چینی ۱.۳٪ است. برای برابری با مقدار دادههای انگلیسی، چین باید تقریباً ۴۰ برابر حضور دیجیتال خود را افزایش دهد. این یک کار عظیم است که به راحتی انجام نخواهد شد.
کارشناسان اشاره میکنند که علاوه بر کمیت، کیفیت محتوا نیز حیاتی است. متنی که به زبان چینی در اینترنت موجود است، معمولاً تنوع کمتری دارد و کیفیت آن نسبت به زبان انگلیسی پایینتر است. این موضوع بر عملکرد مدلها در وظایف استدلال، درک و تولید متن تأثیر میگذارد.
کمبود دادهها همچنین پیامدهای اقتصادی دارد. توسعهدهندگان چینی باید منابع بیشتری را برای پاکسازی و گردآوری دادهها سرمایهگذاری کنند که این امر هزینه فرآیند را افزایش میدهد. به نوبه خود، کمبود دادهها قابلیت نوآوری در حوزههای نوظهور مانند هوش مصنوعی در پزشکی یا مهندسی را محدود میکند.
کمبود دادهها به زبان چینی نه تنها بر آزمایشگاههای هوش مصنوعی تأثیر میگذارد، بلکه بر رقابتپذیری کشور در صحنه جهانی نیز تأثیر میگذارد. اگر چین نتواند این مانع را پشت سر بگذارد، مدلهای آن در وظایف پیچیده نسبت به مدلهای آمریکایی عقب خواهند ماند. این میتواند پذیرش هوش مصنوعی را در بخشهای حیاتی اقتصاد متوقف کند.
دولت چین از چالش آگاه است و به همین دلیل برنامههایی برای ساخت پایگاههای داده ملی راهاندازی کرده است. با این حال، راهحلها سالها طول میکشد تا به ثمر برسند. در همین حال، شرکتهای چینی به دنبال گزینههایی مانند تولید دادههای مصنوعی یا خرید شرکتهایی با مجموعههای بزرگ متنی هستند.
راه دیگری که وجود دارد، توسعه مدلهای چندزبانه است که از دادههای زبانهای دیگر بهره میبرند. اما تمرکز بر زبان چینی برای کاربردهای محلی ضروری است، جایی که دقت زبان حیاتی است. کمبود دادههای خاص به زبان چینی همچنان مانعی برای شخصیسازی و سازگاری مدلها خواهد بود.
این خبر که توسط The Next Web گزارش شده، نکتهای را برجسته میکند که معمولاً نادیده گرفته میشود: هوش مصنوعی تنها به الگوریتمها و قدرت محاسباتی وابسته نیست، بلکه به دادهها نیز بستگی دارد. و زمانی که دادهها کمبود داشته باشند، حتی قدرتهای فناوری نیز به مشکل میخورند. چین در حال یادگیری این موضوع به سختترین شکل ممکن است.
در نتیجه، کمبود دادههای آموزشی به زبان چینی یک مشکل ساختاری است که راهحل سریع ندارد. بر خلاف تراشهها که میتوان با سرمایهگذاری و زمان تولید کرد، دادهها یک منبع محدود و دشوار برای ایجاد هستند. مسابقه چین برای دستیابی به استقلال در هوش مصنوعی با دیواری مواجه است که با کارخانهها یا احکام قانونی نمیتوان آن را شکست.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























