**中国はAI競争において新たなボトルネックに直面している:中国語の訓練データの不足。チップが議論の中心となる中、専門家は中国語のウェブコンテンツが1.3%しかないことが、国内のAIモデルの発展を妨げる可能性があると警告している。
中国の人工知能(AI)競争には、半導体に依存しない新たな限界がある。アメリカの先進的なチップに対する輸出管理が注目を集める中、中国は高品質な中国語の訓練データが不足している。この不足は同様に制約となり、ハードウェアとは異なり、簡単な技術的解決策は存在しない。
インターネットトラッカーW3Techsによると、中国語は世界のウェブコンテンツのわずか1.3%を占めている。それに対し、英語はほぼ半分を占め、スペイン語は6%、日本語は5%に達している。この不均衡は、中国が高度な言語モデルを開発する能力に直接的な影響を与えている。
データの不足は中国特有のものではないが、中国はより深刻な影響を受けている。Epoch AIは、高品質な公開テキストの世界的供給が6年以内に完全に枯渇する可能性があると推定している。OpenAIの共同創設者であるアンドレイ・カルパティは、今世紀末までに「データの壁」が襲う可能性があると警告している。
中国の開発者は、すでに西洋の同業者よりも有用なトークンに対して高い価格を支払っている。その理由は明白である:彼らのモデルは母国語での素材が少ないため、訓練が高くつく。複雑なタスクにおける中国のモデルのパフォーマンスは、アメリカのモデルに対して明らかに劣っている。
この問題は、中国のデジタルエコシステムが閉鎖的であるため、さらに悪化している。WeChatやDouyinのようなプラットフォームは外部の開発者とデータを共有せず、AIラボは質の低いソースに頼らざるを得ない。西洋では、ソーシャルメディアやフォーラムの公開データへのアクセスがより多いため、中国は内部の障壁に直面している。
この状況は、専門家にとってデータの不足がチップの制限と同じくらい深刻であると考えさせている。中国語のテキストの不足を解決するハードウェアの解決策は存在しない。この問題は構造的であり、長期的な戦略を必要とする。
北京はすでにデータを戦略的インフラとして扱っている。6月には国家データ管理局が2028年までに検証済みのAI訓練データセットを構築する国家計画を発表した。これらは製造、エネルギー、健康、金融、農業、自動運転、統合AIなどの分野をカバーする。
国家に所属する中国情報通信技術アカデミーのユウ・シャオフイ会長は、「AI時代の競争はモデルや計算能力だけでなく、高品質なデータ供給システムの競争でもある」と述べている。この見解は、問題の深刻さに対する公式の認識を反映している。
清華大学のコンピュータ科学者であるサン・マオソンは、当局に対して歴史的なアーカイブ、古代の写本、科学文献、地域の方言をデジタル化するよう呼びかけている。これらの未開発のソースは、AIモデルの訓練に利用可能なコーパスを大幅に拡大する可能性がある。
しかし、歴史的資料のデジタル化は高コストで時間のかかるプロセスである。すべてのコンテンツがデジタル形式で利用できるわけではなく、多くは特別な処理を必要とする。政府の努力にもかかわらず、短期的には英語とのギャップは依然として大きい。
別の障害は、出版業界の抵抗です。例えば、華夏出版社は最近、新しい翻訳に警告を追加しました。「この本の内容を人工知能の訓練に使用することは禁止されています。違反者は法的責任を負います。」この措置は他の出版社にも広まり、利用可能な情報源をさらに減少させています。
アメリカでは、状況は根本的に異なります。Claudeの開発会社であるAnthropicは、パナマプロジェクトを立ち上げ、数百万冊の物理的な本を購入して破壊し、それらをスキャンして訓練データとして使用しました。この攻撃的な戦略は、中国が直面している不足とは対照的です。
この比較は、データへのアクセスが重要な競争優位性になっていることを示しています。アメリカは英語で膨大なコーパスを持っていますが、中国は自国語でのウェブコンテンツがわずか1.3%です。この違いは、より強力でよく訓練されたモデルを西側に生み出しています。
データは圧倒的です:英語はウェブコンテンツの49%を占めており、中国語は1.3%です。英語のデータ量に匹敵するためには、中国はデジタルプレゼンスをほぼ40倍に増やす必要があります。これは一朝一夕には達成できない巨大な課題です。
専門家は、量だけでなく、コンテンツの質も重要であると指摘しています。インターネット上の中国語のテキストは、英語と比較して多様性が少なく、質も低いことが多いです。これが、推論、理解、テキスト生成のタスクにおけるモデルのパフォーマンスに影響を与えています。
データ不足は経済的な影響も持っています。中国の開発者は、データのクリーンアップやキュレーションにより多くのリソースを投資しなければならず、プロセスが高くつきます。その結果、データの不足は、医療や工学などの新興分野におけるイノベーションの能力を制限します。
中国語のデータ不足は、AIラボだけでなく、国の国際的な競争力にも影響を与えています。中国がこの障壁を克服できなければ、複雑なタスクにおいてアメリカのモデルに遅れをとり続けることになります。これは、経済の重要な分野におけるAIの採用を妨げる可能性があります。
中国政府はこの課題を認識しており、国家データベースを構築する計画を立てています。しかし、解決策が実現するまでには数年かかります。その間、中国の企業は合成データの生成や、大規模なテキストコーパスを持つ企業の買収などの代替手段を模索しています。
もう一つの道は、他の言語のデータを活用する多言語モデルの開発です。しかし、中国語に焦点を当てることは、言語の精度が重要なローカルアプリケーションにとって不可欠です。中国語の特定のデータが不足していることは、モデルのパーソナライズや適応において依然として障害となります。
The Next Webによって報告されたこのニュースは、見落とされがちな点を強調しています:AIはアルゴリズムや計算能力だけでなく、データにも依存しています。そして、データが不足していると、テクノロジーの大国でさえつまずくことがあります。中国はこれを厳しい方法で学んでいます。
結論として、中国語の訓練データの不足は、迅速な解決策がない構造的な問題です。チップとは異なり、投資と時間で製造できるものではなく、データは有限で作成が難しい資源です。中国のAIにおける主権への競争は、工場や法令では打破できない壁に直面しています。
本コンテンツは、一般的な情報提供のみを目的としたものであり、金融、投資、法律、または税務に関する助言を構成するものではありません。ここに記載されているイベント、報酬、オンラインキャンペーン、またはそれらに関連する情報は、暗号資産の購入、売却、取引、その他いかなる取引の推奨、勧誘、または招待とみなされるべきではありません。暗号資産は価格変動が非常に大きく、損失が発生する可能性があります。WEEXのサービス、プロダクト、および関連イベントの提供状況は、地域によって異なる場合があります。お客様は、ご自身の参加が適用される現地の法令を遵守していることを自ら確認する責任を負うものとします。





























