**China enfrenta un nuevo obstáculo en la carrera de la IA: la escasez de datos de entrenamiento en chino. Mientras que los chips dominan el debate, los expertos advierten que el 1.3% del contenido web en chino podría obstaculizar el desarrollo de modelos de IA en el país.
La carrera de China en inteligencia artificial (IA) tiene un nuevo límite que no depende de los semiconductores. Mientras que los controles de exportación de EE. UU. sobre chips avanzados han acaparado la atención, el país se está quedando sin datos de entrenamiento de alta calidad en chino. Esta escasez podría ser igualmente limitante, y a diferencia del hardware, no hay una solución tecnológica simple.
Según el rastreador de internet W3Techs, el chino representa solo el 1.3% del contenido web global. En contraste, el inglés domina con casi la mitad, el español alcanza el 6% y el japonés el 5%. Este desequilibrio impacta directamente la capacidad de China para desarrollar modelos de lenguaje avanzados.
La escasez de datos no es exclusiva de China, pero el gigante asiático la sufre de manera más intensa. Epoch AI estima que el suministro global de texto público de alta calidad podría agotarse por completo en seis años. Andrej Karpathy, cofundador de OpenAI, ha advertido sobre una "muralla de datos" que podría impactar a finales de esta década.
Los desarrolladores chinos ya están pagando más por cada token útil que sus contrapartes occidentales. La razón es simple: sus modelos deben trabajar con menos material en su idioma nativo, lo que eleva los costos de entrenamiento. La brecha es evidente en el rendimiento de los modelos chinos en comparación con los estadounidenses en tareas complejas.
El problema se agrava porque el ecosistema digital de China es cerrado. Plataformas como WeChat y Douyin no comparten datos con desarrolladores externos, dejando a los laboratorios de IA con fuentes de menor calidad. A diferencia de Occidente, donde hay más acceso a datos públicos de redes sociales y foros, China enfrenta barreras internas.
Esta situación ha llevado a los expertos a considerar que la falta de datos es tan grave como las restricciones de chips. No hay una solución de hardware que pueda resolver la escasez de texto en chino. El problema es estructural y requiere estrategias a largo plazo.
Pekín ya está tratando los datos como infraestructura estratégica. En junio, la Administración Nacional de Datos presentó un plan nacional para construir conjuntos de datos de entrenamiento de IA validados para 2028. Estos cubrirán sectores como manufactura, energía, salud, finanzas, agricultura, conducción autónoma e IA integrada.
Yu Xiaohui, presidente de la Academia China de Tecnología de la Información y Comunicaciones, afiliada al estado, ha declarado que "la competencia en la era de la IA no es solo por modelos y poder de cómputo, sino también por sistemas de suministro de datos de alta calidad". Esta visión refleja una conciencia oficial sobre la gravedad del problema.
El científico informático Sun Maosong de la Universidad de Tsinghua ha instado a las autoridades a digitalizar archivos históricos, manuscritos antiguos, literatura científica y dialectos regionales. Estas fuentes previamente infrautilizadas podrían expandir significativamente el corpus disponible para entrenar modelos de IA.
Sin embargo, la digitalización de materiales históricos es un proceso costoso y lento. No todo el contenido está disponible en formato digital, y muchos requieren un procesamiento especial. A pesar de los esfuerzos del gobierno, la brecha con el inglés seguirá siendo enorme a corto plazo.
Otro obstáculo es la resistencia del sector editorial. Huaxia Publishing, por ejemplo, agregó recientemente una advertencia a una nueva traducción: "Está prohibido utilizar el contenido de este libro para entrenar inteligencia artificial. Los infractores serán responsables legalmente". Esta medida, replicada por otras editoriales, reduce aún más las fuentes disponibles.
En EE. UU., la situación es radicalmente diferente. La empresa Anthropic, creadora de Claude, lanzó el Proyecto Panamá, que compró y destruyó millones de libros físicos para escanearlos y usarlos como datos de entrenamiento. Esta estrategia agresiva contrasta con la escasez que enfrenta China.
La comparación ilustra cómo el acceso a datos se ha convertido en una ventaja competitiva clave. Mientras que EE. UU. tiene un vasto corpus en inglés, China solo representa el 1.3% del contenido web en su idioma. Esta diferencia se traduce en modelos más poderosos y mejor entrenados en Occidente.
Los datos son impactantes: el inglés representa el 49% del contenido web, en comparación con el 1.3% del chino. Para igualar la cantidad de datos en inglés, China necesitaría multiplicar su presencia digital por casi 40 veces. Una tarea titánica que no se logrará de la noche a la mañana.
Los expertos señalan que, además de la cantidad, la calidad del contenido es crucial. El texto en chino disponible en internet tiende a ser menos diverso y de menor calidad en comparación con el inglés. Esto afecta el rendimiento de los modelos en tareas de razonamiento, comprensión y generación de texto.
La escasez de datos también tiene implicaciones económicas. Los desarrolladores chinos deben invertir más recursos en limpieza y curación de datos, lo que eleva los costos. A su vez, la falta de datos limita la capacidad de innovación en áreas emergentes como la IA aplicada a la medicina o la ingeniería.
La escasez de datos en chino no solo afecta a los laboratorios de IA, sino también la competitividad del país en el escenario global. Si China no logra superar esta barrera, sus modelos seguirán rezagados respecto a los estadounidenses en tareas complejas. Esto podría obstaculizar la adopción de la IA en sectores críticos de la economía.
El gobierno chino es consciente del desafío y, por lo tanto, ha lanzado planes para construir bases de datos nacionales. Sin embargo, las soluciones tardarán años en materializarse. Mientras tanto, las empresas chinas están buscando alternativas como generar datos sintéticos o adquirir empresas con grandes corpus de texto.
Otra vía es el desarrollo de modelos multilingües que aprovechen datos en otros idiomas. Pero el enfoque en el chino es esencial para aplicaciones locales, donde la precisión del lenguaje es crítica. La falta de datos específicos en chino seguirá siendo un obstáculo para la personalización y adaptación de modelos.
La noticia, reportada por The Next Web, subraya un punto que a menudo se pasa por alto: la IA no depende únicamente de algoritmos y poder de cómputo, sino de datos. Y cuando los datos son escasos, incluso las potencias tecnológicas tropiezan. China está aprendiendo esto de la manera más difícil.
En conclusión, la escasez de datos de entrenamiento en chino es un problema estructural que no tiene una solución rápida. A diferencia de los chips, que pueden fabricarse con inversión y tiempo, los datos son un recurso finito y difícil de crear. La carrera de China hacia la soberanía en IA enfrenta una muralla que no puede derribarse con fábricas o decretos.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























