Última actualización 14:15, Santiago de Chile
WeChat concentra 1.670 millones de usuarios y…China mantiene prohibido OnlyFans y lo llama una…Cuando murió Mao en 1976, el Chile de Pinochet…China fabricará una ciudad modular para 5.000 mineros…La participación de Estados Unidos en el comercio de…El fabricante chino de chips de IA Enflame se disparó…China opera el mayor programa de modificación del…China prepara su sexta base antártica y proyecta una…Xi visitó Egipto tras una década y amplió la zona…Xi Jinping salta la Asamblea de la ONU y elige…México descarta entrar al BRICS y prioriza el tratado…400 barcos chinos pescan calamar cada año frente a…WeChat concentra 1.670 millones de usuarios y…China mantiene prohibido OnlyFans y lo llama una…Cuando murió Mao en 1976, el Chile de Pinochet…China fabricará una ciudad modular para 5.000 mineros…La participación de Estados Unidos en el comercio de…El fabricante chino de chips de IA Enflame se disparó…China opera el mayor programa de modificación del…China prepara su sexta base antártica y proyecta una…Xi visitó Egipto tras una década y amplió la zona…Xi Jinping salta la Asamblea de la ONU y elige…México descarta entrar al BRICS y prioriza el tratado…400 barcos chinos pescan calamar cada año frente a…

Tecnología ·

China entrena modelos de IA con datos de plataformas occidentales sin avisar

WSJ documenta cómo empresas chinas extraen data de GitHub, Reddit y Twitter para entrenar LLMs que compiten directamente con OpenAI

Imagen referencial · China entrena modelos de IA con datos de plataformas occidentales sin avisar
Imagen referencial · Wall Street Journal — China (via Google News)

Wall Street Journal publicó una investigación que revela cómo empresas chinas de IA acceden a conjuntos de datos de plataformas estadounidenses —GitHub, Reddit, Twitter— para entrenar sus modelos de lenguaje, sin declararlo públicamente. El reporte documenta casos de ByteDance, Alibaba y startups menores que utilizan técnicas de scraping masivo. La práctica ocurre mientras EE.UU. restringe exportación de chips avanzados a China.

La ventaja competitiva en IA no está solo en los chips: está en la calidad y diversidad de los datos de entrenamiento. Mientras DeepSeek sorprendió al mundo con eficiencia computacional usando chips menos avanzados, el acceso a corpus textuales en inglés —especialmente código de GitHub— permitió a modelos chinos cerrar la brecha de capacidad con una fracción del hardware. La restricción de semiconductores no toca la capa de datos, donde China opera sin fricción regulatoria.

▸ Análisis estratégico · The Chinaexpert

Quién gana, quién paga y qué decide Chile

**El hecho.** Wall Street Journal documentó que empresas chinas de IA —ByteDance, Alibaba, startups menores— extraen datos de GitHub, Reddit y Twitter para entrenar sus modelos, sin declararlo, mientras EE.UU. restringe la exportación de chips avanzados.

**El mecanismo.** La ventaja en IA no está solo en los chips, está en la calidad y diversidad de los datos. La restricción de semiconductores no toca la capa de datos, donde China opera sin fricción regulatoria.

**El poder.** Quien accede al corpus abierto occidental cierra la brecha de capacidad con una fracción del hardware. DeepSeek lo probó con chips menos avanzados.

**Lo civilizatorio.** El sistema chino trata el dato ajeno abierto como recurso de libre captura. La asimetría es real: China usa el corpus occidental, Occidente no tiene el chino.

**Lectura Chile-LATAM.** Las startups chilenas y mexicanas que desarrollan IA en castellano enfrentan el mismo cuello de botella: falta de corpus local de calidad. La mayoría de los modelos en español se entrenan con traducciones o datos europeos, no con registros de consumo, legal o sanitario latinoamericano. ¿Quién construye el corpus del castellano regional? Corfo y las universidades chilenas tienen ahí una decisión de soberanía de datos que hoy nadie toma.

**La verdad más profunda.** LATAM puede terminar con modelos de IA que no hablan su propio castellano. El recurso a retener es el dato regional, y hoy se está regalando.

Fuente: Stanford HAI AI Index 2025 · OCDE.

▸ Compartir noticia o artículo · curado por plataforma

Tocas la red, se comparte al instante con la imagen en el formato exacto de esa red y el texto en su tono. Sin descargar, sin pegar.

The Chinaexpert Newsthechinaexpert.newsFeed · 1080×1350
Preparando imagen…

China entrena modelos de IA con datos de plataformas occidentales sin avisar Las startups chilenas y mexicanas que desarrollan IA en castellano enfrentan el mismo problema: falta de corpus local de calidad. Lo cubrimos en The Chinaexpert News 👇

Así se verá tu publicación. Ajusta el texto abajo si quieres.

Caption WhatsApp · imagen + texto curado

Comentarios

¿Qué dimensión de este análisis es más relevante para tu trabajo o industria?

Súmate al debate de ejecutivos, diplomáticos y analistas que leen China con criterio propio.

Entras en 10 segundos con tu cuenta de Google o LinkedIn. Sin formularios, sin espera.

Solo usamos tu nombre y foto pública. Política completa en thechinaexpert.com.

Cargando comentarios…