La carrera entre las dos economías más grandes del mundo para dominar la IA se intensificó recientemente con nuevas acusaciones y planteó la cuestión de cómo China llegó a rivalizar con las capacidades de IA de Estados Unidos.
Seis empresas chinas de IA, alegaron funcionarios estadounidenses a principios de esta semana, encontraron un trocha para cerrar la brecha con los laboratorios de IA estadounidenses comprando suscripciones masivas a sus rivales estadounidenses y luego capacitándose sobre los resultados.
El FBI, la Agencia de Seguridad Franquista y la Agencia de Seguridad de Infraestructura y Ciberseguridad dijeron el martes que DeepSeek, Moonshot y otros cuatro extrajeron “capacidades por valía de miles de millones” de esta forma desde 2024, un método que, según las agencias, permitió a DeepSeek subestimar su costo de capacitación de 5,6 millones de dólares.
Anuncio
Anuncio
El Servicio de Asuntos Exteriores de China dijo que el progreso de la IA del país “es el resultado de una autosuficiencia científica y tecnológica de suspensión nivel” y calificó las acusaciones de “infundadas”.
Las acusaciones son una posible explicación de por qué se estima que los modelos chinos de IA están a la par con sus homólogos estadounidenses, con un referencia de Stanford que sitúa al maniquí superior de Anthropic por delante del de DeepSeek en sólo un 2,7% a principios de este año.
Pero los analistas dicen que hay una preeminencia diferente que los laboratorios chinos desarrollaron para competir: extraer más valía de posibles limitados.
Más valía por menos tokens
Hay una técnica que los laboratorios chinos perfeccionaron y que surge de la “atención”, el mecanismo que los investigadores de Google introdujeron en un artículo histórico de 2017 y que subyace a todos los grandes modelos de jerga.
Anuncio
Anuncio
La atención es lo que permite a un maniquí observar cada fragmento de texto en relación con todos los demás y osar qué conexiones son más importantes. Eso le ayuda a comprender el contexto, pero se vuelve computacionalmente más costoso cuanto más larga es la ventana de contexto.
Brendan Burke, analista de semiconductores y cautiverio de suministro de la firma de investigación tecnológica Futurum Group, dijo Fortuna que los laboratorios chinos descubrieron un trocha para hacer que el mecanismo de atención sea más rebajado y más apto.
“Los laboratorios chinos encontraron algoritmos que reducen la complejidad de esos cálculos en un orden de magnitud y luego logran mejores resultados porque son capaces de resumir los tokens más relevantes”, dijo.
La exigencia fue la hermana de la invención, ya que EE.UU. restringió el llegada de China a los mejores chips de Nvidia, empujándola en torno a alternativas nacionales como Huawei, que limitó el llegada de China a la computación de maduro rendimiento arreglado en EE.UU. Mientras tanto, EE.UU. tiene el 74% de la computación del mundo, según un referencia de la Casa Blanca, y además tiene hiperescaladores que invierten miles de millones en crear más a través de centros de datos.
Anuncio
Anuncio
“Correcto a que tenían menos computación con la que trabajar, encontraron ese método computacionalmente apto en zona de simplemente arrojar más computación a una técnica ineficiente, como hicieron inicialmente los laboratorios estadounidenses”, dijo Burke sobre China.
Por el contrario, los laboratorios fronterizos de Estados Unidos pueden ser “devoradores de fichas” porque sus sistemas de inteligencia sintético están diseñados para ser exploratorios y probar modelos cojín, explicó.
La compensación entre los dos se puede cuantificar. Ameya Kanitkar, cofundadora de la plataforma de medición de IA Larridin, dijo Fortuna que en los flujos de trabajo empresariales que sigue Larridin, los modelos chinos como GLM 5.2 y Kimi 2.6 y 2.7 manejan aproximadamente del 75% de las tareas de ingeniería “razonablemente acertadamente” a una villa parte del costo de los estadounidenses.
“Los modelos Frontier estadounidenses todavía tienen una preeminencia en las tareas más complejas, pero los modelos chinos de peso amplio se están volviendo más que suficientes para la mayoría del trabajo diario de ingeniería empresarial”, dijo Kanitkar.
Anuncio
Anuncio
La diferencia de costos podría terminar siendo importante ya que el compra en IA consume una maduro proporción de los presupuestos corporativos, y el 20% de los líderes empresariales encuestados por McKinsey dijeron que los costos relacionados con la IA, como la transacción de tokens, están limitando su uso.
Empresas estadounidenses se preparan para adoptar modelos chinos
La rentabilidad no es el único atractivo. El maniquí de razonamiento R1 de DeepSeek estuvo arreglado para su descarga a través de plataformas como Hugging Face, lo que permitió a las empresas ejecutar y adaptar versiones del maniquí por sí mismas. Esto ayuda a las empresas brindándoles un maniquí de código amplio con el que trabajar y ajustar para satisfacer sus evacuación sin subordinarse de un maniquí cerrado, con la opción de ejecutarlo a través de un proveedor de nubarrón con sede en EE. UU. como Amazon Web Services.
Esta flexibilidad ayudó a las empresas estadounidenses que podrían acaecer sido cautelosas a la hora de remitir datos a una empresa con sede en China a prepararse para DeepSeek, y esto además se aplica a otros modelos chinos. Hugging Face informó que los modelos chinos de código amplio representaron el 41% del total de descargas el año pasado, una proporción maduro que los estadounidenses.
El director ejecutante de DoorDash, Andy Fang, dijo que usar Kimi de Moonshot AI era “más rebajado” y de “mejor calidad” sin degradar la calidad del código. La startup de codificación de IA, Cursor, además utilizó a Kimi para ayudar a construir su agente de codificación Composer 2. Airbnb y Siemens además están experimentando con los modelos Alibaba y DeepSeek, y el director ejecutante de Airbnb, Brian Chesky, calificó a Qwen de “rápido y rebajado”.
Anuncio
Anuncio
Los modelos chinos incluso están empezando a reemplazar a sus homólogos estadounidenses en trabajos más especializados. Thomson Reuters dijo que construyó un maniquí interno llamado Thomson-1 adaptando el maniquí Qwen de código amplio de Alibaba para manejar el trabajo de revisión de documentos realizado anteriormente por Claude.
Los datos sugieren que el cambio empresarial es cada vez más visible. El índice de IA de Ramp mostró que la proporción de empresas que pagan por plataformas con llegada a modelos de código amplio y desarrollados en China aumentó al 6,1% del total de empresas que gastan en IA en julio desde el 4,5% en enero.
Pero las empresas que experimentan con modelos chinos no significa necesariamente que estén dejando antes a las estadounidenses, que todavía llevan meses de preeminencia en rendimiento. Mike Finley, director de tecnología de la firma de estudio de inteligencia sintético empresarial AnswerRocket, dijo Fortuna La producción de las empresas estadounidenses de IA todavía sirve como “prueba de existencia” para que los laboratorios chinos innoven.
“El trabajo que realizan simplemente no sería posible sin los laboratorios de vanguardia que abren el camino”, afirmó Finley.
Esta historia apareció originalmente en Fortune.com



