Modelos chinos 60-90% más baratos: el 46% de los tokens enterprise en EE.UU. ya van a IA china
El 7 de julio de 2026, CNBC publicó una investigación que produjo exactamente el tipo de silencio incómodo que precede a una conversación que la industria no quería tener.
Los datos venían de OpenRouter — la plataforma que enruta llamadas de API entre modelos de distintos proveedores, y que por lo tanto tiene visibilidad real sobre hacia dónde fluyen los tokens de las empresas que la usan. El hallazgo: desde el 8 de febrero de 2026, los modelos de origen chino han representado consistentemente más del 30% del tráfico de tokens de empresas de EE.UU. en la plataforma, con un pico reciente del 46%.
Casi la mitad de los tokens enterprise. Yendo a modelos chinos. En el mercado donde OpenAI y Anthropic habían dominado sin competencia real durante tres años.
Y la razón, según el análisis de OpenRouter, no era sofisticada ni ideológica. Era aritmética: los modelos open-source chinos corren entre un 60% y un 90% más baratos que los modelos premium de OpenAI y Anthropic. Cuando una tarea no necesita el mejor modelo del mundo, los equipos están empezando a enrutarla al más barato que sea suficientemente bueno. Y la ola reciente de modelos que salen de China está ganando ese trade.
Esta es la historia completa de lo que está pasando, con los números que importan y la pregunta que cada developer y CTO necesita responder.
Los actores: DeepSeek, Qwen, y el "mini momento DeepSeek" de GLM-5.2
Para entender el presente, hay que recordar el año pasado.
En enero de 2025, DeepSeek lanzó R1 con un costo de entrenamiento reportado dramáticamente menor al de los modelos equivalentes de OpenAI. El mercado de valores reaccionó borrando cientos de miles de millones de dólares de capitalización bursátil de empresas de semiconductores en un solo día. El debate que siguió fue sobre si el liderazgo tecnológico de EE.UU. en IA era tan sólido como se asumía.
Lo que pasó después del shock de DeepSeek fue más interesante que el shock mismo: el mercado eventualmente lo descartó como "un golpe de chatbot aislado." No un nuevo paradigma. Solo un modelo barato que era bueno en algunas cosas pero no en el trabajo agéntico complejo que las empresas realmente necesitan.
Esa narrativa dominó durante los primeros meses de 2026. Y luego Z.ai lanzó GLM-5.2 en junio.
GLM-5.2 no es un modelo de chat. Es un modelo agéntico — fuerte en planificación, coding, testing y looping. Exactamente el tipo de trabajo que las empresas están compitiendo por automatizar. Harpreet Arora, head de infraestructura agéntica en Vercel, le dijo a CNBC los números de la primera semana completa después del lanzamiento: el volumen diario de tokens creció 27x y el número de clientes usándolo creció 80x.
"Fastest adoption of any model we tracked in 2026," dijo Arora. No el más rápido de los modelos chinos. El más rápido de todos los modelos que Vercel había rastreado en el año.
El contexto del timing no fue neutral: el lanzamiento de GLM-5.2 en junio coincidió exactamente con el período en que el gobierno de EE.UU. había restringido el acceso a Fable 5 de Anthropic y retrasado el lanzamiento público de GPT-5.6 de OpenAI por razones de seguridad nacional. Como lo formuló CNBC: "el oversight federal ha hecho que un modelo que nadie puede revocar parezca cada vez más la apuesta más segura."
Los números que hacen que cualquier CTO se detenga a pensar
La diferencia de precio entre los modelos chinos open-source y los modelos premium americanos no es un descuento marginal. Es una diferencia de orden de magnitud.
DeepSeek V4 Flash: $0.14 por millón de tokens de input. GPT-5.2: $1.75 por millón. Eso es una diferencia de 12.5x. En el extremo más barato de los modelos chinos — GLM-4.5 listó en $0.11 por millón de tokens de input y $0.28 de output — la comparación con Claude Opus 4.8 es de 136x más barato en input y 268x más barato en output, con performance comparable en benchmarks similares.
GIC, el fondo soberano de Singapur que gestiona más de $700 mil millones, publicó en el Financial Times su análisis de por qué están dando la bienvenida al ascenso de los modelos chinos open-weight incluyendo Moonshot y DeepSeek: porque pueden hacer la IA materialmente más barata de adoptar a escala industrial. No es un early adopter entusiasta. Es capital de largo horizonte mirando la factura.
GLM-5.2 actualmente ocupa el quinto lugar en el Artificial Analysis LLM Leaderboard y el segundo lugar en las rankings de frontend coding de Code Arena. David Sacks — el exasesor de IA de la Casa Blanca — dijo en el podcast All-In: "Ahora tenemos un modelo chino open-weight que es tan bueno como los modelos actualmente disponibles de OpenAI y Anthropic. Está justo por debajo de Opus 4.8 de Anthropic y a la par con GPT-5.5 de OpenAI."
Justin Summerville, que trabaja en datos y analytics en OpenRouter, lo resumió para CNBC con la precisión que define el momento: "Cuando una tarea no necesita el mejor modelo, los equipos están empezando a enrutar al más barato que sea suficientemente bueno, y la reciente ola de modelos que salen de China está ganando ese trade."
La caída del share de EE.UU.: del 70% al 30% en un año
El dato más significativo del análisis de OpenRouter no es el pico del 46% de un día específico. Es la tendencia sostenida que lo precede.
Durante la mayor parte de 2024 y principios de 2025, los modelos hosteados en EE.UU. dominaban el tráfico de OpenRouter con aproximadamente el 70% del share. Para mediados de 2026, ese número había caído a aproximadamente el 30%. Los modelos chinos open-weight absorbieron la diferencia.
Dos releases fueron los puntos de inflexión que aceleraron el shift. El primero: la familia Qwen de Alibaba pasó a Meta's Llama para convertirse en la familia de modelos más descargada en Hugging Face en septiembre de 2025 — un hito que el ecosistema de open source notó pero que la prensa mainstream cubrió brevemente. El segundo: GLM-5.2 de Z.ai en junio de 2026, con los números de adopción en Vercel que ya describimos.
DeepSeek también registró un incremento sostenido en su share de tokens gateway en Vercel entre mayo y junio de 2026. No con un lanzamiento espectacular — simplemente con un crecimiento constante de developers que lo incorporaron silenciosamente a sus pipelines de producción.
El patrón que emerge de esos números es más revelador que cualquier benchmark individual: el mercado de developers ya tomó la decisión de que los modelos chinos son suficientemente buenos para una proporción creciente de workloads. Lo hizo sin conferencias de prensa ni anuncios corporativos. Lo hizo con llamadas de API.
Por qué la eficiencia china es real y por qué importa entender el mecanismo
Una parte importante de la cobertura de los modelos chinos enmarca su precio bajo como resultado de menor capacidad o de subsidios gubernamentales. La evidencia de 2026 complica esa narrativa de formas que vale la pena entender.
GLM-4.5 — la versión anterior de la familia GLM — tiene aproximadamente la mitad del tamaño del modelo DeepSeek competitivo equivalente y requiere solo ocho chips Nvidia H20 para correr. Los H20 son los chips especializados fabricados para China para cumplir con los controles de exportación de EE.UU. — no el hardware más avanzado disponible. A pesar de la limitación de hardware, el modelo compite en benchmarks con modelos que corrieron sobre hardware significativamente más potente.
El CEO de Z.ai, Zhang Peng, dijo a CNBC que la empresa ya tiene suficiente poder de cómputo y no necesita comprar más chips, aunque declinó divulgar los costos de entrenamiento. Lo que sí es público es la eficiencia resultante: el modelo requiere menos infraestructura para producir resultados comparables.
Esto es lo que el CEO de Intel, Lip-Bu Tan, llamó en una entrevista reciente "la lección que DeepSeek debería habernos enseñado hace un año": que la eficiencia en el entrenamiento y la inferencia puede compensar — en algunos casos completamente — las ventajas de hardware. "If we're not careful, China will be ahead of us. DeepSeek was just a wake-up call."
El elefante en el cuarto: los riesgos reales de adoptar modelos chinos
Sería irresponsable escribir este artículo sin dedicar espacio considerable a los riesgos que la mayoría de los titulares optimistas sobre modelos chinos baratos minimizan o ignoran.
El riesgo regulatorio es real y específico.
Z.ai — la empresa detrás de GLM-5.2 — está en la Entity List de EE.UU. OpenAI flaggeó su progreso rápido y la empresa fue designada por sus vínculos con Beijing. Eso significa que companies estadounidenses que usen GLM-5.2 via APIs hosteadas por Z.ai en China pueden estar sujetas a restricciones de exportación de tecnología y datos que van más allá de las preocupaciones de privacidad ordinarias.
Importante distinción: usar GLM-5.2 self-hosted — descargando los pesos y corriendo el modelo en tu propia infraestructura — es diferente desde una perspectiva regulatoria que enviar datos a los servers de Z.ai en China. La primera opción elimina el riesgo de transmisión de datos a jurisdicción china. La segunda no lo hace.
El riesgo de datos es diferente según el modelo de deployment.
Los modelos open-weight — que pueden descargarse y correrse localmente — no presentan los mismos riesgos de privacidad que los modelos que requieren llamadas API a servidores en China. DeepSeek puede correrse completamente self-hosted. GLM-5.2 también. Qwen también. Cuando corres estos modelos en tu propia infraestructura, los datos no salen de tus servidores.
El análisis de EcorpIT lo formuló directamente para CTOs y engineering leaders: "La pregunta ya no es si estos modelos son usables. Es qué tareas enrutar a ellos, y cómo correrlos sin entregar datos al lugar equivocado."
El riesgo de compliance en industrias reguladas.
Wei Sun, analista principal de IA en Counterpoint Research, identificó el obstáculo más claro para la adopción masiva: "Las principales preocupaciones de seguridad de datos han limitado el uso de modelos chinos por empresas de EE.UU., particularmente en industrias reguladas como banca y ciberseguridad." HIPAA, SOC 2, PCI DSS, y los requisitos de soberanía de datos del GDPR europeo tienen implicaciones concretas sobre dónde pueden procesarse los datos y bajo qué condiciones.
Para empresas en esas industrias, la pregunta de "modelo chino vs. modelo americano" no es solo de precio — es de si el deployment architecture está disponible de forma que sea compatible con sus obligaciones regulatorias.
La estrategia que los mejores equipos están usando: intelligent routing
La pregunta correcta que los datos de OpenRouter están respondiendo no es "¿cambio todo a modelos chinos?" Es algo más matizado: ¿qué tareas tienen un mínimo de capacidad requerida que los modelos baratos ya cumplen, y cuáles genuinamente necesitan el modelo más caro?
La arquitectura que emerge de los equipos más sofisticados en 2026 es lo que los analistas llaman intelligent routing o model tiering:
Tier 1 — Tareas de alta complejidad y bajo volumen: Claude Opus 4.8, GPT-5.5, Fable 5 cuando está disponible. Razonamiento complejo, análisis de código crítico, decisiones de arquitectura, tasks donde el costo de un error es alto. El precio premium está justificado porque el output de menor calidad tiene consecuencias reales.
Tier 2 — Tareas de complejidad media y volumen medio: Claude Sonnet 5, GPT-5.6 small, Gemini 3.5 Flash. El sweet spot de precio-calidad para la mayoría de los workflows de producción ordinarios.
Tier 3 — Tareas de baja complejidad y alto volumen: DeepSeek V4 Flash, Qwen, GLM-5.2 self-hosted. Generación de código de boilerplate, resúmenes de documentos, clasificación de contenido, tareas repetitivas donde "suficientemente bueno" es genuinamente suficiente. 60-90% más barato. El caso de negocio es matemáticamente obvio.
Harpreet Arora de Vercel lo articuló con la precisión que define esta estrategia: "Si un modelo más barato maneja el trabajo ordinario, el modelo caro tiene que justificarse en el trabajo difícil."
El resultado práctico para un SaaS con workloads mixtos: los costos de inferencia pueden reducirse significativamente simplemente clasificando las tareas por nivel de dificultad requerido y enrutando cada una al modelo más barato que la maneja bien. No es abandono de los modelos americanos. Es uso estratificado.
La ironía geopolítica que nadie quería nombrar
Hay una ironía en el centro de esta historia que merece nombrarse directamente.
El gobierno de EE.UU. pasó 2026 restringiendo el acceso a los modelos de IA más avanzados de origen americano — apagando Fable 5 de Anthropic por 19 días, retrasando el lanzamiento público de GPT-5.6 de OpenAI. Las restricciones tenían justificaciones de seguridad nacional legítimas.
El efecto colateral de esas restricciones fue hacer que los modelos open-source chinos — que por definición nadie puede apagar ni restringir una vez que los pesos están descargados — parecieran una alternativa más confiable en términos de disponibilidad. Como lo formuló CNBC en su análisis del 26 de junio: "el oversight federal ha hecho que un modelo que nadie puede revocar parezca cada vez más la apuesta más segura."
Cada restricción gubernamental a modelos americanos es, indirectamente, un argumento a favor de adoptar modelos que no están sujetos a esas restricciones. Esa lógica no requiere ninguna simpatía particular hacia los modelos chinos para funcionar — solo la lógica de negocio básica de no construir sobre infraestructura que puede ser apagada sin previo aviso.
David Sacks, antes de que se levantaran las restricciones a Anthropic el 1 de julio, lo dijo en el podcast All-In con una claridad que ningún portavoz corporativo podría haber usado: "no podemos permitirnos hacer cosas que ralenticen a nuestras empresas."
El análisis honesto: ¿qué debería hacer un developer o founder con esta información hoy?
La narrativa binaria — "usa modelos americanos por seguridad" vs. "usa modelos chinos por precio" — es demasiado simplificada para ser útil. La realidad operacional es más granular.
Si eres founder o developer con un SaaS en etapa temprana:
El costo de inferencia en etapa temprana rara vez es el factor limitante. Lo que importa más es la calidad del output, la velocidad de iteración, y la confiabilidad de la API. En esa etapa, la prima que pagas por Claude Sonnet 5 o GPT-5.6 compra fiabilidad, documentación, y una experiencia de developer que los modelos chinos todavía no igualan en todos los aspectos.
A medida que escales y el costo de inferencia se convierta en una línea significativa del P&L, el intelligent routing tiene sentido. Pero el momento de implementarlo es cuando tienes datos reales sobre tus patterns de uso — no antes.
Si eres tech lead o CTO en una empresa con workloads de producción:
Audita tus workloads por nivel de complejidad requerida. Para cada categoría de tarea, pregunta: ¿el modelo barato produce output que un revisor humano aprobaría sin modificaciones significativas? Si la respuesta es sí para una categoría de tarea, hay un caso de negocio concreto para enrutar esa categoría a un Tier 3.
Antes de cualquier deployment de modelos chinos, consulta a tu equipo legal sobre las implicaciones de la Entity List para Z.ai específicamente, y establece si el deployment será self-hosted o via API. La distinción cambia completamente el análisis regulatorio.
Si trabajas en una industria regulada:
Self-hosted es el único deployment architecture que elimina el riesgo de transmisión de datos a jurisdicción extranjera. Los pesos de DeepSeek, Qwen, y GLM están disponibles para descarga. Correrlos en tu propia infraestructura resuelve el riesgo de privacidad de datos, aunque no todos los riesgos regulatorios — especialmente los relacionados con la Entity List.
Para cerrar: el mercado ya decidió, la pregunta ahora es cómo adaptarse
El 46% de tokens enterprise en EE.UU. yendo a modelos chinos no es una predicción. Es un dato de mayo-junio de 2026 reportado por CNBC con fuentes primarias de OpenRouter y Vercel.
El mercado de developers — que toma sus decisiones con llamadas de API, no con declaraciones públicas — ya decidió que los modelos chinos son suficientemente buenos para una proporción significativa del trabajo. Lo hizo de forma silenciosa, pragmática, y acelerada.
Eso no significa que OpenAI y Anthropic vayan a desaparecer. Los modelos frontier siguen siendo significativamente más capaces en las tareas más difíciles. La brecha de capacidad en el trabajo más complejo todavía existe, aunque se está cerrando más rápido de lo que nadie esperaba hace 18 meses.
Lo que sí significa es que la suposición implícita de 2023-2025 — que el ecosistema de IA enterprise sería dominado por dos o tres proveedores americanos con modelos cerrados — ya no describe la realidad de 2026.
El mercado se estratificó. Los desarrolladores están enrutando. Y las empresas que todavía están tomando la decisión de IA como "¿cuál modelo elijo?" en lugar de "¿cómo diseño un sistema de enrutamiento inteligente entre modelos?" están tomando la decisión equivocada — o más precisamente, una decisión de 2024 en un mercado de 2026.
¿Ya incorporaste algún modelo chino a tu stack de producción? ¿Qué tipo de tareas enrutas a ellos y cuáles reservas para los modelos americanos? Cuéntalo en los comentarios — la experiencia real de la comunidad sobre qué funciona y qué no es más valiosa que cualquier benchmark.


Comentarios