DeepSeek R1 llegó a finales de enero de 2025 y en cuestión de horas borró cientos de miles de millones de dólares en valor bursátil de Nvidia, en el mayor desplome de un solo día en la historia de la bolsa estadounidense para una compañía individual. El motivo: un modelo de razonamiento de nivel comparable a GPT-4 entrenado, según la propia empresa, con una fracción del coste y sin acceso a los chips más avanzados de Nvidia.

Qué hace distinta la arquitectura de DeepSeek R1

DeepSeek R1 usa una arquitectura Mixture of Experts (MoE) que activa solo un subconjunto de sus parámetros totales en cada inferencia, en lugar de recorrer el modelo completo como hacen los transformers densos tradicionales. Esto reduce drásticamente el coste computacional por consulta sin sacrificar demasiada calidad. A esto se suma un entrenamiento explícito en razonamiento de cadena de pensamiento (chain-of-thought) mediante aprendizaje por refuerzo, una técnica que lo hace especialmente competitivo en matemáticas, código y problemas de lógica de varios pasos, el mismo terreno donde OpenAI había posicionado su serie o1 como diferenciador exclusivo meses antes.

La cifra del entrenamiento que generó controversia

DeepSeek afirmó haber entrenado el modelo base por menos de 6 millones de dólares en cómputo, una cifra órdenes de magnitud inferior a los cientos de millones que OpenAI o Anthropic invierten en sus modelos de frontera. Esa cifra fue recibida con escepticismo por buena parte de la industria: no incluye, según varios analistas, el coste total de investigación, los experimentos fallidos previos ni el hardware ya amortizado del que dispone la empresa matriz, el fondo de inversión cuantitativo High-Flyer. Aun descontando el escepticismo razonable sobre la cifra exacta, el consenso posterior fue que DeepSeek demostró eficiencia de entrenamiento real, no solo marketing.

Las restricciones de chips de EE.UU. y su efecto boomerang parcial

Las sucesivas restricciones de Washington a la exportación de chips Nvidia de gama alta (A100, H100 y sus variantes reducidas para China, como el H800) buscaban frenar el avance de la IA china limitando el acceso a hardware de entrenamiento masivo. DeepSeek demuestra que esas restricciones, aunque ralentizan, no bloquean: la escasez de chips potentes empujó al equipo a optimizaciones de bajo nivel en el uso de memoria y comunicación entre GPUs que laboratorios con acceso ilimitado a hardware no habían tenido incentivo para desarrollar. Es el mismo patrón que se ha visto antes en sanciones tecnológicas: fuerzan innovación en el margen que compensa parcialmente la limitación original.

Open source gratuito frente al modelo de negocio de OpenAI

DeepSeek R1 se publicó con pesos abiertos y licencia permisiva, descargable y ejecutable localmente por cualquier empresa con suficiente hardware, y accesible vía API a precios muy inferiores a los de OpenAI o Anthropic. Esto representa una amenaza directa al modelo de negocio basado en APIs de pago premium: si un modelo casi tan bueno es gratuito y modificable, la propuesta de valor de pagar por acceso exclusivo se erosiona. La respuesta del mercado fue inmediata, con Meta acelerando el desarrollo de Llama y varias startups migrando cargas de trabajo a DeepSeek para reducir costes de inferencia.

Por qué la adopción empresarial en Occidente sigue siendo limitada

Pese al entusiasmo técnico, la adopción de DeepSeek en empresas europeas y estadounidenses con datos sensibles ha sido notablemente más cautelosa. La versión alojada de DeepSeek procesa datos en servidores ubicados en China, sujetos a la legislación china de seguridad de datos, lo que genera reticencias regulatorias y de cumplimiento normativo (RGPD, en el caso europeo) casi idénticas a las que en su día limitaron la adopción empresarial de TikTok. La alternativa —descargar los pesos abiertos y ejecutar el modelo en infraestructura propia— evita ese problema concreto, pero exige capacidad de cómputo que la mayoría de pymes no tiene, dejando la ventaja de coste de DeepSeek accesible sobre todo a empresas con equipos de ingeniería de IA propios.

El efecto duradero más allá del titular bursátil

Más allá del susto puntual en bolsa, el efecto duradero de DeepSeek ha sido presionar a la baja los precios de las APIs de toda la industria: OpenAI, Anthropic y Google han reducido tarifas o lanzado modelos más baratos en los meses posteriores, en parte como respuesta competitiva directa. También ha reforzado un argumento que China lleva tiempo defendiendo en foros internacionales: que el liderazgo en IA no depende exclusivamente de quién tiene más GPUs, sino de quién optimiza mejor con lo que tiene disponible.