Anthropic ha lanzado Claude 4 Opus y los primeros benchmarks han generado un debate serio dentro de la comunidad de IA: por primera vez en mucho tiempo, un modelo que no es de OpenAI lidera de forma consistente las pruebas de razonamiento complejo. Analizamos benchmark a benchmark por qué el debate está tan reñido.

Extended thinking: razonar con tiempo variable, no con respuesta inmediata

La pieza central del rediseño de Claude 4 Opus es lo que Anthropic denomina "extended thinking": el modelo dedica un tiempo de cómputo interno variable antes de responder, ampliándolo cuando detecta que la tarea es genuinamente compleja y manteniéndolo mínimo en preguntas triviales. Esto se aleja del enfoque de "una pasada" de generaciones anteriores y se acerca más a cómo un experto humano dedica más tiempo a reflexionar sobre un problema difícil que sobre uno trivial, con el coste evidente de que las respuestas más elaboradas tardan más y consumen más tokens de cómputo.

GPQA y Codeforces: los números que sostienen el debate

En GPQA (Graduate-Level Google-Proof Q&A, un examen diseñado para que ni siquiera doctores fuera de su especialidad puedan responder por intuición), Claude 4 Opus alcanza un 87,4%, por delante del 83,1% de GPT-5. En programación competitiva sobre Codeforces, resuelve el 72% de los problemas de nivel experto frente al 65% de su rival más directo. La diferencia no es enorme en términos absolutos, pero en un terreno donde ambas compañías llevan meses estancadas en mejoras marginales, cualquier salto de varios puntos porcentuales se interpreta como una señal relevante de arquitectura superior, no solo de más datos de entrenamiento.

200K tokens de contexto sin perder el hilo

La ventaja más citada por usuarios avanzados no aparece en los benchmarks públicos, sino en el uso práctico con documentos largos: con 200.000 tokens de contexto, Claude 4 Opus mantiene coherencia y capacidad de referencia cruzada entre partes distantes de un documento, mientras que varios modelos competidores muestran una degradación perceptible de calidad a partir de los 50.000 tokens, un fenómeno conocido en la industria como "pérdida en el medio" (lost in the middle), donde el modelo ignora información situada en el centro de un contexto muy largo.

Varias firmas de consultoría estratégica han comenzado a integrar Claude 4 Opus en sus flujos de diligencia debida para fusiones y adquisiciones, citando una reducción del 40% en el tiempo de análisis documental con una calidad de resumen que consideran superior a la de generaciones anteriores. En auditoría de código de alta complejidad, la capacidad de mantener el contexto de una base de código completa sin fragmentarla artificialmente ha sido el factor decisivo para varios equipos de ingeniería que evaluaron el cambio desde otros modelos.

El debate de seguridad: rigor interno frente a vectores ya descubiertos

Anthropic mantiene su posición como la empresa de IA más exigente en evaluaciones de seguridad previas al lanzamiento, con meses de pruebas internas antes de publicar Claude 4 Opus. El modelo incorpora mejoras específicas en detección de manipulación y resistencia al jailbreaking, pero la comunidad de investigadores de seguridad independiente ya ha publicado varios vectores de ataque que la propia Anthropic reconoce y está parcheando de forma iterativa, un recordatorio de que ningún modelo de esta generación llega al mercado con la seguridad completamente resuelta, solo con procesos de mitigación continua.

Precio por token: quién paga la factura del razonamiento extendido

Claude 4 Opus se factura vía API a 15 dólares por millón de tokens de entrada y 75 dólares por millón de salida, un precio superior al de modelos más rápidos pero coherente con el coste computacional real del razonamiento extendido. En Claude.ai, los suscriptores Pro tienen una cuota diaria limitada de uso del modelo completo, mientras que los planes Teams y Enterprise amplían esa cuota junto con funciones de administración y auditoría pensadas para despliegues corporativos a gran escala.

¿De verdad supera a GPT-5?

La respuesta honesta es que depende de la tarea: en razonamiento científico complejo y programación experta, Claude 4 Opus tiene ventaja medible; en otras áreas como generación multimodal o ecosistema de plugins, OpenAI sigue teniendo una oferta más amplia. El verdadero cambio de 2026 no es que exista un ganador absoluto, sino que por primera vez el liderazgo se reparte por tarea concreta, obligando a empresas y desarrolladores a evaluar modelos según su caso de uso específico en lugar de asumir un líder único del mercado.