
Hay avances de inteligencia artificial que impresionan porque mejoran un benchmark y otros que obligan a replantearse qué tipo de trabajo puede delegarse a una máquina. El último experimento de Anthropic pertenece al segundo grupo: Claude completó un cálculo de física teórica que había permanecido fuera del alcance práctico de los especialistas, la amplitud de dispersión de seis partículas a nueve bucles en una teoría conocida como N=4 super-Yang-Mills.
El resultado no equivale a descubrir una nueva ley de la naturaleza ni demuestra que una IA «entienda la física» como un científico. Pero sí aporta algo más concreto y, quizá, más importante a corto plazo: evidencia de que un agente de IA puede sostener durante días una investigación computacional extremadamente frágil, escribir código especializado, detectar problemas, continuar sin supervisión constante y entregar un resultado que un experto externo puede comprobar.
Anthropic publicó el caso el 25 de septiembre de 2026 en un artículo invitado del físico y divulgador Matt von Hippel. La historia tiene un detalle especialmente interesante: el problema nació como un desafío dirigido precisamente a comprobar si la IA podía superar un límite real de la investigación científica con recursos razonables.
El desafío que parecía demasiado incómodo para una IA
Von Hippel trabajó anteriormente en una rama de la física de partículas dedicada al estudio de amplitudes de dispersión. Estas amplitudes son objetos matemáticos que permiten calcular cómo interactúan las partículas y constituyen una pieza fundamental para comparar las predicciones de una teoría con los resultados de experimentos.
El problema es que su complejidad crece de forma brutal. Los físicos recurren a aproximaciones organizadas por «bucles»: incorporar más bucles permite capturar correcciones cada vez más complejas, pero el coste matemático y computacional aumenta rápidamente. Según la explicación publicada por Anthropic, la mayoría de las amplitudes relevantes se calculan a uno o dos bucles; algunos resultados alcanzan tres y determinados cálculos de precisión han llegado más lejos.
Para desarrollar nuevas técnicas, los investigadores utilizan teorías que funcionan como laboratorios matemáticos. Una de las más famosas es la teoría supersimétrica N=4 super-Yang-Mills. No describe directamente nuestro universo, pero posee suficientes similitudes estructurales con teorías físicas reales y, al mismo tiempo, suficientes simetrías como para permitir cálculos que serían prohibitivos en otros contextos.
En agosto, von Hippel lanzó públicamente una prueba: si las compañías de IA querían demostrar que sus sistemas podían hacer ciencia de frontera, debían resolver uno de varios problemas que los especialistas reconocieran como auténticamente difíciles. Entre ellos estaba llevar a nueve bucles la amplitud de seis partículas en N=4 super-Yang-Mills.
Un mes después, Anthropic tenía un resultado.
Qué hizo Claude exactamente
El cálculo se realizó mediante Claude Science, un entorno que combina el modelo con herramientas y una infraestructura preparada para trabajos científicos prolongados. La instrucción inicial era sorprendentemente directa: calcular la amplitud hexagonal de seis partículas en N=4 super-Yang-Mills planar a nueve bucles.
A partir de ahí, el sistema tuvo que convertir una petición de alto nivel en una cadena enorme de operaciones matemáticas y computacionales. No bastaba con generar una fórmula plausible. Tenía que construir código, manejar estructuras simbólicas, aplicar restricciones conocidas de la teoría y mantener la coherencia de todo el procedimiento durante una ejecución prolongada.
La técnica central es el llamado bootstrap de amplitudes. En lugar de calcular ingenuamente todas las interacciones posibles, los físicos construyen un espacio de respuestas compatibles con determinadas propiedades y van imponiendo restricciones hasta reducir las posibilidades. La analogía de von Hippel es útil: se parece a resolver un sudoku gigantesco en el que cada nueva condición elimina respuestas imposibles.
Lo notable es que Claude llevó ese procedimiento un nivel más allá de lo que se había publicado previamente para esta amplitud. El récord anterior era de ocho bucles, obtenido en 2023 por Lance Dixon y Andrew Liu mediante una ruta indirecta relacionada con otro objeto matemático denominado form factor.
Claude abordó tanto la vía directa como la vía basada en el form factor. Los datos del resultado de nueve bucles se publicaron además en formato legible por ordenador, lo que permite que otros investigadores inspeccionen y reutilicen el cálculo.
Por qué nueve bucles no significa «nueve veces más difícil»
La palabra «bucle» puede inducir a imaginar una progresión lineal: si ocho era difícil, nueve sería simplemente un poco más difícil. En este tipo de cálculo ocurre lo contrario. Cada salto añade una cantidad enorme de estructura y posibilidades que deben mantenerse bajo control.
Dixon, profesor de física de partículas y astrofísica en SLAC y Stanford y una de las figuras centrales del campo, explicó que el procedimiento es especialmente frágil. Un error en la receta computacional puede hacer que toda la construcción falle. Parte del conocimiento práctico necesario tampoco está recogido de forma exhaustiva en los artículos científicos, porque muchos detalles de implementación resultan demasiado específicos o tediosos para documentarlos.
Ahí aparece una de las partes más interesantes del experimento. Claude no se limitó a copiar un programa existente y ejecutarlo con más potencia. Tuvo que reconstruir buena parte de la implementación necesaria a partir de la literatura y del conocimiento disponible, escribir el código y conseguir que el proceso convergiera.
Esto conecta con una tendencia que ya analizamos en Fórmate con IA: los modelos empiezan a pasar de responder preguntas a mantener procesos largos con herramientas. En el caso de los agentes de IA capaces de trabajar durante días, el cambio fundamental no es únicamente que el modelo sea más inteligente, sino que puede conservar objetivos, ejecutar herramientas y verificar etapas durante horizontes de trabajo mucho mayores.
La validación es la parte que convierte la demostración en ciencia útil
Una afirmación extraordinaria producida por una IA no debería aceptarse porque el resultado «parezca correcto». En ciencia, y especialmente con modelos generativos, la verificación independiente es esencial.
Anthropic envió el resultado a Lance Dixon. Según su propio relato, recibió la noticia el 1 de septiembre y pasó aproximadamente dos semanas validando principalmente el form factor de nueve bucles asociado. Era una comprobación particularmente significativa: su grupo llevaba años avanzando hacia ese objetivo y él mismo había considerado demasiado difícil realizar directamente la amplitud de nueve bucles.
La publicación de los datos computables también importa. Siddharth Mishra-Sharma mantiene una página específica con los archivos del símbolo y de la función correspondientes a la amplitud MHV de seis gluones a nueve bucles. La descripción técnica señala comprobaciones sobre números primos de 31 bits y resultados consistentes en cálculos separados.
Eso no convierte automáticamente cada interpretación de Anthropic en un hecho independiente. La empresa desarrolla Claude y tiene un interés evidente en mostrar sus capacidades. Pero aquí existe una diferencia importante frente a una simple demostración comercial: hay un problema definido previamente, resultados matemáticos inspeccionables y validación de un especialista externo directamente relacionado con el récord anterior.
Lo que el experimento demuestra y lo que no
Hecho: Claude produjo un resultado de nueve bucles que superaba el resultado de ocho bucles previamente publicado para esta amplitud concreta, y Dixon verificó el cálculo mediante la estructura relacionada del form factor.
Hecho: el sistema trabajó con un grado elevado de autonomía. Von Hippel destaca que no necesitó una supervisión científica continua; las instrucciones posteriores eran fundamentalmente indicaciones para continuar trabajando y enviar actualizaciones periódicas.
Hecho: no se trata de una teoría física nueva. Claude utilizó técnicas desarrolladas previamente por investigadores humanos y extendió esas técnicas a una escala que no se había completado de esa forma.
Inferencia razonable: una parte de la investigación científica que hoy queda sin hacer por falta de tiempo humano —especialmente cálculos extensos, programación científica y exploración sistemática de variantes— puede empezar a ser económicamente abordable mediante agentes de IA.
Hipótesis: sistemas futuros podrían ir más allá de ejecutar métodos conocidos y proponer nuevas técnicas matemáticas o físicas que los investigadores no hubieran considerado. Este experimento, por sí solo, no demuestra esa capacidad.
Predicción: durante los próximos años veremos más laboratorios utilizar agentes de larga duración como una especie de colaborador computacional. La velocidad de adopción dependerá menos de que el modelo produzca respuestas impresionantes y más de que los resultados puedan verificarse de forma fiable.
La diferencia entre resolver y descubrir
Esta distinción merece atención porque determina cómo interpretar titulares sobre «IA haciendo ciencia». Claude resolvió un problema abierto en el sentido práctico de completar un cálculo que nadie había terminado de esa manera. Sin embargo, el camino conceptual ya existía.
El propio von Hippel reconoce que esperaba algo todavía más extraño: una técnica nueva, una forma inesperada de atravesar el límite computacional. Lo que encontró fue diferente. La IA mostró que el límite que los humanos habían asumido quizá no estaba donde creían.
Eso puede ser científicamente transformador aunque suene menos espectacular. Muchos avances no están bloqueados por la ausencia absoluta de una idea genial, sino por combinaciones de tiempo, atención, programación, comprobaciones y trabajo técnico acumulativo. Un agente capaz de absorber esa carga puede multiplicar el número de hipótesis que un equipo humano consigue explorar.
El patrón recuerda a otros trabajos recientes en IA científica. Algo parecido ocurre fuera del laboratorio académico: en nuestro análisis de Rentas Inteligentes y la creación de aplicaciones con IA examinamos cómo la automatización puede reducir el trabajo necesario para convertir una idea en un sistema funcional. En física, el cuello de botella puede adoptar una forma distinta, pero la lógica de fondo es parecida: ampliar drásticamente cuánto terreno intelectual puede explorarse.
El coste cambia la lectura del resultado
Otro elemento relevante es que el experimento no dependió de un superordenador reservado a una gran compañía. Anthropic describe recursos que pueden encajar en el presupuesto de investigación de un grupo académico. El cálculo mediante bootstrap utilizó Python y SymPy y, según el relato publicado, empleó del orden de 96 CPU durante aproximadamente una semana; el coste total de las rutas completas se situaría en una escala de miles de dólares, no de millones.
Las cifras deben interpretarse con cuidado porque el coste de una ejecución experimental no equivale al coste total de desarrollar el modelo que la hace posible. Entrenar Claude exige una infraestructura incomparablemente mayor. Pero para un investigador que ya accede al modelo, la pregunta práctica es otra: ¿cuánto cuesta intentar un problema adicional?
Si ese coste marginal cae a unos pocos miles o cientos de dólares en determinados trabajos, cambia la economía de la investigación. Un laboratorio puede probar más ideas, repetir cálculos con métodos independientes o asignar agentes a problemas que antes no justificaban semanas de trabajo humano.
Un anticipo del laboratorio híbrido
El futuro más plausible que sugiere este caso no es un laboratorio vacío en el que la IA sustituye a todos los científicos. Es un laboratorio híbrido en el que cambia la división del trabajo.
El investigador humano sigue siendo crucial para formular preguntas interesantes, distinguir un resultado importante de uno irrelevante, diseñar criterios de validación, relacionar hallazgos con el conocimiento del campo y decidir qué merece convertirse en una línea de investigación. El agente, mientras tanto, puede asumir una fracción creciente de la exploración técnica: leer literatura, escribir programas, ejecutar cálculos, comparar alternativas y documentar resultados.
Para que ese modelo funcione, la verificación tiene que crecer al mismo ritmo que la autonomía. Cuanto más trabajo pueda realizar un agente sin intervención, mayor es el daño potencial de un error silencioso que contamine etapas posteriores. Por eso el patrón más interesante no es «Claude trabajó solo», sino «Claude trabajó de forma autónoma y el resultado terminó en manos de un experto que podía falsarlo».
La misma idea de combinar autonomía con mecanismos de comprobación aparece en arquitecturas más generales de agentes. Nuestro artículo sobre el Sistema Operativo Cognitivo y la coordinación de memoria, herramientas y verificación analiza precisamente por qué un sistema capaz de actuar durante mucho tiempo necesita algo más que un modelo potente: necesita una arquitectura que controle el proceso.
Qué puede significar para investigadores, empresas y estudiantes
Para un investigador, la lección inmediata es que merece la pena reevaluar qué tareas se consideran demasiado largas o engorrosas para intentar. El punto fuerte de estos sistemas puede no estar solo en responder preguntas difíciles, sino en sostener miles de pasos que un humano sabe ejecutar pero no tiene tiempo de realizar.
Para las empresas, el paralelismo es evidente. Muchos procesos de conocimiento están llenos de «ocho bucles»: trabajos que técnicamente se pueden hacer, pero que no se hacen porque requieren demasiadas horas de análisis, programación, documentación o comprobación. Cuando los agentes pueden mantener una tarea durante horas o días, esos límites económicos empiezan a moverse.
Eso no elimina la necesidad de formación. Al contrario, aumenta el valor de saber plantear el problema correcto, construir criterios de aceptación y detectar resultados engañosos. Para quien quiera desarrollar una base práctica sobre herramientas, prompts y automatización, puede resultar útil nuestro análisis de Domina la IA y su enfoque aplicado, especialmente para entender qué habilidades siguen correspondiendo al usuario cuando la herramienta gana autonomía.
La señal más importante no es el récord
Nueve bucles es un titular perfecto porque ofrece una cifra concreta y un récord reconocible. Pero quedarse con el número sería perder la parte más importante.
El salto relevante es que un modelo general, conectado a un entorno de trabajo científico, pudo transformar literatura especializada y métodos existentes en una ejecución prolongada que produjo conocimiento nuevo y verificable. No necesitó que un físico escribiera manualmente cada paso ni que corrigiera constantemente el código.
Eso todavía está lejos de una máquina que elige por sí misma las preguntas fundamentales de la física y desarrolla nuevas teorías revolucionarias. Tampoco permite extrapolar automáticamente que cualquier problema científico pueda resolverse de la misma manera. N=4 super-Yang-Mills posee una estructura matemática excepcional y el bootstrap ofrece restricciones fuertes que facilitan comprobar si el sistema se desvía.
Precisamente por esas limitaciones, el resultado es más interesante cuando se describe sin exagerarlo. No hace falta afirmar que Claude «se convirtió en físico». Basta con observar lo que ocurrió: un problema que un especialista había señalado públicamente como una prueba seria fue abordado por un agente, completado con recursos razonables y comprobado por uno de los expertos que llevaba años trabajando en la frontera anterior.
La próxima pregunta ya no es si una IA puede producir un cálculo científico impresionante. Es cuántos problemas parecidos existen esperando a que alguien —humano o agente— tenga suficiente tiempo para recorrer todos los pasos.
Fuentes primarias y material técnico
La descripción original del experimento y el testimonio de Lance Dixon están disponibles en la publicación de investigación de Anthropic. Los archivos computables del resultado pueden consultarse en la página técnica Cosmic9, que documenta la amplitud de seis puntos a nueve bucles y los procedimientos de certificación utilizados.
