
La inteligencia artificial ya no solo responde preguntas o escribe código: también participa en la creación de los sistemas que vendrán después. Anthropic confirmó el 17 de septiembre de 2026 que Claude ya “lidera” el 26 % de las tareas de investigación y desarrollo de IA que ha medido dentro de la empresa. En más del 90 % de ese trabajo, el modelo al menos colabora con los investigadores.
El dato es importante, pero necesita contexto. No significa que Claude pueda diseñar y construir por sí solo a su sucesor, ni que exista una inteligencia capaz de automejorarse sin supervisión. Sí muestra que una parte relevante del ciclo de I+D de un laboratorio de frontera ya se apoya en agentes capaces de completar bloques de trabajo extensos. Es una pieza concreta del debate sobre el posible salto hacia sistemas cognitivos más integrados, con memoria, planificación, ejecución y verificación.
Qué anunció Anthropic exactamente
Anthropic presentó un conjunto de métricas para observar tres procesos que suelen quedar ocultos dentro de los grandes laboratorios: cuánto trabajo de I+D realiza la propia IA, cómo se supervisan las acciones de los agentes y qué parte de la capacidad de cómputo se dedica a seguridad.
Según la fotografía correspondiente a agosto de 2026, Claude se encontraba en el nivel “lidera” en el 26 % del trabajo de I+D analizado. En la escala adoptada por la compañía, liderar significa que el sistema puede completar la mayor parte de una tarea de principio a fin a partir de una instrucción de alto nivel, resolver imprevistos y documentar el resultado, mientras una persona supervisa y toma la decisión final.
Además, más del 90 % del trabajo estaba como mínimo en el nivel “colabora”. En ese escalón la IA ejecuta fragmentos grandes de la tarea, pero requiere dirección humana cercana. Anthropic también subrayó el límite más importante: Claude no operaba de manera totalmente autónoma en ninguna de las áreas medidas.
La escala de automatización: asistir no es liderar
Para evitar que la palabra “automatización” mezcle realidades muy distintas, el análisis usa seis niveles, desde AL0 hasta AL5. En la parte baja no hay intervención de IA o esta es mínima. En AL2, el sistema asiste; en AL3, colabora; en AL4, lidera; y en AL5 actúa de forma autónoma, sin una persona dentro del circuito operativo.
Un ejemplo práctico
Imaginemos que falla una canalización de datos nocturna. En AL3, un ingeniero revisa los registros, plantea una hipótesis y guía al agente durante la investigación y la reparación. Si surge un problema nuevo, la persona decide cómo continuar. En AL4, el ingeniero entrega la alerta y el agente investiga los registros, localiza la causa, escribe y prueba la corrección, comprueba los resultados y prepara un informe. La persona sigue decidiendo si el cambio se despliega.
Esa última decisión importa. Un agente que lidera una tarea no equivale a un agente que fija objetivos, selecciona por su cuenta la dirección científica y despliega cambios sin autorización. Para quienes quieran comprender la automatización actual desde una perspectiva aplicada, una formación centrada en prompts, agentes y flujos automatizados puede ayudar a distinguir entre delegación útil y autonomía real.
Cómo se calculó el 26 %
El porcentaje no procede de una encuesta informal. Anthropic construyó un prototipo llamado Anthropic R&D Automation Index. Durante cada semana de julio de 2026 tomó una muestra aleatoria del 20 % del personal de los departamentos que participan en el ciclo de I+D de modelos. Un agente revisó registros de trabajo y documentación interna para identificar unas 15.000 tareas granulares.
Después, Claude organizó esas tareas en un árbol de 542 nodos, con 378 categorías finales. Entre ellas aparecen trabajos como diagnosticar defectos en plataformas de evaluación, revisar políticas de red para entornos de aprendizaje por refuerzo o elaborar informes posteriores a incidentes de servicio.
Para asignar peso a cada área se utilizó el tiempo humano dedicado a ella. Un modelo independiente dentro del proceso examinó las pruebas disponibles y atribuyó el nivel de automatización. La empresa comparó una parte de esas evaluaciones con valoraciones humanas: modelo y personas coincidieron exactamente el 59 % de las veces, mientras que dos evaluadores humanos coincidieron el 35 %. En el 97 % de los casos, modelo y humano quedaron a una distancia máxima de un nivel.
Qué limitaciones tiene la medición
La metodología es más rigurosa que una impresión anecdótica, pero no es una auditoría externa definitiva. La propia Anthropic reconoce varios límites:
- Claude interviene en la recopilación, clasificación y evaluación de tareas, por lo que el sistema participa en la medición de su propio uso.
- La frontera entre “colabora” y “lidera” admite desacuerdos razonables.
- El índice congela una cesta de trabajo para poder compararla con el tiempo; puede no reflejar de inmediato tareas nuevas que aparezcan.
- Los resultados describen una empresa y un periodo concretos. No se pueden trasladar automáticamente a toda la industria.
Anthropic propone que terceros verifiquen estas métricas y que los laboratorios converjan en una metodología común. Esa precaución es esencial: el 26 % es una señal relevante de dirección y velocidad, no una medida universal de progreso hacia la inteligencia general.
Treinta mil agentes trabajando a la vez
La segunda cifra llamativa es la escala operativa. En agosto de 2026 había aproximadamente 30.000 agentes realizando simultáneamente tareas de investigación e ingeniería en la plataforma interna más utilizada de Anthropic. La compañía analizó más de mil millones de decisiones tomadas por esos agentes durante el mes.
Anthropic asegura que el 100 % de sus acciones pasa por un monitor en línea antes de ejecutarse y también se incorpora a un sistema de revisión posterior. El monitor preventivo bloqueó el 0,002 % de las decisiones, alrededor de una entre 47.000. Por su parte, el control posterior marca entre una y dos transcripciones de cada mil para una revisión adicional.
Un porcentaje pequeño puede convertirse en un volumen grande
Un índice de bloqueo del 0,002 % parece diminuto. Sin embargo, aplicado a más de mil millones de decisiones representa decenas de miles de intervenciones potenciales. Esta es una de las lecciones de la automatización masiva: una conducta rara deja de ser rara en términos absolutos cuando millones de agentes actúan de forma continua.
La supervisión debe crecer al mismo ritmo que la actividad. Cobertura, latencia de revisión y tasa de escalado son indicadores más útiles que una promesa genérica de seguridad. El debate conecta directamente con la pregunta de cuándo conviene ralentizar un modelo de frontera si los controles no avanzan con sus capacidades.
Cuánto cómputo se dedica a seguridad
Anthropic examinó una semana, del 13 al 20 de julio de 2026, para estimar el destino de su capacidad de cómputo. Aproximadamente el 6 % del cómputo empleado en I+D de IA se clasificó como trabajo de seguridad. Si se observa solo la I+D de IA realizada con ayuda de IA, la proporción ascendía al 12 %.
Estos porcentajes tampoco deben leerse como una nota. El trabajo de seguridad puede necesitar más tiempo humano y menos aceleradores que el entrenamiento de un modelo. Una mejora de eficiencia también puede reducir su cuota de cómputo sin disminuir el esfuerzo real. La utilidad del indicador está sobre todo en seguir su evolución y comparar definiciones equivalentes.
Anthropic y OpenAI apuntan en la misma dirección
Los datos de Anthropic no aparecen aislados. OpenAI publicó el 6 de septiembre que sus investigadores ya utilizan 3,1 jornadas de trabajo de agentes por cada jornada humana, tomando como referencia un día de ocho horas. También afirmó haber alcanzado el nivel de “investigador en prácticas automatizado”: un sistema capaz de completar, bajo dirección humana, tareas bien definidas que ocuparían varios días a un investigador cualificado.
Las cifras no son comparables de forma directa. Anthropic estima el nivel de automatización de una cesta de tareas; OpenAI mide, entre otras cosas, tiempo de ejecución agregado y resultados de agentes de programación. Aun así, ambas publicaciones describen el mismo cambio estructural: la investigación de IA se está convirtiendo en trabajo híbrido, con personas que dirigen prioridades y enjambres de agentes que ejecutan experimentos, escriben código y resuelven infraestructura.
También coinciden en una cautela: acelerar partes del proceso no acelera necesariamente todo el laboratorio en la misma proporción. El cómputo, la calidad de los datos, la selección de ideas, la validación científica y las decisiones de despliegue pueden convertirse en cuellos de botella.
¿Es esto automejora recursiva?
Hecho: los modelos ya contribuyen de manera sustancial al código, los experimentos, las evaluaciones y la infraestructura utilizados para desarrollar futuros sistemas. Hecho: en los datos publicados no existe autonomía completa y las personas conservan el control de objetivos, despliegues y decisiones de alto nivel.
Hipótesis: si la calidad de los agentes sigue aumentando y cada generación acelera de forma verificable el desarrollo de la siguiente, podría aparecer un bucle de mejora cada vez más rápido. Para llamarlo automejora recursiva fuerte no bastaría con producir más código. El sistema tendría que identificar por sí mismo avances relevantes, comprobarlos, incorporarlos y repetir el ciclo con una intervención humana mínima.
Lo que aún no sabemos: cuánto progreso adicional produce realmente cada hora de agente. Más experimentos también pueden generar más ruido, duplicación o resultados que una persona debe descartar. El indicador decisivo no será el volumen de actividad, sino la mejora científica validada por unidad de tiempo y de cómputo.
Qué cambia para investigadores y profesionales
El trabajo humano no desaparece de golpe; cambia de nivel. Pierden peso algunas tareas de ejecución repetitiva y ganan importancia la definición de objetivos, el diseño de evaluaciones, la revisión crítica, la seguridad y la decisión de qué resultados merecen escalarse. Saber formular una tarea ya no basta: hay que diseñar un entorno en el que el agente pueda actuar, registrar evidencias y detenerse cuando supera sus límites.
Esta transición no se limita a los laboratorios. Empresas pequeñas ya pueden aplicar versiones más modestas del mismo patrón: varios agentes especializados, herramientas conectadas, criterios de aprobación y una persona que supervisa el conjunto. Una ruta práctica para construir agentes y automatizaciones puede ser útil para aprender esa arquitectura sin confundirla con autonomía total.
Tres escenarios para los próximos años
1. Progreso rápido, pero con cuellos de botella humanos
Los agentes podrían asumir una fracción creciente de la ingeniería y experimentación, mientras las decisiones científicas, la validación y el cómputo limitan el ritmo general. Sería una aceleración importante, aunque no explosiva.
2. Un bucle de mejora cada vez más corto
Si los agentes empiezan a proponer y validar mejoras que aumentan su propia capacidad investigadora, los ciclos entre generaciones podrían comprimirse. Este escenario acercaría la automejora recursiva, pero exigiría demostrar que las mejoras son reales, acumulativas y seguras.
3. La supervisión marca el ritmo
Los incidentes, la regulación o la incapacidad de monitorizar sistemas más autónomos podrían imponer periodos de evaluación, límites de cómputo o despliegues escalonados. En ese caso, la capacidad técnica seguiría creciendo, pero su uso en I+D estaría condicionado por controles verificables.
Estos tres escenarios son predicciones, no hechos. Pueden combinarse: una empresa puede acelerar ciertas áreas, mantener otras bajo control humano estricto y detener temporalmente un modelo cuando la supervisión resulte insuficiente.
Las preguntas que conviene seguir
- ¿Qué porcentaje del trabajo pasa de “colabora” a “lidera” y con qué velocidad?
- ¿Cuántas mejoras propuestas por agentes llegan realmente a producción?
- ¿Cuánta intervención humana requieren las tareas largas y difíciles?
- ¿Los monitores detectan comportamientos desconocidos o solo patrones ya definidos?
- ¿Puede un tercero reproducir las métricas sin acceder a secretos industriales?
- ¿La inversión en seguridad crece al mismo ritmo que la automatización de capacidades?
Publicar estas series de forma periódica permitiría detectar si el avance es lineal, se acelera o encuentra un techo. También ayudaría a reemplazar las especulaciones por indicadores observables.
Conclusión: una señal seria, no una prueba de autonomía total
Que Claude lidere el 26 % de la I+D medida por Anthropic es una señal notable de cómo está cambiando el desarrollo de la propia inteligencia artificial. El dato resulta aún más significativo junto a los 30.000 agentes concurrentes y al uso creciente de sistemas similares en OpenAI.
La lectura responsable se encuentra entre dos extremos. No estamos ante una IA completamente autónoma que construye a su sucesora sin personas; tampoco estamos ante un simple asistente que solo completa frases. Los laboratorios ya operan con sistemas que ejecutan partes amplias del ciclo de investigación bajo supervisión humana.
El próximo salto no se medirá únicamente por cuántos agentes trabajan o cuántas horas acumulan. Importará cuánto conocimiento nuevo producen, con qué fiabilidad, qué capacidad humana permanece en el circuito y si los mecanismos de control pueden seguirles el ritmo.
Fuentes primarias
- Anthropic: métricas para entender el ritmo del desarrollo de IA dentro de los laboratorios de frontera (17 de septiembre de 2026).
- Anthropic: acuerdo para incorporar evaluación independiente dentro del laboratorio (18 de septiembre de 2026).
- OpenAI: aceleración de la investigación vista desde dentro (6 de septiembre de 2026).
