Saltar al contenido

GPT-6 Astra aprende a gestionar contratos con Ironclad: qué demuestra el 55 %

octubre 11, 2026
Tres profesionales revisan un flujo de aprobación de contratos configurado por un agente de inteligencia artificial

OpenAI e Ironclad han convertido la gestión de contratos en un banco de pruebas para agentes de inteligencia artificial. La colaboración no consiste en pedirle a un chatbot que resuma un documento: el modelo debe entrar en software especializado, configurar formularios, aplicar reglas de aprobación, reutilizar cláusulas jurídicas y comprobar que el proceso completo se comporta como estaba previsto.

El resultado más llamativo es que GPT‑6 Astra alcanzó una puntuación media del 55,0 % en 11 tareas de investigación, frente al 41,6 % de GPT‑5.6 Sol. OpenAI también estima que el tiempo por intento pasó de 37,0 a 19,2 minutos. Son mejoras relevantes, pero no significan que un agente pueda administrar contratos sin supervisión ni que esos tiempos equivalgan a ahorro real en empresas.

Este artículo explica qué se evaluó, cómo se construyó la prueba, qué enseñan los resultados y qué controles debería exigir una organización antes de delegar trabajo contractual a un agente.

Índice

Índice

Qué han anunciado OpenAI e Ironclad

La publicación oficial de OpenAI del 6 de octubre de 2026 presenta a Ironclad como el primer socio de una línea de investigación orientada a mejorar el uso de aplicaciones profesionales. El objetivo es entrenar modelos para comprender reglas empresariales, ejecutar flujos de varios pasos y verificar si el resultado satisface los requisitos iniciales.

Ironclad desarrolla una plataforma de gestión del ciclo de vida de los contratos. En su documentación, un flujo no es únicamente el archivo que se firma: incluye el formulario de inicio, la creación del documento, la revisión, la negociación, las aprobaciones, la firma y el archivo. Esa secuencia convierte el producto en un entorno útil para comprobar si un agente mantiene el contexto mientras atraviesa decisiones dependientes unas de otras.

La colaboración identificó 11 tareas de las áreas jurídica, comercial y de compras. Entre los ejemplos publicados aparecen configurar un acuerdo de confidencialidad, construir un proceso de aprobación de compras y actualizar una cláusula reutilizable según la jurisdicción elegida por la persona solicitante.

Por qué gestionar un contrato es más difícil que rellenar un formulario

Una automatización simple ejecuta una secuencia conocida: recibe un dato, lo transforma y lo envía. Un flujo contractual introduce condiciones, excepciones y responsabilidades. Una compra por debajo de cierto importe puede seguir una ruta; por encima del umbral puede necesitar aprobación financiera. Una cláusula estándar puede continuar automáticamente, mientras que una redacción no aprobada debe escalarse al equipo jurídico.

El agente no solo tiene que pulsar los controles correctos. Debe traducir una política empresarial a una configuración consistente y comprobar los casos normales y las excepciones. Si recuerda el umbral pero olvida quién aprueba, el sistema queda mal configurado. Si resuelve cada paso aislado pero no verifica el circuito completo, el error puede aparecer después, cuando un contrato real ya está en marcha.

La documentación de flujos de Ironclad describe precisamente esa continuidad: lanzamiento, formularios, creación, revisión, negociación, aprobación, firma y almacenamiento. Es un tipo de tarea donde la calidad no se mide por una respuesta convincente, sino por el estado final de numerosos elementos.

Cómo se construyeron las 11 tareas

OpenAI afirma que empleados de Ironclad y usuarios internos del producto ayudaron a seleccionar operaciones representativas. Una persona con experiencia tardaría, según la estimación publicada, entre 30 y 40 minutos de media en completar cada una.

Cada tarea se evaluó con una rúbrica de entre 8 y 50 criterios. Esta decisión es importante: evita reducir el resultado a “terminó” o “falló” y permite detectar qué requisitos se cumplieron. Un agente puede crear el formulario y las plantillas, pero olvidar una condición de aprobación; la puntuación debe reflejar esa diferencia.

Los investigadores prepararon tareas sintéticas basadas en contratos públicos de EDGAR, la base de datos de la Comisión del Mercado de Valores de Estados Unidos. OpenAI señala que aplicó filtros para retirar información personal y que no utilizó contratos privados de clientes de OpenAI o Ironclad ni contratos internos de OpenAI para el entrenamiento y la evaluación.

Los modelos practicaron en entornos alojados del producto y recibieron entrenamiento mediante aprendizaje por refuerzo. El diseño combina tres piezas: expertos que conocen el trabajo, criterios detallados para medirlo y un entorno donde repetir tareas sin tocar operaciones reales.

Los resultados de GPT‑6 Astra, sin inflarlos

Métrica publicada GPT‑5.6 Sol GPT‑6 Astra
Puntuación media de la rúbrica 41,6 % 55,0 %
Tiempo medio estimado por intento 37,0 min 19,2 min
Ajuste de razonamiento usado Alta Max

La mejora relativa de la puntuación es del 32 %, pero el dato operativo más claro es la diferencia absoluta: 13,4 puntos porcentuales. Astra cumplió más criterios, aunque dejó sin satisfacer aproximadamente el 45 % de la rúbrica media. Ese margen impide interpretar la prueba como autonomía fiable para contratos reales.

OpenAI muestra además un ejemplo en el que Astra cumplió alrededor del 94 % de los criterios en un tiempo estimado de 20 minutos, frente a aproximadamente el 85 % y 32 minutos de Sol. Un caso concreto ayuda a visualizar la mejora, pero no sustituye el promedio de las 11 tareas.

Un modelo interno utilizado durante el desarrollo llegó al 63,7 %. Ese dato señala margen de progreso, no una función disponible para clientes. Conviene separar resultados de investigación, demostraciones seleccionadas y capacidades que una empresa puede contratar y auditar hoy.

Por qué el tiempo publicado no equivale a ahorro real

Los 19,2 y 37,0 minutos son estimaciones simuladas basadas en supuestas velocidades de procesamiento y generación. OpenAI advierte expresamente que no son mediciones del ahorro obtenido por clientes. En un despliegue real habría que añadir preparación, integración, revisión humana, corrección de errores, trazabilidad y mantenimiento.

También hay un coste de validación. Si un agente completa rápido un flujo pero un especialista necesita reconstruir cada paso para confiar en él, el beneficio se reduce. La métrica útil para una empresa no es solo “tiempo de ejecución”, sino tiempo total hasta obtener un resultado aprobado y recuperable.

Ese principio se aplica igualmente a automatizaciones más pequeñas. Nuestro análisis de automatización local con n8n insiste en medir preparación, ejecución, revisión y mantenimiento como un único proceso, no como tiempos aislados.

Qué enseña la prueba sobre los agentes profesionales

Necesitan reglas verificables

Un agente profesional debe recibir requisitos que puedan comprobarse. “Configura bien las aprobaciones” es ambiguo; “Finanzas aprueba por encima de este importe y Seguridad revisa estas categorías” permite construir pruebas. Cuanto más explícitas sean las reglas, más fácil resulta evaluar al sistema y detectar una omisión.

El entorno importa tanto como el modelo

La capacidad del modelo no basta. Hace falta un entorno de pruebas, estados observables, permisos limitados y mecanismos para comparar el resultado con la política inicial. Un agente que actúa sobre una interfaz sin registros ni recuperación puede causar problemas aunque razone correctamente la mayor parte del tiempo.

Este enfoque conecta con los contenedores de ejecución que explicamos en Microsoft Execution Containers y los permisos de los agentes: limitar el alcance y registrar acciones es parte de la arquitectura, no un añadido posterior.

La comprobación final debe estar dentro del trabajo

La investigación no plantea únicamente completar pasos, sino verificar que el flujo funciona en las situaciones para las que se diseñó. Esta diferencia es fundamental. Un sistema que “parece terminado” puede ocultar una ruta sin aprobación, una cláusula aplicada a la jurisdicción equivocada o una excepción no gestionada.

El papel de la supervisión humana

OpenAI e Ironclad mantienen la supervisión humana como requisito. No es una precaución retórica: una puntuación media del 55 % indica que todavía quedan requisitos sin cumplir. En operaciones jurídicas, un error puede afectar obligaciones, plazos, permisos o condiciones económicas.

La documentación de Ironclad permite configurar responsables secuenciales, paralelos y condicionales. Según la guía oficial para configurar aprobaciones, los circuitos pueden depender de propiedades del flujo y reiniciarse si cambian datos relevantes. Un agente que modifica esa lógica necesita una revisión proporcional al impacto.

La mejor división del trabajo no consiste en eliminar a la persona, sino en reservarle las decisiones y excepciones importantes. El agente puede preparar una configuración, ejecutar casos de prueba y señalar inconsistencias. El especialista valida reglas, resuelve ambigüedades y autoriza el paso a producción.

Siete controles antes de permitir que un agente configure procesos

  1. Entorno aislado. Probar con datos sintéticos y sin acceso a contratos activos.
  2. Permiso mínimo. Separar lectura, propuesta, edición y publicación; no conceder escritura global por comodidad.
  3. Rúbrica explícita. Traducir cada regla empresarial a una condición que pueda comprobarse.
  4. Casos límite. Probar importes a ambos lados de un umbral, campos vacíos, jurisdicciones distintas y cláusulas no estándar.
  5. Registro completo. Conservar qué cambió el agente, cuándo, con qué entrada y qué validación superó.
  6. Aprobación humana. Exigir revisión antes de activar el flujo o aplicarlo a operaciones reales.
  7. Plan de reversión. Poder restaurar la versión anterior sin reconstruir manualmente toda la configuración.

La autorización debería viajar con la tarea, no quedar implícita en una sesión permanente. La misma lógica aparece en Personal Agent Protocol, donde identidad, alcance y permisos se separan de la capacidad técnica del agente.

Qué puede aprender una pequeña empresa

Una pyme probablemente no entrenará un modelo con tareas propias, pero sí puede adoptar el método. Primero debe elegir un proceso concreto; después, escribir reglas y excepciones; por último, construir un conjunto de pruebas. Ese trabajo mejora el proceso incluso antes de añadir inteligencia artificial, porque obliga a detectar decisiones que estaban solo en la cabeza de una persona.

Un ejemplo sencillo sería la aprobación de una campaña. El borrador puede pasar automáticamente si utiliza recursos ya autorizados y no supera cierto presupuesto. Si incluye una afirmación nueva, datos personales o un gasto mayor, debe escalarse. Un agente podría preparar materiales y comprobar condiciones, pero no debería inventar la política.

Para negocios centrados en contenido y captación, el análisis de Monetizagram 3.0 permite comparar otro tipo de flujo: publicación, destino, medición y revisión. La herramienta cambia, pero la disciplina es la misma: definir qué resultado se espera y cómo se valida.

Qué no demuestra esta colaboración

  • No demuestra que Astra alcance un 55 % en todos los productos o procesos contractuales.
  • No prueba un ahorro real del 48 % para clientes; el tiempo es una estimación simulada.
  • No acredita que un agente pueda interpretar de forma autónoma el derecho aplicable.
  • No garantiza que una configuración correcta en once tareas se generalice a contratos, países y políticas diferentes.
  • No elimina riesgos de permisos excesivos, instrucciones maliciosas, datos incompletos o criterios empresariales contradictorios.

La interpretación prudente es que entrenar con tareas auténticas, rúbricas detalladas y entornos especializados mejora el uso profesional de software. Aun así, el nivel medio publicado sigue lejos de justificar una delegación sin controles.

Preguntas frecuentes

¿GPT‑6 Astra ya gestiona contratos de forma autónoma?

No según la evidencia publicada. La colaboración describe una evaluación de investigación en 11 tareas y muestra una mejora frente a GPT‑5.6 Sol. OpenAI e Ironclad siguen destacando la necesidad de controles y supervisión.

¿Qué significa la puntuación del 55 %?

Es el promedio de criterios cumplidos en las rúbricas de esas 11 tareas. No es una tasa de contratos correctos, una precisión jurídica general ni una garantía para cualquier flujo de Ironclad.

¿Los 19,2 minutos son tiempo real ahorrado?

No. Son tiempos estimados a partir de velocidades supuestas del modelo. El trabajo empresarial real incluye preparación, revisión, integración y correcciones.

¿Se utilizaron contratos privados para entrenar?

OpenAI afirma que las tareas sintéticas se basaron en contratos públicos de EDGAR con filtros de información personal, y que no empleó contratos no públicos de clientes de OpenAI o Ironclad ni contratos internos de OpenAI.

¿Qué debería automatizar primero una empresa?

Un proceso frecuente, bien documentado, reversible y con impacto limitado. Es preferible comenzar con preparación y comprobación asistidas que entregar al agente acciones irreversibles.

Conclusión

La colaboración entre OpenAI e Ironclad muestra una evolución significativa: los agentes ya no se evalúan solo por responder preguntas o completar una pantalla, sino por respetar reglas empresariales a lo largo de flujos complejos. Astra mejora claramente sobre Sol en las 11 tareas publicadas y reduce el tiempo simulado, pero su puntuación media también revela el límite actual.

El aprendizaje principal para una empresa no es “los contratos ya pueden automatizarse solos”. Es más concreto: para que un agente resulte útil necesita tareas bien definidas, criterios comprobables, permisos mínimos, un entorno seguro y una aprobación humana antes de afectar procesos reales. La calidad del modelo importa; la calidad del sistema de control importa tanto o más.

Fuentes consultadas el 11 de octubre de 2026: publicación oficial de OpenAI sobre la colaboración con Ironclad y documentación oficial de Ironclad sobre flujos y aprobaciones. Las cifras de rendimiento se presentan como resultados de investigación y los tiempos como estimaciones simuladas, no como ahorro comercial verificado.