
En una nave industrial, un brazo robótico intenta sujetar una caja, colocar una pieza o recoger un objeto que alguien ha cambiado de sitio. Se equivoca, vuelve a intentarlo y registra lo ocurrido. Aunque parezca una tarea sencilla, está practicando una habilidad que resulta extraordinariamente difícil de trasladar desde un programa de ordenador al mundo físico: actuar con precisión entre objetos reales, bajo la gravedad y con incertidumbre.
La industria de la inteligencia artificial ha encontrado un obstáculo que no se resuelve acumulando páginas web: los robots necesitan experiencia física. Por eso empresas especializadas están montando espacios de entrenamiento, redes de captura de movimientos y sistemas de simulación. El fenómeno ha recibido un nombre fácil de recordar: «gimnasios de robots».
Un reportaje publicado por Financial Times el 10 de octubre de 2026 llamó la atención sobre estos centros y la nueva economía de datos para máquinas. La noticia encaja con investigaciones documentadas por Generalist, Skild AI, Physical Intelligence y NVIDIA. Pero no significa que los robots domésticos capaces de hacerlo todo estén a la venta: los avances demostrados siguen dependiendo del tipo de tarea, las condiciones del ensayo y los datos disponibles.
Qué es un gimnasio de robots y para qué sirve
Un gimnasio de robots no es un gimnasio humano con máquinas de ejercicio. Es un entorno preparado para que brazos industriales, pinzas, robots móviles o prototipos humanoides realicen y repitan acciones físicas. Puede ser un laboratorio, un almacén, una nave con varias estaciones de trabajo o una red de lugares donde operadores humanos demuestran movimientos.
En un entrenamiento típico se dispone de cámaras, sensores, controladores y objetos. El sistema observa qué ocurrió, qué intentaba hacer el robot y qué órdenes recibieron sus motores. Algunas demostraciones proceden de personas que manejan pinzas o mandos; otras son movimientos realizados por robots; otras se generan en simuladores. La empresa conserva el material útil para entrenar modelos capaces de elegir futuras acciones.
Una trayectoria de aprendizaje físico puede incluir imágenes, posiciones de articulaciones, velocidades, apertura de una pinza, contacto con un objeto y resultado. Un vídeo aislado no siempre contiene toda esa información. Por eso recopilar datos para robótica puede requerir equipos y procesos de registro diferentes de los que se usan para entrenar un chatbot.
El objetivo ideal es que, tras aprender con muchas experiencias, un modelo reconozca que una taza puede sujetarse por el asa, que una bolsa flexible cambia de forma o que una puerta exige coordinar fuerza y dirección. Son destrezas que una persona ejecuta casi sin pensarlo, pero exigen percepción, control y respuesta continua en una máquina.
Por qué leer internet no basta para aprender a doblar una camiseta
Los grandes modelos de lenguaje han aprovechado cantidades enormes de texto, imágenes y otras fuentes digitales para aprender patrones. Esos datos explican qué significa «doblar una camiseta» o cómo describir el procedimiento. Sin embargo, saber narrar los pasos no equivale a controlar dos manos que tiran de una tela que se arruga y se desplaza.
El robot debe transformar instrucciones en señales motoras de muy baja latencia. Sus sensores informan de cambios imprevistos mientras sigue moviéndose. Si la tela resbala o alguien coloca un objeto a una distancia distinta, necesita corregir el gesto antes de que el error provoque una caída o un atasco.
Esta diferencia se conoce en robótica desde hace tiempo y aparece en la documentación original de Physical Intelligence sobre su modelo π0. La compañía explica que combina conocimiento de modelos visuales y lingüísticos con datos procedentes de diversos robots y genera comandos continuos para actuar. En su primera versión, el entrenamiento abarcaba tareas como doblar ropa, recoger utensilios o preparar paquetes, en lugar de limitarse a reconocer imágenes.
Conviene evitar dos exageraciones: los modelos físicos no parten necesariamente de cero, porque pueden utilizar información lingüística y visual previa; y un modelo que haya aprendido muchas manipulaciones no posee automáticamente destreza universal para cualquier objeto, máquina o entorno.
Generalist: cientos de miles de horas de experiencia física
La empresa Generalist documentó en noviembre de 2025 una de sus apuestas para escalar este tipo de aprendizaje. Al presentar GEN‑0 y su estrategia de datos, informó de que había reunido más de 270.000 horas de manipulación física real y de que entonces estaba sumando otras 10.000 horas semanales mediante sus operaciones de captura. Son cifras comunicadas por la empresa en aquella fecha; no deben presentarse como una auditoría independiente ni como un recuento necesariamente actualizado a octubre de 2026.
El proyecto combina experiencias en viviendas, almacenes y puestos de trabajo, con robots y dispositivos preparados para grabar movimientos diversos. Generalist sostiene que cantidades mayores de datos, combinadas con modelos suficientemente capaces, mejoran el comportamiento posterior ante tareas difíciles. También advierte de que la calidad y la diversidad del conjunto importan más que acumular horas sin criterio.
Un modelo que vea miles de veces la misma caja en una misma mesa puede memorizar comportamientos que fracasan al encontrar una caja de otro tamaño. Por ello tiene sentido variar objetos, cámaras, iluminación, agarres y entornos. La diversidad resulta especialmente importante cuando se espera que una habilidad funcione fuera del laboratorio de origen.
El negocio que surge alrededor de estos datos tiene varias capas: fabricantes de robots, laboratorios de inteligencia artificial, operadores que registran acciones, sistemas de etiquetado, centros de cálculo y empresas que comprueban si la máquina realmente ejecuta su tarea. Es una cadena costosa y muy distinta de descargar documentos de una página web.
GEN‑1.5: ¿de verdad aprende una tarea viendo 12 segundos de demostración?
En agosto de 2026, Generalist publicó resultados de GEN‑1.5, un modelo que incorpora ejemplos físicos como parte del contexto de entrada. En algunos ensayos, una demostración de entre tres y doce segundos bastó para indicar una tarea corta sin actualizar los pesos del modelo. La idea recuerda a mostrar un ejemplo a una persona antes de pedirle que repita un gesto.
Sin embargo, los números completos son menos espectaculares que un titular aislado. Según la evaluación interna de la empresa, GEN‑1.5 obtuvo un 59 % de éxito medio en diez tareas cortas con una demostración y sin entrenamiento adicional. Al aplicar unas diez actualizaciones de entrenamiento usando varios minutos de ejemplos por tarea, comunicó un resultado medio de aproximadamente 83 %.
Ambas cifras son valiosas como indicadores de un avance de investigación, pero requieren tres precauciones. Primero, proceden de ensayos organizados por la propia empresa; segundo, se refieren a tareas de duración limitada y condiciones determinadas; y tercero, un 59 % de éxito no sería aceptable en muchas aplicaciones industriales donde un fallo puede romper mercancía o poner en peligro a alguien.
Es incorrecto concluir que «un robot ya puede aprender cualquier oficio en doce segundos». Lo que se observó es más específico: un modelo previamente entrenado con experiencias extensas puede adaptar algunas tareas sencillas a partir de una demostración breve. El largo entrenamiento anterior no desaparece por el hecho de que la adaptación final sea rápida.
Skild AI y la diferencia entre describir y enseñar físicamente
Otro ejemplo es S1, de Skild AI. Sus investigadores compararon modelos que reciben instrucciones expresadas en lenguaje con otros que utilizan una demostración de vídeo y datos de movimiento dentro del contexto. Según sus pruebas internas, las demostraciones pueden comunicar detalles que una frase como «gira el objeto y colócalo en la bandeja» deja sin especificar.
En una evaluación de tareas no vistas durante el entrenamiento, Skild describió una comparación a la escala de 100.000 horas de datos: el sistema condicionado mediante lenguaje alcanzó un 9 % y el condicionado mediante demostraciones un 66 % en su métrica de éxito acumulado por paso. Esta medida no es una tasa de tareas completas terminadas sin intervención humana: el equipo indica que intervino para recuperar errores durante las secuencias experimentales. Omitir esa aclaración exageraría el resultado.
La compañía también mostró ejemplos de robots que vuelven a intentar un movimiento tras un fallo y que responden a desplazamientos de objetos. Son demostraciones interesantes, pero la comparación justa exige publicar qué perturbaciones se probaron, cuántas veces y con qué grado de asistencia.
La conclusión que sí puede extraerse es que el formato de los datos importa. Dos conjuntos de entrenamiento pueden tener el mismo número de horas y resultar muy diferentes si uno contiene únicamente órdenes escritas y otro incluye señales visuales y motoras relevantes para reproducir la acción.
El papel de los simuladores: aprender sin romper objetos reales
Construir datos en el mundo físico consume tiempo, material y supervisión. Por ello, una segunda vía consiste en entrenar parte del comportamiento de un robot dentro de entornos digitales que imitan las leyes físicas. Allí se pueden repetir una y otra vez tareas de agarre, equilibrio o desplazamiento, variar parámetros y registrar automáticamente numerosos intentos.
NVIDIA Isaac Lab es uno de los entornos abiertos orientados a ese proceso. Ofrece herramientas para aprendizaje por imitación y por refuerzo, y permite ejecutar simulaciones en paralelo con aceleración gráfica. No es un robot ni una solución autónoma lista para el hogar: es una infraestructura para que investigadores y desarrolladores entrenen y evalúen políticas de control.
El reto está en trasladar esos comportamientos del simulador a un robot tangible. Una superficie física puede tener una fricción diferente de la simulada, un motor puede acumular retrasos y una cámara puede producir sombras o reflejos inesperados. La transferencia entre simulación y realidad se conoce como sim-to-real, y sigue siendo un área activa de investigación.
Los simuladores reducen parte de los costes y riesgos experimentales, pero no eliminan la necesidad de validar con objetos y condiciones reales. En tareas complejas, una combinación de datos reales, simulación y pruebas finales físicas puede ser más útil que confiar exclusivamente en uno de estos caminos.
Cómo sería una sesión de entrenamiento, paso a paso
Imaginemos una instalación que necesita que un brazo robótico coloque diferentes envases sobre una cinta transportadora. El siguiente ejemplo es ilustrativo y no describe una instalación concreta de Generalist o Skild.
- Definir la tarea: recoger un envase de una bandeja y depositarlo en la posición correcta sin dañarlo.
- Registrar demostraciones: operadores o sistemas controlados muestran movimientos seguros con diversos objetos.
- Capturar las señales: almacenar imágenes, posición del brazo, estado de la pinza, acciones y resultado final.
- Variar las condiciones: cambiar tamaños, materiales, luz, velocidad de la cinta y ubicación inicial.
- Entrenar y contrastar: separar situaciones de entrenamiento de otras que el modelo no ha visto y medir la ejecución.
- Probar fallos: comprobar qué ocurre si un envase se cae, alguien mueve una pieza o se bloquea una trayectoria.
- Desplegar con límites: establecer zonas seguras, parada de emergencia y revisión humana de las incidencias.
El valor de la metodología está en medir el desempeño ante condiciones nuevas. Repetir cien veces un movimiento memorizado no equivale a adquirir una competencia que se mantiene cuando aparecen objetos inesperados.
Qué datos son realmente valiosos: variedad, calidad y errores
La robótica física necesita observar no solo demostraciones perfectas. Los fallos aportan información sobre agarres frágiles, trayectorias imposibles, deslizamientos y situaciones que deben provocar una parada. El problema es que, si los datos están mal registrados o carecen de contexto, el modelo puede aprender asociaciones incorrectas.
Una base de entrenamiento valiosa debería documentar qué sensores se utilizaron, qué versión del robot participó, qué se considera éxito, cuántas acciones necesitaron asistencia y cómo se distribuyen objetos y entornos. También debe aclarar si una demostración viene de una persona, de otro robot, de una simulación o de una reconstrucción.
La conversación sobre el tamaño de los modelos puede distraer de esta cuestión. Un robot físicamente inseguro no se vuelve fiable solo porque su modelo tenga más parámetros. La ingeniería de control, la calidad del hardware y los protocolos de evaluación siguen determinando si el sistema puede trabajar cerca de personas.
La factura invisible: instalaciones, personas y privacidad
La expansión de los gimnasios robóticos plantea costes menos visibles que el precio de una tarjeta gráfica: espacio físico, mantenimiento de equipos, electricidad, transporte de materiales, personal que demuestra tareas y trabajadores que revisan grabaciones. También aparecen preguntas sobre la remuneración y las condiciones de quienes generan o etiquetan los datos.
Si las capturas proceden de hogares o puestos de trabajo, deben evaluarse además el consentimiento de las personas, la protección de imágenes y voces, los permisos para conservar grabaciones y la posible exposición de información personal. Entrenar un robot para ordenar objetos no exige necesariamente conservar rostros identificables o datos confidenciales de clientes.
Y si las instalaciones utilizan robots que pueden ejercer fuerza, la seguridad física es un requisito previo: perímetros de protección, evaluaciones de riesgo, procedimientos de parada, mantenimiento y responsables claros. Una demostración espectacular en un vídeo promocional no sustituye esas medidas.
¿Qué significa todo esto para el empleo y las pequeñas empresas?
Una inteligencia artificial capaz de actuar sobre objetos reales podría transformar tareas repetitivas de almacenes, fabricación, alimentación o mantenimiento. Pero la adopción dependerá de que el ahorro obtenido compense inversión, supervisión y errores. No todos los empleos que incluyen movimientos repetitivos son técnicamente igual de fáciles de automatizar.
En nuestro artículo sobre los límites económicos de la automatización del trabajo físico explicamos precisamente por qué la capacidad técnica y la sustitución rentable de tareas son cuestiones distintas. Un robot que funciona en una demostración de laboratorio todavía tiene que superar pruebas de fiabilidad, integración y mantenimiento para resultar útil durante un turno completo.
Las pequeñas empresas no necesitan montar un laboratorio de robótica para aprender de este proceso. Pueden observar qué tareas son repetibles, qué información permitiría automatizarlas con seguridad y qué incidencias requieren intervención humana. La mejor primera automatización no es necesariamente la que parece más futurista, sino aquella cuya ejecución se puede medir y supervisar.
Para iniciarse en estos conceptos generales sin confundir una formación básica con una titulación de robótica, pueden consultarse los análisis de Inteligencia Artificial para Todos y del programa Domina la IA. Ambos son recursos formativos relacionados con el uso de herramientas de inteligencia artificial; no se presentan como capacitación para operar maquinaria industrial.
También resulta útil distinguir la computación que ejecuta modelos de la maquinaria que actúa físicamente. Nuestro análisis de NVIDIA DGX Spark para modelos de inteligencia artificial en local aborda una categoría de equipos de cálculo; no debe confundirse con un brazo robótico ni con un producto que, por sí solo, resuelva la manipulación física.
Qué falta antes de hablar de robots domésticos verdaderamente generales
En una vivienda aparecen cajones con objetos diversos, suelos irregulares, líquidos, niños, mascotas y materiales frágiles. El robot debe reconocer límites de seguridad y responder a situaciones para las que quizá no dispone de una demostración comparable. El coste de un fallo puede ser muy superior al de una respuesta incorrecta de texto.
Faltan evaluaciones reproducibles de tareas largas y cambiantes, hardware suficientemente fiable, formas seguras de aprender en entornos nuevos y modelos que puedan reconocer sus propias limitaciones. Una prueba de diez movimientos de agarre no demuestra la capacidad de encargarse de una casa durante horas.
Además, conviene distinguir resultados publicados por empresas en sus propios bancos de prueba de verificaciones externas realizadas con protocolos independientes. Las dos fuentes pueden aportar conocimiento, pero no tienen el mismo nivel de evidencia.
Preguntas frecuentes sobre los gimnasios de robots
¿Un gimnasio de robots es un lugar físico o un programa?
Puede ser un laboratorio real con brazos y objetos, una red de estaciones de captura o un conjunto de simulaciones. La expresión designa el entrenamiento repetido de habilidades, no una única tecnología concreta.
¿Un robot puede aprender una tarea viendo un solo vídeo?
Algunos modelos han demostrado adaptación a tareas cortas mediante ejemplos breves en condiciones experimentales. Eso exige entrenamiento previo extenso y no equivale a adquirir de inmediato cualquier habilidad física.
¿La simulación puede sustituir totalmente los datos reales?
Puede reducir costes y acelerar pruebas, pero las diferencias de fricción, sensores, luz y mecánica obligan a validar la transferencia sobre máquinas reales cuando se pretende actuar fuera del simulador.
¿Significa que los robots sustituirán pronto todos los trabajos manuales?
No. Las demostraciones de investigación no prueban rentabilidad ni fiabilidad para todas las actividades. La integración, seguridad, costes y formación de trabajadores condicionarán cada aplicación.
Conclusión: la próxima gran base de datos no son solo palabras
Los gimnasios de robots muestran un cambio relevante en la carrera de la inteligencia artificial: las empresas no compiten únicamente por textos o capacidad de cálculo, sino por experiencia física de buena calidad. Capturar movimientos, aprender de diferentes cuerpos robóticos y probarse con objetos desconocidos puede acercar a las máquinas a tareas que todavía requieren destreza humana.
Pero las horas de entrenamiento no son equivalentes a fiabilidad garantizada. Los resultados de Generalist y Skild ofrecen pistas prometedoras bajo condiciones definidas, mientras que NVIDIA y otros desarrolladores facilitan herramientas para simular y evaluar. El próximo salto no será que un robot complete un vídeo espectacular, sino que ejecute una tarea útil de forma segura, repetida y verificable en el mundo real.
Fuentes y documentación
- Financial Times, 10 de octubre de 2026: investigación periodística sobre centros de entrenamiento y recogida de datos físicos para robots (puede requerir suscripción).
- Generalist, «GEN‑0: Embodied Foundation Models That Scale with Physical Interaction», 4 de noviembre de 2025. Informe de la empresa sobre datos y aprendizaje físico.
- Generalist, «GEN‑1.5: Embodied Foundation Models are One-Shot Learners», 19 de agosto de 2026. Pruebas internas y limitaciones de adaptación.
- Skild AI, «Introducing S1: In-Context Learning for Robotics», agosto de 2026. Comparaciones internas y advertencias metodológicas.
- NVIDIA Developer, Isaac Lab. Documentación de simulación y aprendizaje robótico.
- Physical Intelligence, «π0: Our First Generalist Policy». Introducción a modelos de visión, lenguaje y acción para robots.
Nota editorial: los resultados numéricos procedentes de empresas son sus propios ensayos, no certificaciones universales de seguridad o éxito. La imagen destacada es una composición editorial ilustrativa y no identifica un gimnasio concreto de las empresas citadas.
