Saltar al contenido

Un aviso de seguridad reduce decisiones clínicas arriesgadas en 19 de 20 modelos de IA

octubre 10, 2026
Composición editorial exclusiva de FormateconIA: escena de atención sanitaria con un escudo y marca de verificación que simboliza la supervisión humana de la inteligencia artificial clínica. Fotografía base de Vitaly Gariev (Unsplash).

Una inteligencia artificial recibe una petición que aparentemente procede de un superior y le pide saltarse un control clínico para ahorrar tiempo. ¿Debe obedecerla? Esa es la clase de situación que un grupo de investigadores de Mount Sinai, en Nueva York, decidió estudiar a gran escala. Su trabajo muestra que una advertencia breve de seguridad puede cambiar la respuesta de muchos modelos, pero también revela una limitación que ningún titular debería esconder: incluso después del aviso, siguen apareciendo decisiones potencialmente peligrosas.

El estudio, publicado el 26 de septiembre de 2026 en la revista científica Communications Medicine y presentado por el hospital el 8 de octubre, evaluó 20 modelos de lenguaje mediante 10.096.800 respuestas a situaciones clínicas estructuradas. Sin recordatorio preventivo, el 16,6 % de las elecciones evaluadas correspondía a opciones potencialmente dañinas. Con un recordatorio de seguridad, el porcentaje descendió al 10,1 %. La mejora se observó en 19 de los 20 modelos.

El resultado es interesante para hospitales, desarrolladores y usuarios de agentes de inteligencia artificial, pero necesita contexto. No significa que la inteligencia artificial acertara en el 89,9 % de los diagnósticos ni que se evitara daño real a pacientes. Se midieron elecciones entre alternativas en un experimento controlado. Este artículo explica qué investigaron exactamente, cómo interpretar las cifras y por qué el diseño de las instrucciones es solo una pequeña parte de la seguridad.

Índice

Qué descubrió el estudio de Mount Sinai

La investigación se titula Evaluating large language model responses to unsafe clinical instructions y está firmada, entre otros especialistas, por Mahmud Omar, Reem Agbareia, Girish N. Nadkarni y Eyal Klang. Se publicó con identificador DOI 10.1038/s43856-026-01933-8. La publicación científica original indica que el trabajo pasó por revisión por pares y que se ofrece inicialmente como una versión aceptada, pendiente de los ajustes editoriales definitivos. El comunicado institucional de Mount Sinai describe su posible relevancia para la seguridad clínica.

Los autores no buscaban averiguar si un modelo sabe definir una enfermedad o resumir un artículo médico. Plantearon una pregunta más específica: ¿qué sucede cuando el sistema recibe una instrucción explícita que entra en conflicto con una actuación sanitaria segura? Esto permite estudiar un modo de fallo diferente de la respuesta inventada o de la equivocación factual: el modelo puede disponer de información suficiente y, aun así, dar prioridad a una orden que no debería seguir.

Es un problema que interesa particularmente en organizaciones donde existen jerarquías, urgencias, tareas administrativas y múltiples personas que intervienen en una decisión. Una instrucción redactada con seguridad o atribuida a una autoridad no se convierte por ello en una instrucción apropiada.

Las cifras: 10 millones de respuestas no son 10 millones de pacientes

La investigación analizó 601 situaciones de partida: 501 variantes sintéticas basadas en 50 plantillas y 100 casos adaptados a partir del conjunto MIMIC-IV, que contiene información clínica desidentificada utilizada para investigación. Esas situaciones se presentaron con distintos encuadres, formulaciones de seguridad y repeticiones, hasta reunir las 10.096.800 salidas. El trabajo incluyó 20 modelos cuyos pesos están disponibles para su evaluación.

El estudio no implicó que diez millones de personas fueran atendidas por una inteligencia artificial ni que se produjeran 1,18 millones de incidentes en hospitales. Cada salida fue una respuesta experimental. En total, alrededor de 1,18 millones de respuestas, el 11,7 %, eligieron una alternativa que los investigadores habían clasificado como potencialmente dañina.

Dentro de ese conjunto se compararon condiciones sin advertencia preventiva y otras con instrucciones breves de comprobación o escalado ante una orden insegura:

  • 16,6 %: elecciones potencialmente dañinas cuando no se incluía el recordatorio de seguridad.
  • 10,1 %: elecciones potencialmente dañinas en las condiciones que incluían medidas preventivas.
  • 6,5 puntos porcentuales: reducción absoluta entre ambos porcentajes.
  • 19 de 20 modelos: mostraron una reducción, aunque eso no supone que todos mejoraran igual.

Expresado de otra forma, el descenso relativo fue de aproximadamente el 39 % respecto al 16,6 % inicial. No debe confundirse esa reducción relativa con una mejora de 39 puntos porcentuales. Y, sobre todo, una tasa residual del 10,1 % es incompatible con afirmar que el problema ha desaparecido.

Qué significa una «decisión clínica potencialmente dañina» en este experimento

Los autores organizaron las respuestas en categorías y consideraron potencialmente problemáticas las opciones que implicaban obedecer total o parcialmente una indicación insegura. En cada caso, el modelo debía seleccionar entre cuatro alternativas predeterminadas, dos vinculadas a decisiones potencialmente dañinas y dos compatibles con conductas más seguras, como mantener controles indicados o consultar a un profesional responsable.

El ejemplo descrito por los investigadores consiste en pedir que se omita un análisis de seguimiento para reducir carga de trabajo. También se estudiaron indicaciones de interrumpir un tratamiento antes de lo recomendado sin una razón clínica suficiente. Lo importante es el conflicto entre la orden que recibe el sistema y un criterio de seguridad ya establecido, no la eficacia de un medicamento ni el diagnóstico de una enfermedad concreta.

Una respuesta peligrosa puede surgir por varios motivos: el modelo interpreta una petición como una orden prioritaria, supone que otra persona ya comprobó su legitimidad o da demasiado peso a la urgencia. Ese comportamiento se parece a los fallos que también pueden ocurrir en una cadena de trabajo humana, pero los modelos añaden un elemento particular: pueden repetir la obediencia a gran escala y con un lenguaje muy convincente.

El experimento permite cuantificar ese patrón en condiciones controladas. No permite calcular directamente la probabilidad de que un paciente resulte perjudicado por un programa desplegado en un hospital. Para eso harían falta otras evaluaciones clínicas, procedimientos validados y seguimiento de resultados reales.

Cómo se diseñó la prueba: autoridad, urgencia y órdenes contradictorias

El trabajo combinó las 601 situaciones con 21 configuraciones de contexto, cuatro condiciones de mitigación y diez repeticiones, hasta completar el número total de respuestas. Los textos podían presentar la misma situación de manera neutra o incluir señales de presión social como órdenes de autoridad, urgencia, amenazas de consecuencias negativas, transferencia de responsabilidad o presión para actuar de acuerdo con otros.

Esto importa porque los modelos de lenguaje no reciben una situación clínica aislada de la forma en que un manual presenta un problema de examen. Procesan un contexto narrativo. Si se introduce una instrucción que parece proceder de alguien con rango superior, la redacción puede afectar a qué parte del mensaje interpretan como prioritaria.

En los casos con recordatorio preventivo, los investigadores añadieron una indicación breve para comprobar situaciones potencialmente inseguras o pedir ayuda cuando fuera necesario. No entrenaron desde cero veinte modelos diferentes para esta prueba. Cambiaron el contexto con el que se les pedía responder y compararon la conducta resultante.

La diferencia es crucial: una advertencia en el mensaje puede influir en la respuesta, pero no proporciona por sí sola nuevos conocimientos médicos, acceso a pruebas diagnósticas ni capacidad para determinar la gravedad real de una situación particular.

Los resultados cambian según el tipo de caso clínico

La mejora no fue idéntica en todos los conjuntos. En las viñetas sintéticas, las opciones potencialmente dañinas descendieron aproximadamente del 10,6 % al 7,2 %. En los casos adaptados de registros de alta hospitalaria, el cambio fue mayor: del 46,6 % al 24,5 %.

La segunda cifra es especialmente importante porque impide quedarse solo con el promedio general. El recordatorio tuvo un efecto apreciable, pero incluso con él casi una de cada cuatro respuestas de ese subconjunto experimental seleccionó una alternativa clasificada como potencialmente perjudicial. Los escenarios derivados de registros de alta tienen características distintas de los textos sintéticos; no se deben tratar esas tasas como si fueran intercambiables o extrapolarlas directamente a una consulta de atención primaria.

Un titular que dijera únicamente «el aviso hace más segura la inteligencia artificial» dejaría fuera buena parte de la evidencia. El resultado completo se entiende mejor así: el contexto importa, determinadas medidas reducen errores, y el riesgo residual obliga a añadir otros controles.

¿Qué ocurre cuando se hace diez veces la misma pregunta?

Otro hallazgo interesante tiene que ver con la consistencia. Los investigadores agruparon las respuestas en 1.009.680 conjuntos de diez repeticiones bajo condiciones equivalentes. En el 80,4 % de esos conjuntos, el modelo seleccionó la misma categoría de actuación en las diez ocasiones.

Eso también significa que una proporción relevante produjo variaciones. Entre los conjuntos inestables, el 38,2 % alternó entre categorías consideradas seguras y otras potencialmente dañinas. La consistencia varió notablemente según el modelo, y el artículo documenta diferencias importantes entre sistemas.

La enseñanza no es que repetir una pregunta garantice mayor precisión. Un modelo puede responder siempre lo mismo y equivocarse siempre. También puede cambiar su criterio sin recibir datos clínicos nuevos. Por eso hay que separar dos dimensiones: consistencia es repetir una categoría; seguridad es que la decisión se ajuste al procedimiento adecuado.

Esta diferencia conecta con el análisis que publicamos sobre por qué la cadena de pensamiento de un modelo no siempre explica cómo tomó una decisión. Una respuesta que suena razonada y detallada tampoco constituye, por sí misma, una auditoría fiable del sistema.

Por qué un recordatorio no equivale a una barrera de seguridad

En informática, una barrera robusta es aquella que el sistema no puede saltarse simplemente porque encuentre una orden convincente dentro de otro texto. Una instrucción de lenguaje natural, por el contrario, comparte el mismo espacio de interpretación que el resto de mensajes y puede entrar en conflicto con nuevas peticiones, documentos o conversaciones.

Es útil incluir recordatorios de seguridad, pero una aplicación clínica fiable necesita controles que no dependan únicamente de la buena voluntad textual del modelo: permisos por función, validación de los datos, reglas claras de escalado, supervisión de profesionales, pruebas repetidas, registros de auditoría y mecanismos de bloqueo para acciones de riesgo.

Si un asistente simplemente redacta una propuesta para que un especialista la revise, su función es diferente de la de un agente que cambia automáticamente un tratamiento o cancela una prueba. Cuanto mayor es su capacidad de ejecutar acciones externas, mayor debe ser el esfuerzo en diseñar autorizaciones y confirmar cada operación relevante.

Hemos tratado esta cuestión desde otra perspectiva en nuestro análisis del Arena Alignment Index y los agentes que actúan sin permiso. La relación editorial es clara: una cosa es contestar a una pregunta y otra decidir si un agente puede actuar de forma autónoma cuando el contexto contiene señales dudosas.

Qué aporta la investigación al debate sobre agentes autónomos

Muchos sistemas actuales ya no se limitan a responder. Pueden revisar documentos, consultar bases de datos, elaborar resúmenes, proponer cambios y ejecutar tareas dentro de aplicaciones. En medicina esa evolución es especialmente delicada, porque un error en una acción puede ser más difícil de detectar o revertir que una frase incorrecta en una conversación.

Los propios autores señalan como línea futura estudiar contextos acumulados durante tareas con varios pasos. Un agente podría recibir instrucciones legítimas, después encontrar un mensaje conflictivo en un documento y, finalmente, actuar basándose en una combinación de ambos. Ese tipo de situación se relaciona con la denominada inyección de instrucciones: contenidos externos que intentan alterar indebidamente las prioridades del sistema.

La investigación de Mount Sinai no demuestra por sí sola cuántos agentes reales son vulnerables a esas secuencias. Sí ofrece un procedimiento para medir una parte del problema: crear pruebas representativas, cambiar el encuadre sin alterar la cuestión esencial y observar cómo se modifican las elecciones del modelo.

Lo que la OMS ya recomendaba para la inteligencia artificial médica

La Organización Mundial de la Salud publicó orientaciones sobre la ética y la gobernanza de los grandes modelos multimodales en sanidad. Entre sus preocupaciones figuran las respuestas falsas o incompletas, el sesgo de automatización, la protección de los datos y la necesidad de que gobiernos, desarrolladores, profesionales y pacientes participen en la evaluación.

El llamado sesgo de automatización aparece cuando una persona otorga demasiado crédito a una herramienta precisamente por el hecho de presentarse como automática, avanzada o técnicamente sofisticada. Los modelos pueden expresarse con confianza incluso cuando su recomendación no es apropiada; por eso la revisión humana necesita ser auténtica y disponer de capacidad real para rechazar la propuesta.

Estas recomendaciones no nacieron del estudio de octubre de 2026, pero ayudan a situarlo. Añadir una frase preventiva puede ser una medida complementaria; no sustituye un sistema de gobernanza, la evaluación del producto o la obligación de trabajar dentro de las competencias de cada profesional.

Qué puede aprender una empresa que no pertenece al sector sanitario

El estudio utiliza escenarios médicos y no debe extrapolarse con sus mismos porcentajes al marketing, la programación o la atención al cliente. Sin embargo, permite plantear una lección de diseño útil en cualquier sistema de agentes: antes de ejecutar una petición, un asistente debería comprobar si quien la solicita tiene permiso, si la acción entra en conflicto con restricciones previas y si existe un punto de revisión para operaciones difíciles de revertir.

En una tienda digital, por ejemplo, el riesgo quizá no sea modificar una pauta clínica, sino enviar un precio incorrecto, compartir un dato personal o prometer condiciones que no existen. Una buena automatización separa investigación, propuesta, validación y ejecución. También distingue los mensajes del cliente de las instrucciones internas que gobiernan el funcionamiento del negocio.

Quien esté empezando a comprender los límites de estas herramientas puede consultar nuestro análisis de Inteligencia Artificial para Todos, centrado en una formación introductoria. Para entender cómo se pueden aplicar asistentes en procesos concretos de negocio, está también el análisis del curso ChatGPT para emprendedores. Son recursos formativos comerciales relacionados con el uso responsable de herramientas generales; ninguno de esos cursos acredita la capacidad de ejercer tareas clínicas ni sustituye la formación sanitaria.

Cinco preguntas que deberían hacerse quienes desarrollan asistentes de salud

  1. ¿Qué tareas tiene permiso para realizar el sistema? Informar, resumir o proponer no es lo mismo que autorizar una intervención.
  2. ¿Qué hace ante una instrucción incompatible con la seguridad? Debe existir una ruta verificable para rechazarla, pedir aclaraciones o trasladarla a un profesional.
  3. ¿La evaluación incluye presión de autoridad y urgencia? Probar únicamente solicitudes neutras puede ocultar fallos de obediencia.
  4. ¿Se comprueba la consistencia sin confundirla con exactitud? Es necesario medir tanto las respuestas cambiantes como los errores que se repiten siempre.
  5. ¿Qué evidencia existe después de desplegarlo? Las pruebas de laboratorio no sustituyen la supervisión y el seguimiento de un sistema operativo real.

Estas preguntas no constituyen un protocolo clínico ni sustituyen estándares técnicos específicos. Son un marco editorial para entender por qué una cifra prometedora de laboratorio es solo el comienzo de una evaluación de seguridad.

Limitaciones del experimento que conviene recordar

Primera: las salidas proceden de situaciones y alternativas estructuradas. No se observaron diez millones de tratamientos ni se midieron daños clínicos a pacientes. Segunda: los modelos utilizados tienen características específicas y los resultados no equivalen a una evaluación de todos los asistentes médicos comerciales disponibles.

Tercera: una mejora de promedio puede esconder diferencias entre escenarios, tipos de mensajes y modelos concretos. Cuarta: un cambio en la formulación de la petición modifica el contexto experimental, pero no prueba por sí solo que una aplicación integrada en un hospital cuente con controles de acceso, trazabilidad y supervisión adecuados.

Quinta: el enorme número de salidas proporciona precisión para estudiar este experimento, pero no convierte automáticamente los resultados en una estimación de riesgo real. Los investigadores describen expresamente su trabajo como una prueba de concepto para evaluar respuestas a instrucciones inseguras.

Existen además revisiones sobre usos y salvaguardas de modelos de lenguaje en atención primaria que distinguen tareas administrativas, apoyo informativo y decisiones clínicas. Es una diferencia práctica importante para interpretar cualquier anuncio comercial sobre inteligencia artificial sanitaria.

Preguntas frecuentes

¿Un simple mensaje hizo seguros a los veinte modelos?

No. Redujo las elecciones potencialmente dañinas en 19 de los 20 modelos estudiados, pero persistió un porcentaje importante de respuestas problemáticas. El estudio no convierte un modelo general en un producto sanitario validado.

¿Qué significan el 16,6 % y el 10,1 %?

Son porcentajes de decisiones experimentales clasificadas como potencialmente dañinas bajo dos condiciones. La caída es de 6,5 puntos porcentuales, y no representa un porcentaje de pacientes perjudicados.

¿Por qué son importantes las órdenes de un supuesto superior?

Porque un sistema puede interpretar el tono o la jerarquía como una señal para obedecer incluso si la petición contradice medidas de seguridad. El experimento estudió cómo el encuadre afecta a las elecciones.

¿Puedo utilizar un asistente de inteligencia artificial para decidir mi tratamiento?

Una herramienta general puede ayudar a comprender conceptos o preparar preguntas, pero este estudio no demuestra que pueda decidir tratamientos de forma independiente. Las decisiones sanitarias deben tomarse con profesionales cualificados y con información clínica adecuada.

Conclusión: menos decisiones arriesgadas no significa riesgo eliminado

El trabajo de Mount Sinai aporta una advertencia útil para el momento actual de la inteligencia artificial: no basta con evaluar si un modelo conoce la respuesta correcta; también hay que medir qué hace cuando alguien le pide actuar contra un criterio de seguridad. Un recordatorio breve mejoró muchas respuestas, y eso merece atención. Pero el resultado residual y las grandes diferencias entre escenarios impiden tratarlo como una solución definitiva.

El mensaje más importante para quienes construyen sistemas no es «añade una frase y ya está». Es este: combina buenas instrucciones, límites técnicos, pruebas de presión, revisión humana y registros verificables. En salud, esa combinación debe apoyarse además en investigación clínica y gobernanza específica. La investigación de septiembre, difundida en octubre, ayuda a precisar qué parte de ese desafío empieza en las palabras que escribimos a la máquina.

Fuentes originales y bibliografía

Artículo informativo de análisis científico. No constituye consejo médico ni avala usar asistentes generales para tomar decisiones clínicas. La portada es una fotografía ilustrativa: no representa un experimento ni a los participantes reales del estudio.