·

Seguridad de la IA en la atención médica

Atención médica

Clínico

ChatGPT en el soporte a la decisión clínica: capacidades y limitaciones

Explora el papel de ChatGPT en el soporte a la decisión clínica: dónde ayuda, dónde falla y cómo evaluar herramientas de IA de forma segura en el ámbito sanitario

El soporte a la decisión clínica ha estado presente en la atención sanitaria durante décadas, desde simples alertas de interacciones medicamentosas integradas en sistemas de prescripción hasta sofisticadas herramientas de diagnóstico basadas en reglas. La llegada de los modelos de lenguaje de gran tamaño (LLM), como ChatGPT, ha transformado este panorama. Estas herramientas pueden responder preguntas clínicas complejas en lenguaje natural, resumir extensos historiales de pacientes y generar razonamientos clínicos que resultan plausibles en cuestión de segundos. Para los profesionales sanitarios, esto plantea un dilema real: estas herramientas ya se utilizan de manera informal en los flujos de trabajo clínicos, pero su validación para la toma de decisiones de alto riesgo sigue siendo limitada y desigual. Comprender en qué situaciones los LLM realmente ayudan, en cuáles fallan y qué marcos de gobernanza deben regular su uso es ahora una necesidad práctica para cualquier persona que trabaje en el sector sanitario.

Qué significa realmente el soporte a la decisión clínica en 2026

El soporte a la decisión clínica no es una tecnología única, sino un espectro. En un extremo se encuentran las alertas pasivas basadas en reglas: un sistema de prescripción que señala una combinación de medicamentos contraindicada o un recordatorio de que una paciente tiene pendiente una citología cervical. En el otro extremo están las herramientas activas impulsadas por IA que interpretan datos clínicos no estructurados, generan diagnósticos diferenciales o recomiendan vías de tratamiento en tiempo real.

Esta distinción es importante para la estratificación del riesgo. Una alerta basada en reglas que se activa incorrectamente resulta molesta y puede causar fatiga de alertas. Un LLM que genera con confianza un diagnóstico diferencial plausible pero incorrecto en un caso complejo puede contribuir al daño del paciente. No todas las herramientas de soporte a la decisión clínica implican el mismo perfil de riesgo, y evaluar LLM de propósito general como ChatGPT frente a este espectro requiere claridad sobre qué parte del espectro se está abordando.

En 2026, la mayoría de las aplicaciones de IA clínica se sitúan en un punto intermedio: herramientas que combinan el reconocimiento de patrones en grandes conjuntos de datos con lógica clínica estructurada. ChatGPT y sus equivalentes ocupan una posición distintiva. Son extraordinariamente capaces en tareas lingüísticas, pero no fueron diseñados, entrenados ni validados como dispositivos médicos.

Cómo funcionan los modelos de lenguaje de gran tamaño: una guía para profesionales sanitarios

Los LLM como ChatGPT generan texto prediciendo el siguiente token (fragmento de palabra) estadísticamente más probable, basándose en patrones aprendidos a partir de enormes cantidades de datos de entrenamiento. No razonan como lo haría un profesional sanitario. No acceden a una base de conocimientos estructurada, no consultan una farmacopea ni aplican reglas lógicas. Generan respuestas que son lingüísticamente coherentes y, a menudo, factualmente precisas porque la información correcta estaba bien representada en sus datos de entrenamiento.

Este mecanismo es fundamentalmente diferente de los sistemas de soporte a la decisión clínica basados en reglas que la mayoría de los profesionales sanitarios ya conocen en sus sistemas de historias clínicas. Un sistema basado en reglas siempre señalará una interacción medicamentosa específica si la lógica está correctamente codificada. Un LLM puede hacerlo o no, dependiendo de cómo se formule la pregunta, qué información había en sus datos de entrenamiento y la variabilidad probabilística inherente a sus resultados.

Comprender esta distinción es clínicamente importante. Los LLM no son sistemas de consulta con un índice fiable. Son motores sofisticados de coincidencia de patrones que producen lenguaje, y sus resultados deben evaluarse en consecuencia.

Dónde ChatGPT muestra un potencial genuino en los flujos de trabajo clínicos

A pesar de estas limitaciones arquitectónicas, la base de evidencia sobre la utilidad de los LLM en tareas clínicas específicas está creciendo. Una revisión de alcance de 28 estudios publicada en Health Science Reports identificó el soporte a la decisión clínica y la educación médica como las ventajas más citadas de ChatGPT en entornos sanitarios.

Las áreas donde la evidencia de utilidad es más sólida incluyen:

  • Documentación clínica: Una síntesis publicada en Frontiers in Artificial Intelligence encontró ahorros de tiempo del 40 al 70 % en tareas de documentación clínica cuando los LLM ayudaron con la generación y el resumen de notas.

  • Apoyo a no especialistas: Un estudio de junio de 2026 en NPJ Digital Medicine que evaluó ChatGPT-4o en 100 casos reales de polineuropatía encontró que logró una precisión del 65,5 % en el diagnóstico principal, comparable a los neurólogos no especialistas (63,0 %), aunque inferior a los especialistas (74,0 %). Los no especialistas revisaron sus evaluaciones en el 21,8 % de los casos tras consultar las sugerencias de ChatGPT-4o, mejorando su precisión.

  • Amplitud del diagnóstico diferencial: En el mismo estudio de polineuropatía, ChatGPT-4o superó a los no especialistas en diagnósticos diferenciales (82,0 % frente a 77,5 %) y recomendó pruebas confirmatorias más apropiadas (68,0 % frente a 53,0 %).

  • Comunicación con el paciente: Los LLM demuestran una utilidad medible en la redacción de mensajes al paciente, la explicación de diagnósticos en un lenguaje accesible y el apoyo a tareas de alfabetización sanitaria.

  • Síntesis de literatura: Para profesionales sanitarios que realizan revisiones rápidas de evidencia, los LLM pueden acelerar la identificación y el resumen de estudios relevantes, aunque los resultados requieren verificación.

Una revisión sistemática de LLM en todo el continuo de atención del cáncer colorrectal, publicada en el Journal of Medical Internet Research en mayo de 2026, encontró utilidad en la automatización de la extracción de datos de textos clínicos, el apoyo a la educación del paciente y la asistencia en la toma de decisiones clínicas. Los modelos específicos de dominio y multimodales mostraron ventajas sobre los modelos de propósito general en ciertas tareas.

El problema de la precisión: alucinaciones, conocimiento desactualizado y confianza sin certeza

La limitación clínicamente más significativa de los LLM es la alucinación, es decir, la generación de información que suena plausible pero es incorrecta. En tareas lingüísticas cotidianas, un detalle alucinado es un inconveniente menor. En contextos clínicos, puede ser peligroso.

Un análisis de noviembre de 2025 sobre riesgos de alucinación en LLM desplegados en la atención sanitaria encontró que los resultados alucinados que parecen creíbles pueden guiar a los profesionales sanitarios hacia intervenciones dañinas, influyendo tanto en las vías diagnósticas como en las elecciones terapéuticas. El análisis señaló que incluso las imprecisiones menores pueden aumentar el riesgo clínico cuando se alinean con el sesgo cognitivo existente del profesional sanitario. El modelo confirma lo que el profesional ya sospechaba, y el error pasa inadvertido.

El problema de la alucinación se ve agravado por una falta de calibración de la confianza. Una evaluación exhaustiva de cuatro LLM en casos complejos de reumatología, publicada en Health Informatics Journal en abril de 2026, encontró que aunque ChatGPT-4 logró una precisión del 100 % en el diagnóstico principal en los casos de prueba (en un conjunto pequeño), el análisis de correlación de Spearman reveló asociaciones uniformemente débiles y no significativas entre la calidad del razonamiento y la certeza expresada en todos los modelos. Los modelos no sabían de manera fiable cuándo estaban equivocados y expresaban una confianza similar independientemente de si su razonamiento era sólido.

ChatGPT demostró la tasa de alucinación más baja de los cuatro modelos probados (7,4 %), en comparación con el 18,5 % de Gemini. Incluso una tasa de alucinación del 7,4 % en un contexto clínico no es una cifra trivial.

Otras limitaciones de precisión incluyen:

Estado regulatorio: ¿es ChatGPT un dispositivo médico?

La posición regulatoria de los LLM de propósito general bajo el Reglamento de Dispositivos Médicos (MDR) de la UE no es sencilla, y la claridad en esta área aún está evolucionando. El MDR define un dispositivo médico en parte por su propósito previsto. El software destinado al diagnóstico, prevención, monitorización o tratamiento de enfermedades entra dentro del alcance. Los LLM de propósito general como ChatGPT no se comercializan con un propósito médico previsto, lo que significa que actualmente no llevan el marcado CE como dispositivos médicos.

Esto crea una brecha significativa de responsabilidad. Cuando un profesional sanitario utiliza una herramienta regulada de soporte a la decisión clínica, existe una base de evidencia validada, un uso previsto definido, un marco de responsabilidad del fabricante y un rastro de auditoría regulatoria. Cuando un profesional sanitario utiliza ChatGPT de consumo para apoyar una decisión clínica, ninguna de esas salvaguardas se aplica. La responsabilidad clínica recae enteramente en el profesional sanitario.

Esta distinción no es meramente burocrática. Afecta a si una herramienta ha sido probada con poblaciones reales de pacientes, si sus resultados han sido validados frente a resultados clínicos y si existe algún mecanismo de vigilancia poscomercialización en caso de que la herramienta cause daño.

Riesgos de seguridad del paciente que los profesionales sanitarios no deben pasar por alto

Más allá de la alucinación, existen varios modos de fallo de seguridad relevantes para la práctica clínica.

El sesgo de automatización es la tendencia de los profesionales sanitarios a confiar en una sugerencia generada por IA incluso cuando su propio juicio clínico habría llevado a una conclusión diferente y potencialmente más precisa. Este riesgo está bien documentado en la literatura de factores humanos y es directamente aplicable al uso de LLM en entornos clínicos.

El rendimiento en la toma de decisiones secuenciales es sustancialmente peor que en las respuestas a preguntas estáticas. El benchmark AgentClinic, publicado en NPJ Digital Medicine en abril de 2026, encontró que la precisión diagnóstica de los LLM en escenarios clínicos secuenciales e interactivos puede caer a menos de una décima parte de la precisión en preguntas estáticas equivalentes. Los encuentros clínicos reales son secuenciales y dinámicos. La mayoría de las evaluaciones de referencia no lo son.

Los diagnósticos raros presentan una vulnerabilidad particular. Los LLM se entrenan con datos a nivel poblacional, y las enfermedades poco frecuentes están, por definición, subrepresentadas. Un modelo que funciona bien en presentaciones comunes puede fallar en el caso atípico o raro que más requiere apoyo diagnóstico.

El acceso no supervisado de pacientes introduce una categoría de riesgo adicional. Los pacientes ya utilizan LLM de consumo para interpretar síntomas, evaluar medicamentos y decidir si buscar atención. Los controles de calidad que se aplican a las herramientas dirigidas a profesionales sanitarios no existen en este contexto, y el potencial de daño por información clínica generada por IA sin supervisión es una preocupación reconocida en la literatura de seguridad del paciente.

Un estudio que evaluó cinco LLM en 50 escenarios clínicos de mieloma múltiple, revisado por tres hematólogos-oncólogos independientes, concluyó que las recomendaciones de tratamiento de los LLM requieren una supervisión clínica cuidadosa para garantizar la seguridad del paciente, incluso en un contexto de evaluación estructurado y específico de oncología.

Seguridad de datos, RGPD y el problema de introducir datos de pacientes

Un riesgo de cumplimiento que los profesionales sanitarios frecuentemente subestiman es la introducción de datos identificables de pacientes en herramientas LLM orientadas al consumidor, lo que plantea importantes preocupaciones sobre seguridad y privacidad de datos. Bajo el Reglamento General de Protección de Datos del Reino Unido (RGPD) y el RGPD de la UE, los datos de pacientes son datos de categoría especial que requieren una base legal explícita para su procesamiento. Introducir el nombre de un paciente, fecha de nacimiento, historial clínico o resultados de pruebas en una herramienta LLM de consumo casi con certeza constituye procesamiento de datos personales por un tercero, sin un acuerdo de procesamiento de datos, sin una base legal y potencialmente con residencia de datos en jurisdicciones fuera del Reino Unido o la UE.

La distinción entre ChatGPT de consumo y los despliegues empresariales o específicos de atención sanitaria es relevante aquí. Los acuerdos empresariales con OpenAI o proveedores equivalentes pueden incluir acuerdos de procesamiento de datos, compromisos de no usar las entradas para el entrenamiento de modelos y residencia de datos definida. Las herramientas orientadas al consumidor no incluyen ninguna de estas protecciones por defecto.

Los profesionales sanitarios que utilicen cualquier herramienta de IA en un contexto clínico deben verificar:

  • Si existe un acuerdo de procesamiento de datos entre su organización y el proveedor de IA

  • Dónde se procesan y almacenan los datos de pacientes

  • Si la herramienta ha sido aprobada por el equipo de gobernanza de información de su organización

  • Si los datos de pacientes pueden ser desidentificados antes de la entrada sin perder utilidad clínica

Cómo difiere la IA clínica específicamente diseñada de los LLM de propósito general

El contraste entre los LLM de propósito general y las herramientas de IA clínica específicamente diseñadas no es solo una cuestión del modelo subyacente, sino de toda la arquitectura de despliegue.

Un estudio de referencia publicado en NPJ Digital Medicine en diciembre de 2025 desarrolló el Clinical Safety-Effectiveness Dual-Track Benchmark (CSEDB) y probó seis LLM en 30 métricas que cubren dominios de soporte a la decisión clínica. Los LLM médicos específicos de dominio mostraron ventajas de rendimiento consistentes sobre los modelos de propósito general, con puntuaciones máximas más altas tanto en seguridad (0,912 frente a puntuaciones más bajas de propósito general) como en efectividad (0,861). El rendimiento general en todos los modelos promedió el 57,2 %, con una caída del 13,3 % en escenarios clínicos de alto riesgo.

Las herramientas de IA clínica específicamente diseñadas para entornos sanitarios regulados suelen ofrecer:

  • Resultados validados probados frente a resultados clínicos en poblaciones de pacientes definidas

  • Rastros de auditoría que apoyan la gobernanza clínica y la responsabilidad

  • Integración con el sistema de historias clínicas que permite a la herramienta acceder a datos estructurados de pacientes sin reingreso manual

  • Certificación de dispositivo médico bajo marcos regulatorios relevantes (MDR en la UE, registro UKCA o MHRA en el Reino Unido)

  • Usos previstos definidos que limitan la herramienta a tareas donde su rendimiento ha sido evaluado

El modelo de lenguaje subyacente puede ser similar o idéntico a un LLM de propósito general. Lo que cambia es la capa de gobernanza, la evidencia de validación y la responsabilidad regulatoria.

Lo que realmente dice la evidencia: una revisión de estudios clínicos

La evidencia publicada sobre el rendimiento de los LLM en tareas clínicas está creciendo rápidamente, pero sigue siendo metodológicamente desigual. Varias advertencias importantes deben considerarse al interpretar la literatura.

El rendimiento en pruebas de referencia no equivale a utilidad clínica en el mundo real. Los LLM han logrado puntuaciones en el rango del 80 al 90 % en exámenes de licencia médica como el USMLE, un resultado que generó una atención mediática significativa. Los exámenes de licencia evalúan el recuerdo y el razonamiento estructurado en problemas bien definidos. No replican la ambigüedad, la presión del tiempo, la información incompleta y la toma de decisiones secuencial de los encuentros clínicos reales.

La calidad de los estudios es variable. La revisión sistemática de LLM en la atención del cáncer colorrectal encontró que solo el 27 % de los estudios incluidos presentaban bajo riesgo de sesgo, con problemas en la medición de resultados, la selección de pacientes y la falta de evaluación ciega. Los resultados de estudios con mayor riesgo de sesgo deben interpretarse con precaución.

Los marcos de evaluación aún no están estandarizados. Un consenso de expertos de 2025 publicado en ScienceDirect identificó la falta de metodologías de evaluación consistentes como una barrera significativa para el despliegue seguro, abarcando el cribado de enfermedades, la asistencia diagnóstica y la gestión de la salud. Sin evaluación estandarizada, comparar el rendimiento entre estudios es difícil.

El rendimiento específico por especialidad varía sustancialmente. La base de evidencia es más sólida en áreas con conjuntos de datos de entrenamiento grandes y bien estructurados, como presentaciones comunes en atención primaria, estadificación oncológica e interpretación radiológica. El rendimiento en enfermedades raras, multimorbilidad compleja y presentaciones agudas sensibles al tiempo está menos caracterizado.

Un comentario de JAMIA de enero de 2025 que explora el potencial de ChatGPT para aumentar la lógica de soporte a la decisión clínica reconoció tanto la promesa como las brechas significativas en la evidencia, señalando que las limitaciones clave y las áreas para investigación futura permanecen sin resolver.

Un marco para que los profesionales sanitarios evalúen herramientas de IA para el soporte a la decisión

Antes de adoptar cualquier herramienta de IA en un flujo de trabajo clínico, los profesionales sanitarios y los responsables de la toma de decisiones en atención sanitaria deben aplicar una evaluación estructurada. Las siguientes preguntas se basan en marcos regulatorios y de gobernanza clínica actuales, y son especialmente relevantes al evaluar herramientas de soporte a la decisión clínica.

Sobre precisión y validación

  • ¿Ha sido validada la herramienta en poblaciones de pacientes comparables a las de su entorno clínico?

  • ¿Cuál es la evidencia publicada sobre la tasa de alucinación, calibración y rendimiento en escenarios de alto riesgo?

  • ¿Se degrada el rendimiento en pacientes con comorbilidades o presentaciones atípicas?

Sobre el estado regulatorio

  • ¿Está clasificada la herramienta como dispositivo médico bajo el marco regulatorio relevante?

  • Si no es así, ¿cuál es el uso previsto declarado por el fabricante y su caso de uso clínico entra dentro de él?

Sobre la gobernanza de datos

  • ¿Existe un acuerdo de procesamiento de datos entre su organización y el proveedor de IA?

  • ¿Dónde se procesan y almacenan los datos de pacientes?

  • ¿Ha sido aprobada la herramienta por los equipos de gobernanza de información y seguridad clínica de su organización?

Sobre la supervisión clínica

  • ¿El modelo de despliegue de la herramienta requiere la revisión del profesional sanitario de todos los resultados antes de que influyan en las decisiones clínicas?

  • ¿Existe un rastro de auditoría que respalde la responsabilidad si una decisión asistida por IA es posteriormente cuestionada?

  • ¿Están los profesionales sanitarios que utilizan la herramienta capacitados para reconocer sus modos de fallo específicos, incluida la alucinación y el sesgo de automatización?

El preprint ChatGPT-CARE identificó limitaciones específicas del ChatGPT base en entornos clínicos, como el desconocimiento de las directrices de práctica clínica, la falta de transparencia en el razonamiento y las respuestas excesivamente generales. Propuso el aprendizaje en contexto y el prompting de cadena de pensamiento como estrategias de mitigación. Estas representan una dirección de avance para herramientas específicamente diseñadas, más que una solución disponible en despliegues de consumo.

La conclusión: uso apropiado versus dependencia inapropiada

La evidencia respalda una posición matizada. ChatGPT y LLM comparables pueden reducir la carga de documentación, apoyar a profesionales sanitarios no especialistas en la generación de diagnósticos diferenciales y mejorar la accesibilidad de la comunicación clínica, especialmente en entornos con recursos limitados o no especializados. Estos son beneficios reales y medibles.

Lo que la evidencia no respalda es la toma de decisiones clínicas autónoma por parte de los LLM, ni el uso de herramientas de consumo de propósito general como sustituto de sistemas validados de soporte a la decisión clínica en contextos de alto riesgo. El estudio de Annals of Biomedical Engineering sobre ChatGPT en soporte a la decisión clínica concluyó que la supervisión de expertos humanos sigue siendo esencial en todas las aplicaciones, una conclusión reiterada en toda la literatura.

El límite entre el uso apropiado y la dependencia inapropiada no siempre es obvio en la práctica, pero varios marcadores son útiles:

  • Tareas de bajo riesgo y alto volumen como la asistencia en documentación, la redacción de mensajes al paciente y el resumen de literatura son donde los LLM ofrecen el mayor beneficio con el menor riesgo, siempre que se cumplan los requisitos de gobernanza de datos de pacientes.

  • Decisiones diagnósticas o de prescripción de alto riesgo, especialmente en presentaciones complejas, con multimorbilidad o enfermedades raras, requieren herramientas validadas y reguladas, con usos previstos definidos y supervisión clínica integrada en el flujo de trabajo.

  • Las herramientas de consumo sin acuerdos de datos empresariales no deben usarse con datos identificables de pacientes bajo ninguna circunstancia, independientemente de la tarea clínica.

La supervisión del profesional sanitario no es una salvaguarda temporal en espera de una mejor IA. Es un requisito estructural dado el estado actual de la precisión, calibración y validación regulatoria de los LLM. Las herramientas están mejorando, la base de evidencia está creciendo y los marcos regulatorios están evolucionando. Hasta que las herramientas de IA clínica validadas demuestren un rendimiento consistente y seguro en toda la gama de complejidad clínica, el profesional sanitario sigue siendo el punto de control esencial en cualquier decisión asistida por IA.

Preguntas frecuentes

▶ ¿Es ChatGPT un dispositivo médico regulado para el soporte a la decisión clínica?

No. Los modelos de lenguaje de gran tamaño de propósito general como ChatGPT no se comercializan con un propósito médico previsto, por lo que no llevan el marcado CE como dispositivos médicos bajo el Reglamento de Dispositivos Médicos de la UE. Cuando un profesional sanitario utiliza ChatGPT de consumo para apoyar una decisión clínica, no hay base de evidencia validada, ni marco de responsabilidad del fabricante ni rastro de auditoría regulatoria. La responsabilidad clínica recae enteramente en el profesional sanitario.

▶ ¿Qué tareas clínicas muestran la evidencia más sólida de utilidad de los LLM?

La evidencia es más sólida en la documentación clínica, donde una síntesis publicada en Frontiers in Artificial Intelligence encontró ahorros de tiempo del 40 al 70 % cuando los modelos de lenguaje de gran tamaño ayudaron con la generación y el resumen de notas. Los LLM también muestran una utilidad medible en la redacción de mensajes al paciente, el apoyo a profesionales sanitarios no especialistas con diagnósticos diferenciales y la aceleración del resumen de literatura. Las decisiones diagnósticas o de prescripción de alto riesgo en casos complejos son donde la evidencia es más débil y los riesgos son mayores.

▶ ¿Qué es la alucinación y por qué importa en entornos clínicos?

La alucinación ocurre cuando un modelo de lenguaje de gran tamaño genera información que suena plausible pero es incorrecta. En contextos clínicos, esto puede ser peligroso. Un análisis de noviembre de 2025 encontró que los resultados alucinados que parecen creíbles pueden guiar a los profesionales sanitarios hacia intervenciones dañinas, especialmente cuando el resultado incorrecto coincide con una sospecha clínica existente. ChatGPT demostró la tasa de alucinación más baja entre cuatro modelos probados, con un 7,4 %, pero incluso esa cifra no es trivial en un contexto clínico.

▶ ¿Puede ChatGPT detectar de manera fiable las interacciones medicamento-medicamento?

No. Un estudio europeo publicado en Clinical Pharmacology and Therapeutics en febrero de 2025 encontró que ChatGPT produjo respuestas diferentes en el 90 % de los casos al repetir la misma consulta de interacción medicamentosa y omitió interacciones clínicamente relevantes. El estudio concluyó que actualmente no se puede recomendar para este caso de uso. A diferencia de los sistemas de prescripción basados en reglas, que aplican lógica codificada de forma consistente, los modelos de lenguaje de gran tamaño producen resultados probabilísticos que varían según la formulación y el contexto.

▶ ¿Cuáles son los riesgos del RGPD de introducir datos de pacientes en herramientas LLM de consumo?

Introducir datos identificables de pacientes en herramientas de modelo de lenguaje de gran tamaño orientadas al consumidor casi con certeza constituye procesamiento de datos de categoría especial por un tercero, sin un acuerdo de procesamiento de datos, sin una base legal y potencialmente con datos almacenados fuera del Reino Unido o la UE. Las herramientas de consumo no incluyen ninguna de las protecciones que los despliegues empresariales o específicos de atención sanitaria pueden ofrecer. Los profesionales sanitarios deben verificar si existe un acuerdo de procesamiento de datos, dónde se procesan y almacenan los datos, y si el equipo de gobernanza de información de su organización ha aprobado la herramienta antes de su uso.

▶ ¿En qué se diferencia una herramienta de IA clínica específicamente diseñada del ChatGPT de propósito general?

La diferencia no es solo el modelo subyacente, sino toda la arquitectura de despliegue. Las herramientas de IA clínica específicamente diseñadas ofrecen resultados validados probados frente a resultados clínicos, rastros de auditoría que apoyan la gobernanza y la responsabilidad, integración con el sistema de historias clínicas y certificación de dispositivo médico bajo marcos regulatorios relevantes. Un estudio de referencia publicado en NPJ Digital Medicine en diciembre de 2025 encontró que los modelos de lenguaje de gran tamaño médicos específicos de dominio mostraron ventajas de rendimiento consistentes sobre los modelos de propósito general, con puntuaciones más altas en métricas tanto de seguridad como de efectividad.

▶ ¿Significa aprobar exámenes de licencia médica que ChatGPT es seguro para el soporte a la decisión clínica?

No directamente. Los modelos de lenguaje de gran tamaño han logrado puntuaciones en el rango del 80 al 90 % en exámenes de licencia médica como el USMLE, pero estos exámenes evalúan el recuerdo y el razonamiento estructurado en problemas bien definidos. No replican la ambigüedad, la información incompleta y la toma de decisiones secuencial de los encuentros clínicos reales. Un estudio basado en simulación publicado en Healthcare (MDPI) en julio de 2025 encontró que la fiabilidad de ChatGPT disminuyó significativamente en casos cardiovasculares con comorbilidades, precisamente los pacientes más comúnmente atendidos en atención especializada.

▶ ¿Qué es el sesgo de automatización y cómo afecta a los profesionales sanitarios que utilizan herramientas de IA?

El sesgo de automatización es la tendencia de los profesionales sanitarios a confiar en una sugerencia generada por IA incluso cuando su propio juicio clínico habría llevado a una conclusión diferente y potencialmente más precisa. Este riesgo está bien documentado en la literatura de factores humanos y se aplica directamente al uso de modelos de lenguaje de gran tamaño en entornos clínicos. Se ve agravado por una falta de calibración de confianza en los modelos actuales: una evaluación exhaustiva publicada en Health Informatics Journal en abril de 2026 encontró que los modelos expresaban una confianza similar independientemente de si su razonamiento era sólido.

▶ ¿Dónde deben los profesionales sanitarios trazar la línea entre el uso apropiado y la dependencia inapropiada de los LLM?

Las tareas de bajo riesgo y alto volumen como la asistencia en documentación, la redacción de mensajes al paciente y el resumen de literatura ofrecen el mayor beneficio con el menor riesgo, siempre que se cumplan los requisitos de gobernanza de datos de pacientes. Las decisiones diagnósticas o de prescripción de alto riesgo, especialmente en presentaciones complejas, con multimorbilidad o enfermedades raras, requieren herramientas validadas y reguladas, con usos previstos definidos y supervisión clínica integrada en el flujo de trabajo. Las herramientas de consumo sin acuerdos de datos empresariales no deben usarse con datos identificables de pacientes bajo ninguna circunstancia, independientemente de la tarea clínica.

Empieza a usar Tandem hoy

Únete a miles de facultativos que disfrutan de una documentación sin estrés.

Empieza a usar Tandem hoy

Únete a miles de facultativos que disfrutan de una documentación sin estrés.

Empieza a usar Tandem hoy

Únete a miles de facultativos que disfrutan de una documentación sin estrés.