Un estudio publicado el 4 de marzo de 2026 en BMC Emergency Medicine evaluó el desempeño de cuatro modelos de lenguaje de gran escala en escenarios simulados de medicina de emergencias. Médicos especialistas analizaron la calidad, relevancia y aplicabilidad clínica de las respuestas generadas por sistemas de inteligencia artificial en casos clínicos críticos.

Inteligencia artificial y medicina de emergencias

La integración de la inteligencia artificial (IA) en salud ha aumentado de forma sostenida, impulsada por herramientas capaces de analizar información y generar respuestas en lenguaje natural.

Entre ellas se destacan los modelos de lenguaje de gran escala (LLM, Large Language Models), sistemas entrenados con grandes volúmenes de texto para responder preguntas complejas y producir recomendaciones.

Sin embargo, el rendimiento de estas herramientas en entornos de alta presión clínica —como los servicios de urgencias— continúa siendo objeto de evaluación, debido a que en estos escenarios la toma de decisiones debe ser rápida, contextual y segura.

Modelos de lenguaje de gran escala (LLM: Large Language Models)

En el estudio “Evaluation of large language models in emergency medicine scenarios: a comparative analysis of ChatGPT-4o, ChatGPT-o3mini, Gemini 2.0-Pro, and DeepSeek-R1”, publicado el 4 de marzo de 2026 en BMC Emergency Medicine (Vol. 26, artículo 69), fue comparado el rendimiento de cuatro modelos de lenguaje de gran escala:

  • ChatGPT-4o
  • ChatGPT-o3mini
  • Gemini 2.0-Pro
  • DeepSeek-R1

La evaluación se enfocó en tres dimensiones: calidad, relevancia y aplicabilidad clínica, con el propósito de estimar su utilidad potencial como apoyo en tareas críticas de la atención urgente.

Diseño del estudio y metodología

Se utilizó un diseño mixto (cuantitativo y cualitativo) basado en 11 casos clínicos simulados, representativos de seis dominios centrales de la medicina de emergencias:

  • Triage
  • Evaluación y diagnóstico
  • Toma de decisiones terapéuticas
  • Manejo posterior y seguimiento
  • Apoyo psicosocial
  • Pronóstico y rehabilitación

Las respuestas generadas por los modelos fueron evaluadas por 20 médicos especialistas en emergencias, todos con más de 8 años de experiencia clínica.

Para reducir sesgos, se aplicó un diseño doble ciego: los evaluadores no conocían qué modelo había producido cada respuesta.

Las respuestas identificadas como incorrectas o potencialmente engañosas fueron sometidas a una nueva evaluación tras el uso de re-prompting (reformulación de las preguntas), con el objetivo de analizar la capacidad de autocorrección de cada sistema.

Confiabilidad de la evaluación e ICC (Intraclass Correlation Coefficient)

La consistencia entre evaluadores fue considerada alta. Se informó el coeficiente de correlación intraclase (ICC, Intraclass Correlation Coefficient) para cada modelo:

  • ChatGPT-4o: 0,693
  • ChatGPT-o3mini: 0,769
  • Gemini 2.0-Pro: 0,856
  • DeepSeek-R1: 0,887

El ICC global fue de 0,897 (IC 95%: 0,856–0,930), lo que respaldó la confiabilidad de las calificaciones aplicadas por los especialistas.

Extensión de las respuestas: diferencias entre modelos

En relación con la longitud promedio de las respuestas, se observaron diferencias significativas entre sistemas:

  • Gemini 2.0-Pro: 843,53 ± 289,88 palabras
  • ChatGPT-o3mini: 536,71 ± 180,39
  • ChatGPT-4o: 433,47 ± 122,75
  • DeepSeek-R1: 387,65 ± 87,80

Gemini 2.0-Pro produjo, en promedio, las respuestas más extensas, aunque la utilidad clínica fue evaluada principalmente por la precisión, pertinencia y aplicabilidad de la información entregada.

Resultados globales: calidad, relevancia y aplicabilidad clínica

En las evaluaciones globales, Gemini 2.0-Pro y ChatGPT-4o obtuvieron los mejores resultados generales.

Calidad

  • Gemini 2.0-Pro: 3,61 ± 0,51
  • ChatGPT-4o: 3,58 ± 0,52
  • ChatGPT-o3mini: 3,35 ± 0,52
  • DeepSeek-R1: 3,04 ± 0,63

Se informó una diferencia significativa entre modelos (P = 0,001).

Relevancia

  • ChatGPT-4o: 3,53 ± 0,53
  • Gemini 2.0-Pro: 3,54 ± 0,51
  • ChatGPT-o3mini: 3,30 ± 0,54
  • DeepSeek-R1: 3,02 ± 0,64

Las diferencias también fueron significativas (P = 0,001).

Aplicabilidad clínica

  • Gemini 2.0-Pro: 2,69 ± 0,46
  • DeepSeek-R1: 2,46 ± 0,51
  • ChatGPT-o3mini: 2,40 ± 0,49

Gemini 2.0-Pro fue el modelo con mejor aplicabilidad clínica y mostró diferencias significativas frente a otros (P = 0,001).

Análisis por dominios: fortalezas diferenciales

El rendimiento varió según el dominio clínico evaluado. Se observaron diferencias específicas por tarea:

  • ChatGPT-4o mostró mejor desempeño en triage, diagnóstico y decisiones terapéuticas.
  • Gemini 2.0-Pro obtuvo los puntajes más altos en apoyo psicosocial y pronóstico/rehabilitación (P < 0,001).
  • DeepSeek-R1 también mostró buen rendimiento en tareas psicosociales, superando a algunos modelos propietarios (P < 0,05).

El triage como punto crítico: tendencia a sobreestimar gravedad

El triage fue identificado como el dominio con mayor tasa de errores. En general, los modelos tendieron a sobreestimar la gravedad, clasificando pacientes nivel II–III como nivel I. Este sesgo fue atribuido a una interpretación excesiva del síntoma principal, sin integrar de forma suficiente el contexto clínico completo.

Re-prompting: mejora de la aplicabilidad y autocorrección contextual

El uso de re-prompting permitió observar mejoras significativas en varios dominios. Se reportó un incremento estadísticamente significativo en aplicabilidad clínica para ChatGPT-o3mini, Gemini 2.0-Pro y DeepSeek-R1, en especial en triage y apoyo psicosocial (P < 0,001).

Estos hallazgos sugirieron que la capacidad de adaptación de los modelos puede ser dependiente del contexto y de la guía externa, lo que refuerza la importancia del diseño de las preguntas en entornos clínicos.

Implicancias clínicas y límites actuales

En conjunto, los resultados indicaron que los LLM (Large Language Models) presentan potencial para apoyar tareas de la medicina de emergencias, especialmente en evaluación clínica inicial y apoyo psicosocial. No obstante, se informaron limitaciones persistentes en:

  • Razonamiento clínico dinámico
  • Interpretación de guías clínicas
  • Estabilidad en decisiones críticas

Por este motivo, los autores concluyeron que la implementación asistencial requiere ajustes específicos por dominio, mayor interpretabilidad y validación clínica real antes de su uso en práctica cotidiana.

Conclusión

Fue observado que los modelos de lenguaje pueden aportar valor en escenarios simulados de emergencias, con mejor desempeño global de Gemini 2.0-Pro y ChatGPT-4o. Aun así, el triage concentró más errores y se mantuvieron límites en decisiones críticas, por lo que se consideró necesaria una validación clínica real previa a su implementación.

Referencias

Autor

El equipo de redactores de Sapue realizo esta historia, utilizando herramientas editoriales, de traducción e inteligencia artificial. El proceso de redacción contó con incidencia humana en cada etapa.