Un estudio de Oliver Johannes Deffaa, Johanna Pape y colaboradores, publicado en BMC Emergency Medicine, evaluó una inteligencia artificial para detectar fracturas pediátricas fuera del horario habitual y encontró alta precisión diagnóstica, aunque con un beneficio clínico incremental limitado.

La inteligencia artificial como apoyo para detectar fracturas pediátricas

La incorporación de sistemas de inteligencia artificial (IA) a la interpretación de estudios por imágenes ha abierto nuevas posibilidades para asistir a los profesionales durante la atención de urgencias. Una de las áreas en las que este apoyo podría resultar especialmente relevante es la detección de fracturas en niños y adolescentes, debido a que las particularidades anatómicas del esqueleto pediátrico pueden dificultar la lectura de las radiografías.

Esta dificultad puede adquirir mayor importancia fuera del horario habitual, cuando la disponibilidad inmediata de especialistas en radiología pediátrica puede ser limitada. En ese escenario, una herramienta automatizada podría funcionar como una segunda evaluación destinada a señalar lesiones que requieran una revisión adicional.

En este contexto fue desarrollado el estudio “Artificial intelligence for pediatric fracture detection: impact on diagnostic revisions and patient recall rates in a tertiary emergency setting”, realizado por Oliver Johannes Deffaa, Johanna Pape, Dominik Schlösser, Franz Wolfgang Hirsch, Martin Lacher, Maciej Rosolowski y Daniel Gräfe.

El trabajo fue publicado en BMC Emergency Medicine el 29 de julio de 2026 y fue orientado a establecer si una herramienta comercial de IA podía mejorar la atención de pacientes pediátricos sometidos a radiografías por sospecha de una lesión traumática.

El estudio no se limitó a determinar si la inteligencia artificial podía reconocer una fractura, sino que evaluó si esa capacidad podía modificar de forma concreta la atención del paciente.

No solo fue evaluada la capacidad del sistema para reconocer correctamente una fractura. También fueron analizadas sus posibles consecuencias sobre revisiones diagnósticas, cambios terapéuticos, nuevas convocatorias de pacientes, consultas con médicos senior, confianza diagnóstica y duración de la estancia en emergencias.

Esta diferencia fue fundamental para interpretar los resultados. Una herramienta puede alcanzar una alta exactitud diagnóstica y, sin embargo, generar una mejora relativamente pequeña cuando es utilizada en un centro donde los profesionales ya presentan una elevada precisión sin asistencia tecnológica.

Las fracturas pediátricas representan además un desafío particular debido a la presencia de placas de crecimiento, centros de osificación y variantes anatómicas normales que pueden dificultar la interpretación de las radiografías o confundirse con lesiones.

Una omisión diagnóstica puede ocasionar la necesidad de volver a contactar a la familia, modificar una inmovilización, indicar una nueva evaluación o cambiar el seguimiento establecido inicialmente. Por el contrario, una interpretación falsamente positiva también puede conducir a tratamientos o controles innecesarios.

La utilidad clínica de una herramienta de inteligencia artificial depende no solo de cuántas fracturas detecta, sino también de cuántos errores relevantes logra evitar.

Cómo fue evaluado el sistema Milvue Suite/TechCare Kids

Para estudiar esta cuestión fue realizado un trabajo prospectivo y cuasi aleatorizado en un hospital terciario entre abril y septiembre de 2025.

Fueron incluidos niños y adolescentes de 2 a 18 años sometidos a radiografías del esqueleto apendicular ante sospecha de fractura, luxación u otra lesión ósea traumática.

La investigación fue enfocada específicamente en la atención efectuada entre las 16:30 y las 07:30, correspondiente al período fuera del horario habitual.

En días alternos fue activado el sistema comercial Milvue Suite/TechCare Kids, desarrollado por Milvue, París. La herramienta analizaba automáticamente las radiografías y clasificaba cada estudio como fractura definitiva, posible fractura o ausencia de fractura.

La herramienta fue utilizada como apoyo a la decisión médica y no como sustituto del profesional encargado de diagnosticar y tratar al paciente.

La decisión definitiva permaneció siempre bajo responsabilidad de los médicos. La clasificación proporcionada por la inteligencia artificial (IA) debía ser integrada con la historia clínica, el mecanismo del traumatismo, el examen físico y la propia interpretación de las imágenes.

La metodología permitió comparar períodos en los que el equipo asistencial disponía del resultado automatizado con otros en los que las radiografías eran evaluadas sin asistencia de IA.

De los 1.515 pacientes elegibles, 667 otorgaron consentimiento y fueron finalmente incluidos, lo que representó el 44,0% de la población inicialmente considerada.

La mediana de edad fue de 11,0 años, con un rango intercuartílico (RIC) de 8,1–13,6 años, y el 61% eran varones.

Las fracturas fueron identificadas en 296 pacientes, equivalentes al 44,3% de todos los participantes incluidos.

Casi la mitad de los pacientes analizados presentaba una fractura: fueron identificadas lesiones en 296 de los 667 participantes.

La IA estuvo disponible en 262 estudios, mientras que 405 fueron realizados sin asistencia. Esta distribución estuvo determinada tanto por el esquema de días alternos como por fallas técnicas de infraestructura registradas durante la investigación.

La inteligencia artificial alcanzó una exactitud diagnóstica del 95,1%

Uno de los hallazgos más destacados fue el elevado rendimiento diagnóstico alcanzado por la herramienta. La inteligencia artificial obtuvo una exactitud del 95,1%.

La sensibilidad fue del 93,0%. Este indicador expresa la capacidad de una prueba para identificar correctamente a los pacientes que realmente presentan la condición estudiada y mostró que el sistema detectó una elevada proporción de las fracturas existentes.

La especificidad alcanzó el 95,1%, reflejando una alta capacidad para reconocer correctamente los estudios en los que no existía una fractura.

El valor predictivo positivo fue del 92,2%, mientras que el valor predictivo negativo alcanzó el 95,6%.

La inteligencia artificial alcanzó 95,1% de exactitud, 93,0% de sensibilidad, 95,1% de especificidad, 92,2% de valor predictivo positivo y 95,6% de valor predictivo negativo.

Considerados en conjunto, estos indicadores mostraron que el algoritmo presentaba un desempeño técnico elevado para analizar radiografías pediátricas del esqueleto apendicular.

Sin embargo, la investigación buscó determinar algo diferente: si esa elevada precisión podía traducirse en una reducción mensurable de los errores con consecuencias clínicas.

La diferencia entre rendimiento diagnóstico y utilidad clínica incremental fue central para interpretar los resultados. Una exactitud elevada no implica necesariamente que la incorporación de una herramienta modifique una gran cantidad de decisiones cuando los profesionales ya realizan correctamente la mayoría de los diagnósticos.

Una alta precisión del algoritmo no equivale automáticamente a un gran beneficio clínico cuando la precisión diagnóstica basal del hospital ya es elevada.

En un entorno especializado, la cantidad de errores disponibles para ser corregidos es relativamente pequeña. Por este motivo, incluso un sistema con resultados superiores al 90% puede producir diferencias absolutas modestas sobre variables clínicas.

Las revisiones diagnósticas disminuyeron, pero sin significación estadística

Uno de los principales objetivos fue establecer si la inteligencia artificial (IA) podía reducir la necesidad de revisar el diagnóstico inicial al día siguiente.

Entre los 405 estudios realizados sin IA, fueron necesarias revisiones diagnósticas en 35 casos, equivalentes al 8,6%, con un intervalo de confianza del 95% (IC95%) de 6,1–11,8.

Entre los 262 estudios realizados con asistencia, fueron registradas 15 revisiones diagnósticas, equivalentes al 5,7%, con un IC95% de 3,2–9,3.

Las revisiones diagnósticas descendieron del 8,6% sin inteligencia artificial al 5,7% cuando el sistema estuvo disponible.

El riesgo relativo (RR) fue de 0,66, con un IC95% de 0,37–1,19 y un valor de p=0,24.

Aunque el RR inferior a 1 mostró una dirección favorable hacia una reducción de las revisiones, la diferencia no alcanzó significación estadística.

El intervalo de confianza incluyó el valor correspondiente a ausencia de efecto, por lo que no pudo afirmarse que hubiera quedado demostrada una reducción de las revisiones atribuible a la intervención.

Al mismo tiempo, tampoco pudo descartarse un posible beneficio, debido a que la estimación puntual mostró una menor frecuencia de revisiones con IA.

El riesgo relativo fue de 0,66, pero el intervalo de confianza del 95% de 0,37–1,19 y el valor de p=0,24 impidieron confirmar una diferencia estadísticamente significativa.

La reducción absoluta observada fue de 2,9 puntos porcentuales. Este resultado debe ser interpretado en un contexto en el que la mayoría de los diagnósticos iniciales ya eran correctos sin la asistencia automatizada.

Por esta razón, el hallazgo fue interpretado como una tendencia favorable que requiere confirmación en investigaciones con una muestra mayor.

Los cambios terapéuticos fueron menos frecuentes con inteligencia artificial

No todas las revisiones diagnósticas ocasionaron una modificación significativa del manejo. Por esta razón fueron analizados específicamente los casos en los que la corrección del diagnóstico produjo un cambio terapéutico relevante.

De todas las revisiones realizadas, 9, equivalentes al 17,3%, provocaron modificaciones terapéuticas relevantes.

Ocho de estos eventos ocurrieron en pacientes evaluados sin inteligencia artificial, equivalentes al 2,0% de los estudios de ese grupo.

En los estudios asistidos por IA fue registrado un solo cambio terapéutico relevante, equivalente al 0,4%.

Ocho de los nueve cambios terapéuticos relevantes ocurrieron cuando la inteligencia artificial no estaba disponible.

El riesgo relativo (RR) para este resultado fue de 0,19, con un IC95% de 0,02–1,53 y un valor de p=0,10.

La estimación puntual fue compatible con una reducción importante del riesgo, pero el amplio intervalo de confianza evidenció una considerable incertidumbre estadística.

La comparación tampoco alcanzó significación estadística. Uno de los principales factores que limitaron esta evaluación fue el bajo número total de eventos, ya que solamente se produjeron 9 modificaciones terapéuticas.

Los cambios terapéuticos relevantes ocurrieron en el 2,0% de los estudios sin inteligencia artificial y en el 0,4% de aquellos realizados con asistencia.

Aun así, la concentración de 8 de los 9 eventos en el grupo sin IA fue considerada una señal que justifica continuar estudiando este desenlace en poblaciones de mayor tamaño.

El hallazgo también mostró la importancia de distinguir entre una corrección diagnóstica y un error capaz de modificar efectivamente la conducta clínica del paciente.

Qué revelaron el riesgo relativo y el análisis bayesiano

Además del análisis convencional mediante riesgo relativo (RR), intervalos de confianza del 95% (IC95%) y valores de p, fue realizado un análisis bayesiano para estimar la probabilidad de que la intervención produjera un beneficio real.

Para las revisiones diagnósticas, fue calculada una probabilidad del 86,4% de que la inteligencia artificial redujera estos eventos.

En relación con las modificaciones terapéuticas, la probabilidad estimada de reducción fue del 89,0%.

El análisis bayesiano estimó una probabilidad del 86,4% de reducción de las revisiones diagnósticas y del 89,0% de disminución de las modificaciones terapéuticas.

Estos resultados aportaron una perspectiva complementaria a los valores de p. Aunque las comparaciones tradicionales no mostraron significación estadística, los datos fueron más compatibles con una dirección favorable a la asistencia mediante IA.

Sin embargo, los intervalos de credibilidad fueron amplios e incluyeron el efecto nulo, por lo que no fue posible establecer con precisión la verdadera magnitud del posible beneficio.

El análisis bayesiano no transformó una señal incierta en una demostración definitiva. En cambio, permitió mostrar que un efecto favorable continuaba siendo plausible y que debía ser investigado con una muestra considerablemente mayor.

Los resultados fueron compatibles con un posible beneficio de la herramienta, pero la incertidumbre estadística impidió determinar cuánto podría reducir realmente los eventos clínicos.

No hubo diferencias en consulta senior, confianza ni estancia en emergencias

La investigación también evaluó si la disponibilidad de inteligencia artificial (IA) modificaba otros aspectos del funcionamiento cotidiano del servicio de emergencias.

La necesidad de consultar con un médico senior fue del 14,3% sin IA y del 12,5% con IA. La diferencia no fue significativa, con p=0,59.

La consulta con un médico senior fue necesaria en el 14,3% de los casos sin inteligencia artificial y en el 12,5% con asistencia.

La confianza diagnóstica tampoco mostró cambios. La puntuación fue de 3,6 en ambos grupos, con un valor de p=0,91.

El hallazgo indicó que disponer de una segunda evaluación automatizada no se tradujo en una modificación mensurable de la seguridad con la que los profesionales percibían sus propias decisiones.

La duración de la estancia en emergencias tampoco fue reducida. Fue de 2,3 horas sin IA y de 2,4 horas con asistencia, con un valor de p=0,75.

La estancia fue de 2,3 horas sin inteligencia artificial y de 2,4 horas con asistencia, sin una diferencia significativa entre ambos grupos.

La clasificación automatizada de las radiografías constituyó solamente una parte del proceso asistencial, que también incluye evaluación clínica, decisiones terapéuticas, procedimientos, indicaciones y organización del alta.

Por ese motivo, una mayor velocidad en el análisis de las imágenes no necesariamente debía traducirse en una reducción del tiempo total de permanencia del paciente.

La ausencia de diferencias significativas en estas variables reforzó la conclusión de que el impacto incremental de la herramienta fue limitado dentro del hospital terciario estudiado.

Las familias aceptaron la inteligencia artificial, aunque persistió la ansiedad

La investigación también incorporó la percepción de las familias. Fueron encuestadas 650 familias acerca de su opinión sobre la utilización de inteligencia artificial (IA) dentro de la atención médica pediátrica.

El 82% manifestó una actitud positiva hacia la IA cuando era presentada como una herramienta de apoyo clínico.

Además, el 64% consideró que esta tecnología podría contribuir a mejorar la atención de sus hijos.

Entre 650 familias encuestadas, el 82% mostró una actitud positiva hacia la inteligencia artificial y el 64% consideró que podría mejorar la atención de sus hijos.

La percepción fue diferente cuando se evaluó la posibilidad de sustitución profesional. Solo el 13% consideró que la IA podría reemplazar a los médicos a mediano plazo.

Este resultado fue coherente con el modelo utilizado en el estudio, donde el algoritmo no tomó decisiones autónomas y la interpretación final de las radiografías permaneció bajo responsabilidad médica.

La elevada aceptación coexistió, sin embargo, con un dato de preocupación: el 61% manifestó ansiedad respecto del uso de inteligencia artificial en medicina.

Aunque la aceptación fue elevada, el 61% de las familias manifestó ansiedad respecto del uso de inteligencia artificial en medicina.

La coexistencia de confianza y preocupación sugirió que las familias podrían valorar favorablemente la tecnología como complemento del profesional sin aceptar necesariamente un modelo de automatización completa de la atención.

Por esta razón, la comunicación sobre el funcionamiento del sistema, sus limitaciones y la permanencia de la supervisión médica deberá formar parte de cualquier estrategia de implementación.

El beneficio dependió del contexto de un hospital terciario

Uno de los elementos centrales para interpretar los resultados fue el alto nivel de precisión diagnóstica basal existente en el hospital donde se llevó a cabo la investigación.

Cuando un centro dispone de profesionales experimentados, mecanismos de revisión y acceso a radiología pediátrica especializada, la cantidad de errores que pueden ser evitados mediante una segunda evaluación automatizada puede ser relativamente pequeña.

El beneficio incremental de una inteligencia artificial depende no solo de su precisión, sino también de la calidad diagnóstica que existe antes de incorporarla.

Los autores señalaron que este contexto podría explicar por qué una herramienta con una exactitud del 95,1% no produjo diferencias estadísticamente significativas en varias de las variables clínicas estudiadas.

Los resultados no demostraron que la IA carezca de utilidad. Mostraron que, dentro de un centro terciario con elevada precisión diagnóstica basal, el margen disponible para lograr una mejora adicional podía ser limitado.

En instituciones sin acceso inmediato a radiología pediátrica especializada, el efecto podría ser diferente y potencialmente más relevante.

También fue destacada la importancia de la infraestructura. Aunque fueron incluidos 667 pacientes, el sistema estuvo disponible en solamente 262 estudios, mientras que 405 fueron realizados sin asistencia debido al esquema de días alternos y a fallas técnicas.

El rendimiento de un algoritmo no depende únicamente de su capacidad diagnóstica: también requiere una infraestructura suficientemente estable para estar disponible cuando el equipo clínico lo necesita.

La implementación real de estas herramientas requiere, por lo tanto, considerar su integración con los sistemas hospitalarios, la disponibilidad permanente y la capacidad de funcionar de manera estable durante los períodos en los que fueron diseñadas para ofrecer apoyo.

Los futuros estudios deberán ser multicéntricos y aleatorizados

Los autores concluyeron que serán necesarios estudios multicéntricos, aleatorizados y de mayor tamaño para determinar con mayor precisión el impacto clínico de la inteligencia artificial en la detección de fracturas pediátricas.

La incorporación de múltiples centros permitiría incluir hospitales con distintos niveles de complejidad, experiencia profesional y disponibilidad de especialistas.

La aleatorización permitiría controlar con mayor rigurosidad posibles diferencias entre los pacientes atendidos con y sin asistencia tecnológica.

Una muestra mayor será especialmente importante para evaluar eventos poco frecuentes, como los cambios terapéuticos relevantes, de los cuales solamente fueron registrados 9 durante la investigación.

Los autores señalaron que las próximas investigaciones deberían ser multicéntricas, aleatorizadas y suficientemente grandes para estudiar eventos clínicos poco frecuentes.

Uno de los escenarios de mayor interés serán los hospitales sin acceso inmediato a radiología pediátrica especializada. En estas instituciones podría existir un margen considerablemente mayor para que una segunda evaluación automatizada contribuya a reducir errores.

También deberá estudiarse si la utilidad de la herramienta varía de acuerdo con la experiencia del profesional responsable de interpretar inicialmente las radiografías.

Los futuros trabajos tendrán que considerar desenlaces que excedan la exactitud diagnóstica, incluyendo revisiones posteriores, cambios terapéuticos, necesidad de nuevas consultas, tiempos de atención, utilización de recursos y aceptación por parte de las familias.

La pregunta futura no será solamente cuántas fracturas reconoce el algoritmo, sino en qué hospitales y circunstancias esa capacidad consigue mejorar realmente la atención.

Conclusión

La inteligencia artificial mostró una elevada precisión diagnóstica para detectar fracturas pediátricas, pero su incorporación no produjo diferencias estadísticamente significativas en revisiones, cambios terapéuticos, consultas senior, confianza profesional o tiempos de atención. Su mayor utilidad podría encontrarse en centros sin acceso inmediato a radiología pediátrica especializada, una posibilidad que deberá ser evaluada mediante estudios más amplios.

El estudio mostró que una elevada precisión algorítmica no garantiza por sí sola un gran impacto clínico: el beneficio depende también del entorno asistencial en el que la herramienta es utilizada.

Referencias

Autor

El equipo de redactores de Sapue realizo esta historia, utilizando herramientas editoriales, de traducción e inteligencia artificial. El proceso de redacción contó con incidencia humana en cada etapa.