Un estudio cualitativo analizó cómo profesionales clínicos interactúan con CoDE-HF, una herramienta basada en aprendizaje automático para estimar la probabilidad de insuficiencia cardíaca aguda en pacientes con disnea atendidos en emergencias.
Una herramienta para una decisión clínica compleja
El estudio “Clinician interaction with a machine learning algorithm for the assessment of patients with possible acute heart failure: a qualitative study” evaluó cómo los clínicos interactúan con una herramienta de soporte a la decisión clínica basada en machine learning (ML), o aprendizaje automático, para el diagnóstico de posible insuficiencia cardíaca aguda en pacientes con disnea atendidos en servicios de emergencias.
La herramienta analizada fue CoDE-HF, sigla de Collaboration for the Diagnosis and Evaluation of Heart Failure. Se trata de un algoritmo que utiliza concentraciones de péptidos natriuréticos y variables clínicas para estimar la probabilidad individual de insuficiencia cardíaca aguda.
El diagnóstico de insuficiencia cardíaca aguda en emergencias suele ser complejo, ya que otros cuadros potencialmente graves pueden presentar síntomas y signos similares. La disnea, o dificultad para respirar, puede estar relacionada con causas cardíacas, respiratorias, renales, infecciosas o metabólicas.
Por qué la insuficiencia cardíaca aguda puede ser difícil de diagnosticar
Los pacientes con sospecha de insuficiencia cardíaca aguda suelen presentar múltiples comorbilidades que dificultan la interpretación clínica. Entre las enfermedades cardíacas asociadas se mencionan la enfermedad coronaria y la fibrilación auricular. Entre las no cardíacas, pueden aparecer la enfermedad pulmonar obstructiva crónica (EPOC) y la insuficiencia renal.
Estas condiciones pueden modificar los síntomas, alterar los estudios complementarios o generar presentaciones clínicas superpuestas. Por ese motivo, en los servicios de emergencias la evaluación debe integrar antecedentes, examen físico, estudios de laboratorio, imágenes y criterio clínico.
En ese contexto, CoDE-HF fue evaluado como un posible apoyo para ordenar la información disponible, aportar objetividad y reducir la incertidumbre diagnóstica, sin reemplazar la valoración del equipo tratante.
El papel de NT-proBNP y BNP
Las guías nacionales e internacionales recomiendan el uso de NT-proBNP, sigla de fragmento N-terminal del propéptido natriurético tipo B, y BNP, sigla de péptido natriurético tipo B, para evaluar a pacientes con sospecha de insuficiencia cardíaca.
Estos biomarcadores son liberados por el corazón ante situaciones de estrés de la pared ventricular. Sin embargo, su interpretación puede verse influenciada por factores como la edad, la obesidad, la función renal y el sexo.
Por esta razón, un valor aislado de NT-proBNP o BNP puede no ser suficiente para confirmar o descartar el diagnóstico. CoDE-HF fue diseñado para integrar estos datos con variables clínicas y ofrecer una estimación individualizada de la probabilidad de insuficiencia cardíaca aguda.
Cómo funciona CoDE-HF
CoDE-HF calcula un puntaje de 0 a 100, que corresponde a la probabilidad individual de insuficiencia cardíaca aguda. Según ese resultado, los pacientes son clasificados en probabilidad baja, intermedia o alta.
Los umbrales fueron diseñados para descartar la enfermedad con 98% de valor predictivo negativo y 90% de sensibilidad. Para confirmarla, fueron establecidos con 75% de valor predictivo positivo y 90% de especificidad.
El resultado se presenta mediante cuatro elementos: una declaración sobre si la insuficiencia cardíaca está descartada, es probable o intermedia; el puntaje absoluto; una frase con el valor predictivo positivo o negativo; y una barra visual tipo “semáforo” con colores verde, amarillo y rojo.
Un estudio cualitativo con 17 profesionales
El estudio fue cualitativo y se realizó en febrero y marzo de 2024. Participaron 17 profesionales multidisciplinarios de tres hospitales de atención aguda, todos vinculados a la evaluación de pacientes con disnea en emergencias o unidades de admisión aguda.
Las entrevistas fueron individuales, semiestructuradas, presenciales o por videollamada, y tuvieron una duración de entre 64 y 92 minutos.
Durante las entrevistas, los participantes revisaron cinco casos clínicos anonimizados, seleccionados de una cohorte prospectiva, con diagnóstico adjudicado según guías internacionales.
Casos clínicos presentados de forma progresiva
La información de cada caso fue revelada de manera progresiva, con el objetivo de reproducir el modo en que los datos suelen estar disponibles en la práctica clínica real.
Primero se presentó la historia clínica, los antecedentes y la medicación. Luego se incorporaron los hallazgos del examen físico. Más adelante se agregaron el ECG, sigla de electrocardiograma, la radiografía de tórax, el NT-proBNP y, finalmente, el resultado de CoDE-HF.
Esta dinámica permitió observar cómo los profesionales integraban el resultado del algoritmo dentro del razonamiento clínico. En algunos casos, el puntaje reforzaba la impresión inicial. En otros, llevaba a reconsiderar el diagnóstico o a revisar elementos que podían haber sido subestimados.
El modelo UTAUT para analizar la aceptación tecnológica
El análisis se basó en el modelo UTAUT, sigla de Unified Theory of Acceptance and Use of Technology, o Teoría Unificada de Aceptación y Uso de la Tecnología.
Este marco contempla cuatro dominios principales: expectativa de desempeño, expectativa de esfuerzo, influencia social y condiciones facilitadoras.
La expectativa de desempeño se relaciona con la percepción de que una tecnología puede mejorar el trabajo clínico. La expectativa de esfuerzo evalúa si la herramienta resulta fácil de usar.
La influencia social considera el peso de colegas, guías y referentes profesionales. Las condiciones facilitadoras incluyen los recursos técnicos y organizacionales necesarios para su implementación.
Facilitadores identificados por los clínicos
Entre los principales facilitadores, los profesionales destacaron que CoDE-HF podía reducir la carga cognitiva, estandarizar la evaluación, disminuir el error humano y funcionar como un apoyo objetivo para comunicarse con colegas, especialistas y pacientes.
También se valoró su capacidad para repriorizar la insuficiencia cardíaca cuando el diagnóstico podía haber sido subestimado. En escenarios clínicos complejos, el algoritmo podía actuar como una señal de alerta para volver a considerar una hipótesis cardíaca.
Además, fue considerado útil para apoyar el descarte cuando la sospecha clínica era baja. Esta función podría contribuir a orientar la búsqueda de diagnósticos alternativos y a evitar intervenciones innecesarias, siempre dentro del contexto de la evaluación médica integral.
El juicio clínico siguió siendo central
Uno de los hallazgos más importantes fue que la evaluación clínica siguió siendo considerada central. Los participantes interpretaron CoDE-HF como un complemento del juicio clínico, no como un reemplazo de la experiencia profesional.
Cuando el resultado del algoritmo no coincidía con la impresión inicial, los clínicos tendían a reconsiderar su evaluación, más que a descartar automáticamente el puntaje o aceptarlo sin análisis.
No se identificaron diferencias claras de uso según el rol profesional o los años de experiencia. Esto sugiere que la herramienta podría ser útil tanto para profesionales con mayor trayectoria como para clínicos en etapas más tempranas de formación, aunque con necesidades interpretativas distintas.
Una presentación visual bien recibida
El sistema visual tipo semáforo fue bien recibido por los participantes. La combinación de colores verde, amarillo y rojo permitió una interpretación rápida del nivel de probabilidad estimado por el algoritmo.
También fueron valoradas las frases sobre valor predictivo positivo o negativo, ya que ofrecían una explicación más directa del significado clínico del resultado.
En un entorno de emergencias, donde las decisiones deben tomarse con rapidez y bajo presión asistencial, la claridad visual puede favorecer la incorporación de una herramienta digital al flujo de trabajo habitual.
El puntaje numérico generó dudas
A pesar de la buena recepción del formato visual, el puntaje numérico absoluto resultó más difícil de comprender. Algunos clínicos intentaban relacionarlo directamente con el valor predictivo positivo o negativo, aunque ambos conceptos están vinculados pero no son equivalentes.
La dificultad fue especialmente evidente en los casos de probabilidad intermedia. Algunos participantes expresaron dudas cuando valores predictivos positivos de 42% y 77% parecían no alinearse completamente con el mensaje de que la insuficiencia cardíaca era “posible pero menos probable”.
Este punto fue señalado como una oportunidad de mejora. La herramienta podría requerir una presentación más clara del significado del puntaje, especialmente en situaciones donde el resultado no permite confirmar ni descartar con seguridad la enfermedad.
Las categorías intermedias necesitan mayor orientación clínica
La categoría de probabilidad intermedia fue uno de los aspectos que generó mayor incertidumbre. En estos casos, el algoritmo no ofrece una respuesta definitiva, sino una estimación que debe ser integrada con el resto de la información clínica.
Los participantes señalaron la necesidad de contar con una orientación más clara sobre qué acciones podrían considerarse ante estos resultados. Por ejemplo, si se debería solicitar evaluación especializada, repetir estudios, ampliar el diagnóstico diferencial o intensificar la observación clínica.
Esta dificultad no invalida el uso del algoritmo, pero muestra que las herramientas de aprendizaje automático deben ser diseñadas no solo para calcular riesgos, sino también para comunicar los resultados de manera clínicamente útil.
Barreras organizacionales para su implementación
Las principales barreras organizacionales identificadas fueron el acceso a computadoras y el tiempo de procesamiento de las muestras de laboratorio.
En los servicios de emergencias, la disponibilidad de equipos informáticos puede ser limitada. Si una herramienta requiere ingresar a una computadora fija o realizar pasos adicionales, su uso puede verse reducido en la práctica cotidiana.
Como posible solución, los participantes sugirieron una aplicación móvil, que permitiría acceder a CoDE-HF de manera más rápida y flexible.
El posible aporte de las pruebas point-of-care
Otra limitación señalada fue el tiempo necesario para obtener el resultado de NT-proBNP. Si el biomarcador demora demasiado, el algoritmo puede llegar tarde para influir en decisiones tempranas.
Por ese motivo, fue sugerido el uso de pruebas point-of-care, es decir, pruebas realizadas en el punto de atención o cerca del paciente, con resultados más rápidos.
La combinación de CoDE-HF con pruebas rápidas de NT-proBNP podría facilitar su uso en emergencias, especialmente en pacientes con disnea y diagnóstico incierto.
La influencia de las guías y los referentes clínicos
La influencia social más relevante para la adopción de la herramienta fueron las guías locales, nacionales e internacionales. Los participantes señalaron que la inclusión de CoDE-HF en recomendaciones formales podría favorecer su aceptación.
También fueron mencionados colegas activos en investigación y discusiones en podcasts respetados como posibles impulsores de adopción.
Este hallazgo muestra que la implementación de herramientas basadas en aprendizaje automático no depende únicamente de su rendimiento técnico. También requiere confianza profesional, respaldo institucional y formación adecuada.
Aprendizaje automático y medicina de emergencias
El estudio aporta información relevante sobre el lugar que pueden ocupar las herramientas de aprendizaje automático en la medicina de emergencias. En lugar de desplazar al profesional, CoDE-HF fue percibido como una ayuda para estructurar el razonamiento clínico y reducir la incertidumbre.
Sin embargo, también quedó claro que la adopción de este tipo de sistemas requiere una presentación comprensible, integración al flujo de trabajo y claridad sobre los límites de la herramienta.
En la práctica, el algoritmo podría ser más útil cuando se lo utiliza como una segunda mirada objetiva, especialmente ante casos complejos o diagnósticos poco claros.
Conclusión
En conclusión, los clínicos consideraron que CoDE-HF podría ser una herramienta útil en la evaluación de pacientes con disnea en servicios de emergencias, siempre como complemento del juicio clínico.
Su mayor valor estaría en aportar objetividad, mejorar la comunicación y ayudar a reconsiderar la insuficiencia cardíaca como diagnóstico posible.
No obstante, el estudio identificó la necesidad de refinar la presentación de los resultados, especialmente el significado del puntaje numérico y la orientación clínica en categorías intermedias.
Referencias
Autor
El equipo de redactores de Sapue realizo esta historia, utilizando herramientas editoriales, de traducción e inteligencia artificial. El proceso de redacción contó con incidencia humana en cada etapa.
