Prof. Valmed, un modelo de lenguaje grande (LLM) autorizado por los reguladores europeos para diagnóstico médico, superó a los médicos humanos en el diagnóstico de condiciones reumatológicas en cuanto a velocidad, pero no en precisión, según un trial aleatorizado.
La precisión diagnóstica fue casi exactamente la misma en los escenarios de casos de reumatología para los médicos que utilizaron Prof. Valmed en comparación con aquellos que alcanzaron sus diagnósticos de forma habitual, según Johannes Knitza, MD, PhD, MHBA, de la Philipps-Universität Marburg en Alemania, y sus colegas.
Sin embargo, los médicos dependientes de sus propios recursos necesitaron un promedio de 206 segundos para hacer sus diagnósticos, en comparación con 94 segundos entre aquellos apoyados por Prof. Valmed (P<0.001), informó el grupo en un manuscrito preliminar disponible en medRxiv.
Además, el uso de Prof. Valmed aumentó la confianza de los médicos en sus diagnósticos, quizás demasiado, sugirieron Knitza y sus colegas. “Un hallazgo interesante fue que la confianza superó la precisión observada en todos los escenarios evaluados y aumentó aún más después de la asistencia de Prof. Valmed en ambos grupos, lo que indica una confianza persistente”.
Los desarrolladores de sistemas de IA han promovido durante mucho tiempo la medicina como una de las aplicaciones más importantes para la tecnología emergente, ya que el diagnóstico y la gestión de enfermedades dependen en gran medida de la síntesis de diversas formas de información. Es plausible que las máquinas capaces deberían ser capaces de hacerlo mejor y más rápido que los humanos.
No obstante, la duda persiste sobre si se ha alcanzado ese punto. Sistemas generales de IA han tenido resultados mixtos, encontrando diagnósticos que habían eludido a los profesionales humanos, pero también propensos a “alucinaciones”, concluciones falsas que parecen derivar del énfasis de los sistemas en complacer a sus usuarios.
Prof. Valmed, fundado por Vera Roedel, una abogada de Merck KGaA, y Heinz Wiendl, MD, un neuroinmunólogo del Hospital Universitario de Friburgo, está diseñado específicamente para aplicaciones médicas con limitaciones que reducen las alucinaciones. Se promociona como un “copiloto de IA” para asistir pero no reemplazar a los médicos y recibió la marca CE de la Unión Europea en marzo de 2025, permitiendo su venta para uso médico.
En el trial, denominado ALLIANCE, Knitza y sus colegas buscaron evaluar el rendimiento de Prof. Valmed en el campo de la reumatología. Reclutaron a 82 médicos de siete instituciones en Alemania y Noruega, aleatorizando el grupo 1:1 para hacer diagnósticos en tres escenarios clínicos ya sea con o sin el apoyo de Prof. Valmed. Estos escenarios incluían el síndrome de Cogan, dermatomiositis y fiebre mediterránea familiar, todos extraídos de informes de casos publicados.
El resultado primario fue la precisión, definida como el porcentaje de instancias en las que el diagnóstico más probable de un participante coincidía con el real publicado. Esto se logró en el 33.3% de los casos del grupo de intervención frente al 35.0% de aquellos abordados de manera convencional, una diferencia que no llegó a ser estadísticamente significativa. El rendimiento de Prof. Valmed se mostró algo mejor con un resultado menos estricto, logrando que uno de los tres diagnósticos posibles de un participante coincidiera con el correcto, con una tasa de éxito del 49.2%, frente al 39.2% en el grupo de control, pero el efecto no fue significativo (P=0.291).
Los análisis también revelaron que la evaluación de confianza superó a la precisión en todos los pasos. En el grupo de intervención, incluso antes de que se invocara a Prof. Valmed, la calificación media de confianza fue del 39%, comparada con una precisión del 22%. Su precisión del 33% al usar el sistema de IA se acompañó de calificaciones de confianza promedio del 57%. Se observó el mismo patrón en el grupo de control.
En resumen, los participantes valoraron positivamente a Prof. Valmed, otorgándole altas calificaciones por facilidad de uso y una interfaz agradable. Aproximadamente dos tercios dijeron que era confiable y más del 80% expresó que lo usarían nuevamente. Sin embargo, solo el 36% mencionó que fue fácil corregir errores al utilizar el sistema, lo que sugiere que los desarrolladores aún tienen trabajo por hacer.
LLM basado en soporte diagnóstico puede ser más valioso para mejorar la eficiencia, aumentar la percepción de calidad de apoyo y ampliar el diagnóstico diferencial, mientras que la sobreconfianza y la dependencia excesiva siguen siendo preocupaciones clave de seguridad. Se concluyó que son necesarios más ensayos en condiciones reales para definir el papel del soporte de decisión basado en LLM certificado en la atención rutinaria.
Nota de Descargo de Responsabilidad: Este contenido no debe ser interpretado como un consejo médico. Siempre consulte a un profesional de salud calificado para cualquier pregunta sobre una condición médica o tratamiento.
Fuente: https://www.medpagetoday.com/rheumatology/generalrheumatology/122900
Join the doctors who get the most relevant medical news, curated by specialty, every week — no spam, unsubscribe anytime.






