Alsentzer, Emily et al. «Fenotipado interpretable de disparo cero de la hemorragia posparto utilizando modelos de lenguaje grandes». NPJ medicina digital vol. 6,1 212. 30 de noviembre de 2023, DOI: 10.1038/s41746-023-00957-x
Recopilado por Carlos Cabrera Lozada. Miembro Correspondiente Nacional, ANM puesto 16. ORCID: 0000-0002-3133-5183. 09/12/2023
Resumen
Muchas áreas de la medicina se beneficiarían de un fenotipado más profundo y preciso, pero existen enfoques limitados para el fenotipado utilizando notas clínicas sin datos anotados sustanciales. Los grandes modelos de lenguaje (LLM) han demostrado un inmenso potencial para adaptarse a tareas novedosas sin necesidad de formación adicional mediante la especificación de instrucciones específicas de la tarea. En este trabajo se presenta el desempeño de un LLM disponible públicamente, Flan-T5, en el fenotipado de pacientes con hemorragia posparto (HPP) utilizando notas de alta de historias clínicas electrónicas (n = 271.081). El modelo de lenguaje logra un gran rendimiento en la extracción de 24 conceptos granulares asociados con PPH. La identificación precisa de estos conceptos granulares permite el desarrollo de fenotipos y subtipos complejos e interpretables. El modelo Flan-T5 logra una alta fidelidad en el fenotipado de la HPP (valor predictivo positivo de 0,95), identificando un 47% más de pacientes con esta complicación en comparación con el estándar actual de uso de códigos de reclamación. Esta canalización de LLM se puede utilizar de manera confiable para subtipificar la HPP y supera un enfoque basado en reclamos en los tres subtipos de HPP más comunes asociados con la atonía uterina, la placentación anormal y el trauma obstétrico. La ventaja de este enfoque de la subtipificación es su interpretabilidad, ya que se puede evaluar cada concepto que contribuye a la determinación del subtipo. Además, dado que las definiciones pueden cambiar con el tiempo debido a las nuevas directrices, el uso de conceptos granulares para crear fenotipos complejos permite una actualización rápida y eficiente del algoritmo. El uso de este enfoque de modelado de lenguaje permite un fenotipado rápido sin necesidad de datos de entrenamiento anotados manualmente en múltiples casos de uso clínico.
