Evaluación de modelos de lenguaje extensos para la promoción posterior a la publicación: un estudio comparativo ciego de publicaciones en redes sociales en el ámbito de la salud pública

Compartir

Doskaliuk B, Mukhamediyarov M, Yessirkepov M, Zimba O. Evaluating Large Language Models for Post-Publication Promotion: A Blinded Comparative Study of Social Media Posts in Public Health. J Korean Med Sci. 2026 Jun 22;41(24):e168. doi: 10.3346/jkms.2026.41.e16

Recopilado por Carlos Cabrera Lozada. Individuo de Número, ANM Sillón VII. ORCID: 0000-0002-3133-5183. 13/09/2026

Resumen

Fondo

Las plataformas de redes sociales como X (antes Twitter) son cada vez más utilizadas por revistas, autores e instituciones para promocionar investigaciones recién publicadas. Las publicaciones bien diseñadas pueden mejorar la visibilidad, acelerar la transferencia de conocimiento y aumentar la atención en las métricas alternativas. Sin embargo, crear contenido preciso y que cumpla con las políticas requiere mucho tiempo. Los modelos de lenguaje a gran escala (LLM, por sus siglas en inglés) ofrecen una posible solución, pero las evaluaciones sistemáticas de su rendimiento en la promoción posterior a la publicación aún son limitadas.

Métodos

Realizamos una evaluación ciega, cruzada y offline de cuatro LLM: GPT-5 (OpenAI), Gemini 2.5 Pro (Google DeepMind), Grok-3 (xAI) y Perplexity Pro (Perplexity AI), con la tarea de generar publicaciones de estilo X (≤ 260 caracteres) para 36 artículos de acceso abierto de The Lancet Public Health, The Lancet Planetary Health y Annual Review of Public Health. Las publicaciones se generaron utilizando un sistema estandarizado y una solicitud al usuario. Un único evaluador ciego calificó los resultados utilizando una rúbrica de cinco dominios (precisión factual, claridad, cumplimiento de políticas, calidad de la llamada a la acción, estructura/metadatos; puntuación máxima 10). Las medidas secundarias incluyeron el recuento de caracteres, el uso de hashtags y la legibilidad (nivel de grado Flesch-Kincaid). Se aplicaron modelos lineales generales con pruebas post hoc ajustadas de Bonferroni y análisis no paramétricos.

Resultados

Los cuatro modelos lograron una precisión fáctica perfecta y ninguna violación de políticas. Las puntuaciones medias de calidad total difirieron significativamente por modelo, P < 0,001. GPT-5 (9,60) y Perplexity Pro (9,60) obtuvieron el mejor rendimiento, seguidos de Gemini 2.5 Pro (9,47), mientras que Grok-3 obtuvo una puntuación más baja (8,80). Los análisis de dominio mostraron que Grok-3 tuvo un rendimiento inferior en la calidad de la llamada a la acción (1,40 frente a ≥1,97 en otros modelos, P < 0,001) y produjo publicaciones significativamente más cortas (mediana de 194 caracteres, P < 0,001). Perplexity Pro obtuvo la puntuación más alta en cumplimiento de políticas, mientras que GPT-5 y Gemini 2.5 Pro lograron puntuaciones estructurales superiores. La legibilidad varió: GPT-5 8.9 (7,3–9,2) y Perplexity Pro 7.3 (6,5–8,8) generaron resultados más complejos, mientras que Gemini 2.5 Pro 5.1 (4,8–6,5) y Grok-3 4.5 (3,6–6,3) produjeron publicaciones más accesibles.

Conclusión

Los modelos de lenguaje natural (MLN) pueden generar publicaciones en redes sociales precisas y conformes a las políticas para la promoción de la investigación, con diferencias en el estilo y la legibilidad que pueden orientar la segmentación de la audiencia. GPT-5, Gemini 2.5 Pro y Perplexity Pro produjeron resultados de alta calidad, mientras que Grok-3 tuvo un rendimiento inferior en varios ámbitos. Estos hallazgos resaltan el potencial de los MLN como herramientas escalables para la primera versión de publicaciones en la promoción posterior a la publicación, capaces de mejorar el alcance y la accesibilidad de la investigación científica. La selección cuidadosa del modelo, adaptada a la audiencia y a los objetivos de comunicación, junto con la supervisión humana, sigue siendo esencial.