Producción científica2026· Journal Of Clinical Periodontology
Large Language Models and Retrieval‐Augmented Platforms for the Diagnosis and Management of Periodontal Diseases: A Blinded Expert‐Rated Comparative Study of 11 Systems
AutoresYaniv Mayer, Bertha Demetriou, Giulio Rasperini, Eran Gabay, Rok Gašperšič, Darko Božić, Javier Calatrava, Ofir Ginesin, Hadar Zigdon‐Giladi, Ricardo Faría Almeida
Por qué importa
Este estudio compara el rendimiento de once sistemas de inteligencia artificial, incluyendo modelos de lenguaje grandes (LLMs) de propósito general y plataformas de recuperación aumentada, en el diagnóstico y manejo de casos clínicos periodontales estandarizados. La evaluación, realizada por periodontistas expertos de forma ciega, analizó la precisión, seguridad y exhaustividad de las respuestas, así como la presencia de alucinaciones. Los resultados indican diferencias significativas entre los sistemas, con las plataformas de recuperación aumentada mostrando un rendimiento superior, aunque con advertencias sobre la longitud de las respuestas y la seguridad en algunos casos. Subraya la importancia de estas herramientas como apoyo, no sustituto, del juicio clínico especializado en periodoncia.
AIM: To compare retrieval-augmented systems with general-purpose large language models (LLMs) on standardised periodontal clinical vignettes. MATERIALS AND METHODS: Eleven AI systems were evaluated: nine general-purpose LLMs, one general-purpose retrieval-augmented platform (Perplexity) and one medical-domain retrieval-augmented platform (OpenEvidence). Each responded to 30 synthetic vignettes covering acute, chronic and complex periodontal scenarios. Six blinded periodontists scored responses on a 5-point Likert scale for accuracy, safety, freedom from hallucinations and completeness in a randomised block design. Friedman and Conover-Iman tests with Holm correction were applied; mixed-effects and ordinal models served as sensitivity analyses. RESULTS: At least one parameter scored dangerous (≤ 2) in 3.3%-46.7% of responses across platforms, despite mean composite scores (3.28-4.86) exceeding the rubric midpoint of 3.0. Between-model differences were significant (p < 0.001), with a small-to-medium overall effect (Kendall's W = 0.17) and large within-category effects (W up to 0.82). Perplexity, OpenEvidence and Claude 4.7 Opus formed a top tier. CONCLUSION: Retrieval-augmented systems rated highest, but this advantage was confounded with response length. The dangerous-response spread argues against undifferentiated use. These tools should assist, not replace, specialist judgement.
Mayer Y, Demetriou B, Rasperini G, Gabay E, Gašperšič R, Božić D, et al. Large Language Models and Retrieval‐Augmented Platforms for the Diagnosis and Management of Periodontal Diseases: A Blinded Expert‐Rated Comparative Study of 11 Systems. Journal Of Clinical Periodontology. 2026. doi:10.1111/jcpe.70160