Doctor&Cols — colectivo de mentoría dental
Producción científica2026· Journal Of Clinical Periodontology

Large Language Models and Retrieval‐Augmented Platforms for the Diagnosis and Management of Periodontal Diseases: A Blinded Expert‐Rated Comparative Study of 11 Systems

AutoresYaniv Mayer, Bertha Demetriou, Giulio Rasperini, Eran Gabay, Rok Gašperšič, Darko Božić, Javier Calatrava, Ofir Ginesin, Hadar Zigdon‐Giladi, Ricardo Faría Almeida

Por qué importa

Este estudio compara el rendimiento de once sistemas de inteligencia artificial, incluyendo modelos de lenguaje grandes (LLMs) de propósito general y plataformas de recuperación aumentada, en el diagnóstico y manejo de casos clínicos periodontales estandarizados. La evaluación, realizada por periodontistas expertos de forma ciega, analizó la precisión, seguridad y exhaustividad de las respuestas, así como la presencia de alucinaciones. Los resultados indican diferencias significativas entre los sistemas, con las plataformas de recuperación aumentada mostrando un rendimiento superior, aunque con advertencias sobre la longitud de las respuestas y la seguridad en algunos casos. Subraya la importancia de estas herramientas como apoyo, no sustituto, del juicio clínico especializado en periodoncia.

Temas tratados

Abstract original

AIM: To compare retrieval-augmented systems with general-purpose large language models (LLMs) on standardised periodontal clinical vignettes. MATERIALS AND METHODS: Eleven AI systems were evaluated: nine general-purpose LLMs, one general-purpose retrieval-augmented platform (Perplexity) and one medical-domain retrieval-augmented platform (OpenEvidence). Each responded to 30 synthetic vignettes covering acute, chronic and complex periodontal scenarios. Six blinded periodontists scored responses on a 5-point Likert scale for accuracy, safety, freedom from hallucinations and completeness in a randomised block design. Friedman and Conover-Iman tests with Holm correction were applied; mixed-effects and ordinal models served as sensitivity analyses. RESULTS: At least one parameter scored dangerous (≤ 2) in 3.3%-46.7% of responses across platforms, despite mean composite scores (3.28-4.86) exceeding the rubric midpoint of 3.0. Between-model differences were significant (p < 0.001), with a small-to-medium overall effect (Kendall's W = 0.17) and large within-category effects (W up to 0.82). Perplexity, OpenEvidence and Claude 4.7 Opus formed a top tier. CONCLUSION: Retrieval-augmented systems rated highest, but this advantage was confounded with response length. The dangerous-response spread argues against undifferentiated use. These tools should assist, not replace, specialist judgement.

Autor Doctor&Cols

Cómo citar

Mayer Y, Demetriou B, Rasperini G, Gabay E, Gašperšič R, Božić D, et al. Large Language Models and Retrieval‐Augmented Platforms for the Diagnosis and Management of Periodontal Diseases: A Blinded Expert‐Rated Comparative Study of 11 Systems. Journal Of Clinical Periodontology. 2026. doi:10.1111/jcpe.70160

Casos clínicos relacionados

Más producción científica del autor

Ver toda la producción científica →
Educational Partners