トルコ語の腹部CT・MRIで、研修医の予備レポートと確定レポートの食い違いを3種のLLMに検出させ、専門医の判定と比べた論文。
- 単施設の後ろ向き研究。CT317件とMRI171件の計488組のレポートを、GPT-5.3、Claude 4.6 Sonnet、Gemini 3.0 Proに比較させた
- 専門医が特定した776件の食い違いに対する感度はClaude 93.4%、GPT-5.3 91.9%、Gemini 72.6%(p<0.001)。Claudeの偽陽性率は0.6%だった
- 教育的フィードバックの評価はGemini 4.60、Claude 3.95で順位が逆転した。モデルは画像を見ておらず、テキスト比較に限った評価
出典:Abdom Radiol (NY) / Diagnostic performance of large language models for discrepancy detection in non-English resident-authored abdominal CT and MRI reports: a Turkish-language evaluation.