不妊治療の意思決定支援AIで、自動評価の性能向上が臨床的な質の向上と一致しなかったという論文。
- 中国の不妊治療の電子カルテ8201件を使い、4種類のLLM調整手法(SFT・DPO・GRPO・ICL)の性能を比較した
- 自動評価ではGRPOが最高精度(不妊タイプ正解率92.57%)だったが、専門医評価では保守的なSFTの方が高く評価された
- 幻覚(事実と異なる内容)の発生率はGRPOで15%、SFTで18.5%あり、いずれも臨床導入には至らないと結論づけた
出典:J Med Internet Res / The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement From Clinical Decision-Making Quality.