Claudeを臨床データ解析のエージェントとして3つの対話モードで動かし、性能と失敗パターンを検証したという論文。
- 英国の加齢黄斑変性7802例・12年追跡データを用い、Claudeを3つの対話モードで研究設問立案から統計解析実行まで計27回試行した
- 17件の完了ランでKaplan-Meier推定はほぼ一致した一方、結果の要約文17件のうち2件に臨床的に問題となる誤りがあった
- 統計的枠組みの立案は概ね妥当だったが、SAPの質はコードの正確性を予測せず、単一分野での検証のため他領域への一般化には追試が必要とされた
出典:J Med Internet Res / Performance, Failures, and Oversight of a Large Language Model Agent for Clinical Data Analysis: Evaluation Study.