2026年9月9日(水)の Dose

5本(論文5)

論文 生成AI・LLM 注目

Claudeを臨床データ解析のエージェントとして3つの対話モードで動かし、性能と失敗パターンを検証したという論文。

  • 英国の加齢黄斑変性7802例・12年追跡データを用い、Claudeを3つの対話モードで研究設問立案から統計解析実行まで計27回試行した
  • 17件の完了ランでKaplan-Meier推定はほぼ一致した一方、結果の要約文17件のうち2件に臨床的に問題となる誤りがあった
  • 統計的枠組みの立案は概ね妥当だったが、SAPの質はコードの正確性を予測せず、単一分野での検証のため他領域への一般化には追試が必要とされた

出典:J Med Internet Res / Performance, Failures, and Oversight of a Large Language Model Agent for Clinical Data Analysis: Evaluation Study.

サトシサトシ
LLMに解析を任せる話が増えてきたけど、要約文の2件に問題があったという結果を見ると、検証を省く発想はまだ早いと僕は思う。

韓国の大学病院で28万件超の術後CTレポートから再発・転移を自動判定するモデルを開発したという論文。

  • 韓国Asan医療センターの2014〜2021年、術後CT報告28万8076件・患者8万6083例を用いて半教師あり深層学習モデルを開発した
  • 実運用を模した条件下で再発判定は精度97.33%(多クラス)、転移判定は精度96.67%(2値)に達し、臨床医同士の一致率に匹敵した
  • 「否定できない」等の診断上の不確実性も再発1.4%・転移6.9%で検出できたが、他施設への一般化には前向き多施設検証が必要とされた

出典:JMIR Med Inform / Automated Extraction of Postoperative Cancer Recurrence and Metastasis From Computed Tomography (CT) Reports: Semisupervised Deep Learning Study.

サトシサトシ
CTレポートを自動で仕分けてくれるなら、術後フォローの見落とし防止に地味だけどかなり効くと僕は思います。
論文 生成AI・LLM 注目

電子カルテからの臨床推論において、検索拡張生成(RAG)と長文脈入力を比較したという論文。

  • 米国の学術医療機関の実診療録を用い、画像検査抽出・抗菌薬タイムライン作成・診断名特定の3タスクでGPT-5.4-mini等3モデルを検証した
  • 画像検査抽出ではRAGが長文脈入力をF1スコアで0.17〜9.83上回り、8000トークン未満の入力で同等以上の性能を達成した
  • 一方で診断名特定タスクは手法やモデルによらず性能が頭打ちで、記録間の情報欠落が精度を制限する一因になっていた

出典:J Am Med Inform Assoc / Evaluating retrieval-augmented generation versus long-context input for clinical reasoning over electronic health records.

サトシサトシ
全文を読ませるより必要な部分だけ拾わせる方が速くて正確というのは、現場の実感にも近いです。
論文 ウェアラブル・PHR 注目

腹部がんの化学放射線療法中にmHealthを用いた多職種リハビリ介入を行ったランダム化第II相試験という論文。

  • 中国の多施設で腹部がん患者111例を、専用アプリと心拍ウェアラブルを使う多職種リハビリ群と標準治療群に1対1で無作為割付した
  • 主要評価項目の握力は介入群が標準治療群より治療終了時点で平均4.87kg高く(95%CI 3.36-6.38、P<.001)、有意差を認めた
  • 体重や骨格筋量の維持など副次評価項目も良好だったが、非盲検・腫瘍種の異質性を伴う探索的な結果で、第III相での検証が必要とされた

出典:J Med Internet Res / Multidisciplinary mHealth Rehabilitation for Patients With Abdominal Cancer Who Are Receiving Chemoradiotherapy: Randomized Phase II Trial.

サトシサトシ
点滴と放射線だけでなく、そこにアプリと運動指導を組み合わせる発想は消化器の現場でも参考になります。

カタルーニャ・ノルウェー・シンガポール・クイーンズランドの医療AI導入戦略を比較したという論文。

  • 4つの医療システムを対象に、文書・関係者インタビュー・フォーカスグループを通じた国際比較の質的研究を行った
  • 60件の文書、34件のインタビュー、5回のフォーカスグループ、計50名の関係者データから、AI普及の速度は地域のデジタル戦略や資金構造の違いに強く左右されると示された
  • トップダウンかボトムアップかという二分法ではなく、多層的な調整のプロセスとして普及を捉える必要があると論じた

出典:J Am Med Inform Assoc / International qualitative case studies of system-level approaches to promote the development, adoption, and implementation of artificial intelligence in healthcare.

サトシサトシ
僕としては、現場のツールより先に資金の流れと制度設計で普及速度の大半が決まるという指摘が一番納得できる。