週刊Dose 2026年9月21日〜27日

6日分 / 全64本(論文41・リリース4・ニュース19)

サトシ

サトシの総括

医療DXエバンジェリスト/薬剤師

AIの助言は、外れたときに人を引きずると数字で出た週

今週は64本を取り上げました。論文41本、ニュース19本、プレスリリース4本です。ニュースは前週の8本から19本に増え、リリースは14本から4本に減りました。テーマでは生成AI・LLMが12本(前週7本)で一番多く、前週最多だった電子カルテ・記録業務は13本から7本になりました。5点をつけたのは8本です。

AIの助言:当たれば精度が上がり、外れると引きずられる

今週いちばん考えさせられたのは、AIの助言が外れたときの話です。薬剤師と薬学生の計77人の処方監査にGPT-4oの助言を付けた試験では、正確性は上がりました(調整OR1.58)。ところがAIが誤ると正答率は26.1%に落ち、誤った助言の73.9%がそのまま受け入れられています。家庭医13人が音声AI診断アシスタントを使った試験でも、上位3診断の正答率は74.6%対62.3%で上がった一方、誤った提案に同調する傾向が見られました。こちらは有意差には届いていません。

論文 生成AI・LLM 注目 2026-09-26

薬剤師と薬学生の処方監査にGPT-4oの助言を付けたときの正確性と自動化バイアスを調べたランダム化シミュレーション試験という論文。

  • 学生・レジデント・薬剤師の計77人が10問の症例に回答し、問題ごとにAI助言の有無を割り付けた
  • AI支援で正確性は上がった(調整OR1.58)が、AIが誤ると正答率は26.1%に落ちた
  • 誤ったAI助言の73.9%がそのまま受け入れられ、AIに反対した場合の正答率は21.7%だった

出典:Am J Health Syst Pharm / Impact of AI assistance on pharmacist and pharmacy trainee accuracy and automation bias during medication order verification: A randomized simulation trial.

サトシサトシ
薬剤師として耳が痛いです。AIに逆らったときの正答率が2割というのは、監査の設計ごと見直す話だと感じます。

リアルタイム音声AI診断アシスタントを使った模擬診療のランダム化シミュレーション試験という論文。

  • 家庭医13人が260件の模擬音声診察を、AI支援ありなしの条件で担当した
  • 上位3診断の正答率はAI支援ありで74.6%、なしで62.3%とAI支援群で有意に高かった(P=.01)
  • AIが誤った提案をした場面では支援群の方が誤りに同調する割合が高い傾向だったが、有意差はなかった

出典:JMIR Form Res / Real-Time Artificial Intelligence Diagnostic Copilot in Simulated Primary Care Consultations: Randomized Simulation Study.

サトシサトシ
便利になるほど間違った提案にも乗りやすくなる、という警告に近い結果だと思います。

評価の物差し:高得点と臨床の質が一致しなかった

評価の物差しそのものがずれていた報告も続きました。不妊治療のLLMでは、自動評価で最高(正解率92.57%)だったGRPOより、専門医は保守的なSFTを高く評価しています。肺CTの基盤モデルは、画像を使わず撮影条件6項目だけでもAUC0.996が出て、結節部分に絞ると外部検証で0.682まで下がりました。AIスクライブ3社の比較では、医師評価で最高だったベンダーの誤りが8件、最少は別ベンダーの3件です。点数の高さと臨床での質が一致しない例が、1週間で3本そろいました。

論文 生成AI・LLM 注目 2026-09-22

不妊治療の意思決定支援AIで、自動評価の性能向上が臨床的な質の向上と一致しなかったという論文。

  • 中国の不妊治療の電子カルテ8201件を使い、4種類のLLM調整手法(SFT・DPO・GRPO・ICL)の性能を比較した
  • 自動評価ではGRPOが最高精度(不妊タイプ正解率92.57%)だったが、専門医評価では保守的なSFTの方が高く評価された
  • 幻覚(事実と異なる内容)の発生率はGRPOで15%、SFTで18.5%あり、いずれも臨床導入には至らないと結論づけた

出典:J Med Internet Res / The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement From Clinical Decision-Making Quality.

サトシサトシ
数字上の性能が良くても専門医の評価とは一致しない、という冷静な報告です。AIの導入判断は現場の目で見ないといけませんね。

肺CTの良悪性分類で示された基盤モデルの高精度が、撮影条件の違いによる見せかけだったという論文。

  • 単施設381例のCTで、画像特徴量による分類のAUCは0.994に達した
  • 画像を一切使わず撮影条件6項目だけで分類しても精度はAUC0.996とほぼ同じだった
  • 結節部分だけに絞ると外部検証のAUCは0.682まで下がり、真のがん所見の寄与は限定的だった

出典:J Imaging Inform Med / Multicohort Evaluation of Acquisition Confounding in Single-Site Lung-CT Malignancy Classification with Frozen Foundation-Model Features.

サトシサトシ
高いAUCがそのまま実力とは限らない好例です。数字を見たら検証方法まで確認したくなります。

アンビエント型AI医療記録システム3社を、医師の主観評価と誤り監査の両面で比較したという論文。

  • 56人の医師が2種類の模擬診察を録音し、3社のAIが生成した記録を7段階で評価した
  • 医師評価で最高評価だったベンダーAは誤り監査で8件、最少の3件だったのは別のベンダーBだった
  • 医師は監査で確認された数より多くの幻覚を指摘する「疑似幻覚」の傾向がみられた

出典:J Am Med Inform Assoc / Comparative evaluation of ambient digital scribe systems in clinical documentation.

サトシサトシ
見た目の完成度と正確さは別物だと分かる結果です。導入前に自院で誤りを実際に数えたくなります。

記録AIとお金:米国は資金と請求増、国内は月額の予価

記録AIの周りではお金も動いています。AIスクライブのHeidiは3億4000万ドルを調達し、評価額は9億ドルになったとFierce Healthcareが報じました。一方で米国の保険者団体BCBSAは、病院のAIコーディングで同程度の医療への請求が増えたとして、2年間の追加費用を約9億4,200万ドルと推計しています。これは払う側の分析です。国内では、オプティムが電子カルテ記載の下書きまで作る病院向けスマホサービスを2027年1月に始めると発表しました。予価は1IDあたり月額1,500〜1,980円(税抜)です。

臨床記録AIスクライブから始まったHeidiが、3億4000万ドルの資金調達を発表したとFierce Healthcareが報じました。

  • シリーズCの1億ドルとGeneral Catalyst主導の2億4000万ドルの成長投資を合わせ、評価額は9億ドルとなった
  • 英NHSイングランド・ミッドランズの臨床AI調達で単独採用されるなど、支援した診察は過去2年で7300万件から1億7500万件に増えた
  • 記録業務の自動化から一歩進め、医師の監督下で実務を代行する機能へ展開する計画だという

出典:Fierce Healthcare / Heidi lands $340M to build 'AI care partner' for clinicians

サトシサトシ
スクライブが記録係から一歩踏み出す動きです。日本の現場にどう波及するか注視したいです。

病院のAIによる診療報酬コーディングで、同程度の医療への請求が増えたとする米BCBSAの分析について、Fierce Healthcareが報じました。

  • BCBSAの請求データ分析で、加盟プランの医学的に複雑な入院の割合は2023年初めの37%から2025年末に40%へ上がった
  • BCBSAは2年間の追加費用を約9億4,200万ドルと推計し、うち6億5,300万ドルが副傷病名による上位DRGへの移行分だとしている
  • BCBSAは、ICU利用や輸血など提供された治療の強度には対応する変化が見られなかったと説明している

出典:Fierce Healthcare / Hospitals' use of AI coding tools cost BCBSA plans $942M more for similar care: analysis

サトシサトシ
記録が正確になったのか、請求が盛られたのかは立場で見え方が逆になります。日本のDPCでも同じ議論が起きそうです。

病院向けスマホサービス「OPTiM AI ホスピタルフォン」を2027年1月に提供開始するというオプティムの発表。

  • 院内チャット、依頼の承認ワークフロー、撮影・録音をまとめ、AIが電子カルテ記載用の文面の下書きを作る
  • 価格は予価で1IDあたり月額1,500〜1,980円(税抜)。最大1カ月の無償トライアルがある
  • 送信前にAIがSBARの観点で報告の抜け漏れを確認するとしている。同社MDMは370施設・約5万台で稼働

出典:株式会社オプティム / 病院内スマホとAIで医師・看護師の業務を効率化、「OPTiM AI ホスピタルフォン」を2027年1月提供開始

サトシサトシ
PHSの置き換えで止まっている病院は多いので、記録までつなげる設計は現場の実感に合っています。

特に注目された10本

Epicの敗血症早期検知モデル(ESM)を臨床の流れに組み込んだ後の実際の効果を検証したという論文。

  • 単一医療システムの入院8万9,469件を、導入前と医師に表示された期間で比較した準実験研究
  • 反実仮想モデルの予測と比べ、院内死亡は1.21%対1.94%、抗菌薬使用は43.52%対47.74%と低かった(いずれもp<0.001)
  • 単施設で、表示期間は約4カ月と短い。遅れた治療による害の増加は認められなかったとしている

出典:Appl Clin Inform / Real-world effects of a sepsis early detection model integrated into clinical workflow: a quasi-experimental study.

サトシサトシ
性能が疑問視されてきたEpicのモデルで、抗菌薬が減ったという結果は薬剤師としても気になります。
論文 生成AI・LLM 注目 2026-09-26

薬剤師と薬学生の処方監査にGPT-4oの助言を付けたときの正確性と自動化バイアスを調べたランダム化シミュレーション試験という論文。

  • 学生・レジデント・薬剤師の計77人が10問の症例に回答し、問題ごとにAI助言の有無を割り付けた
  • AI支援で正確性は上がった(調整OR1.58)が、AIが誤ると正答率は26.1%に落ちた
  • 誤ったAI助言の73.9%がそのまま受け入れられ、AIに反対した場合の正答率は21.7%だった

出典:Am J Health Syst Pharm / Impact of AI assistance on pharmacist and pharmacy trainee accuracy and automation bias during medication order verification: A randomized simulation trial.

サトシサトシ
薬剤師として耳が痛いです。AIに逆らったときの正答率が2割というのは、監査の設計ごと見直す話だと感じます。

病院向けスマホサービス「OPTiM AI ホスピタルフォン」を2027年1月に提供開始するというオプティムの発表。

  • 院内チャット、依頼の承認ワークフロー、撮影・録音をまとめ、AIが電子カルテ記載用の文面の下書きを作る
  • 価格は予価で1IDあたり月額1,500〜1,980円(税抜)。最大1カ月の無償トライアルがある
  • 送信前にAIがSBARの観点で報告の抜け漏れを確認するとしている。同社MDMは370施設・約5万台で稼働

出典:株式会社オプティム / 病院内スマホとAIで医師・看護師の業務を効率化、「OPTiM AI ホスピタルフォン」を2027年1月提供開始

サトシサトシ
PHSの置き換えで止まっている病院は多いので、記録までつなげる設計は現場の実感に合っています。

アンビエント型AI医療記録システム3社を、医師の主観評価と誤り監査の両面で比較したという論文。

  • 56人の医師が2種類の模擬診察を録音し、3社のAIが生成した記録を7段階で評価した
  • 医師評価で最高評価だったベンダーAは誤り監査で8件、最少の3件だったのは別のベンダーBだった
  • 医師は監査で確認された数より多くの幻覚を指摘する「疑似幻覚」の傾向がみられた

出典:J Am Med Inform Assoc / Comparative evaluation of ambient digital scribe systems in clinical documentation.

サトシサトシ
見た目の完成度と正確さは別物だと分かる結果です。導入前に自院で誤りを実際に数えたくなります。
論文 画像診断AI 注目 2026-09-24

非造影CTから食道がんをAIで検出するスクリーニングモデル「EAGLE」を12施設で検証したという論文。

  • 中国など3カ国12施設で、通常CTでの日和見スクリーニングと肺がん検診の低線量CTの両方を検証した
  • 外部検証では特異度98.5%、感度はがんで90.0%、前がん病変で52.5%だった
  • 実臨床での前向き検証では陽性的中率42.2%、低線量CTでは特異度99.94%まで上がった

出典:Nat Med / Large-scale esophageal cancer screening through noncontrast computed tomography and artificial intelligence.

サトシサトシ
CTを撮るたび食道がんまで見てくれるなら理想的です。実装後の読影体制の変化が気になります。

臨床記録AIスクライブから始まったHeidiが、3億4000万ドルの資金調達を発表したとFierce Healthcareが報じました。

  • シリーズCの1億ドルとGeneral Catalyst主導の2億4000万ドルの成長投資を合わせ、評価額は9億ドルとなった
  • 英NHSイングランド・ミッドランズの臨床AI調達で単独採用されるなど、支援した診察は過去2年で7300万件から1億7500万件に増えた
  • 記録業務の自動化から一歩進め、医師の監督下で実務を代行する機能へ展開する計画だという

出典:Fierce Healthcare / Heidi lands $340M to build 'AI care partner' for clinicians

サトシサトシ
スクライブが記録係から一歩踏み出す動きです。日本の現場にどう波及するか注視したいです。

郵便局の空き室を診療拠点にしたオンライン診療が過疎地で広がっていると、日本経済新聞が報じました。

  • 山口県の郵便局では2024年7月に全国初の巡回診療所を開設し、医師が対面とオンラインを組み合わせて診療している
  • 厚労省によると無医地区は2025年10月時点で全国575地区あり、2022年の前回調査から18増えた
  • 三重県や北海道でも郵便局を使った診療が広がっており、2026年4月施行の改正医療法でオンライン診療は正式に法制化された

出典:日本経済新聞 / へき地医療、郵便局拠点に オンラインで「無医地区」解消目指す

サトシサトシ
薬を郵送してもらえるのは薬局としても見逃せない仕組みです。過疎地の医療インフラとして今後も広がりそうですね。
論文 生成AI・LLM 注目 2026-09-22

不妊治療の意思決定支援AIで、自動評価の性能向上が臨床的な質の向上と一致しなかったという論文。

  • 中国の不妊治療の電子カルテ8201件を使い、4種類のLLM調整手法(SFT・DPO・GRPO・ICL)の性能を比較した
  • 自動評価ではGRPOが最高精度(不妊タイプ正解率92.57%)だったが、専門医評価では保守的なSFTの方が高く評価された
  • 幻覚(事実と異なる内容)の発生率はGRPOで15%、SFTで18.5%あり、いずれも臨床導入には至らないと結論づけた

出典:J Med Internet Res / The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement From Clinical Decision-Making Quality.

サトシサトシ
数字上の性能が良くても専門医の評価とは一致しない、という冷静な報告です。AIの導入判断は現場の目で見ないといけませんね。

救急外来で、ポップアップを出さずノートに埋め込んだCDSがHEARTスコアの記録率を上げたかを調べたという論文。

  • 米国の6つの救急外来で胸痛の8万1,895件を対象に、導入前21カ月と導入後27カ月を分割時系列で比較した
  • 月ごとの記録率の中央値は導入前29.0%、導入後82%で、導入時点での水準の変化は有意だった(p<0.0001)
  • 導入後の傾きには有意な変化がなく(p=0.237)、記録率の上昇は導入時点に集中していた

出典:Int J Med Inform / Impact of a non-interruptive electronic health record-based clinical decision support tool on HEART score documentation compliance in the emergency department.

サトシサトシ
アラートを増やすより書く場所に置く方が効く、というのは院内の他のツールにも当てはまりそうです。

統合失調症の陰性症状に対するスマートフォン型デジタル治療CT-155の第3相ランダム化比較試験という論文。

  • 米国66施設で抗精神病薬を服用中の成人457人を、CT-155とデジタル対照に1対1で割り付け16週間追跡した
  • 主要評価項目CAINS-MAPの変化は-6.8対-4.2で、群間差-2.6(p<0.001、効果量d=-0.36)だった
  • 重篤な有害事象は1.3%対2.2%で、治療に関連するものはなかった

出典:JAMA Netw Open / A Digital Therapeutic Intervention for Negative Symptoms of Schizophrenia: A Randomized Clinical Trial.

サトシサトシ
陰性症状は薬で手が届きにくい領域なので、アプリで上乗せできるなら処方の選択肢が一つ増えます。

テーマの内訳

この週の日次ページ