日本でHPVワクチン未接種の娘を持つ女性保護者に、AIチャットボットと政府のリーフレットを比べたランダム化比較試験の論文。
- 全国調査パネルの女性保護者848人を1:1に割り付け、HPVとワクチンに関する7問の知識テスト(0〜7点)を介入直後と2週後に測った
- 調整後の知識スコアは、介入直後も2週後もチャットボット群が0.30点高かった(いずれもP<.001)
- 2週後の接種の決定は40.3%対39.6%で差がなかった(調整OR 0.74、P=.31)
出典:JAMA Netw Open / AI Chatbot Use for Human Papillomavirus Vaccine Literacy in Japan: A Randomized Clinical Trial.
サトシ 配布物は読まれているか分からないので、対話型で知識が伸びるのは納得です。行動までは動かなかったと正直に書いている点も良いと思います。
フットスイッチで録音からAI要約、カルテ転記まで操作する医療支援AI「カルステップ」のMac版が正式リリースされたという発表。
- 診察の会話を文字起こしし、SOAP形式などに要約して下書きを作る。Windows版と同等の機能で、2026年8月26日に提供を始めた
- 初期費用はキャンペーン価格5万5,000円(通常7万7,000円)、月額保守5,500円(いずれも税込)。AI使用料は1分約1円の従量課金
- 導入医療機関は150施設以上と同社は説明している。Mac版も備品付きの1週間無料トライアルがある
出典:MJS / Macの診察室にも、足元からカルテ作成を支援するAIを。「カルステップ」Mac版を正式リリース
サトシ 足元のスイッチで操作するのは、診察中に手を止めたくない先生には合っていそうです。1分1円の従量課金は小さな診療所でも試算しやすいです。
救急外来で低リスク胸痛と判断され不安を抱える患者に、遠隔の認知行動療法を行ったランダム化比較試験の論文。
- 米国6大学病院の救急外来から375人を登録し、プライマリケア紹介、ピア支援型ネットCBT、治療者による遠隔CBTの3群を12か月追った
- GAD-7の改善はピア支援型ネットCBTが紹介群より1.22点大きく(95%CI 0.01〜2.43)、重症の不安がある患者では2.8点だった
- 抑うつ、身体化、生活障害度の改善には群間差がなかった
出典:JAMA Intern Med / Telehealth Treatment of Anxiety in Patients With Low-Risk Chest Pain in the Emergency Department: The PACER Randomized Clinical Trial.
サトシ 胸痛で救急に行き「異常なし」で帰された人のその後は、薬局でもよく出会います。ピアの支えがあるネットCBTなら人手の少ない地域でも回せそうです。
腎臓内科の症例報告101件を使い、大手3社の大規模言語モデル6種の診断能力を比べた論文。
- ドイツ語誌の症例を各社の最上位モデルと小型モデルの計6種に解かせ、鑑別5つと最有力診断を3段階で評価した
- 最有力診断の正答率はClaude Opus 4.6が86.1%、GPT-5.4が85.1%。部分正答を含めると上位3モデルは91.1〜92.1%だった
- 複数の要素からなる診断では、誤答は全くの誤りより不完全な回答が多かった。症例が学習データに含まれていた可能性は否定できない
出典:Dtsch Arztebl Int / Large Language Models as Diagnostic Tools in Nephrology: Helpful, With Limitations.
サトシ もっともらしいのに一部が欠けている答えは、疑義照会でも一番見落としやすい形です。正答率より欠け方を見る評価が増えてほしいです。
炎症性腸疾患の診療で、GPT-4とDeepSeekの回答が非専門医の判断をどこまで助けるかを調べた中国の論文。
- 非専門医から寄せられた実際の質問20件を2モデルに入力し、IBD専門医7人と非専門医12人が回答を評価した
- 回答を読んだ後の症例テストの中央値は、GPT-4で5.5点から8.0点、DeepSeekで6.0点から8.0点に上がった(いずれもp<0.001)
- 両モデルの差は有意でなかった(p=0.781)。有害な推奨はなかったが、紹介基準の提示などに安全上の抜けがあった
出典:Digestion / AI-generated guidance for non-specialist physicians managing inflammatory bowel disease: expert evaluation and case-based testing of GPT-4 and DeepSeek.
サトシ 専門医が少ない地域で非専門の先生が参照する使い方は現実的です。紹介のタイミングが抜けやすい点は、薬の相談でも同じ落とし穴だと感じます。
院内サーバーで動かすオープンな大規模言語モデルで、レカネマブ投与の適格性を診療報告書から事前判定した論文。
- ドイツのもの忘れ外来の報告書を使い、gpt-oss-120bによる抽出と規則ベースの判定を開発用97件で調整し、別の99件で検証した
- 検証用データで正解率94%、κ係数0.90となり、規則ベースの抽出(正解率80%)を有意に上回った
- 正解は専門家の合議で決めた。クラウドを使わない構成で、専門家と同程度の性能とされた
出典:Alzheimers Dement (Amst) / Locally deployed large language model for real-world lecanemab eligibility pre-screening.
サトシ 新薬の対象患者の洗い出しは、薬剤部も巻き込まれる地味で重い仕事です。院内で完結するLLMなら情報管理の説明もしやすそうです。
オランダの病院で、電子カルテの成熟度の高さが財務や運営の成績に結びつくかを7年分のデータで調べた論文。
- 2017〜2023年の病院年次報告(年66〜74病院、最大498病院年)とHIMSS EMRAMステージ6・7の認定を結びつけ、混合効果モデルで分析した
- 利益率、総資産利益率、在院日数、欠勤率のいずれも、成熟度の高さと有意な関連はなかった
- 患者数は当初多く見えたが(P=.008)、多重比較の補正後は有意でなかった(補正後P=.44)
出典:J Med Internet Res / Impact of Digitalization on Performance of Dutch Hospitals: Longitudinal Quantitative Study.
サトシ システムを入れれば成績が上がるわけではない、というのは取材していても実感します。何をどう使ったかまで踏み込んだデータを見てみたいです。
膵嚢胞性病変の主要ガイドライン3つの長期的な悪性化予測を、LLMで読影レポートから所見を抽出して比べた論文。
- 単施設の2000〜2025年の腹部画像レポートから検証済みのLLMで所見を抽出し、ACR、京都、欧州の各基準でリスク分類した
- 1万3,269人のうち209人(1.6%)が5年以内に悪性化した。AUROCは京都0.655、ACR 0.639、欧州0.623だった(p<0.001)
- 5年間画像で変化のなかった1,830人では、8年時点のがん発生率が0.71%だった。単施設の後ろ向き研究
出典:J Am Coll Radiol / Evaluating the Long-Term Malignancy Risk Prediction Accuracy of Major Guidelines for Pancreatic Cystic Lesions Using Radiology Features.
サトシ ここでのLLMは主役ではなく、大量のレポートを読むための道具です。こういう地味な使い方の方が先に定着しそうです。
精神科向け医療AI「MENTRA」が、自立支援医療や障害年金などの診断書をAIで作成する機能の提供を始めたという発表。
- 診察や看護、面談の会話から貯めた記録をもとに、医療機関の様式どおりのPDFで診断書を作る。最後は医師が確認して確定する
- ある導入先の精神科病院では、利用職員が2人から13人に、月の利用が9件から393件に増えたと同社は説明している(自社集計)
- 2026年10月31日までの申し込みは1か月無料で試せる。料金はリリースに書かれていない
出典:株式会社MENTRA / 精神科の申請書類をAIが自動で作成。医療AI「MENTRA」、自立支援医療・精神障害者保健福祉手帳・障害年金などの診断書に対応
サトシ 自立支援医療や手帳の更新書類は、薬局から見ても患者さんの負担が大きい手続きです。医師の書き写しが減れば更新の滞りも減りそうです。
広島市立広島市民病院とOPEReが、LINEで説明動画を届ける患者説明DXで包括的パートナーシップを結んだという発表。
- 2023年10月の導入以来の取り組みを、腸瘻管理、がん相談・緩和ケア、自己注射指導の3領域から在宅医療へ広げる
- 入院申込書の問い合わせは3か月あたり393件から89件に減り、入院説明は入院支援室で1人6分短縮したと同社は説明している
- 提携の締結は2026年7月10日。累計登録者は1万4,176人(2023年10月〜2026年6月)
出典:株式会社OPERe / 広島市立広島市民病院と株式会社OPERe、「患者説明DX」で包括的パートナーシップを締結
サトシ 自己注射の手技を家で見返せるのは、薬局で説明する側としてもありがたい仕組みです。理解度を拾えるなら服薬指導にもつなげられそうです。
ローソンが団地内の店舗にオンライン診療の受診施設を開設したことについて、Impress Watchが報じました。
- ハッピーローソンタウン日野高幡台店に9月29日開設。KDDIのリモート接客基盤を使い、専用端末で診療科と医療機関を選んで受診する
- 処方箋が出た場合は、店内に併設されたクオール薬局で薬を受け取れる
- 隣接するUR高幡台団地では、2018年の閉院以降、急な体調不良で通える医療機関が近隣になくなっていた
出典:Impress Watch / ハッピーローソンタウンにオンライン診療施設 診療と薬の受取を地域完結
サトシ 診療から薬の受け取りまで店内で完結するのは、医療機関がなくなった団地には現実的な形です。服薬指導の丁寧さが薬局側の腕の見せ所です。
経皮的腎砕石術の合併症をClavien-Dindo分類で判定させ、6種のLLMと泌尿器科医を比べた探索的研究の論文。
- 既報のコンセンサス分類の症例文を使い、ChatGPTやGeminiなど6モデルと、指導医6人・専攻医15人の判定を一致度で比べた
- 一致度はモデル0.97〜0.98で、専攻医0.95(p<0.001)、指導医0.96(p=0.03)より高かった。最速の医師は17分、モデルは最長3.90分だった
- 用いたのは既報の症例文で、実際の診療録での検証はまだ行われていない
出典:World J Urol / Automating Clavien-Dindo classification with large language models in percutaneous nephrolithotomy: an exploratory study.
サトシ 合併症の等級付けは人によってぶれやすい作業なので、機械の方がそろうのは納得です。実際のカルテの書きぶりでどうなるかが本番ですね。
脊椎手術の複雑な症例で、推論型LLMのOpenAI o1とDeepSeek R1が出した治療計画を外科医が評価した論文。
- 合成症例10例に同じ指示で回答させ、匿名化した出力を脊椎外科医8人が診断、推論、術式、明快さの4領域で採点した
- o1は診断の正確さ(4.6対4.3)と明快さ(4.4対4.2)で有意に高かった。推論と術式の妥当性は補正後の基準に届かなかった
- 評価者間の信頼性は低かった(ICC 0.03〜0.07)。明快さで補正すると、臨床領域でのo1の優位は検出されなくなった
出典:Spine Deform / Evaluating reasoning-tuned large language models for clinical decision-making in spine surgery.
サトシ 読みやすい答えほど中身も良く見えてしまうのは、人間の文章でも起こります。評価する側の目の癖まで測った点が面白いです。
急患の受診前に症状チェッカーアプリAdaを患者に使ってもらい、使いやすさと診断の一致を調べた論文。
- 米国の急患向けプライマリケア214人と救急外来40人が医師の診察前にAdaへ症状を入力し、技術受容モデルに基づく質問票に答えた
- 使いやすさに同意した割合はプライマリケアで73%、救急で84%。Adaの上位3診断が医師の診断と合ったのは172例中109例(63.3%)だった
- 50歳超と技術に不慣れなことが使いにくさの予測因子で、性別、人種、学歴は有意でなかった
出典:Appl Clin Inform / Usability and acceptability of a symptom checker app by patients seeking urgent care.
サトシ 高齢の方ほどアプリで止まってしまうのは、オンライン服薬指導でも同じ壁です。家族や窓口の手助けまで含めた設計が要りそうです。
電子カルテの薬剤名の誤記を見つけるため、BERT系の専用モデルを作り外部データで検証した論文。
- RxNormの薬剤名6万9,824件に人工的な誤記を加えて学習し、長期ケアの薬剤データ3,586件で外部検証した
- RxNormのテストではBERTDrugがF1 0.859、ROC-AUC 0.947で最良。2,000語での比較ではGPT-4o(ROC-AUC 0.856)を上回った
- 一方、長期ケアの200語ではGPT-4oが多くの指標で最良だった。実データでは専用学習の利点が小さくなった
出典:JMIR Med Inform / Detecting Misspelled Drug Names Using Transformer-Based Language Models: Model Development and External Validation.
サトシ 薬剤名の表記ゆれは薬剤師が毎日目にする問題です。現場のデータに近づくほど汎用LLMが強くなるという逆転が興味深いです。
単純CTの腎結石について、深層学習で構造化された読影前レポートを自動で作る仕組みを開発し評価した論文。
- 単施設で腎結石が確認された195人(390腎)を後ろ向きに使い、画像の手動選択なしで結石の有無、大きさ、部位を判定した
- 結石有無のAUCは0.980だった。一方、レポート単位の複合F1は0.533で、幻覚率0.458、欠落率0.476だった
- ハイブリッドCNN-TransformerとResNet-18の間に有意差はなかった。外部検証は行われていない
出典:J Imaging Inform Med / Automated Structured Pre-Report Generation for Nephrolithiasis on Non-Contrast CT: Development and Report-Level Evaluation of a Deep Learning Framework.
サトシ 項目ごとには当たっていても、レポートとして並べると半分近く崩れるのは示唆的です。部分の精度と使い物になるかは別の話ですね。
埼玉県戸田市の病院が診療車をオンライン診療の受診施設として県に届け出たことについて、毎日新聞が報じました。
- 届け出たのはLeMonみんなの病院(44床)。遠隔聴診器や生体情報モニターを備えた車内で、看護師同席のもと病院の医師が診察する
- 4月の医療法改正で、受診施設として届け出た場所でもオンライン診療を受けられるようになった
出典:毎日新聞 / 地域医療に新たな風 戸田の民間病院 「オンライン診療車」登録 高齢者宅、企業など活用へ /埼玉
サトシ 看護師が同席する車なら、画面越しでも聴診やバイタルが取れます。法改正で場所の縛りが外れた使い道として分かりやすい例です。
米国を中心にヘルステック企業のM&Aが再び活発になっていることについて、Fierce Healthcareが報じました。
- Corum Groupの集計では、2026年1〜3月期のヘルステックM&Aは149件、開示額227億ドルで、2025年通年の303億ドルに迫る
- Rock Healthによると、2026年上半期のデジタルヘルス企業の買収は115件で、うち71件が4〜6月期だった
- 例として、Sword HealthによるKaia Health買収(2億8,500万ドル)、Hims & HersによるEucalyptus買収(12億ドル)を挙げている
出典:Fierce Healthcare / Health tech's dealmaking boom is back as firms chase scale and profitable growth
サトシ スクライブや健康アプリの会社が単独で勝ち残るより、束ねられていく流れが見えます。日本の中小ベンダーにも再編の波が来そうです。
2026年版厚生労働白書で、医療・介護の担い手不足への不安とAI導入への考えが示されたことについて、TBSが報じました。
- 厚労省の昨年度の調査で、医療分野の担い手不足に不安を感じる人は74.5%、介護・福祉分野では81.3%だった
- 医療や介護の現場にAIやロボットを導入することには、70%以上が肯定的に答えた
- 白書は、2040年ごろに向けてAIやロボットの活用で業務の効率化と生産性の向上を進めることが重要だとしている
出典:dメニューニュース / 「医療・介護分野の将来の担い手不足に不安」と7割以上の人が回答 2040年頃に高齢者人口ピーク 現場にAIやロボット導入に7割以上が肯定的な考え 厚生労働省
サトシ 7割が肯定的というのは、現場より利用者側の方が先に受け入れているのかもしれません。導入費用を誰が持つかの議論はまだこれからです。