2026年9月21日(月)のおすすめトピック

6本(論文5・ニュース1)

ドイツで公開運用されたパーキンソン病の情報提供AIチャットボットを、会話単位で評価した前向き観察研究。

  • RAG型のjAImesが公開後129日間に行った2035会話(6146メッセージ)を、自動トリアージと専門医レビューで評価した
  • 自動判定は1803件(88.6%)が良好、224件(11.0%)が部分的に適切、8件(0.4%)が不適切。良好と判定された100件の再確認で4件に重大な誤りがあった
  • 確認された重大事象には、認知症を伴う例への不適切なメマンチン推奨と、自殺念慮の訴えで緊急対応が作動しなかった例が含まれる

出典:Lancet Reg Health Eur / Real-world use and evaluation of a generative AI chatbot for Parkinson's disease information: a prospective observational study.

サトシサトシ
自動評価で9割近くが良好でも、専門医が見ると重大な誤りが残っていました。患者向けAIを出すなら、会話単位の監視体制まで含めて設計が要りそうです。

腫瘍領域のRCTの適格基準を、GPT-5に抄録と全文のどちらで読ませるのがよいかを比べた研究。

  • 腫瘍領域のRCT 200件について、限局例と転移例が対象に含まれるかをGPT-5に分類させ、抄録入力と全文入力を手作業のラベルと照合した
  • 限局例の判定精度は抄録86%(95%CI 81〜91%)、全文92%(88〜95%)で差があった(P=.027)。転移例の判定は99%と98%でほぼ同等だった
  • 評価対象は1種類のモデルと腫瘍領域のRCTに限られる

出典:JAMIA Open / More signal versus more noise: comparing full text and abstract as inputs for large language model-based classification of oncology trial eligibility criteria.

サトシサトシ
抄録だけだと適格基準の細かい記載が抜けます。文献の自動スクリーニングでは、全文を読ませる手間が精度に効くようです。

ベンガル語の会話音声からパーキンソン病を検出する、説明可能な機械学習の枠組みを提案した研究。

  • ベンガル語で初となるパーキンソン病の会話音声データセットを作り、多様な音響特徴量、特徴選択、分類器のハイパーパラメータ最適化を組み合わせた
  • 精度95.67%、F1 95.62%、AUC 0.990を報告した。他言語の既存データセットでも既存手法を上回ったとしている
  • SHAP解析で各音響特徴量の寄与を示した。臨床現場での前向き検証は抄録に書かれていない

出典:★Artif Intell Med / BenSParX: A robust explainable machine learning framework for Parkinson's disease detection from Bengali conversational speech.

サトシサトシ
言語ごとに音声バイオマーカーのデータが要る、という現実がよく分かります。精度は高いですが、現場での検証はこれからです。

肺がん登録のための病理報告の抽出を、ローカル動作の8B小型言語モデルで試した概念実証研究。

  • Gemini 2.0 Flashの推論をMed42-8Bに蒸留し、MIMIC-IV 2256件を家庭用GPU(RTX 3060)で1エポック学習した。台北医学大学病院の134件で運用を確認した
  • 専門家が監査した33件で精度90.91%、マクロF1 0.92(κ=0.86)だった。Llama-3-8Bは精度78.79%、マクロF1 0.79だった
  • 監査対象は33件で、著者らは多施設での前向き検証が必要としている

出典:J Multidiscip Healthc / Distillation of a Locally Deployable 8B Language Model for Lung Histology Abstraction: A 33-Report Proof-of-Concept Study.

サトシサトシ
外部APIに出せない病院データを手元のGPUで処理する発想は、現場の事情に合っています。件数が少ないので、参考値として見たいところです。

電子カルテデータベースと生物医学の知識グラフをMCPでつなぎ、LLMに研究用クエリを実行させる枠組みを評価した研究。

  • 700万人超のOMOP標準化EHRとSPOKE知識グラフを1つのワークフローに統合し、100の研究タスクと617問の事実確認問題で評価した
  • 知識グラフへのアクセスで、GPT-5.5とClaude Opus 4.8の平均スコアが向上した。BiomixQAでは択一式の正答率が上がり、正誤問題は変わらなかった
  • 公表済み観察研究の再現では、作業期間が数か月から数時間に短縮された。研究設計と解釈は専門家の監督下に置かれている

出典:Front Artif Intell / An agentic AI framework connecting language models to electronic health records and a biomedical knowledge graph for real-world evidence.

サトシサトシ
データ抽出の壁が下がるのはありがたい反面、設計と解釈は人が持つ前提です。ベンチマーク中心の評価なので、実運用は別の話です。

古川デジタル大臣の就任会見で示された医療AXと医療情報の2次利用の方針について、smartwatchlife.jpが報じました。

  • 9月18日に就任した古川氏は、AIの出口として医療を挙げ、現在進めている医療DXを医療AXにしたいと会見で述べた
  • 医療情報の2次利用は次世代医療基盤法の改正を視野に検討会で議論中で、9月中の取りまとめと来年の通常国会を目指すとした
  • 着手する分野や工程は会見では示されていないと同記事は指摘している

出典:smartwatchlife.jp / 古川大臣の就任で日本のAI政策はどう変わるのか|医療DXを医療AXへと語り医療情報の2次利用は来年の通常国会を目指す

サトシサトシ
2次利用の法整備は、医療系の情報を扱う事業者にも関わる話です。9月中の取りまとめ内容を待ちたいところです。