8種類の大規模言語モデルを216症例のシミュレーション環境で比較し、精度が同じでもコストや安全性に差があると分かったという論文。
- 8つのLLMを19診療科216症例・1728セッションのシミュレーション病院で検査や処置を発注させて評価した
- 精度93.5〜94.0%と近い3システムでもコストは最大1.75倍、医師の監督量は2.1倍の差があった
- 不要な侵襲的処置は8.7〜29.9%、失敗症例での無意味な侵襲的処置も最大18.1%発生していた
出典:J Am Med Inform Assoc / DiagnosticXchange: an open-source framework for evaluating safety, efficiency, and diagnostic reasoning in clinical AI systems.