跳到主要內容
2026-08-10 日報
研究與評測

NOHARM 醫療 AI 評測:GPT-5.6 Sol 與 Claude Fable 5 皆會出錯,76.6% 有害錯誤源於資訊遺漏

科技新報 AI多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

史丹佛大學、哈佛大學與 ARISE 網絡共同執行的 NOHARM 醫療 AI 基準研究顯示,包含 GPT-5.6 Sol、Claude Fable 5、Doximity 與 OpenEvidence 在內的主流臨床 AI 工具皆會出錯。該測試輸入 1,100 個真實臨床案例並蒐集約 13,000 筆醫師註解,發現高達 76.6% 的有害錯誤肇因於漏答或漏列重要資訊的「資訊遺漏」,而非捏造事實。 評測結果中 Doximity 的臨床工具 Ask 表現居前,但 OpenEvidence 執行長 Daniel Nadler 質疑該研究未經同儕審查,且方法有瑕疵,認為不應允許 AI 提出「重測」要求。 報告發布正值醫療 AI 監管變動期,凸顯法規分歧:美國 FDA 剛放寬規定,只要醫師能獨立檢查 AI 推理即可放行;但各州政府趨於嚴格,多數要求 2026 年前 AI 輔助決策須有「人類簽核」,且當 AI 建議出錯時,醫師、醫院與 AI 供應商之間的醫療過失責任歸屬目前仍未明朗。
讀原始報導

背景

NOHARM(Numerous Options Harm Assessment for Risk in Medicine)是一項針對初級照護轉診專科案例的基準測試,旨在衡量大型語言模型(LLM)在醫療諮詢中產生潛在有害錯誤的頻率與嚴重性。參與此次評測的 Doximity 成立於 2010 年,為一個提供醫療新聞與遠距醫療工具的醫療專業人員線上社群網路服務。

來源

本期分類