NOHARM 醫療 AI 評測:GPT-5.6 Sol 與 Claude Fable 5 皆會出錯,76.6% 有害錯誤源於資訊遺漏
史丹佛與哈佛團隊以 1,100 個真實臨床案例測試,Doximity 表現居前但遭對手質疑,並點出當前醫療 AI 監管與究責的法規困境。
科技新報 AI多家報導
24 則值得知道的變化
史丹佛與哈佛團隊以 1,100 個真實臨床案例測試,Doximity 表現居前但遭對手質疑,並點出當前醫療 AI 監管與究責的法規困境。
專案包含任務資料集與執行框架,採用全通過評分標準與 LLM 裁判機制,並提供完整的併購資料室任務教學,測試代理在真實法律環境的執行能力。
1000 筆測試顯示開源模型綜合表現較佳;且所有開啟推理模式的模型,皆能成功攔截以 Base64 隱藏的危險指令。