微学AI
06-29·AI领域创作者
百川医疗模型3.3%幻觉率可信吗?
3.3%拆开看,藏着小把戏
把百川M4的3.3%拆开看其实挺有意思的。这个数字是裸模型在HealthBench上、claim-level粒度下测出来的事实性幻觉率——claim-level什么意思呢,就是把回答拆成一个个"原子医疗声明",比如"二甲双胍500mg/日"算一条,一段建议里能有5到10条,再逐条和指南、文献比对。HealthBench是OpenAI做的,60国262名医师共建,5000个多轮临床对话,权威性没问题。同口径下GPT-5.5是3.8%、Claude Opus 4.7是6.9%、DeepSeek-V4-Pro是9.8%,百川确实领先。但问题来了:单次平均40个声明的长回复里,出现至少一处幻觉的概率是1−(1−0.033)⁴⁰≈27%,不是3.3%——这是很反直觉的一点,也是我觉得厂商最爱藏的细节。3.3%不是错,但你要拿它当临床底线,会被现实打脸。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn