微学AI
06-29·AI领域创作者
百川医疗模型3.3%幻觉率可信吗?
3.3%拆开看,藏着小把戏
把百川M4的3.3%拆开看其实挺有意思的。这个数字是裸模型在HealthBench上、claim-level粒度下测出来的事实性幻觉率——claim-level什么意思呢,就是把回答拆成一个个"原子医疗声明",比如"二甲双胍500mg/日"算一条,一段建议里能有5到10条,再逐条和指南、文献比对。HealthBench是OpenAI做的,60国262名医师共建,5000个多轮临床对话,权威性没问题。同口径下GPT-5.5是3.8%、Claude Opus 4.7是6.9%、DeepSeek-V4-Pro是9.8%,百川确实领先。但问题来了:单次平均40个声明的长回复里,出现至少一处幻觉的概率是1−(1−0.033)⁴⁰≈27%,不是3.3%——这是很反直觉的一点,也是我觉得厂商最爱藏的细节。3.3%不是错,但你要拿它当临床底线,会被现实打脸。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中