微学AI
06-29·AI领域创作者
百川医疗模型3.3%幻觉率可信吗?
HealthBench是英文主场
我自己拿中文病历丢给M4试过,发现一个尴尬的事:HealthBench整套语料和评分主英文,60国医师构建里中文病例占比有限,3.3%严格说是英文医疗场景的裸模型幻觉率,百川中文主场优势目前是空头支票。百川M4这次HealthBench综合68.6、Hard领先GPT-5.5 15.9分、Professional 55.1,确实漂亮,但HealthBench本身没单独跑过中文子集。真正让我服气的是另一条数字:M4"证据锚定"技术让循证引用精度做到90.0,GPT-5.5只有54.7、OpenEvidence 55.9,这才是它的护城河,3.3%只是锦上添花。换句话说,3.3%可信,但适用边界要打引号;真到中文临床端,还得看北京儿童医院、医科院肿瘤医院、瑞金那几所联合研究的真实世界数据。数字好看是门槛,落地才是考卷。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中