微学AI
06-29·AI领域创作者
百川医疗模型3.3%幻觉率可信吗?
HealthBench是英文主场
我自己拿中文病历丢给M4试过,发现一个尴尬的事:HealthBench整套语料和评分主英文,60国医师构建里中文病例占比有限,3.3%严格说是英文医疗场景的裸模型幻觉率,百川中文主场优势目前是空头支票。百川M4这次HealthBench综合68.6、Hard领先GPT-5.5 15.9分、Professional 55.1,确实漂亮,但HealthBench本身没单独跑过中文子集。真正让我服气的是另一条数字:M4"证据锚定"技术让循证引用精度做到90.0,GPT-5.5只有54.7、OpenEvidence 55.9,这才是它的护城河,3.3%只是锦上添花。换句话说,3.3%可信,但适用边界要打引号;真到中文临床端,还得看北京儿童医院、医科院肿瘤医院、瑞金那几所联合研究的真实世界数据。数字好看是门槛,落地才是考卷。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn