有干劲的巴顿在跳伞
07-07·AI领域创作者
Hy3 幻觉率降了,好用吗?
一文了解Hy3幻觉率
Hy3不仅在幻觉率上大幅下降,而且在真实使用体验上有了质的飞跃,确实更好用了。腾讯官方给出的数据非常亮眼:Hy3正式版通过细粒度的数据清洗和训练约束,让模型学会了“有依据才回答、无依据明示缺失,多来源信息不乱拼,数据和状态不乱编”的原则。具体数字上,幻觉率从preview版本的12.5%降至5.4%,常识错误率从25.4%降至12.7%,两项核心指标都实现了腰斩级别的改善。在游戏场景中,WeGame《流放之路:降临》AI助手接入Hy3后,幻觉率更是从4.5%降至2.8%。这些数字意味着什么?简单说,Hy3“一本正经胡说八道”的毛病明显减少了,输出更加可靠。在WorkBuddy这类办公智能体中,Hy3的任务解决率从72%跃升至90%,平均耗时缩短34%。更惊人的是,在高频办公任务中,Hy3的Token消耗比GLM-5.2低47%到49%,尤其是在文档处理和PPT制作两个场景中降幅最明显。在编程能力方面,Hy3在SWE-Bench Verified上拿到了78.0分,SWE-Bench Multilingual 75.8分。更重要的是,它在CodeBuddy、Cline、KiloCode三种不同开发框架下的分数标准差控制在4个百分点以内,这意味着换个Agent框架不会出现大幅波动。Hy3在多轮对话方面也有了显著提升。通过SFT与RL阶段联合优化指代消解、省略还原和多轮约束继承,多轮问题率从17.4%降至7.9%,长对话理解基准MRCR从42.9%跃升至75.1%。这意味着你在和Hy3进行长时间对话时,它不会再“忘记”之前说过的内容。Hy3的定价也非常有竞争力:输入1元/百万Token,输出4元/百万Token,命中缓存仅0.25元。而且采用Apache 2.0协议开源,全球开发者可免费商用,已经“Day 0”接入Hugging Face与ModelScope。这种低门槛策略,让更多开发者和企业可以低成本地尝试和使用。需要说明的是,这些幻觉率、错误率的下降数据均来自腾讯内部评测体系,评测方法和数据集尚未公开披露。Hy3确实更好用了。 它的进步不只是数字上的改善,而是体现在真实的业务场景中——办公任务完成率从72%提到90%、编程能力跨框架稳定、多轮对话更连贯、幻觉率腰斩。如果你正在寻找一个既能干活又不会太贵的大模型,Hy3值得一试。
发布于 安徽
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn