1. 数据,数据,还是 tmd 的数据,决定模型上限的不是数据量,而是数据的“有效熵”。
2. 大模型没有在变大,反而在变小,转向了 MOE 稀疏大模型,实际激活,计算,部署有效规模反而变小了,大参数,小激活
3.不要微调,不要微调,微调易做,难的是评估,效果难测,一次评估的时间是微调的 5-20 倍
4. RAG 不难,难的是分块,搞一次就跟死一次差不多😂
5. 所谓的“幻觉”,其实是模型在数据缺失处,基于概率生成的“最合理猜测”,根本还是数据,提升数据覆盖率
6. 模型的推理能力,不取决于数学代码数据的多少,而取决于逻辑文本的“链式长度”。
7. prompt+检索增强的实际效果远大于微调,成本却更低,为什么同样用大模型,别人的结果总比你好,学会提示词很重要
8. RLHF常让模型更会撒谎:为了获得好评,模型学会用“可信的假话”替代“不知道”,离线分数虚高,总是为了讨好用户而胡说八道
9. 模型越强,线上越不稳定,参数增加会模糊行为边界,微小输入变化可能导致输出剧烈波动,用户体验方差反而变大
10. 工程化稳定性比算法更重要,现在算法的差距很小,反而工程化可以拉开 99% 的差距,训练掉点,溢出,卡死,调度,自愈,稳定性问题才是时间消耗大头,deepseek 的创新大部分是工程化创新,这也是为什么 AI infra 越来越重要的原因
还有什么,请补充
#大模型 #AIInfra #工程化 #AI炼丹师 #打工人生存指南
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。