微学AI
06-24·AI领域创作者
LLM第三次变革,变革点在哪?
从概率预测到逻辑验证的跨越
最近在本地跑o3-mini的INT4量化版时,我盯着终端里那条被展开的思维链看了很久。它不再是一口气吐出答案,而是先自己列了七八个步骤,每个步骤结束还顺手校验一下,遇到不确定的地方就调Python跑一遍。这种"慢思考"的感觉,和三年前我第一次用GPT-3.5写代码完全是两回事。如果让我给LLM的演化画一条线,第一次变革是2017年Transformer的"Attention is All You Need",把序列建模从RNN里彻底解放;第二次是2020年前后靠预训练Scaling Laws暴力出奇迹,GPT-3出来的时候大家集体失语,觉得"大力真的能出奇迹"。但2024年底o1发布、2025年o3登场后,我意识到第三次变革的关键词已经从"更大"变成了"更慢"——也就是Test-time Compute(推理时算力)和RLVR(基于可验证奖励的强化学习)。背后逻辑其实不复杂:以前模型是"概率性的文本生成器",本质是高级自动补全;现在RLVR让模型在数学、代码这种有标准答案的领域自我博弈、自我验证,把"思考"这件事从提示词工程搬进了训练循环。直接看跑分就懂了——o1在AIME上74.3%,o3直接拉到91.6%;Codeforces Elo从1891涨到2706,已经是国际大师级别。港大AIEL刚发的《AI高阶推理能力评测报告》里,GPT-5(思考模式)以91分排第一,豆包1.5 Pro(思考模式)85分是国产唯一挤进前五的。SuperCLUE 2025年度总榜上,Kimi-K2.5-Thinking、Qwen3-Max-Thinking、Doubao-Seed-1.8、DeepSeek-V3.2、GLM-4.7基本包圆了推理赛道。说实话,这种"通用模型打不过专用推理模型"的梯度差,已经很说明问题——行业焦点真的从"功能够多够广"转向了"特定场景的深度精耕"。我个人最大的感受是:以前调模型像在抽卡,现在更像在和一位愿意反复验算的同事协作。它还是会犯错,但"错的方式"高级多了。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中