吃不饱还打嗝
08-11·AI领域创作者
通用大模型榜:模型观察员任务
当我开始用大模型写代码时,第一反应也是:要不要换一门「更适合 LLM」的语言?比如网上常说的:动态语言更省 token、更高效;语法越紧凑、越「怪」的语言,对大模型越友好。后来我自己做了几轮稍微「像样一点」的实验,结论完全不一样。1. 小玩具题的结论,放大后经常会翻车很多流行观点,其实是用非常简单的题目得出来的:几十上百个 token 就能写完的小函数、小脚本。在这种级别上,动态语言少几行类型声明,确实会更短一些,看起来就「更省 token、更便宜」。但一旦把任务放大到「真实项目级」:比如让大模型在没有联网的环境里,从规范文档实现一个完整的压缩算法解码器,或者根据文档和上千条测试实现一个类似 Pandoc 这样的复杂工具,这种「动态完胜静态」「越怪越强」的关系,立刻就消失了。2. 动态 vs 静态:没有谁在真实场景里碾压对方在复杂任务上,我重点看三件事:正确率、花费、时间。直观感受是:- 中等强度下,有时动态语言略微便宜一点,但差距远没有网络传言说的那种 2~3 倍;- 提升到「高强度、长期反复尝试」后,静态语言里也经常能跑出表现最好的结果;- 整体看,静态和动态语言之间,更像是不同任务下此消彼长,而不是一方全面领先。更有意思的是,那些被神话成「为大模型而生」的冷门致密语言,在这种场景里并没有展现出什么统治级优势,反而容易因为生态小、训练数据少,在复杂任务中频繁翻车。3. 反而是「主流语言」有一点天然优势在几类任务里,一个反复出现的现象是:GitHub 上更流行的语言,往往在正确率、成本和用时上略有优势。5. 对我自己的结论:少纠结语言,多打磨任务和工具链走完这一圈,我对「大模型写代码该选什么语言」的看法反而简单了很多:- 想从一两个小 benchmark 里得出「某语言是 LLM 最强搭子」这种结论,几乎是不可能的;- 语言差异确实存在,但在不少真实场景里,它远没有「任务设计、提示方式、测试体系、工具链配置」这些因素重要;- 对绝大多数人来说,选一门主流、生态成熟、自己熟练的语言,往往比为了大模型特地改用冷门致密语法语言,现实而高效得多。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中