小卷的IoT
06-25·AI领域创作者
Claude Opus 4.8
Claude Tag做任务,实际落地稳定性如何?
上手Claude Tag一周,说点实话。简单任务确实稳。写个正则、封个API、跑个小重构,一次通过率很高,Anthropic自己说65%代码靠它生成的,这个数据在可控环境里我信。但复杂任务就开始露馅了。我们团队试过多仓库批量代码审计,跑到第三步直接卡住不动,追问它说"已达到单轮工具调用上限",等了半小时没人确认,任务自动判定超时终止,中间结果全丢。更坑的是多人并发。产品经理和开发同时在不同线程@Claude,A的需求参数混进了B的任务里,输出直接作废。它不会主动隔离多人指令,只会无脑堆叠处理所有消息,公共频道基本没法用。6月23号大面积宕机就不用说了,Opus 4.8错误率断断续续飙了一整天。你敢把核心业务交给一个随时宕机的AI吗?我的结论:短任务、单线程、有人盯的场景可以用;长链路、多人并发、无人值守的场景,再等等。
发布于 山东
分享
1
1
未登录
友善发言
image-upload
评论
加载中