logo
登录 / 注册

AI Agent 完全入门(二)

头像
霍格沃兹测试开发学社
06-17 · 测试开发工程师
二、本质变化:为什么会这样普通的大模型应用走的是“单次问答”模式。用户输入 -> 模型推理 -> 输出结果。一次调用结束。模型没有状态,没有目标,不会主动做下一步。Agent不同。它有一个“目标-规划-执行-观察”的循环。用户说“订机票”,Agent不会直接输出“我做不到”。它会先拆解:需要日期、目的地、预算。缺少信息就反问用户。拿到信息后调用查票接口。拿到结果后再调用下单接口。每一步都依赖上一步的输出。本质是把“一次性生成”变成了“多步推理+行动”。这个变化对工程的意义很大。因为每一步都可能出错:工具调用失败、返回格式不对、模型理解错误。你需要处理的事情比单次调用复杂一个数量级。但回报也大:一个能闭环执行任务的系统,比一个只会回答的系统,价值高不止十倍。观点句2:Agent的核心不是“调用工具”,而是“为了达成目标,自主决定下一步做什么”。三、核心机制拆解:感知-规划-记忆-工具的四层闭环一个标准的Agent架构,可以拆成四个模块。我用测试工程师能听懂的语言翻译。第一层:感知Agent需要知道当前状态。用户说了什么、上一步执行结果是什么、环境有什么变化。在测试场景里,感知可以是:页面当前显示什么、接口返回了什么、日志里有没有报错。第二层:规划这是Agent的“大脑”。大模型把用户目标拆成一系列子任务。比如“测试登录功能”,规划可能是:打开登录页 输入正确账号密码 点击登录 验证跳转到首页 再测错误密码场景规划可以是一次性生成,也可以是每做完一步重新规划(动态规划)。第三层:记忆Agent需要记住做过的事。短期记忆存当前对话的上下文。长期记忆存历史成功案例、工具使用经验。测试场景中,记忆可以让Agent记住:上次这个接口返回的token格式是这样的,下次可以直接复用。第四层:工具工具是Agent的“手”。API、数据库、浏览器、命令行、测试框架……任何可以调用的外部能力。关键点是:模型决定“什么时候用哪个工具,传什么参数”。不是硬编码。mermaid图把Agent的执行流程画出来:这个循环会一直跑,直到目标达成或遇到无法处理的错误。所以Agent有时候会陷入无限循环,这是工程上需要加最大迭代次数和早停机制的原因。
AI Agent 完全入门(二)脉脉
阅读 1
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...