朱亚威
08-08 · 得物App
用 Vibe Coding 完成了 Personal Agent 一期,写了篇复盘。系统是:iPhone 负责对话和确认,自托管后端持有 Agent Runtime、MCP Client、权限、审计和高权限凭据,飞书账本作为 Finance 事实源。结构上它其实是一个只有一个开发者、一个用户的开放平台——业务工具是 API,allowlist 和设备 scope 是权限模型,幂等键和receipt 是写入契约。文章记录了四件改变项目形态的事:开发组合。不是某个 Coding Agent 从头写到尾,而是计划、实现和独立审查分开,主请求与辅助请求路由到不同供应商,避免共享故障域。独立审查两次在全绿的测试套件背后找出六个阻塞级缺陷。中途停下来补底座。把 Timeline、Session、Context、Memory 拆成四个独立概念,并拒绝了会话列表这套主流交互——它本质上是把模型的 context 限制转嫁给用户。上线后一次Session 污染事故反过来验证了这个抽象:修复只需关闭被污染的 Session,用户历史不用动。把"成功"的定义移到外部事实。模型只提结构化意图;一次写入要完成写后回读并生成verified receipt 才算成功。也因此没有接飞书现成的公开 MCP,而是自己设计每个业务工具的边界。eval 的覆盖边界。补了歧义输入和带历史的多轮回归,固定版本重复四次,把稳定缺陷和采样波动分开——严格通过率在抖,安全通过率四次没动过。也发现所谓"真实用户输入"其实被我自己逐渐形成的提示技巧污染了。最后一部分是代码之外:公网、证书、服务用户、加密异地备份、异机恢复和一次完整回滚。这段花的时间远超预期,也最直接地区分了玩具和产品。回看下来,我真正负责的不是代码,是决策和完成标准——而一期最贵的三个决定都是"不做"。全文:https://taou.cn/a/igwa0W
发布于 上海
分享
评论
1
未登录
友善发言
image-upload
评论
加载中