杨思义
08-13 · 蚂蚁集团第一代数据中台(代号:五代架构)体系化参与及贡献者,开源HiveMetaStore(大数据核心中间件)重构及应用。第一代大数据数据质量与治理系统的设计与研发。曾上海中新社实习记者:)
AI并行工作实战,复杂任务拆得开、扛得住
昨晚爆肝,把博思AI智能体的复杂任务从单Agent串行升级为TaskPlanner→RabbitMQ→双实例Worker并行→收敛压缩的完整编排链路。全链路12个测试用例全绿,架构评分提升至92分。比如写一份数字化转型报告,9个业务维度挤在一次生成里,首token延迟恶化,任何一块失败整篇作废。现在我将LLM先拆解为最多9个独立子任务并行执行,最后用轻量模型汇总压缩到1000字以内。并发保护用Redis Lua原子限流,全局共享8个工作流额度,超限自动降级到单Agent兜底。实测20并发:8个并行+12个降级,零丢失,系统不雪崩。消息可靠性靠manual ack+prefetch=1,Worker忙时不拉消息,按真实处理能力公平分发。子结果写Redis hash幂等覆盖,双实例同时写也只收敛一次。最头疼的是故障兜底:如果收敛实例在结果到齐前崩溃,plan会永久卡住。落地WorkflowReconciler每30s扫描对账,三层去重防重复收敛,把卡住的plan救活。踩坑发现仅靠DB状态去重会误判,必须以Redis的converged标记为主判据。今晚还踩了几个坑:Semaphore跨实例错配换Lua解决、Nacos公网8848被防火墙挡需本机访问、group是CHAT不是DEFAULT_GROUP、UA黑名单拦curl需伪造浏览器头、历史遗留plan干扰需清理。一句话总结:让复杂任务拆得开、跑得动、扛得住、丢不了、挂了能自愈,用12条测试用例把闭环钉死在代码里。
发布于 上海
2
3
1
未登录
友善发言
image-upload
评论
加载中