业务研发中的 Loop Engineering:基于事前-事中-事后架构的实践|AICon深圳

AI 行业动态1 次阅读来源:InfoQ 中文 AI
分享:

Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。腾讯高级后台开发工程师、项目组 Agent 落地负责人任磊达已确认出席 “Harness Engineering:模型之外的智能体工程” 专题,并发表题为《业务研发中的 Loop Engineering:基于事前-事中-事后架构的实践》的主题分享。AI 时代,研发提效的关键不再只是让 Agent 更快写代码,而是让团队能持续证明代码“做对了”、质量“兜得住”。本次分享以“事前-事中-事后”Harness Engineering 为主线,结合游戏后端质量验证实践,探讨如何把 Agent 执行、测试策略、集成测试、Review 沉淀与 Skill 评估组织成质量飞轮。分享将从“查杀分离”这一核心理念出发,说明为什么测试需要独立于实现路径,为什么 Agent 自写自测存在认知同源风险;随后展开 TDD、tester skill、lobbytest / ugctest、skill evaluator 四类实践,分别对应事前结构化、事中自动化验证和事后沉淀回灌。最终目标是让人聚焦业务边界、风险判断和质量标准,让 Agent 承担执行、验证与重复性修复,使同类问题越来越少,质量资产持续复利。任磊达,腾讯高级后台开发工程师、项目组 Agent 落地负责人,推动百人规模项目组开发团队从 Token Maxing 向 Token Apocalypse 转型,将 Harness 的目标明确聚焦于 ROI。基于事前、事中、事后的架构构建 Harness Loop,降低认知成本,实现单人月耗百亿 Token 的开发模式,并完成团队推广。基于 18 年线上项目运营经验,持续探索 100% Coding Vibe 场景下的质量投入模式与 ROI。在实践中,可于 20 天内完成原本约 100 人天的需求,并通过后续 2–3 个月的质量工程化手段恢复系统的可控性。他在本次会议的详细演讲内容如下:演讲提纲:引言:Agent 时代的质量焦虑最大的问题不再是“能不能写代码”,而是“怎么证明写对了”研发质量的目标:让问题更早暴露、更少重复、更容易回灌引出核心框架:事前结构化、事中自动化、事后沉淀2. 两层 Harness:执行托底与项目组织Agent-CLI 侧 Harness:托住长程执行,控制失控风险项目侧 Harness:拆清需求、测试、Review 和沉淀入口最终目标:白天做判断,夜里跑执行,第二天复盘回灌3. 质量验证的核心理念:查杀分离类比机器学习:训练集与验证集必须分离类比业务安全:发现问题的“查”和线上处置的“杀”需要独立映射到研发质量:Development 与 Test 要形成独立验证路径Test vs Review:测试通过真实执行路径验证,Review 更多依赖代码文本和经验判断4. 事前:把需求、验收和测试策略结构化/workflow:clarify:把模糊需求变成边界、风险和验收条件TDD 在 Agent 时代的新定位:测试即规格,先定义“怎么算做对”Agent 自写自测的风险:认知同源,容易“用训练集验证训练集”解决方向:上下文隔离、跨模型验证、属性测试、不变量测试tester skill repo:从“怎么测”升级到“该测什么”Push vs Pull:从过度测试转向风险驱动的恰到好处测试5. 事中:Agent 执行,自动化测试与 Hooks 盯防按 plan.yaml 分 stage 执行:实现、验证、失败重试、提交Hooks / linter / auto review:把确定性问题前移到执行过程中lobbytest / ugctest:游戏后端集成测试的实践样本从 CLI 工具到插件化,再到服务化架构真实服务、模拟客户端、TraceID、日志分析共同支撑事中验证事中困惑:用例维护成本、并发测试资源、复杂场景定位成本6. 事后:Review、Issue 与 Skill Evaluator 沉淀闭环Review 放到 MR:沉淀代码上下文、判断依据和处理结果Test 放到 Issue:沉淀验收标准、失败案例和回归入口高频问题回灌为 Hook、Linter、Skill、WorkflowSkill Evaluator:验证对象从代码升级到流程本身两类评估:Skill 是否被正确触发,Skill 是否完成预期任务7. 开发自测的三阶段价值定位阶段一:手工测试最佳实践沉淀为可执行用例阶段二:风险评估驱动低风险变更直发阶段三:测试团队主导质量系统化,开发团队提供技术支撑风险模型:风险等级 = 失效影响 × 失效可能性低风险 + 集成测试通过,可以进入更轻量发布路径8. 效率飞轮:从质量验证到工程资产复利事前:clarify、TDD、tester skill 定义清楚输入事中:Agent、Hooks、lobbytest / ugctest 自动执行验证事后:MR、Issue、Skill Evaluator 沉淀判断并回灌观测指标:MR 评论数、重复评论占比、Harness 回灌率、自动放行率、事前澄清耗时9. 结语:让人的判断越来越值钱人负责业务边界、风险判断和质量标准Agent 负责执行、验证、修复和重复性反馈处理Harness 的价值不是让 Agent 一次写得更快,而是让团队越跑越稳、同类问题越来越少、质量资产越来越厚。这样的技术在实践过程中有哪些痛点?token 消耗较大,会有一定认知成本和管理成本的压力。听众收益了解 token maxxing 的上限边界,掌握通过认知管控提升该上限的方法。明晰 vibe coding 的质量保障路径,该路径并非局限于常规的 tdd、单元测试、接口测试,而是要实现功能覆盖度与维护 ROI 的平衡。如果组织选择不缩减 HC,以及保证相对稳定的组织架构的形态下,如何借力 AI 实现效能 ROI 的收益。除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、端侧智能与 AI 原生终端、AI Agent 高价值商业场景实战等 11 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。大会限时早鸟票享 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。

评论 (0)

0/500

7 + 5 = ?

暂无评论,来写第一条吧