业务研发中的 Loop Engineering:基于事前-事中-事后架构的实践|AICon深圳

在AI技术飞速发展的今天,业务研发中的质量挑战成为行业焦点。任磊达,腾讯高级后台开发工程师,将分享他在“Harness Engineering:模型之外的智能体工程”专题中的深度见解,探讨如何通过事前-事中-事后架构实现质量飞轮,提升团队效率和系统稳定性。

--91likeyou---

在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。

腾讯高级后台开发工程师、项目组 Agent 落地负责人任磊达已确认出席 “Harness Engineering:模型之外的智能体工程” 专题,并发表题为业务研发中的 Loop Engineering:基于事前-事中-事后架构的实践的主题分享。AI 时代,研发提效的关键不再只是让 Agent 更快写代码,而是让团队能持续证明代码“做对了”、质量“兜得住”。本次分享以“事前-事中-事后”Harness Engineering 为主线,结合游戏后端质量验证实践,探讨如何把 Agent 执行、测试策略、集成测试、Review 沉淀与 Skill 评估组织成质量飞轮。分享将从“查杀分离”这一核心理念出发,说明为什么测试需要独立于实现路径,为什么 Agent 自写自测存在认知同源风险;随后展开 TDD、tester skill、lobbytest / ugctest、skill evaluator 四类实践,分别对应事前结构化、事中自动化验证和事后沉淀回灌。最终目标是让人聚焦业务边界、风险判断和质量标准,让 Agent 承担执行、验证与重复性修复,使同类问题越来越少,质量资产持续复利。

任磊达,腾讯高级后台开发工程师、项目组 Agent 落地负责人,推动百人规模项目组开发团队从 Token Maxing 向 Token Apocalypse 转型,将 Harness 的目标明确聚焦于 ROI。基于事前、事中、事后的架构构建 Harness Loop,降低认知成本,实现单人月耗百亿 Token 的开发模式,并完成团队推广。基于 18 年线上项目运营经验,持续探索 100% Coding Vibe 场景下的质量投入模式与 ROI。在实践中,可于 20 天内完成原本约 100 人天的需求,并通过后续 2–3 个月的质量工程化手段恢复系统的可控性。他在本次会议的详细演讲内容如下:

演讲提纲:

  • 引言:Agent 时代的质量焦虑

    • 最大的问题不再是“能不能写代码”,而是“怎么证明写对了”

    • 研发质量的目标:让问题更早暴露、更少重复、更容易回灌

    • 引出核心框架:事前结构化、事中自动化、事后沉淀

    2. 两层 Harness:执行托底与项目组织

    • Agent-CLI 侧 Harness:托住长程执行,控制失控风险

    • 项目侧 Harness:拆清需求、测试、Review 和沉淀入口

    • 最终目标:白天做判断,夜里跑执行,第二天复盘回灌

    3. 质量验证的核心理念:查杀分离

    • 类比机器学习:训练集与验证集必须分离

    • 类比业务安全:发现问题的“查”和线上处置的“杀”需要独立

    • 映射到研发质量:Development 与 Test 要形成独立验证路径

    • Test vs Review:测试通过真实执行路径验证,Review 更多依赖代码文本和经验判断

    4. 事前:把需求、验收和测试策略结构化

    • /workflow:clarify:把模糊需求变成边界、风险和验收条件

    • TDD 在 Agent 时代的新定位:测试即规格,先定义“怎么算做对”

    • Agent 自写自测的风险:认知同源,容易“用训练集验证训练集”

    • 解决方向:上下文隔离、跨模型验证、属性测试、不变量测试

    • tester skill repo:从“怎么测”升级到“该测什么”

    • Push vs Pull:从过度测试转向风险驱动的恰到好处测试

    5. 事中:Agent 执行,自动化测试与 Hooks 盯防

    • 按 plan.yaml 分 stage 执行:实现、验证、失败重试、提交

    • Hooks / linter / auto review:把确定性问题前移到执行过程中

    • lobbytest / ugctest:游戏后端集成测试的实践样本

    • 从 CLI 工具到插件化,再到服务化架构

    • 真实服务、模拟客户端、TraceID、日志分析共同支撑事中验证

    • 事中困惑:用例维护成本、并发测试资源、复杂场景定位成本

    6. 事后:Review、Issue 与 Skill Evaluator 沉淀闭环

    • Review 放到 MR:沉淀代码上下文、判断依据和处理结果

    • Test 放到 Issue:沉淀验收标准、失败案例和回归入口

    • 高频问题回灌为 Hook、Linter、Skill、Workflow

    • Skill Evaluator:验证对象从代码升级到流程本身

    • 两类评估:Skill 是否被正确触发,Skill 是否完成预期任务

    7. 开发自测的三阶段价值定位

    • 阶段一:手工测试最佳实践沉淀为可执行用例

    • 阶段二:风险评估驱动低风险变更直发

    • 阶段三:测试团队主导质量系统化,开发团队提供技术支撑

    • 风险模型:风险等级 = 失效影响 × 失效可能性

    • 低风险 + 集成测试通过,可以进入更轻量发布路径

    8. 效率飞轮:从质量验证到工程资产复利

    • 事前:clarify、TDD、tester skill 定义清楚输入

    • 事中:Agent、Hooks、lobbytest / ugctest 自动执行验证

    • 事后:MR、Issue、Skill Evaluator 沉淀判断并回灌

    • 观测指标:MR 评论数、重复评论占比、Harness 回灌率、自动放行率、事前澄清耗时

    9. 结语:让人的判断越来越值钱

    • 人负责业务边界、风险判断和质量标准

    • Agent 负责执行、验证、修复和重复性反馈处理

    • Harness 的价值不是让 Agent 一次写得更快,而是让团队越跑越稳、同类问题越来越少、质量资产越来越厚。

    这样的技术在实践过程中有哪些痛点?

    • token 消耗较大,会有一定认知成本和管理成本的压力。

    听众收益

  • 了解 token maxxing 的上限边界,掌握通过认知管控提升该上限的方法。

  • 明晰 vibe coding 的质量保障路径,该路径并非局限于常规的 tdd、单元测试、接口测试,而是要实现功能覆盖度与维护 ROI 的平衡。

  • 如果组织选择不缩减 HC,以及保证相对稳定的组织架构的形态下,如何借力 AI 实现效能 ROI 的收益。

  • 除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、端侧智能与 AI 原生终端、AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。

    大会限时早鸟票享 9 折专属优惠,现在报名立减 580,更多详情可扫码或 进行咨询。

    🔥 热词:#业务事前事中事后管理概念