尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
《AI 渐进编程》之二十一:Agent 不光要交代码,还要交证据包
使用 AI 编程时最容易被看到的是生成能力。代码写出来了页面生成了接口补上了看起来任务已经完成。但在真实项目里生成只是第一步。这就像吊车搬运重物。货物被吊到目标区域并不等于已经放准还需要确认位置、偏差和后续影响。AI 编程也是一样。Agent 写完代码不等于完成交付。它还需要说明改了什么为什么这样改影响了哪里如何验证还有哪些风险需要人判断。这就是证据包。AI 生成速度远超过人工审查速度。如果每次都让人检查全部代码流程很快就会堵住。证据包的作用是把修改范围、验证结果和剩余风险提前整理出来让人集中判断关键风险。所以AI 编程不应该只是生成式交付而应该是验证式交付。1. AI 的审查能力也要用起来过去代码审查主要依赖人。人要读 diff、理解调用关系、判断影响范围、确认测试是否充分还要识别隐藏风险。这件事很难也很耗时间。AI 出现以后不能只利用它的生成能力也要利用它的审查能力。Agent 在提交结果之前应该先做一轮机器审查是否越过修改边界是否破坏调用关系是否只修复了表面问题是否缺少关键路径测试是否留下旧代码和过期注释是否有需要人工判断的风险。这些检查不能完全替代人但它可以把大量原本需要人从头梳理的信息提前整理出来。2. 传统工程审代码Agent 工程审证据传统软件工程里一轮开发大致是需求 → 设计 → 手写代码 → 人工审查 → 测试代码是主要交付物。审查者拿到代码 diff再自己判断改动是否合理。Agent 工程不应该只是把“手写代码”换成“AI 写代码”。更合理的流程是意图与约束 → 项目状态检索 → 生成 / 执行 / 反馈循环 → 机器验证 → 证据包 → 人类风险审批这里的关键变化是Agent 不能只交结果还要交代结果是怎样来的。它不仅要说“我改完了”还要说明基于什么上下文修改、影响范围在哪里、已经验证了什么还有哪些风险没有覆盖。3. 证据包应该包括什么证据包不是一堆日志。它是一份让人能够快速判断风险的工程说明。一份基本的证据包可以包括任务目标 修改文件 关键改动 影响范围 验证结果 未覆盖风险 需要人工判断的问题例如任务目标 修复空购物车结算异常。 修改文件 - checkout/service.py - tests/test_checkout.py 关键改动 - 在结算前增加 empty cart 检查 - 阻止空购物车进入支付流程 - 增加空购物车测试。 影响范围 - checkout service - order creation - payment request path。 验证结果 - 空购物车测试通过 - 正常购物车测试通过 - 未发送 payment request。 未覆盖风险 - 未验证优惠券叠加场景 - 未验证多币种结算路径。 需要人工判断 - 空购物车错误提示文案是否符合产品要求。这样的提交比一句“已修复”有用得多。4. 人类审批的是风险Agent 可以生成代码也可以整理证据。但最后是否接受修改仍然需要人类判断。因为有些问题不是测试能完全决定的业务是否合理用户体验是否接受风险是否可承受是否符合长期架构方向是否应该现在解决还是写入open_issues.md。所以人类审查的重点不只是逐行看代码而是判断证据是否充分、风险是否说清、当前结果是否可以进入项目状态。人不是重新替 Agent 做一遍而是做最后的风险审批。5. 证据包让交付可追踪如果 Agent 每次只返回“已完成”项目很快会变得不可追踪。人不知道它基于什么理解修改验证了哪些路径有没有越界留下了哪些风险。所以在长期项目里证据包应该成为每一轮交付的一部分。可以在current_task.md中提前要求本轮完成时必须提交证据包包括 1. 修改文件清单 2. 关键改动摘要 3. 影响范围分析 4. 已执行的验证 5. 未覆盖风险 6. 是否清理旧代码 7. 需要人工审批的问题。这不是形式主义。它是在让 Agent 的工作变得可审查、可追踪、可回滚。本章小结Agent 工程的交付物不应该只有代码还应该有证据包。代码说明“改了什么”证据包说明“为什么这样改、验证了什么、还有什么风险”。人类不必从零审查而是基于证据包做风险判断。
RELATED

相关推荐

SIM820X-M2 5G HAT OpenWrt软路由器——安装MySQL(三)问题记录

SIM820X-M2 5G HAT OpenWrt软路由器——安装MySQL(三)问题记录

问题一:只读文件系统错误描述:这表示文件系统以只读方式安装,从而阻止了软件包安装所需的任何写入操作。解决办法:要将文件系统重新挂载为读写,可以使用以下命令:mount -o remount,rw /成功!问题…

📅 2026/9/16 9:49:45
MCP协议:AI工具互联互通的标准解决方案

MCP协议:AI工具互联互通的标准解决方案

1. MCP协议:AI工具互联互通的"普通话"去年在调试一个多AI协作系统时,我遇到了工具链整合的噩梦——每个模型都需要单独对接API,参数格式千奇百怪,光是处理不同服务的错误码就耗掉两周。直到发现Anthropic推出的MCP协议&…

📅 2026/9/16 9:49:07
深入解析C2000 eQEP模块:正交编码器硬件解码与高精度运动控制

深入解析C2000 eQEP模块:正交编码器硬件解码与高精度运动控制

1. 项目概述与核心价值在伺服电机、工业机器人或者高精度数控机床的研发调试过程中,你是否曾为如何精确、实时地获取电机转轴的位置和速度信息而头疼?面对编码器输出的两路看似简单的方波信号,软件解码不仅占用宝贵的CPU资源,在高…

📅 2026/9/8 11:37:13
MORE NEWS

更多资讯

📰

低成本树莓派机器人:40元打造智能机械爪

1. 项目概述:低成本打造智能机器人助手去年夏天,我在工作室角落发现一堆闲置的树莓派和舵机,萌生了搭建低成本机器人助手的想法。经过两周的调试优化,最终用不到40元的附加成本实现了具备基础交互能力的OpenClaw机器人系统。这个方…

📰

Qt aarch64静态交叉编译实战:从环境搭建到产线部署

1. 这不是“装个Qt”那么简单:为什么aarch64静态交叉编译必须从零搭起你搜“Qt aarch64 交叉编译”,页面上全是零散的命令片段、报错截图和半截配置——有人卡在libxcb找不到,有人死在-fPIC警告里,更多人反复重装Ubuntu虚拟机&…

📰

Colibri:用C语言+NVMe实现MoE大模型边缘推理

1. 项目概述:Colibri不是“降级妥协”,而是重新定义大模型推理的物理边界你有没有试过在一台没有RTX 4090、甚至没有独立显卡的机器上,跑一个参数量超过100B的MoE大模型?不是量化到4bit、不是只跑单个专家,而是真正激活…

📰

AI学术写作工具评测与使用指南

1. 学术写作痛点与AI润色工具的崛起学术写作向来是研究者面临的最大挑战之一。我至今记得第一次投稿国际期刊时,审稿人那句"语言表达不够学术化"的评语让我整整修改了半个月。传统润色服务价格昂贵(每千字约$100-$300),…

📰

Wazuh部署避坑指南:从单机到分布式的完整实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

双馈风机调频系统建模与虚拟惯量控制策略

1. 双馈风机调频系统概述在电力系统频率调节领域,双馈感应发电机(DFIG)因其优异的动态性能已成为现代风电场的主流机型。传统同步机组通过转子惯量自然参与系统频率响应的机制,在风电渗透率不断提高的背景下正面临严峻挑战。三机九…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬