尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Agent 评测别把「调优 Loop」 跑成「刷题 Loop」
创作型 Agent 的评测不能只盯固定 benchmark。更可靠的做法是用 Scenario Model 每轮生成样本外任务再让 baseline 和 candidate 在同一批新题上做配对比较。导语Agent 系统最容易让团队产生安全感的东西是一条向上的 ​benchmark 曲线​。今天 72 分下周 81 分再过两周 89 分。看起来系统在变强prompt 更稳工具调用更准失败 case 越来越少。但这里有个不舒服的问题它是真的更会做新任务了还是只是越来越熟悉那套题对创作型 Agent 来说这个问题尤其危险。这类 Agent 不是回答标准题而是在开放创作空间里完成任务。用户的需求会换场景、换素材、换约束、换验收标准。固定 benchmark 能帮你挡回归却不能长期证明 ​泛化能力​。图分数上涨不等于新任务能力上涨问题不在 Agent 会不会循环而在团队怎么调系统很多人说 Agent Loop指的是单次任务里的循环理解目标 - 调工具 - 观察结果 - 修正 - 再执行这很重要但评测体系里还有一层更关键的 loop跑 benchmark - 看失败 case - 改 skill / tool / schema / prompt / evaluator - 再跑 benchmark这才是系统优化循环。一个创作型 Agent 的表现通常不是由模型单点决定的。它背后有工具、编辑器能力、schema、资源库、模板、skill、retry 策略和 evaluator。团队每次看到失败 case 后都会改一点系统。问题也出在这里。当固定 benchmark 反复参与这个优化循环它就不再只是测试集而开始变成 ​训练信号​。这里的训练不一定是模型训练也可能是工程层面的适配。比如某个失败 case 被写进 skill某类工具调用被特殊加强某个 evaluator 偏好反过来塑造 executor 输出。几轮之后系统确实更会做这套题了但这不等于更会处理新的创作请求。这就是 Benchmark Loop。固定题有价值但别让它背两个职责固定 benchmark 不是错。它很适合回答一个问题已知能力有没有退化某个工具之前能不能调用某个已修 bug 有没有复现某条高频路径是否仍然稳定这些都应该用固定集看。因为题目不变跨轮比较才有意义。问题在于很多团队会让固定集同时承担第二个职责证明系统泛化能力提升。这就麻烦了。评测职责固定 benchmark 是否适合原因回归防护适合题目固定能跨轮比较已修问题复测适合可以确认 bug 是否复现泛化能力证明不适合单独承担长期参与优化后会被污染新任务适应性不适合单独承担用户需求空间远大于固定题库Goodhart 定律在这里很直接当 benchmark 分数变成目标它就不再只是质量代理指标。测试集污染也不只发生在模型训练语料里。Agent 系统的污染常常发生在 prompt、skill、tool 和 evaluator 这些工程层。不要拿练习册原题考试可以把创作型 Agent 想象成一个正在学复杂创作软件的人。固定 benchmark 是练习册。练习册能帮他掌握基础动作但考试不能永远考原题。否则你看到的是记忆而不是能力。更合理的方式是保留固定题检查基础能力有没有退化。每轮根据真实任务空间生成一批新题。baseline 和 candidate 在同一批新题上同时跑。逐 case 比较谁做得更好。有价值的新题经过 review 后再考虑进入长期回归集。这套方法的核心是把固定题和新题的职责分开。固定题守底线。新题测泛化。图固定题守底线轮换题测泛化Scenario Model维护出题模型而不是只维护题库如果每轮都要有新题题从哪里来不能让 LLM 随机编一批 prompt。那样会生成很多坏题需求不自然、验收标准不清、要求产品做不到的能力或者内部 metadata 直接泄露给 executor。需要维护的是 Scenario Model也就是场景模型。它建模的不是物理世界而是创作任务空间用户会提出什么样的需求这些需求会覆盖哪些工具能力、编辑器 schema、素材资源、项目结构、运行时行为和验收标准。Scenario Model 的输入可以包括真实用户请求分布常见创作任务类型已有评测 casetool 能力与 schemaasset catalog 和 template历史失败样本产品当前重点方向它输出的不是新的长期题库而是每一轮评测开始时冻结的一批 Rotating Evaluation Set。Rotating Set同轮配对跨轮不硬比新题带来一个现实问题每轮题都不一样分数怎么比答案是不要直接比较不同轮次的绝对分。要比较同一轮里 baseline 和 candidate 在同一批新题上的表现。流程可以这样设计图同一批新题内比较 baseline 与 candidate配对比较比绝对分更重要。CaseBaselineCandidate判断AFailPass候选版本改善BPassPass持平CPassFail候选版本退化DFailFail共同能力缺口如果 candidate 在同一批新任务上明显多赢、少退化才有理由说这轮系统改动提升了样本外能力。第 N 轮 70 分和第 N1 轮 75 分不能硬比。因为两轮任务的难度、长尾能力比例、素材组合和交互复杂度可能完全不同。轮内复用保证公平跨轮不复用保证样本外性。生成式评测也要治理Scenario Model 不是免费午餐。它会生成坏题。有些失败不是 Agent 不会做而是 case 本身不成立prompt 有歧义验收标准前后矛盾要求超出产品能力或者 schema 组合非法。所以 Scenario Model 自己也要被评测。一个关键指标是 ​Invalid Case Rate​也就是无效用例率。无效 case 应该从分母里剔除并进入出题模型改进而不是被当成 Agent 能力缺口。更重要的是rotating failure 不应该立刻进入 autoloop。否则新题很快又会被污染成训练信号。更稳的流程是先诊断失败是系统问题还是题目问题。有效失败再进入人工 review。只有代表真实能力缺口的 case才能 promotion 到固定回归集、skill 改进或 tool 改进。promotion 时最好重投影 prompt替换措辞、素材和非核心参数避免系统记住原题 wording。三层评测分工最终创作型 Agent 的评测体系应该拆成三层层级回答的问题使用方式Fixed Regression Set已知能力有没有退化固定不变跨轮可比Rotating Evaluation Set本轮系统改动是否提升样本外能力每轮生成同轮配对Scenario Model Quality出题模型是否可靠看无效率、覆盖率和自然度这三层缺一不可。只看固定集容易刷题。只看新题难以守住已知能力。只生成新题但不治理出题模型又会被坏题拖偏。结语Agent 系统分数上涨不一定代表系统变强。它可能只是越来越会做那批固定题。真正值得相信的评测不该只问系统有没有把 benchmark 跑高而要问这轮 prompt、skill、tool、schema、retry 或 evaluator 的改动是否让 Agent 在新的、自然的、真实感足够强的任务上做得更好。固定集守住过去轮换集检验未来。对会持续自我调优的 Agent 系统来说这个区分比漂亮的分数曲线更重要。推荐阅读代码不是 AI 编程的最终资产AI Coding 真正该存的是 CheckpointRAG 找不到答案时别急着怪模型不如试试 SAG 知识库Agent 从上手到精通打造有记忆的个人智能体Agent Memory 架构拆解别再把向量库当唯一记忆系统Hermes Skill Runtime 架构拆解三层加载如何压住 Agent 上下文成本
RELATED

相关推荐

Kimi K3 发布当天,我拿它和 GPT-5.6-Luna、Claude Sonnet 5 跑了 5 轮硬核编程题——有一类多步推理任务排名和官方宣传完全反过来

Kimi K3 发布当天,我拿它和 GPT-5.6-Luna、Claude Sonnet 5 跑了 5 轮硬核编程题——有一类多步推理任务排名和官方宣传完全反过来

上周三 Kimi K3 发布,朋友圈被刷屏了。Moonshot 官方宣传说"推理能力大幅跃升",我当天晚上就把 moonshotai/kimi-k3、openai/gpt-5.6-luna、anthropic/claude-sonnet-5 三个模型拉到同一套测试框架里跑了一遍。结论先放这儿:在单步…

📅 2026/9/25 16:56:41
AI落地失败,最大的变量不是技术,而是组织

AI落地失败,最大的变量不是技术,而是组织

过去,一个岗位对应一个人。未来,一个岗位,对应的是“人 Data Agent”共同协作。最近两年,AI以前所未有的速度进入企业经营,企业投入持续加码,但真正见到实效的却凤毛麟角。问题究竟出在哪儿?近…

📅 2026/9/25 16:56:49
MiniMax市值缩水3000亿港元,从明星公司到普通上市企业,能否重回千亿市值?

MiniMax市值缩水3000亿港元,从明星公司到普通上市企业,能否重回千亿市值?

【MiniMax股价暴跌,市值缩水超3000亿港元】上市半年的MiniMax,股价经历了一轮过山车走势,从4000亿港元到不足1000亿港元。7月21日收盘,MiniMax股价报收222.4港元,总市值776.7亿港元。半年前的1月9日,公司在…

📅 2026/8/24 1:26:44
MORE NEWS

更多资讯

📰

Flecs 层级系统(Hierarchies)完全指南:ChildOf 与 Parent 两种存储、递归遍历与查询优化

游戏开发 【免费下载链接】flecs A fast entity component system (ECS) for C & C 项目地址: https://gitcode.com/gh_mirrors/fl/flecs 点击查看 免费下载 层级结构是 Flecs 这个 C/C ECS(Entity Component System)引擎中最常用的组织…

📰

VoltAgent Working Memory 实战指南:跨会话持久化 Agent 上下文的三格式配置与源码解析

人工智能AI AgentAgent 框架后端多智能体RAG工具调用Agent 记忆 【免费下载链接】voltagent AI Agent Engineering Platform built on an Open Source TypeScript AI Agent Framework 项目地址: https://gitcode.com/gh_mirrors/vo/voltagent 点击查看 免费下载 Wo…

📰

Atlas 300V 24G加速卡与YOLOv8部署实战

最近总有人私信问我关于“atlas”的问题,点开一看大多是两个:“atlas部署yolo”到底难不难,以及“atlas 300v 24g 是运算加速卡吗”。这两个问题放在一块问,其实说明很多人对这把利器有误解。我上个月刚用一张Atlas 300V 24G推理卡…

📰

PaddleNLP `chat_template` 多轮对话精调实战:从配置构造、数据流到训练全流程解析

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 多轮对话精调(Mu…

📰

【方法篇07】BP神经网络:C与MATLAB双实现及效能评估(附源码)

目录 一、前言 二、BP神经网络运行流程 三、样本数据 四、C语言实现 4.1 核心设计思路 4.2 完整代码 4.3 关键实现细节 五、MATLAB实现 六、C与MATLAB实现对比 七、模型评价与改进方向 7.1 当前模型表现 7.2 局限性 7.3 改进建议 八、总结 九、勘误及更新说明 一…

📰

MCP 协议实战(下):JSON-RPC 机制拆解与面试高频考点

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬