尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
PostHog Signals Scout 健康与性能评估指南:基于运行窗口的五维诊断法
PostHog Signals Scout 健康与性能评估指南基于运行窗口的五维诊断法【免费下载链接】posthog:hedgehog: PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, experiments, error tracking, logs, and more – capture all the context agents need to diagnose problems, uncover opportunities, and ship fixes. Steer it all from Slack, web, desktop, or the MCP.项目地址: https://gitcode.com/GitHub_Trending/po/posthog在 PostHog 的 Signals 体系中scout侦察代理是周期性唤醒、扫描项目并把真正值得关注的内容写成 inbox 报告的调度式 Agent。判断一个 scout 是否健康并没有单一数字指标——它的职责是大多数时候保持安静开口时足够准确因此什么都没写往往恰恰是正确的表现。本文基于仓库内exploring-scouts技能集的评估手册assessing-performance.md系统讲解如何在一次运行窗口window of runs上从节奏符合度、成功率、报告产出率、信噪比、记忆增长五个维度诊断 scout 的健康状况并给出每个异常模式对应的排查路径与修复归属读完即可对任意一个signals-scout-*侦察代理完成一次完整的健康体检。评估的前提认知为什么安静不是故障评估 scout 之前必须先接受两条设计前提沉默是默认行为scout 被设计为只在越过较高报告门槛时才写作报告多数运行合法地以空结果收场。一个朴素地认为它什么都没写 坏了的视角会把正常表现误判为故障。必须跨窗口评估单次运行说明不了问题。只有拉取一段时间的运行记录才能区分真安静与坏了。因此评估动作分两步走先拉取评估窗口再逐维度推理。第一步拉取评估窗口数据评估的原始数据来自scout-runs-list按以下参数限定窗口示例见评估手册原文scout-runs-list { skill_name: signals-scout-error-tracking, date_from: 2026-05-01T00:00:00Z, limit: 100 }skill_name将窗口限定到单个 scout省略则拉取整个舰队fleet的运行。date_from/date_toISO-8601 时间窗date_to为开区间created_at上可不断回传更早的date_to向前翻页。limit列表端点单次上限 100 行且返回顺序为全舰队最新优先。emitted过滤器emittedtrue只返回至少撰写过一篇报告的运行emittedfalse只返回什么都没写的运行——注意只编辑过报告的运行会按emittedfalse计。窗口内每一行的关键读取字段是summaryscout 自己的收尾叙述与失败运行上的failure_reason一行式失败原因摘要。scout 学到的记忆来自scout-scratchpad-search跨运行的持久记忆。评估手册特别提醒两类旁路数据每条运行都携带emitted_report_ids/edited_report_ids因此报告产出量可以直接从运行行读出来无需解析 proseinbox-reports-list { source_product: signals_scout }能列出舰队浮出水面的全部报告。运行记录与 inbox 列表必须对读前者回答scout 写了多少次后者回答这些输出在用户侧长什么样。维度一节奏符合度Cadence Adherence——它是否按计划运行方法对比相邻两次运行的started_at时间戳间隔与配置中的run_interval_minutes滚动间隔对配置了run_cron_schedule的 scout则与其 cron 槽位对比——这类 scout 的间隔天然不规则例如仅工作日运行的 scout 会跳过周末因此脚本 assess_health.py 会为其跳过基于间隔的评分cadence 列显示为cron。判定大致按计划运行 健康。持续出现大间隔意味着协调器coordinator没有按配置频率派发它。大间隔时的排查清单检查配置行enabled——被暂停的 scout 永远不会运行确认项目仍处于signals-scout功能开关的允许名单enrollment中——项目被移出名单后配置行仍是enabled: true但协调器不再为其规划运行记住繁忙 tick 有上限——存在大量逾期 scout 的团队部分 scout 可能延迟运行。从数据模型文档scout-data-model.md可知协调器的派发机制周期性的 Temporal 协调器约每 30 分钟 tick 一次对每个已注册团队按最逾期优先派发所有到期且启用的 scout每个 tick 有数量上限。滚动间隔下到期指last_run_at is None或now - last_run_at run_interval_minutescron 调度下到期指last_run_at、上次调度编辑、创建时间三者的最晚者之后的第一个槽位。没有采样——到期、启用、已注册的 scout 一定会跑。此外要区分两种间隔大如果配置的last_run_at也很陈旧说明协调器停止规划它如果last_run_at很新但最新运行行是几小时前的说明是正在派发但未执行worker 积压/宕机运行被搁置——这是runs-list单独看不出的可靠性问题。脚本 assess_health.py 中STALL_FACTOR 2.0即间隔超过预期间隔 2 倍即记为一次停滞stall并会对dispatch stamp 领先实际运行超一个间隔的情况单独给出DISPATCHING BUT NOT RUNNING标记。维度二成功率Success Rate——运行是否干净完成方法统计窗口内干净完成completed与failed运行的数量并按failure_reason对失败分组。同一种原因反复出现过期的凭据、被重命名的表与零散的超时是两类不同的问题。用时长区分失败模式失败前运行了约15 分钟每次运行的预算参考 scout-data-model.md 中failed状态说明→超时很快死掉的失败 → 更可能是真的坏了。关于超时需要双重理解多数超时是过度调查scout 一路查到预算墙。这在日志、错误追踪等高流量表面上常见且半预期舰队会通过写tight-run recipe紧凑运行配方的 scratchpad 条目自我纠正但也存在假超时scout 几分钟就完成了随后运行挂在一次被丢弃的收尾close-out上。不要仅凭时长推断过度调查。失败熔断器failure breaker连续的计划内失败达到阈值后scout 会被系统以pause_reasonrepeated_failures暂停。阈值是12 小时内其调度能容纳的运行次数 1并钳制在5–25之间日频为 5、滚动小时间隔为 13、小时级 cron 为 15cron 槽位按 DST 填充后的窗口计数。协调器每天对其探测一次探测成功即恢复——因此已修复的根因会自动清除暂停除非项目已达启用 scout 上限此时干净探测后行仍保持paused_by_system。手动触发与工作流触发的失败不计入连续失败计数任何来源的干净运行都会清零该计数。诊断路径先读失败运行的failure_reason与error字段——它们自带诊断结论与完整错误文本需要查看调用序列时再读 transcript打开task_url或通过tasks-runs-session-logs-retrieve以数据形式拉取取完整日志limit: 5000用offset翻页直到某页为空——默认每页 100 条且字节上限可能提前截断一页捆绑脚本 render_run_report.py 负责从tool_call_update分块重组工具输入因此这些分块不能被排除工具调用一直持续到预算墙 → 真实过度调查预算墙之前很久就沉默 → 假超时查询工具报错、body 引用了已不存在的 event/表、或表面 schema 变更导致的快速失败 →作者侧修复交给authoring-scouts火线表面firehose上反复出现过度调查超时 → body 过于宽泛需要更廉价的判别器同样属作者侧修复。维度三报告产出率Report Rate——它多久开口一次方法在完成的运行中有多大比例撰写或编辑了报告而非空收尾直接读每条运行的emitted_report_ids/edited_report_ids或用runs-list?emittedtrue/?emittedfalse切分窗口后比较计数记住仅编辑的运行按emittedfalse计。判定基准必须对照表面surface来判断而不是抽象地看——大多数健康 scout 很少写作在安静、成熟的项目上几乎每次运行合法地空收尾。测量型 scoutmeasurement scout的特殊处理配置携带structured_output_schema的 scout其产出是记录流record stream正常运行时不上报报告是设计行为接近零的报告率不说明健康问题。评估它要看记录运行是否携带metadata.derived.has_structured_output以及$scout_structured_output事件是否以预期量与节奏到达。异常判定长时间窗口内接近零要么被监视的表面确实安静用scout-project-profile-get确认——该表面是否真的在用要么 scout 的信噪判别器过严。读几条运行 summary若 scout 反复写看到了 X 但低于阈值说明门槛可能过高接近 100%scout 太吵了——判别器没有把基线baseline与异常分开。下游预期会出现大量被抑制suppressed或被驳回dismissed的报告对应维度四。两类修复都是作者侧改动重新调校判别器 / 阈值 / 排除规则 disqualifiers。维度四信噪比Signal-to-Noise——输出是否值得方法在 scout 写出的内容中多少是可行动的多少被抑制或当作噪声驳回emitted_report_ids列出每条撰写的报告——通过inbox-reports-retrieve解析并读取状态一条存活的、未被抑制的、被人采取行动的报告 命中被抑制或被驳回的 噪声。inbox-reports-list { source_product: signals_scout }提供舰队级视图——将其状态与写作量交叉核对并读运行 summary 加 scratchpad 获取定性画面健康 scout 的 summary 描述的是审慎、校准过的报告scratchpad 会随学习积累dedupe:/noise:/addressed:/report:条目记录什么不该重复上报。噪声诊断如果 summary 显示同一件事被反复上报或 scratchpad 缺少针对已标记事项的report:/dedupe:条目说明其去重记忆没有生效——这是对 save-memory 与 disqualifier 部分的作者侧修复。维度五记忆增长Memory Growth——它是否在学习方法运行过很多次的 scout 应当积累pattern:基线、noise:、dedupe:等 scratchpad 条目。搜索 scratchpad观察created_by_run_id与时间戳。诊断多次运行后 scratchpad 仍为空 → scout 没有内化所见每次运行都从冷启动重新推理容易重复上报。body 的 save-memory 引导可能太弱——作者侧修复。从 scout-data-model.md 的 scratchpad 一节可知条目 key 自带类别前缀pattern:基线、watch:跟踪中的活跃问题仍低于报告门槛、followup:验证探针、noise:忽略、addressed:已修复/已翻篇、dedupe:重报闸门、allowlist:永不重提、not-in-use:、mcp-gap:、report:已撰写报告的report_id、reviewer:缓存的负责人等。前缀词汇表是开放的scout 可自造前缀遇到陌生前缀当作另一类别即可条目之间用[[key]]维基链接互引。综合判断健康 scout 长什么样健康 scout 的画像见评估手册Putting it together运行按节奏落地几乎全部干净完成绝大多数运行空收尾稀少的报告大多作为可行动内容存活scratchpad 随时间增长pattern:/noise:/dedupe:条目。不健康 scout 的四种典型频繁报错 → 坏了读 transcript 确认报告洪流且大多被抑制 → 太吵重新调校在 profile 显示活跃的表面上彻底沉默 → 太严重新调校运行很多却无记忆增长 → 没在学习。测量型 scout 的变体在它身上彻底沉默要从记录而非报告上读取——报告侧的沉默是健康的真正值得调查的形态是调度保持而事件流变稀。单次has_structured_output为 false 不算数——空的可观测窗口正是其设计的提前收尾先确认人群population确实存在再下死了的结论要针对反复出现的无法解释的零值采取行动而不是单次零值。当诊断指向 scout 的指令本身判别器、阈值、排除规则、save-memory、调度、姿态 posture时探索到此为止接下来进入创作阶段——交接给authoring-scouts技能SKILL.md它覆盖测试循环与scout-config-update。配套自动化assess_health.py 一键体检评估手册所述的五维评估已被纯格式化脚本 assess_health.py 实现其 docstring 明确说明这是五维健康手册cadence adherence、success rate、report rate、run duration、memory growth的落地。脚本不做任何网络 I/O遵循Agent 用call --json拉数据落盘、脚本格式化的分工# 先分别用 call --json 拉取并落盘 # call --json scout-runs-list { limit: 100, date_from: ISO } - runs.json # call --json scout-config-list {} - cfg.json # call --json scout-scratchpad-search {} - mem.json python scripts/assess_health.py --runs runs.json --config cfg.json \ --scratchpad mem.json --now current-ISO-time [--skill signals-scout-general]要点对应源码实现--config提供每个 scout 的预期run_interval_minutes以打分节奏符合度带run_cron_schedule的 scout 标记为cron并豁免间隔类 flag源码中intervals字典对 cron scout 置None--now启用距上次运行多久的陈旧度staleness判断并区分dispatch_stale_min派发时间戳与run_stale_min实际执行时间进而暴露正在派发但未执行--scratchpad提供记忆增长信号通过created_by_run_id将条目归属到 scout缺省时记忆列显示n/a且不触发记忆类 flag报告率直接读运行行的emitted_report_ids/edited_report_ids因此精确——但它只统计写入信噪比要结合inbox-reports-list的报告状态判断输出含worth a look区段自动标记全部运行失败的 scout、超时形失败TIMEOUT_MINUTES 14.0分钟、节奏停滞间隔 2 倍预期、陈旧、空 scratchpad。同一技能集还捆绑了 fleet_survey.py舰队一览表逐 scout 展示调度/姿态/最近运行/最近结果与 render_run_report.py单次运行深挖含工具调用时间线重组。评估时的数据模型速查评估全程涉及的字段与语义定义在 scout-data-model.md 中有完整表格核心速查如下SignalScoutConfigscout-config-listenabledfalse 暂停、statusactive/pending_pause/paused_by_system/paused_by_user、pause_reasonno_output/ignored/repeated_failures、consecutive_failure_count、emitfalse dry-run运行但不写 inbox、run_interval_minutes30–43200默认 1440、run_cron_schedule设置时优先于间隔、structured_output_schema、last_run_at派发时间戳非执行证明。SignalScoutRunscout-runs-list/-retrieverun_id传给runs-retrieve时参数名是id而非run_id、statusnot_started/queued/in_progress/completed/failed/cancelled、started_at/completed_at、emitted_report_ids/edited_report_ids、metadata.derived布尔集has_emit_report/has_edit_report/has_self_improvement/has_chart/has_self_validation/has_structured_output、summary、error、failure_reason、task_url。运行状态语义completed且空收尾 健康的安静运行而非失败failed且时长 ≈ 15 分钟预算 超时cancelledworker 关闭/部署与 scout 无关不计入失败熔断器。SignalProjectProfilescout-project-profile-get项目的确定性快照在用的产品、集成、信号源配置、top events 等是每个 scout 冷启动的 ground truth——解释安静时先查它profile 显示不存在的表面无日志、无 LLM 事件上安静运行是正确的。exploring-scouts整体是只读技能见 SKILL.md——评估、诊断、交接是它的边界一旦判定需要改判别器、阈值、排除规则、save-memory、调度或姿态请转向authoring-scouts完成写操作。常见误区速查表象正确解读emitted_count: 0不等于没干活——这是遗留信号通道字段报告通道 scout 上恒为 0看报告 id 列空收尾运行成串舰队在正常履职不是坏了failed且跑了 ~15 分钟大概率超时过度调查先看failure_reason而非只凭时长last_run_at: null协调器从未派发过不等于从未运行手动/工作流触发不更新该戳先查scout-runs-listenabled: true但emit: false活着且在推理只是不允许发报告——我的 scout 什么都没做最常见的原因运行秒死更可能是真坏凭据过期、表/事件被删、schema 变更——作者侧修复测量型 scout 报告率为零设计行为改看$scout_structured_output事件流把上述五个维度放在一个运行窗口上读完配合 assess_health.py 的表格输出与worth a look标记你就能稳定地回答那个最常被问起的问题——我的 scout 到底是在工作还是在装死【免费下载链接】posthog:hedgehog: PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, experiments, error tracking, logs, and more – capture all the context agents need to diagnose problems, uncover opportunities, and ship fixes. Steer it all from Slack, web, desktop, or the MCP.项目地址: https://gitcode.com/GitHub_Trending/po/posthog创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

BrewUI:为Homebrew包管理器打造的开源图形界面工具

BrewUI:为Homebrew包管理器打造的开源图形界面工具

如果你是个用 macOS 做开发或日常办公的人,大概率被 Homebrew 这个包管理器救过命。brew install一条命令解决依赖,brew update && brew upgrade保持工具链新鲜,但它的默认交互完全活在终端里。命令行用多了,问题就来了&a…

📅 2026/9/19 10:58:23
数字集成电路期末复习:题型背后的三大核心能力图谱

数字集成电路期末复习:题型背后的三大核心能力图谱

简介:本资源是一份面向高校电子工程、微电子及相关专业本科生的数字集成电路课程期末复习资料,聚焦典型题型与核心考点精练,助力考前系统梳理与应试强化。文件为单页PDF(74KB),内容涵盖填空、电路设计、时序…

📅 2026/9/19 10:53:23
Win10原版镜像安全获取指南:官方下载渠道与校验方法

Win10原版镜像安全获取指南:官方下载渠道与校验方法

先说一个现象:只要你在搜索引擎里敲“Win10原版系统下载”,翻两三页能看到十几个“装机版”“纯净版”“旗舰版”站点,点进去基本都是一个套路——百度网盘链接,解压密码在网页广告里,镜像包里要么预装全家桶&#xff…

📅 2026/9/19 10:53:23
MORE NEWS

更多资讯

📰

区块链运营计划书:从链上假设到可验证闭环

简介:这是一份区块链项目运营计划书文档,定位在互联网与数字经济交叉领域,适合区块链创业者、项目运营人员、投资分析师以及需要撰写项目方案的学生参考。文档仅一个PDF文件,压缩包大小为1.12MB,但内容框架完整&#x…

📰

ERP信息化实施方案:从数据准备到系统切换的完整路径

简介:这套ERP信息化资料以一份完整的ERP系统实施方案为主体,面向企业信息化负责人、ERP实施顾问及项目管理人员,用于指导ERP项目从目标设定、效益预估到组织分工、阶段推进与上线切换的全过程落地。压缩包内共1个doc格式文档,整体…

📰

AI Agent 驱动 Unity 命令行编译与自动化测试的完整实践指南

如果你的工作里既有 Unity 项目,又用得上 AI Agent,那么“让 Agent 自己调 Unity 编辑器编译、跑测试”这个需求早晚会找上门。前段时间我在自己的工具链项目里把这个闭环彻底打通了,过程说不上轻松,Unity 的命令行模式向来不是给…

📰

通达信真实资金流指标源码与实战应用指南

简介:本资源是一份面向股票量化分析初学者与通达信公式开发者的技术文档,聚焦真实资金流建模与主力行为识别,解决传统技术指标对资金博弈本质刻画不足的问题。文档完整呈现一套可直接导入通达信的附图指标源码,涵盖主力筹码估算、…

📰

MiroFish多智能体仿真:群体智能预测引擎拆解与实战

你拿同一句话去问同一个大模型三次,会得到三个版本的"预测",而且每一个都言之凿凿、逻辑自洽。这不是模型不靠谱,是你的用法本身就有结构性缺陷——你只问了它一次。真实的判断从来不是一个人拍脑袋得出的,而是几万个人…

📰

BrewUI 图形化指南:让 macOS 包管理器 Homebrew 不再吓人

如果你也是 macOS 用户,大概率绕不开 Homebrew 这个名字。它是 macOS 上最主流的包管理器,装开发工具、装命令行软件、装各种应用,全靠它。但问题恰恰出在这里——Homebrew 是纯命令行的,很多朋友一看到终端黑框就头大&#xff0c…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬