<?xml version="1.0" encoding="utf-8"?><?xml-stylesheet type="text/xsl" href="rss.xsl"?>
<rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/">
    <channel>
        <title>wbsxhh 的 blog Blog</title>
        <link>https://wbsxhh-blog.pages.dev/blog</link>
        <description>wbsxhh 的 blog Blog</description>
        <lastBuildDate>Mon, 10 Aug 2026 00:00:00 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>https://github.com/jpmonette/feed</generator>
        <language>zh-Hans</language>
        <item>
            <title><![CDATA[SRE Agent 构建思考：从行业调研到编排落地]]></title>
            <link>https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking</link>
            <guid>https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking</guid>
            <pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[基于排障 Agent 建设方案讨论、L1 演进问题与编排流程分析整理。]]></description>
            <content:encoded><![CDATA[<blockquote>
<p>基于排障 Agent 建设方案讨论、L1 演进问题与编排流程分析整理。</p>
</blockquote>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="要解决什么问题">要解决什么问题<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E8%A6%81%E8%A7%A3%E5%86%B3%E4%BB%80%E4%B9%88%E9%97%AE%E9%A2%98" class="hash-link" aria-label="要解决什么问题的直接链接" title="要解决什么问题的直接链接" translate="no">​</a></h2>
<p>告警响应的现状：oncall 收到告警后，需要登录多个系统拉取上下文（监控指标、日志、最近发布、配置变更、服务依赖），判断影响范围，定位根因，执行修复。这个过程依赖工程师的经验和对系统的熟悉程度，新人和老手之间的效率差距可以是数倍。</p>
<p>排障 Agent 的目标是把 <strong>Observe 阶段</strong>——收集上下文、关联信号、生成初步假设——自动化，让每个 oncall 工程师都能快速获得资深工程师级别的初步分析。</p>
<p>行业成功落地的案例都遵循「AI 调查 + 建议，人审批执行」的模式。</p>
<!-- -->
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="行业三种架构路线">行业三种架构路线<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E8%A1%8C%E4%B8%9A%E4%B8%89%E7%A7%8D%E6%9E%B6%E6%9E%84%E8%B7%AF%E7%BA%BF" class="hash-link" aria-label="行业三种架构路线的直接链接" title="行业三种架构路线的直接链接" translate="no">​</a></h2>
<p>调研覆盖了 Datadog、Grafana、Komodor、Dash0、字节跳动、Azure 等 20+ 家公司的 SRE AI Agent 实践，按架构可归为三种模式。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="模式-a单-agent--假设驱动">模式 A：单 Agent + 假设驱动<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E6%A8%A1%E5%BC%8F-a%E5%8D%95-agent--%E5%81%87%E8%AE%BE%E9%A9%B1%E5%8A%A8" class="hash-link" aria-label="模式 A：单 Agent + 假设驱动的直接链接" title="模式 A：单 Agent + 假设驱动的直接链接" translate="no">​</a></h3>
<p>代表：<a class="" href="https://wbsxhh-blog.pages.dev/docs/research/datadog-bits-ai">Datadog Bits AI</a>。</p>
<p>告警触发后，单个 Agent 生成多个根因假设，逐个定向验证，验证通过的假设继续深挖子假设，形成递归调查链。早期版本一次性查看所有遥测数据，12+ tool calls 产生矛盾信号，效果很差；改为假设驱动后准确率显著提升。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="模式-b多-agent-并行调查">模式 B：多 Agent 并行调查<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E6%A8%A1%E5%BC%8F-b%E5%A4%9A-agent-%E5%B9%B6%E8%A1%8C%E8%B0%83%E6%9F%A5" class="hash-link" aria-label="模式 B：多 Agent 并行调查的直接链接" title="模式 B：多 Agent 并行调查的直接链接" translate="no">​</a></h3>
<p>代表：Grafana Assistant、Resolve.ai。</p>
<p>多个专业 Agent 同时展开调查（一个查 metrics、一个查 logs、一个查 traces），各自产出带置信度的发现，最后交叉验证合并结论。Grafana 内部实测中，AI 8 分钟定位根因（人工 28 分钟），核心加速来自并行分析多条调查线。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="模式-corchestrator--领域专家-agent推荐">模式 C：Orchestrator + 领域专家 Agent（推荐）<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E6%A8%A1%E5%BC%8F-corchestrator--%E9%A2%86%E5%9F%9F%E4%B8%93%E5%AE%B6-agent%E6%8E%A8%E8%8D%90" class="hash-link" aria-label="模式 C：Orchestrator + 领域专家 Agent（推荐）的直接链接" title="模式 C：Orchestrator + 领域专家 Agent（推荐）的直接链接" translate="no">​</a></h3>
<p>代表：<a class="" href="https://wbsxhh-blog.pages.dev/docs/research/komodor">Komodor</a>、<a class="" href="https://wbsxhh-blog.pages.dev/docs/research/dash0">Dash0</a>、<a class="" href="https://wbsxhh-blog.pages.dev/docs/research/bytedance-sre-agent">字节跳动 SRE-Copilot</a>、Azure Copilot。</p>
<p>一个编排器做意图理解和任务分派，按需调度领域专家 Agent。与模式 B 的区别：B 是同时并行调查，C 是按需调度。</p>
<p><strong>行业共识</strong>：缩小每个 Agent 的作用域能显著降低幻觉率。K8s 问题和数据库问题的排查逻辑完全不同，与其让一个大 LLM 覆盖所有领域，不如把每个 agent 的 scope 缩到足够小。</p>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="分建还是统建">分建还是统建？<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E5%88%86%E5%BB%BA%E8%BF%98%E6%98%AF%E7%BB%9F%E5%BB%BA" class="hash-link" aria-label="分建还是统建？的直接链接" title="分建还是统建？的直接链接" translate="no">​</a></h2>
<p>SA、SRE、DBA、Network 各团队在排障中关注的数据源、排查逻辑、修复手段完全不同。三种方案对比如下：</p>
<table><thead><tr><th>方案</th><th>优势</th><th>问题</th></tr></thead><tbody><tr><td><strong>各自建各自的</strong></td><td>领域深、迭代快、scope 窄准确率高</td><td>跨领域告警无人兜底，技术栈分裂</td></tr><tr><td><strong>统一建一个大 Agent</strong></td><td>天然支持跨领域、体验统一</td><td>context 塞满后幻觉率急剧上升，跨团队协调慢</td></tr><tr><td><strong>统一编排 + 领域专家</strong></td><td>兼顾跨领域与专业化，各团队独立迭代</td><td>需要共建 Orchestrator 和基础框架</td></tr></tbody></table>
<p>推荐 <strong>方案三：统一编排 + 领域专家 Agent</strong>：</p>
<div class="language-text codeBlockContainer_Ckt0 theme-code-block" style="--prism-color:#393A34;--prism-background-color:#f6f8fa"><div class="codeBlockContent_QJqH"><pre tabindex="0" class="prism-code language-text codeBlock_bY9V thin-scrollbar" style="color:#393A34;background-color:#f6f8fa"><code class="codeBlockLines_e6Vv"><div class="token-line" style="color:#393A34"><span class="token plain">                    ┌─────────────┐</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">                    │ Orchestrator │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">                    │  (意图理解    │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">                    │   路由分派)   │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">                    └──────┬──────┘</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">              ┌────────┬───┴───┬────────┐</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">              ▼        ▼       ▼        ▼</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">         ┌────────┐┌───────┐┌──────┐┌─────────┐</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">         │DBA     ││Network││SA    ││SRE      │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">         │Agent   ││Agent  ││Agent ││Agent    │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">         └────────┘└───────┘└──────┘└─────────┘</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">              │        │       │        │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">              ▼        ▼       ▼        ▼</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">         各团队的 MCP Tool Server（封装各自数据源）</span><br></div></code></pre></div></div>
<p><strong>共建层</strong>：Orchestrator、LLM 调用、MCP 协议、上下文管理、安全机制、通用工具（告警历史、发布变更、服务依赖、CMDB）。</p>
<p><strong>各建层</strong>：各领域的 Specialist Agent，包含独立的 tool set 和领域知识。</p>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="关键工程决策">关键工程决策<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E5%85%B3%E9%94%AE%E5%B7%A5%E7%A8%8B%E5%86%B3%E7%AD%96" class="hash-link" aria-label="关键工程决策的直接链接" title="关键工程决策的直接链接" translate="no">​</a></h2>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="1-工具设计比-prompt-工程重要">1. 工具设计比 Prompt 工程重要<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#1-%E5%B7%A5%E5%85%B7%E8%AE%BE%E8%AE%A1%E6%AF%94-prompt-%E5%B7%A5%E7%A8%8B%E9%87%8D%E8%A6%81" class="hash-link" aria-label="1. 工具设计比 Prompt 工程重要的直接链接" title="1. 工具设计比 Prompt 工程重要的直接链接" translate="no">​</a></h3>
<p>Komodor 的经验数据：<strong>20% prompt engineering + 80% custom tools, evals, monitoring</strong>（详见 <a class="" href="https://wbsxhh-blog.pages.dev/docs/research/komodor">Komodor 调研</a>）。每个团队的核心工作量在 MCP tool server 的设计上——工具描述的准确性、输出格式的 LLM 友好性、错误消息的引导性。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="2-查询接口优于原始数据拉取">2. 查询接口优于原始数据拉取<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#2-%E6%9F%A5%E8%AF%A2%E6%8E%A5%E5%8F%A3%E4%BC%98%E4%BA%8E%E5%8E%9F%E5%A7%8B%E6%95%B0%E6%8D%AE%E6%8B%89%E5%8F%96" class="hash-link" aria-label="2. 查询接口优于原始数据拉取的直接链接" title="2. 查询接口优于原始数据拉取的直接链接" translate="no">​</a></h3>
<p>让 Agent 写 SQL / PromQL 在数据源侧完成过滤和聚合，而非把原始数据拉到 context window 里处理。Datadog 实测准确率提升，成本降低约 40%（详见 <a class="" href="https://wbsxhh-blog.pages.dev/docs/research/datadog-bits-ai">Datadog Bits AI 调研</a>）。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="3-token-效率是硬约束">3. Token 效率是硬约束<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#3-token-%E6%95%88%E7%8E%87%E6%98%AF%E7%A1%AC%E7%BA%A6%E6%9D%9F" class="hash-link" aria-label="3. Token 效率是硬约束的直接链接" title="3. Token 效率是硬约束的直接链接" translate="no">​</a></h3>
<ul>
<li class="">表格数据用 CSV 而非 JSON，token 消耗减半</li>
<li class="">嵌套数据用 YAML，token 开销降低约 20%</li>
<li class="">Token-based 分页替代记录数分页</li>
</ul>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="4-假设驱动而非全量扫描">4. 假设驱动而非全量扫描<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#4-%E5%81%87%E8%AE%BE%E9%A9%B1%E5%8A%A8%E8%80%8C%E9%9D%9E%E5%85%A8%E9%87%8F%E6%89%AB%E6%8F%8F" class="hash-link" aria-label="4. 假设驱动而非全量扫描的直接链接" title="4. 假设驱动而非全量扫描的直接链接" translate="no">​</a></h3>
<p>Agent 收到告警后，应该先生成假设（「可能是最近发布导致」、「可能是数据库连接池耗尽」），再针对性查询验证。全量扫描是行业级教训。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="5-领域知识的结构化注入">5. 领域知识的结构化注入<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#5-%E9%A2%86%E5%9F%9F%E7%9F%A5%E8%AF%86%E7%9A%84%E7%BB%93%E6%9E%84%E5%8C%96%E6%B3%A8%E5%85%A5" class="hash-link" aria-label="5. 领域知识的结构化注入的直接链接" title="5. 领域知识的结构化注入的直接链接" translate="no">​</a></h3>
<p>每个团队现有的 runbook 和排障经验是最大的差异化资产。可参考 <a class="" href="https://wbsxhh-blog.pages.dev/docs/research/cleric-ai">Cleric AI 三层记忆系统</a> 的设计思路。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="6-评测体系必须同步建设">6. 评测体系必须同步建设<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#6-%E8%AF%84%E6%B5%8B%E4%BD%93%E7%B3%BB%E5%BF%85%E9%A1%BB%E5%90%8C%E6%AD%A5%E5%BB%BA%E8%AE%BE" class="hash-link" aria-label="6. 评测体系必须同步建设的直接链接" title="6. 评测体系必须同步建设的直接链接" translate="no">​</a></h3>
<p>每个团队收集 10-20 个历史典型告警案例，标注根因和排查过程，作为 benchmark dataset。合成数据不够用，必须用真实 incident。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="7-信任通过透明度建立">7. 信任通过透明度建立<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#7-%E4%BF%A1%E4%BB%BB%E9%80%9A%E8%BF%87%E9%80%8F%E6%98%8E%E5%BA%A6%E5%BB%BA%E7%AB%8B" class="hash-link" aria-label="7. 信任通过透明度建立的直接链接" title="7. 信任通过透明度建立的直接链接" translate="no">​</a></h3>
<p>输出结构建议：What Happened（摘要）+ Related Evidence（证据）+ Suggested Remediation（修复步骤）+ Rejected Alternatives（被排除的方案及原因）。</p>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="实际编排人工动作--agent-链路">实际编排：人工动作 ↔ Agent 链路<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E5%AE%9E%E9%99%85%E7%BC%96%E6%8E%92%E4%BA%BA%E5%B7%A5%E5%8A%A8%E4%BD%9C--agent-%E9%93%BE%E8%B7%AF" class="hash-link" aria-label="实际编排：人工动作 ↔ Agent 链路的直接链接" title="实际编排：人工动作 ↔ Agent 链路的直接链接" translate="no">​</a></h2>
<p>落地一个 SRE Agent 后，核心问题是：<strong>人工怎么查 ↔ Agent 哪一轮、哪个 sub-agent、哪类工具在做等价动作</strong>。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="自动编排总览">自动编排总览<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E8%87%AA%E5%8A%A8%E7%BC%96%E6%8E%92%E6%80%BB%E8%A7%88" class="hash-link" aria-label="自动编排总览的直接链接" title="自动编排总览的直接链接" translate="no">​</a></h3>
<div class="language-text codeBlockContainer_Ckt0 theme-code-block" style="--prism-color:#393A34;--prism-background-color:#f6f8fa"><div class="codeBlockContent_QJqH"><pre tabindex="0" class="prism-code language-text codeBlock_bY9V thin-scrollbar" style="color:#393A34;background-color:#f6f8fa"><code class="codeBlockLines_e6Vv"><div class="token-line" style="color:#393A34"><span class="token plain">告警 / CLI / webhook</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        ▼</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">resolve_initial_agent_type  ← classify_alert（metric / 关键词）</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        ▼</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">Orchestrator.investigate</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  ├─ Round 1: 代码构造 seed dispatch（不跑 planner）</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  ├─ Round 2..N: planner 读历史 verdict → dispatch 或 finalize</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  └─ 预算耗尽 / 中断 → synthesis 出 partial 结论</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        │</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">        ▼</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">InvestigationOutcome（summary + planner_verdict + dispatch_results）</span><br></div></code></pre></div></div>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="入口分类选谁做-seed">入口分类：选谁做 seed<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E5%85%A5%E5%8F%A3%E5%88%86%E7%B1%BB%E9%80%89%E8%B0%81%E5%81%9A-seed" class="hash-link" aria-label="入口分类：选谁做 seed的直接链接" title="入口分类：选谁做 seed的直接链接" translate="no">​</a></h3>
<table><thead><tr><th>条件</th><th>首轮 agent</th><th>target_kind</th></tr></thead><tbody><tr><td>接入层 metric / 关键词 + domain</td><td>access</td><td>domain</td></tr><tr><td>日志类 metric / error·panic 关键词</td><td>log</td><td>service</td></tr><tr><td>其余监控指标（默认兜底）</td><td>monitor</td><td>service</td></tr></tbody></table>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="三-agent-职责">三 Agent 职责<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E4%B8%89-agent-%E8%81%8C%E8%B4%A3" class="hash-link" aria-label="三 Agent 职责的直接链接" title="三 Agent 职责的直接链接" translate="no">​</a></h3>
<table><thead><tr><th>Agent</th><th>target_kind</th><th>数据源</th><th>人工对应动作</th></tr></thead><tbody><tr><td>access</td><td>domain</td><td>接入层日志（nginx / gateway）</td><td>看接入大盘、域名 5xx、upstream</td></tr><tr><td>log</td><td>service</td><td>错误日志仓库</td><td>查 error/panic、堆栈、trace 下游</td></tr><tr><td>monitor</td><td>service | component</td><td>PromQL / 监控平台</td><td>查 RED、依赖、PG/Redis/Kafka、节点资源</td></tr></tbody></table>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="通用步骤映射">通用步骤映射<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E9%80%9A%E7%94%A8%E6%AD%A5%E9%AA%A4%E6%98%A0%E5%B0%84" class="hash-link" aria-label="通用步骤映射的直接链接" title="通用步骤映射的直接链接" translate="no">​</a></h3>
<table><thead><tr><th>#</th><th>人工步骤</th><th>Agent 编排对应</th></tr></thead><tbody><tr><td>1</td><td>收报警，看规则、标签、等级</td><td>InvestigationInput + AlertContext</td></tr><tr><td>2</td><td>判断接入层 / 日志 / 指标类</td><td>classify_alert → Round1 seed</td></tr><tr><td>3</td><td>打开大盘：域名/接入 5xx</td><td>access seed / dispatch</td></tr><tr><td>4</td><td>查 error / panic / 超时日志</td><td>log agent</td></tr><tr><td>5</td><td>查服务 RED、依赖、中间件</td><td>monitor + playbook 裁剪</td></tr><tr><td>6</td><td>对照是否在滚动发布</td><td>deploy prefetch + 交叉验证</td></tr><tr><td>7</td><td>锁定下游后继续追</td><td>planner 消费 handoffs + dispatch</td></tr><tr><td>8</td><td>写因果链 / 根因结论</td><td>planner finalize → Outcome</td></tr><tr><td>9</td><td>同步研发、止损、静默、工单</td><td><strong>编排外（人工）</strong></td></tr></tbody></table>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="现象--优先路径速查">现象 → 优先路径速查<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E7%8E%B0%E8%B1%A1--%E4%BC%98%E5%85%88%E8%B7%AF%E5%BE%84%E9%80%9F%E6%9F%A5" class="hash-link" aria-label="现象 → 优先路径速查的直接链接" title="现象 → 优先路径速查的直接链接" translate="no">​</a></h3>
<table><thead><tr><th>报警表征</th><th>优先 seed</th><th>常见下一跳</th><th>人工兜底</th></tr></thead><tbody><tr><td>域名 / nginx 5xx</td><td>access</td><td>monitor（上游）或说明三方</td><td>DNS 切换、换 IP</td></tr><tr><td>服务 HTTP 5xx</td><td>monitor</td><td>log → PG/Redis handoff；对照 deploy</td><td>研发确认、工单</td></tr><tr><td>panic / error 日志计数</td><td>log</td><td>monitor 排除资源</td><td>策略静默、排期修</td></tr><tr><td>业务/中间件 QPS 跌零</td><td>monitor</td><td>对照入口流量是否随动</td><td>策略例外</td></tr><tr><td>疑似发布抖动</td><td>monitor + deploy</td><td>log 伴生错误</td><td>研发确认</td></tr></tbody></table>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="l1-演进三个待解决问题">L1 演进：三个待解决问题<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#l1-%E6%BC%94%E8%BF%9B%E4%B8%89%E4%B8%AA%E5%BE%85%E8%A7%A3%E5%86%B3%E9%97%AE%E9%A2%98" class="hash-link" aria-label="L1 演进：三个待解决问题的直接链接" title="L1 演进：三个待解决问题的直接链接" translate="no">​</a></h2>
<p>实际落地后，L1 阶段暴露出三个关键问题：</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="1-缺少真实反馈闭环">1. 缺少真实反馈闭环<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#1-%E7%BC%BA%E5%B0%91%E7%9C%9F%E5%AE%9E%E5%8F%8D%E9%A6%88%E9%97%AD%E7%8E%AF" class="hash-link" aria-label="1. 缺少真实反馈闭环的直接链接" title="1. 缺少真实反馈闭环的直接链接" translate="no">​</a></h3>
<p>未接入真实报警处理平台的评分/纠错，只能事后手工造评测集。Agent 无法从工程师的实际处置中学习。</p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="2-双报告机制缺失">2. 双报告机制缺失<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#2-%E5%8F%8C%E6%8A%A5%E5%91%8A%E6%9C%BA%E5%88%B6%E7%BC%BA%E5%A4%B1" class="hash-link" aria-label="2. 双报告机制缺失的直接链接" title="2. 双报告机制缺失的直接链接" translate="no">​</a></h3>
<p>缺「时限内短报告」（可点证据链、值班第一眼）与「深度事后长报告」的拆分。现在默认数分钟的完整调查，偏事后分析。</p>
<p><strong>短报告设计</strong>（基于历史优先）：</p>
<ul>
<li class=""><strong>拉历史</strong>：同服务、同策略的近期告警；若有历次调查结论一并挂上</li>
<li class=""><strong>快推理</strong>：是否像已知模式、上次根因与建议是什么</li>
<li class=""><strong>快调查</strong>：只做轻量校验（近发布、关键指标是否仍红）</li>
<li class=""><strong>短报告输出</strong>：结论草案 + 可点证据链 + 标注「沿用历史 / 建议深挖」</li>
<li class=""><strong>升级条件</strong>：无历史、校验失败、低置信或有新变更时，再跑深度长报告</li>
</ul>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="3-同类告警结论未复用">3. 同类告警结论未复用<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#3-%E5%90%8C%E7%B1%BB%E5%91%8A%E8%AD%A6%E7%BB%93%E8%AE%BA%E6%9C%AA%E5%A4%8D%E7%94%A8" class="hash-link" aria-label="3. 同类告警结论未复用的直接链接" title="3. 同类告警结论未复用的直接链接" translate="no">​</a></h3>
<p>相同服务、相同策略触发的告警，根因往往相同，但 agent 仍全量 LLM 推理（约 200s）。应增加「(服务名) + 报警策略组合 key 命中 → 短报告引用历史 + 轻量校验」的快路径。</p>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="agent-已覆盖-vs-编排外">Agent 已覆盖 vs 编排外<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#agent-%E5%B7%B2%E8%A6%86%E7%9B%96-vs-%E7%BC%96%E6%8E%92%E5%A4%96" class="hash-link" aria-label="Agent 已覆盖 vs 编排外的直接链接" title="Agent 已覆盖 vs 编排外的直接链接" translate="no">​</a></h2>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="agent-已覆盖">Agent 已覆盖<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#agent-%E5%B7%B2%E8%A6%86%E7%9B%96" class="hash-link" aria-label="Agent 已覆盖的直接链接" title="Agent 已覆盖的直接链接" translate="no">​</a></h3>
<ul>
<li class="">告警分类与首轮 agent 选择</li>
<li class="">接入 / 日志 / 指标多源取证与结构化 verdict（findings + handoffs）</li>
<li class="">多轮 planner 派发与去重门禁</li>
<li class="">Monitor 按 playbook / seed.intent 裁剪排查路径</li>
<li class="">Deploy 上下文预取，辅助「变更窗口」判断</li>
<li class="">Finalize / synthesis 产出排查摘要与根因候选</li>
</ul>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="编排外人工闭环">编排外（人工闭环）<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E7%BC%96%E6%8E%92%E5%A4%96%E4%BA%BA%E5%B7%A5%E9%97%AD%E7%8E%AF" class="hash-link" aria-label="编排外（人工闭环）的直接链接" title="编排外（人工闭环）的直接链接" translate="no">​</a></h3>
<table><thead><tr><th>动作</th><th>说明</th></tr></thead><tbody><tr><td>拉群、同步研发、口头确认</td><td>滚动发布、第三方、慢 SQL、panic</td></tr><tr><td>策略静默 / 策略例外</td><td>panic、QPS 跌零误报</td></tr><tr><td>DNS 切换、换 IP、LB 摘除</td><td>第三方 504</td></tr><tr><td>SQL 工单、代码排期上线</td><td>慢 SQL、panic</td></tr><tr><td>三方客服 / 白名单</td><td>第三方故障</td></tr></tbody></table>
<p>通知出口可以把结论推给人，但<strong>不替代</strong>上述操作。</p>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="llm-排障的已知局限">LLM 排障的已知局限<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#llm-%E6%8E%92%E9%9A%9C%E7%9A%84%E5%B7%B2%E7%9F%A5%E5%B1%80%E9%99%90" class="hash-link" aria-label="LLM 排障的已知局限的直接链接" title="LLM 排障的已知局限的直接链接" translate="no">​</a></h2>
<p>团队需要了解 LLM 在排障场景下的系统性弱点：</p>
<ol>
<li class=""><strong>因果推断不可靠</strong>：LLM 擅长发现相关性，但在因果方向判断上系统性不可靠（<a class="" href="https://wbsxhh-blog.pages.dev/docs/research/anthropic-sre-agent">Anthropic AIRE 一手经验</a>）。假设驱动 + 工具定向验证是最务实的起步方案。</li>
<li class=""><strong>Postmortem 的 80% 问题</strong>：生成的事后报告 80% 可读、有说服力，但根因分析很差。组织层面的根因分析仍然需要人来补充。</li>
<li class=""><strong>Agent 不理解组织上下文</strong>：不知道系统历史演进、配置为什么长这样、上次类似事故的处理策略。需要通过 runbook、skill、记忆系统结构化注入。</li>
</ol>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="演进路径">演进路径<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E6%BC%94%E8%BF%9B%E8%B7%AF%E5%BE%84" class="hash-link" aria-label="演进路径的直接链接" title="演进路径的直接链接" translate="no">​</a></h2>
<div class="language-text codeBlockContainer_Ckt0 theme-code-block" style="--prism-color:#393A34;--prism-background-color:#f6f8fa"><div class="codeBlockContent_QJqH"><pre tabindex="0" class="prism-code language-text codeBlock_bY9V thin-scrollbar" style="color:#393A34;background-color:#f6f8fa"><code class="codeBlockLines_e6Vv"><div class="token-line" style="color:#393A34"><span class="token plain">Phase 1：单领域 PoC</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  选一个数据源集中、告警场景标准化的领域试点</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  输出：告警触发后的结构化上下文摘要（手动触发）</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain" style="display:inline-block"></span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">Phase 2：加入推理能力</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  Agent 基于上下文生成假设并定向验证</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  输出：根因假设 + 证据链 + 置信度 + 建议处置</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain" style="display:inline-block"></span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">Phase 3：多领域 + Orchestrator</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  建设统一编排层，接入多个 Specialist Agent</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  支持跨领域排查</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain" style="display:inline-block"></span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">Phase 4：知识积累 + 自动触发 + 短报告快路径</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  累积结构化处置记录，同类告警结论复用</span><br></div><div class="token-line" style="color:#393A34"><span class="token plain">  告警触发后自动产出分析报告推送到 oncall</span><br></div></code></pre></div></div>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="最后">最后<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E6%9C%80%E5%90%8E" class="hash-link" aria-label="最后的直接链接" title="最后的直接链接" translate="no">​</a></h2>
<p>SRE Agent 的构建不是「一个大 LLM + 全量数据」，而是：</p>
<ol>
<li class=""><strong>Orchestrator + 领域专家</strong> 的分层架构，缩小每个 Agent 的 scope</li>
<li class=""><strong>假设驱动</strong> 而非全量扫描，<strong>工具设计</strong> 比 prompt 工程更重要</li>
<li class=""><strong>人工动作 ↔ Agent 编排</strong> 的清晰映射，明确 Agent 已覆盖与编排外的边界</li>
<li class=""><strong>短报告 + 历史复用</strong> 解决 L1 阶段的效率和时效问题</li>
<li class=""><strong>评测体系同步建设</strong>，用真实 incident 驱动迭代</li>
</ol>
<p>核心原则：<strong>AI 调查 + 建议，人审批执行</strong>。Agent 的价值在于让每个 oncall 都能快速获得资深工程师级别的初步分析，而不是替代人做最终决策。</p>
<hr>
<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="引用文档">引用文档<a href="https://wbsxhh-blog.pages.dev/blog/sre-agent-construction-thinking#%E5%BC%95%E7%94%A8%E6%96%87%E6%A1%A3" class="hash-link" aria-label="引用文档的直接链接" title="引用文档的直接链接" translate="no">​</a></h2>
<p>详细行业调研材料见 <a class="" href="https://wbsxhh-blog.pages.dev/docs/research">调研材料索引</a>：</p>
<table><thead><tr><th>文档</th><th>主题</th></tr></thead><tbody><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/datadog-bits-ai">Datadog Bits AI</a></td><td>假设驱动调查、MCP 工具设计</td></tr><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/komodor">Komodor</a></td><td>Multi-Agent 平台、SME Agent</td></tr><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/dash0">Dash0</a></td><td>Agent0 编排、可观测性 Agent</td></tr><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/cleric-ai">Cleric AI</a></td><td>三层记忆、Knowledge Graph</td></tr><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/anthropic-sre-agent">Anthropic SRE Agent</a></td><td>OODA 能力边界、AIRE 实践</td></tr><tr><td><a class="" href="https://wbsxhh-blog.pages.dev/docs/research/bytedance-sre-agent">字节跳动 SRE Agent</a></td><td>SRE-Copilot、按模态拆分 Agent</td></tr></tbody></table>]]></content:encoded>
            <category>SRE</category>
            <category>Agent</category>
        </item>
    </channel>
</rss>