← 返回动态
Claude Tag 如何成为 Anthropic CI/CD 故障的第一响应者
AI 可显著缩短故障响应时间,建议探索智能体在运维中的深度应用。
关键标注
关键数据
它在事故开启后中位 14 分钟发布首份有证据的分析;最快的案例在 4 分钟内指出根因。
关键性能指标:Claude Tag 作为第一响应者的速度,体现其效率。
一个涉及十几个文件的中等需求消耗约 2480 万 Token,成本约 202 元,比改造前还多 40 多元。
关键成本数据:优化后成本反而增加,说明局部优化可能无效。
在 12 个真实编码任务、24 组对照中,模型看到的终端字符减少 40.19%,原始总 Token 却增加 4.23%。
关键实验数据:压缩输出并未减少总Token,反直觉结果。
关键决策
Anthropic 同时开源了 oncall-kit,用团队自己的事故历史生成分诊流程,并从只读 Claude 开始。
Anthropic 开源工具,推动行业实践。
作者还为搜索设置熔断:第一次压缩搜索没有出现预期线索,就用原生命令复核;若后面还需要第二次宽泛搜索,后续搜索和文件读取全部切回原始输出。
设置熔断机制,确保可回退性,是重要的工程决策。
写公共组件前先搜索已有实现,涉及资金的方案必须经过专门审查,最终推送则在展示完整变更后等待人的明确确认。
京东技术团队在AI Coding中设置人工审查环节,确保安全。
关键观点
这里的难点不只在数据连接,也在报告是否符合团队真实的沟通习惯。
强调AI报告需符合团队沟通习惯,否则难以被接受。
先问信息何时进入窗口、交给谁判断、保留多久,再用端到端结果决定工具是否默认开启。
关于上下文优化的核心洞察:关注信息流而非单纯减少内容。
如果检查 AI 产出的成本低于自己完成,协作划算;任务边界含糊、错误代价又高时,验证可能比执行更贵。
验证成本决定人机分工,是重要决策依据。
原文全文 (高亮 = 关键标注)
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
一个值班 Agent 到底要具备什么,才能从回答问题走到处理真实事故?Anthropic 的答案不是再写一段更长的提示词,而是把记忆、权限、工具、调查流程和人类审批一起接进 CI/CD 现场。今天第一条精讲从这份一手复盘出发,看 Claude Tag 如何形成首份态势报告,又在哪些环节仍然依赖工程师。
另外两条精讲分别处理成本与分工。腾讯云开发者用多组实验检验 CodeGraph 和 RTK,发现单次输出缩短不等于整条工作流更省;京东技术则用四阶段框架讨论 AI Coding 从补全走向流程编排后,人应如何保留验证、取舍和责任。
昨天的早报谈到语义层如何为 Agent 提供可追溯的业务上下文。今天更靠近运行现场:上下文进入哪个角色、保留多久、能否回到原始证据,会直接改变成本和可靠性。
★ 精讲一:Claude Tag 如何成为 Anthropic CI/CD 故障的第一响应者
来源:Claude Blog · BestBlogs 评分:93
Anthropic 工程师从一个晚上十点的告警讲起:新服务约有 44 个测试突然不再运行。Claude 查到测试消失与当天启用的 feature flag 有关,也判断回滚是安全的。工程师让同事回滚后,Claude 在 3 分钟后再次确认跳过规则已移除,错误率回到基线。
这不是一次临时调用。过去几个月,Claude Tag 一直担任 Anthropic CI/CD 故障的第一响应者。团队给出的口径是,它在事故开启后中位 14 分钟发布首份有证据的分析;最快的案例在 4 分钟内指出根因。近期那些形成了态势报告的事故,第一份报告都由 Claude 撰写。
系统的基础可以拆成四部分。记忆让 Claude 保留频道里的事故进展;连接与访问让独立服务账户读取监控、日志、代码仓库和集群;日程让它按约定时间复查和交接;指令则以 Markdown Skill 的形式进入 GitHub,和代码一样接受版本管理。
告警升级后,编排 Agent 会启动多个执行 Agent,分别追查监控、日志、PagerDuty、GitHub、Kubernetes 和事故频道里的线索,再汇总成态势报告。每类错误有对应调查 Skill,已经解决的事故写入 lessons.md。当同一种模式反复出现,团队再把经验提升为正式调查流程。
调查之外,Claude 还承担验证与沟通。修复完成后,它使用相同的连接器检查错误率和发布状态,把事后记录补进 lessons.md。团队另设 ci-weather Agent,汇总多个事故频道、构建指标、合并队列和发布延迟,用公开报告回答当前 CI 是否健康、合并是否需要暂停。这里的难点不只在数据连接,也在报告是否符合团队真实的沟通习惯。
这里有一个很重要的分层:告警判断保留确定性规则,智能体负责在规则触发后并行调查。修复也没有完全交给 Claude。它更常见的输出是缓解建议或 PR,由值班人员审查、合并和部署。文章明确承认,Claude 第一次并不总能判断正确,人类直觉仍会改变调查方向。
Anthropic 同时开源了 oncall-kit,用团队自己的事故历史生成分诊流程,并从只读 Claude 开始。对准备尝试的团队,合理顺序是先限制权限、要求判断附带证据,再观察首报质量、误报、平均修复时间和人工介入成本。
★ 精讲二:Agent 的命门是上下文:关键不在少给,而在给对
来源:腾讯云开发者 · BestBlogs 评分:90
作者给一套多 Agent 开发流程接入两个看似合理的优化。CodeGraph 像代码地图,先圈出调用者和影响范围;RTK 像终端摘要器,压缩搜索、测试和日志。结果,一个涉及十几个文件的中等需求消耗约 2480 万 Token,成本约 202 元,比改造前还多 40 多元。
这笔账单促使作者把省 Token 分成三层:工具的局部输出是否变短,Agent 的搜索与测试路径是否缩短,以及从开始到结束的整体成本是否下降。这个拆法很有用,因为很多优化只报告第一层,却把后续补偿性搜索、会话历史和角色交接留在统计之外。
CodeGraph 的结果高度依赖任务形态。问题围绕明确符号时,两条结构查询可以替代多轮文本搜索,总 Token 下降 80.0%。到了完整调用链任务,图查询只负责导航,业务分支和 fallback 语义仍要回源码确认,总 Token 反而上升 95.8%。需要给出精确 path:line 时,Agent 运行图查询后还要逐点读取源码,总 Token 上升 152.9%。
RTK 也给出类似的反直觉结果。在 12 个真实编码任务、24 组对照中,模型看到的终端字符减少 40.19%,原始总 Token 却增加 4.23%。压缩后的输出可能漏掉定位问题所需的线索,Agent 随后多搜文件、多改代码、多跑测试。作者又对一个坏案例重复实验,RTK 组平均只高 1.24%,并没有坐实它必然增费。
改造方向因此从少给内容转向安排信息流。完整方案、源码证据和测试结果进入 Artifact,角色交接只发送短 Handoff 与材料路径。CodeGraph 只在前段建立结构,后续角色复用定位结果;RTK 按场景启用,结果异常为空、出现截断或缺少预期线索时立即回到原生命令。状态迁移、路由、去重和固定汇总交给程序。
作者还为搜索设置熔断:第一次压缩搜索没有出现预期线索,就用原生命令复核;若后面还需要第二次宽泛搜索,后续搜索和文件读取全部切回原始输出。最终代码审查与验收也始终保留完整信息。这个设计承认压缩会损失细节,因此把可回退性本身当成优化的一部分。
综合改造后,GLM 流程平均每步 Token 从约 10.68 万降到 6.70 万,Claude 组总 Token 下降 23.34%。但交接、工具策略和调度方式同时发生变化,不能把降幅归功于单一组件。更可迁移的结论是:先问信息何时进入窗口、交给谁判断、保留多久,再用端到端结果决定工具是否默认开启。
★ 精讲三:AI Coding 的共生与替代:一场分阶段的演进
来源:京东技术 · BestBlogs 评分:90
京东技术作者把 AI Coding 的演进分成工具、副驾、协作者和共生体四个阶段。这不是行业统一成熟度模型,而是一套观察分工变化的框架:AI 每接管一层可形式化劳动,人机协作的界面就向判断、约束和责任上移一层。
工具阶段处理补全、API 用法和样板代码,人仍逐行决定要写什么。副驾阶段可以实现边界清晰的函数、组件或修复,人从实现者转向任务描述者与审阅者。协作者阶段开始读文件、调用工具并执行多步流程,人则负责设计流程、设置关口和处理例外。共生体仍偏向展望,关注跨任务记忆、规则沉淀和多流程协同。
贯穿四阶段的一把尺是验证成本。如果检查 AI 产出的成本低于自己完成,协作划算;任务边界含糊、错误代价又高时,验证可能比执行更贵。这也解释了为什么补全工具容易建立信任,而跨系统设计不能只看生成速度。
文章用团队工作流展示这一判断。AI 可以生成项目文档和调用链,把 PRD 转成技术设计,拆分任务、生成代码并做提交前验证。写公共组件前先搜索已有实现,涉及资金的方案必须经过专门审查,最终推送则在展示完整变更后等待人的明确确认。
更进一步的需求分治 Agent 会读取仓库路由表和架构图,判断一个需求影响哪些系统,再为各系统生成技术设计。低置信的系统归属、多个合理方案和知识库里的信息缺口仍交回给人。若最早的归属判断错了,后续步骤可能一路自洽却整体走偏,因此基础资料的准确性直接限制这套方法的可靠程度。
进入共生体阶段后,作者特别区分两类记忆。某字段来自哪个系统这类稳定事实,可以跨需求沉淀;某次选择双写方案这类依赖背景的取舍,不能自动复用到下一次需求。组织记忆的价值不只是越积越多,还在于知道哪些内容能够验证,哪些决定必须重新审视。否则,历史经验也可能成为被自动继承的错误前提。
作者最后归纳出五条原则:用验证成本决定分工,给目标时也给红线,按置信度与阻断程度安排确认,审查流畅却无依据的输出,把稳定事实与失败经验沉淀为知识。事实型结论可以跨需求复用,情境化方案不能自动照搬。至于岗位收缩的幅度和速度,文章没有就业数据;对读者更有帮助的,是先划清哪些结果能被规则验证,哪些决定必须由具体的人承担。
速览
通过智能体源代码审查保持对对抗性 AI 的领先
来源:Google Cloud Blog · BestBlogs 评分:90
Google Cloud 介绍一套智能体漏洞发现框架,用多个 Agent 扩展大规模源代码审查,寻找关键漏洞。
系统先用代码库、资产清单、架构文档和威胁情报建立环境,再让专门 Agent 处理认证、授权、路由等领域,汇总成威胁模型后继续寻找入口点与潜在利用路径。
这类框架适合承担重复检索和路径探索,把安全工程师的时间留给可利用性判断与修复优先级。文章没有提供统一的漏洞数量或提升比例,不能据此推断人工审计已经可以被替代。
Claude Code 推出 /design 技能,用于 UI 画板
来源:ClaudeDevs(@ClaudeDevs) · BestBlogs 评分:91
Claude Code 在研究预览中加入 /design 技能,把用于 UI 设计与实现的画板工作流带进 CLI 和桌面环境。
这条短讯确认了技能名称、研究预览状态和两个入口,但没有交代完整功能范围、开放对象或正式发布日期。
设计探索和代码实现靠近同一工作区,可能减少设计与前端之间的来回翻译;真实效率、稳定性和协作边界还需要在项目中观察。
LangSmith 推出可调优的自动评估器
来源:LangChain Blog · BestBlogs 评分:90
LangSmith 推出 Tuned Evaluators,这是一种托管的低成本 AI 评判器,用来评分生产环境 Agent 轨迹中的感知错误。
它把真实用户轨迹作为输入,尝试从大量交互里持续发现不良行为,再把反馈变成可监控、可迭代的质量信号。
评判器可以扩大检查范围,但团队仍需定义什么算错误、维护反馈样本,并抽查评判偏差。自动评估是质量闭环的一部分,不等同于把质量标准本身交给模型。
使用 Google Agent Development Kit 构建零信任 AI 智能体
来源:Google Developers Blog · BestBlogs 评分:91
Google Developers Blog 给出一套基于 Agent Development Kit 的零信任架构,用于防范提示注入和未经授权的状态变更。
方案以加密签名确认请求身份,以内核级隔离限制动态代码的网络与资源,再用确定性语义网关检查模型输入、工具调用和数据库写入是否符合规则。
当 Agent 能调用外部工具并写入真实状态,安全问题已经超出文本输出。每一步重新验证比默认信任内部 Agent 更稳妥,但这套设计降低的是风险,并不意味着提示注入已经被彻底解决。
对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了
来源:硅谷101 · BestBlogs 评分:89
前 DeepMind 研究科学家曹原在访谈中讨论 AI for Science 的进展、挑战和未来路径,强调验证瓶颈与模型创新性。
他的判断是,科学任务不能停在生成假设。模型能否提出新的方向,以及结果能否经实验或严格计算确认,决定了系统是否真正进入科研闭环。
这是一位研究者的具名观点,不是学界共识。它提供的判断框架,是区分会给答案的模型与能参与知识创造的系统,并重新看待人在验证和选择问题上的角色。
对比与生成:抖音 SOTA 多模态表征模型 DME
来源:字节跳动技术团队 · BestBlogs 评分:91
抖音搜索团队发布多模态表征模型 DME,用两阶段训练连接大规模对比学习和语义充分性学习。
模型引入隐式推理与交叉条件重建。团队报告它在 MMEB-v2 的 2B 和 9B 两种规模上达到同规模领先结果,部署只增加亚毫秒级延迟,并在抖音线上观察到 LT 收益 0.1%。
这条进展的价值在于同时报告训练机制、部署代价和业务指标。数字来自团队自己的基准与线上实验,0.1% 不应外推到其他搜索系统。
主要前沿模型提供商采用水印技术以符合欧盟法规
来源:InfoQ · BestBlogs 评分:88
主要前沿模型提供商开始部署统计水印,以符合欧盟 AI 法案 Article 50 对生成内容透明度的要求。
与此同时,开源移除工具和相关研究指出,水印在编辑、压缩或主动规避后可能失效,鲁棒性仍是现实限制。
法规正在推动内容标识成为基础设施,但采用水印不等于所有生成内容都能稳定识别。治理效果取决于检测工具能否在常见修改后继续工作。
补充阅读
任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践
来源:腾讯技术工程 · BestBlogs 评分:92
TencentDB Agent Memory 把团队经验拆成 Chat Memory、Wiki、CodeGraph 和 Skill 四类资产,再按任务相关性装配上下文。在团队的 SWE-bench 相关任务中,完成率从 60% 提升到 80%,这一结果属于其自身任务口径。
10 不是 100
来源:Towards Data Science · BestBlogs 评分:91
现有 RAG 幻觉检测器可能漏掉 10 与 100 这类数字错误。文章提出无需训练的 groundlens,用 token 级依据校验寻找不匹配,让数字是否忠于来源成为独立检查对象。
它提醒读者,语义相近不代表事实一致,数字、单位和比较对象需要更细粒度的依据检查。
从晶圆厂到 Token:市场现状
来源:InfoQ · BestBlogs 评分:90
InfoQ 从台积电晶圆产能、数据中心网络和推理设施梳理 Token 成本链。模型价格背后仍受芯片供给、互连效率与长期数据中心投资约束。
模型调用成本因此不只是厂商定价问题,也成为判断供给与基础设施周期的入口。
前沿模型成本和开放权重模型的流行正在推动模型路由的需求
来源:Latent.Space · BestBlogs 评分:90
前沿模型成本上升与开放权重模型增多正在推动企业采用模型路由。文章以 Glean 为案例,讨论如何让不同任务在质量、延迟和价格之间选择模型。
您的智能体实际上需要多少内存?
来源:Hugging Face - Blog · BestBlogs 评分:90
Hugging Face 的结论是记忆剂量应匹配模型能力:更强模型可以利用完整指南集,较弱模型反而更适合精选检索。记忆量增加并不自动带来更好的任务表现。
B 站 indexTTS 2.5 开源:五国语言零样本配音,推理提速 2.28 倍
来源:魔搭ModelScope社区 · BestBlogs 评分:89
B 站 IndexTTS 2.5 已开源,支持中、英、日、西、阿五种语言的零样本配音。团队报告推理提速 2.28 倍,跨语言情感迁移 MOS 达到 4.18/5。
对配音应用而言,多语覆盖、速度和情感保持需要一起看,单一速度数字不足以代表最终体验。
Agent 基建不是设计出来的,是被 Kimi K3 和一堆应用公司卷出来的
来源:Founder Park · BestBlogs 评分:88
TiDB 团队从 Kimi K3 与应用公司的需求反推 Agent 基建,尝试以统一存储层承接数据库、内存和文件状态,为持久化与弹性执行提供底座。
关注点从单次推理转向长任务里的状态保存、恢复与扩缩容,这也是数据库团队切入 Agent 工程的理由。
Netflix 开源用于因果推断的 Agentic 工作流
来源:InfoQ · BestBlogs 评分:89
Netflix 开源一套因果推断 Agentic 工作流,通过带人工监督的 actor-critic 循环让 Agent 提出分析、接受批评并迭代结果。
人工监督仍在循环中,说明因果推断场景更重视可审查的分析过程,而不只是自动生成结论。
中国大模型的奥德修斯时刻
来源:晚点LatePost · BestBlogs 评分:90
晚点从能力、成本、开源份额、资本和架构变化观察中国大模型竞争,认为开源扩张与算力效率正在改变全球格局。这是产业报道的综合判断,不是单一指标能够证明的结论。
黄仁勋、奥特曼、孙正义“抱团 20 年”
来源:腾讯科技 · BestBlogs 评分:89
腾讯科技梳理英伟达、OpenAI 与软银在美国大型数据中心上的长期合作,重点关注 AI 算力需求带来的巨额表外承诺与供应链风险。
这篇产业分析把合作愿景与资本承诺放在一起看,帮助读者理解算力扩张对资产负担和供应链的长期影响。
延伸探索
如果你在搭建 Agent 工程链,可以继续看 Claude Science、AgentCore Payments、Cloudflare WriteGuard、Stacked Pull Requests、vLLM、MemoraX Code 和 DeepSeek Harness 桌面应用。这组内容分别覆盖垂直工作台、支付与预算、MCP 写权限、代码审查协作、推理扩展和长期记忆,适合按当前系统的缺口选择。
另一组围绕模型与创作基础设施:Krea 的大规模训练服务、NVIDIA 低精度优化、多模态 API 成本、Git 托管,以及实时视频、自然语言游戏工具、音乐交互和 3D 图像编辑。政策侧还有白宫 AI 战略与国家安全监督,方法侧则包括 RAG 过滤、LLM 分类和 boosting 调参。铁路扫描与 Vercel 图片迁移属于边缘工程探索,不必硬套进 AI 主题。
今日阅读路径
如果团队正准备把智能体接进生产流程,可以把前三篇当作一张连续的检查表:先确认权限边界和人工审批,再记录完整任务的成本、失败路径与恢复过程,最后判断哪些步骤能由规则验证、哪些决定仍须由人负责。只有当证据能够回源、上下文压缩可以回退、工具副作用可以阻断时,自动化才真正具备可运营性。反过来,如果系统只展示生成速度,却没有事故记录、端到端账单和明确责任人,再流畅的输出也不足以证明流程已经可靠。上线后的观察也应覆盖误报、返工、人工介入和恢复时间,而不只看调用量。
时间有限时,可以按手头问题选三篇。负责线上系统,先读 Claude Tag,重点看服务账户、调查 Skill 与人工授权如何配合;正在优化 Agent 成本,读上下文工程实验,检查局部压缩是否真的减少端到端步骤;负责团队流程或个人能力规划,再读 AI Coding 四阶段,用验证成本和责任边界重新划分工作。
读完后可以继续追问:你的 Agent 在哪一步拥有真实副作用,它的判断能否回到原始证据?你正在做的上下文优化,衡量的是单次输出,还是完整任务的质量与成本?欢迎沿着这条阅读顺序打开原文,也欢迎在评论区分享你的实际做法和反例。
👉 近期早报
BestBlogs 早报 · 2026-08-18
BestBlogs 早报 · 2026-08-17
BestBlogs 早报 · 2026-08-16
BestBlogs.dev 第 108 期:智能的执行层
BestBlogs.dev 第 107 期:个人 AGI
BestBlogs.dev 第 106 期:1% 法则
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。