Agent 应用开发会员账号
知识目录选择核心方向与细分内容
知识单元 52高级场景设计约 18 分钟

理解 → 实现 → 排错 → 取舍

事故止血、证据与因果定位

考察止损、版本归因、分层指标、隐私和复盘。

事故处理Observability成本

知识内容核对 2026-10-03 · 原题来源核对 2026-10-02

这个知识点,你想学到哪一步?

按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。

先理解

刚接触这个知识点

补齐先备概念,读原理与反例,再用自己的话解释为什么。

从核心原理开始 →

再实现

准备把原理写进代码

理解实现步骤与边界,完成小任务,对照验收要求检查结果。

阅读实现与取舍 →

会排错

需要处理故障与条件变化

沿连续追问定位失效前提,再比较迁移案例,说明方案应如何调整。

沿问题继续深入 →

能取舍

需要设计或评审方案

结合工程推演与资深自评标准,解释方案的适用条件、代价和替代选择。

分析工程场景 →
知识单元目录

LEARN · PRACTICE · REFLECT

知识学习与个人记录

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 事故止血、证据与因果定位

先理解核心原理

先备概念:服务指标、版本追踪、任务阶段

事故响应先限制持续损害,再保留能判断原因的证据。业务成功、请求成功与成本变化各有不同口径,不能在失去对照后凭感觉修 Prompt。

先判断是否仍在扩大影响

成功率下降与账单增加可能来自重试风暴,也可能分别来自数据源失效和流量上升。先确认用户与任务范围,检查危险写入及持续费用;按风险关闭相关动作、限流或回滚已知异常变更,不必等根因完全确定。

对照要留得住

记录首次异常时间、实际行为配置、任务类型与错误阶段。比较同口径任务的失败、重试、token 和延迟,区分分母变化。多项参数同时修改会让改善无法归因,应保留基线与变更日志,逐步验证假设。

在途任务不是统计噪音

回滚后仍可能有旧配置任务继续写入。按阶段暂停、核对外部效果并重新验证恢复条件;未知结果留账。事后将具体失败转为脱敏回归,复盘事实和防线,而不是捏造单一根因。以下三十分钟安排是示例,实际优先级依风险变化;没有真实事故报告或性能数据。

用一个问题检查理解

上线后成功率骤降、账单翻倍,你作为负责人前 30 分钟怎么处理?

先确认影响范围与是否仍在产生危险副作用,必要时关闭写动作或回滚明确异常的版本。按租户、任务类型、模型和配置版本对比成功率、重试、Token 与延迟,找出首次异常时间和关键链路。保留脱敏证据,避免一边改 Prompt 一边失去对照。稳定服务后再做最小复现、根因修复和回归,成本上涨与质量下降可能不是同一个原因。

实现与取舍

先止损再求完整解释

查看是否有越权、重复发布或无限循环;高风险动作先暂停,普通读任务可限流或降级。记录开始时间、影响版本、受影响租户和已执行外部动作。停止新增动作不等于撤销已发生效果,对账和用户状态修复需要单独安排。不要未经证据同时重启所有依赖。

用分层证据缩小范围

比较发布前后相同任务类型的模型轮数、工具错误、上下文长度、排队、重试和输入输出 Token。若只有一个检索索引版本异常,优先检查召回;若所有工具出现 429,查看配额和并发;若质量下降但 HTTP 正常,检查行为版本与验收失败分布。Trace 关联运行与步骤,敏感正文避免默认全量记录。

保持可恢复与可归因

一次只做有依据的干预并记录时间,使用稳定版本回滚或降低并发。回滚后确认新任务确实使用旧配置,同时处理在途任务。日志留存按必要范围和权限控制,调试样本脱敏;不能为了诊断把生产秘密复制到公开工单或低信任工具。

复盘变成系统改进

选取失败运行构建最小复现,说明触发条件、放大机制、监测为何没提前发现和具体修复。新增回归与告警后重放相同任务集,观察错误率和单位成功成本是否恢复。复盘不以“模型偶发抽风”结束,也不要求在证据不足时强行给出唯一根因。

工程推演

场景
面试假设:新提示词上线后,Agent 不断重试无权限工具,费用翻倍。
设计决策
暂停异常版本,检查权限拒绝重试和终止条件。
验证目标
重复失败受限退出,新增回归阻止同类复发。
适用边界
费用上涨原因需结合账单与调用记录核对,不能只凭图表猜测。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

调用量翻倍但单位成本稳定

改变的条件:总账单上升主要由需求增加。

延伸问题:应该立即切便宜模型吗?

推导与参考解答

先核对任务量、单任务真实用量和重试比例,确认容量与预算风险;需求增长不证明效率回退。按业务限额与服务目标扩容或排队,模型切换仍需能力回归,不能因总账单变化仓促改变质量。

保持不变的原理:总量、单位量与任务构成分开归因。

某租户退款重复,其余正常

改变的条件:风险集中在小范围高影响写入。

延伸问题:总体成功率 99% 是否允许继续?

推导与参考解答

先停止该类写动作或受影响路径,核对目标交易和未知回执,保留业务键与批准记录。高风险违规不应被总体平均掩盖;修复后针对同类窗口回归,不能只观察全站曲线恢复。

保持不变的原理:止血按实际损害与风险范围决定,平均分不能覆盖禁令。

易错点

  • 先无限加机器和额度
  • 同时修改多项配置失去对照
  • 为诊断无差别记录敏感原文

参考资料

依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
能先限制危险动作的影响,再检查版本和配置变化。
中高级信号
从重试、上下文、工具和模型层逐层定位。
资深信号
同时处理外部事实、证据隐私、在途运行及可验证复盘。

动手验证 按需完成 · 建议 15 分钟

给“工具 403 激增、轮数翻倍、成功率下降”的三张指标图写处置顺序。

展开验收要求与检查点
  • 权限拒绝不盲重试
  • 止损动作有时间记录
  • 修复后用原失败样本验证

重点检查

  • 止损与根因分析分开
  • 按链路和版本定位
  • 证据脱敏且改动可归因