READ · UNDERSTAND · TRANSFER
阅读理解,按需巩固
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 事故止血、证据与因果定位
先理解核心原理
先备概念:服务指标、版本追踪、任务阶段
事故响应先限制持续损害,再保留能判断原因的证据。业务成功、请求成功与成本变化各有不同口径,不能在失去对照后凭感觉修 Prompt。
先判断是否仍在扩大影响
成功率下降与账单增加可能来自重试风暴,也可能分别来自数据源失效和流量上升。先确认用户与任务范围,检查危险写入及持续费用;按风险关闭相关动作、限流或回滚已知异常变更,不必等根因完全确定。
对照要留得住
记录首次异常时间、实际行为配置、任务类型与错误阶段。比较同口径任务的失败、重试、token 和延迟,区分分母变化。多项参数同时修改会让改善无法归因,应保留基线与变更日志,逐步验证假设。
在途任务不是统计噪音
回滚后仍可能有旧配置任务继续写入。按阶段暂停、核对外部效果并重新验证恢复条件;未知结果留账。事后将具体失败转为脱敏回归,复盘事实和防线,而不是捏造单一根因。以下三十分钟安排是示例,实际优先级依风险变化;没有真实事故报告或性能数据。
回到问题:怎样回答?
先确认影响范围与是否仍在产生危险副作用,必要时关闭写动作或回滚明确异常的版本。按租户、任务类型、模型和配置版本对比成功率、重试、Token 与延迟,找出首次异常时间和关键链路。保留脱敏证据,避免一边改 Prompt 一边失去对照。稳定服务后再做最小复现、根因修复和回归,成本上涨与质量下降可能不是同一个原因。
实现与取舍
先止损再求完整解释
查看是否有越权、重复发布或无限循环;高风险动作先暂停,普通读任务可限流或降级。记录开始时间、影响版本、受影响租户和已执行外部动作。停止新增动作不等于撤销已发生效果,对账和用户状态修复需要单独安排。不要未经证据同时重启所有依赖。
用分层证据缩小范围
比较发布前后相同任务类型的模型轮数、工具错误、上下文长度、排队、重试和输入输出 Token。若只有一个检索索引版本异常,优先检查召回;若所有工具出现 429,查看配额和并发;若质量下降但 HTTP 正常,检查行为版本与验收失败分布。Trace 关联运行与步骤,敏感正文避免默认全量记录。
保持可恢复与可归因
一次只做有依据的干预并记录时间,使用稳定版本回滚或降低并发。回滚后确认新任务确实使用旧配置,同时处理在途任务。日志留存按必要范围和权限控制,调试样本脱敏;不能为了诊断把生产秘密复制到公开工单或低信任工具。
复盘变成系统改进
选取失败运行构建最小复现,说明触发条件、放大机制、监测为何没提前发现和具体修复。新增回归与告警后重放相同任务集,观察错误率和单位成功成本是否恢复。复盘不以“模型偶发抽风”结束,也不要求在证据不足时强行给出唯一根因。
工程推演
- 场景
- 面试假设:新提示词上线后,Agent 不断重试无权限工具,费用翻倍。
- 设计决策
- 暂停异常版本,检查权限拒绝重试和终止条件。
- 验证目标
- 重复失败受限退出,新增回归阻止同类复发。
- 适用边界
- 费用上涨原因需结合账单与调用记录核对,不能只凭图表猜测。
连续追问与解答
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层质量下降但 HTTP 200 正常怎么监测?
事故判断必须超出 HTTP 状态,检测业务质量。
参考解答
用业务终态与抽样事实核对监测,如报告覆盖缺失、引用不支持、退款状态不符。HTTP 200 只说明请求被处理,不说明任务达标。保留人工反馈与语义抽检,自动质量指标先校准,再按任务类型观察,避免把裁判分直接当事实成功。
沿着这个回答继续深入
第 2 层线上评分裁判也随发布升级,成功率下降能归因 Agent 吗?
父问引入质量监测,子问增加测量器自身变更。
参考解答
不能直接。冻结旧裁判或用同一锚点让两者复评,核对真实业务后置条件与人工样本,再区分行为变化和测量变化。事故记录标明评分器版本;若硬事实同样下降再调查执行链路,不让评分口径变更掩盖或制造事故。
沿着这个回答继续深入
第 3 层裁判无法及时恢复,是否必须等质量真值再止血?
父问发现监测不可靠,继续讨论证据不足时的处置边界。
参考解答
不用。若已有危险写入、预算异常等可信信号,可以先执行范围明确、可回滚的限流或关闭相关能力,同时保留证据。对纯语义质量保持未知并人工抽检;紧急操作依据风险事实,而不是假定所有分数下降都是模型变差。
第 1 层回滚后在途任务怎么办?
止血和回滚后仍有执行中的业务状态需要处理。
参考解答
按读、待审、正在提交和未知效果分组。可停止新的危险动作,保留已执行账本;旧任务需兼容版本或显式迁移,重验权限、批准与资源状态。不能清队列就当任务从未执行,也不能让回滚后的 worker 盲目重放旧写操作。
第 1 层哪些信息应该进入事故日志?
因果定位依赖可靠记录和事实假设分离。
参考解答
记录发现时间、影响范围、已知事实与未知项、运行配置、采取的操作和效果、责任角色及下一步。使用脱敏任务/事件标识关联受控证据,保留关键回执;不要把密钥或客户正文复制到广泛共享日志,也不把尚未验证的假设写成根因。
举一反三:条件变了,怎样推导?
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
调用量翻倍但单位成本稳定
改变的条件:总账单上升主要由需求增加。
延伸问题:应该立即切便宜模型吗?
推导与参考解答
先核对任务量、单任务真实用量和重试比例,确认容量与预算风险;需求增长不证明效率回退。按业务限额与服务目标扩容或排队,模型切换仍需能力回归,不能因总账单变化仓促改变质量。
保持不变的原理:总量、单位量与任务构成分开归因。
某租户退款重复,其余正常
改变的条件:风险集中在小范围高影响写入。
延伸问题:总体成功率 99% 是否允许继续?
推导与参考解答
先停止该类写动作或受影响路径,核对目标交易和未知回执,保留业务键与批准记录。高风险违规不应被总体平均掩盖;修复后针对同类窗口回归,不能只观察全站曲线恢复。
保持不变的原理:止血按实际损害与风险范围决定,平均分不能覆盖禁令。
易错点
- 先无限加机器和额度
- 同时修改多项配置失去对照
- 为诊断无差别记录敏感原文
参考资料
依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
检查自己理解到哪一步
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
- 基础达标
- 能先限制危险动作的影响,再检查版本和配置变化。
- 中高级信号
- 从重试、上下文、工具和模型层逐层定位。
- 资深信号
- 同时处理外部事实、证据隐私、在途运行及可验证复盘。
巩固练习 按需完成 · 建议 15 分钟
给“工具 403 激增、轮数翻倍、成功率下降”的三张指标图写处置顺序。
展开验收要求与检查点
- 权限拒绝不盲重试
- 止损动作有时间记录
- 修复后用原失败样本验证
重点检查
- 止损与根因分析分开
- 按链路和版本定位
- 证据脱敏且改动可归因