先理解
刚接触这个知识点
补齐先备概念,读原理与反例,再用自己的话解释为什么。
从核心原理开始 →理解 → 实现 → 排错 → 取舍
考察止损、版本归因、分层指标、隐私和复盘。
知识内容核对 2026-10-03 · 原题来源核对 2026-10-02
建议先理解:
任务因果链与资源归因 →故障窗口与恢复不变量 →按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。
LEARN · PRACTICE · REFLECT
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 事故止血、证据与因果定位
先备概念:服务指标、版本追踪、任务阶段
事故响应先限制持续损害,再保留能判断原因的证据。业务成功、请求成功与成本变化各有不同口径,不能在失去对照后凭感觉修 Prompt。
成功率下降与账单增加可能来自重试风暴,也可能分别来自数据源失效和流量上升。先确认用户与任务范围,检查危险写入及持续费用;按风险关闭相关动作、限流或回滚已知异常变更,不必等根因完全确定。
记录首次异常时间、实际行为配置、任务类型与错误阶段。比较同口径任务的失败、重试、token 和延迟,区分分母变化。多项参数同时修改会让改善无法归因,应保留基线与变更日志,逐步验证假设。
回滚后仍可能有旧配置任务继续写入。按阶段暂停、核对外部效果并重新验证恢复条件;未知结果留账。事后将具体失败转为脱敏回归,复盘事实和防线,而不是捏造单一根因。以下三十分钟安排是示例,实际优先级依风险变化;没有真实事故报告或性能数据。
先确认影响范围与是否仍在产生危险副作用,必要时关闭写动作或回滚明确异常的版本。按租户、任务类型、模型和配置版本对比成功率、重试、Token 与延迟,找出首次异常时间和关键链路。保留脱敏证据,避免一边改 Prompt 一边失去对照。稳定服务后再做最小复现、根因修复和回归,成本上涨与质量下降可能不是同一个原因。
查看是否有越权、重复发布或无限循环;高风险动作先暂停,普通读任务可限流或降级。记录开始时间、影响版本、受影响租户和已执行外部动作。停止新增动作不等于撤销已发生效果,对账和用户状态修复需要单独安排。不要未经证据同时重启所有依赖。
比较发布前后相同任务类型的模型轮数、工具错误、上下文长度、排队、重试和输入输出 Token。若只有一个检索索引版本异常,优先检查召回;若所有工具出现 429,查看配额和并发;若质量下降但 HTTP 正常,检查行为版本与验收失败分布。Trace 关联运行与步骤,敏感正文避免默认全量记录。
一次只做有依据的干预并记录时间,使用稳定版本回滚或降低并发。回滚后确认新任务确实使用旧配置,同时处理在途任务。日志留存按必要范围和权限控制,调试样本脱敏;不能为了诊断把生产秘密复制到公开工单或低信任工具。
选取失败运行构建最小复现,说明触发条件、放大机制、监测为何没提前发现和具体修复。新增回归与告警后重放相同任务集,观察错误率和单位成功成本是否恢复。复盘不以“模型偶发抽风”结束,也不要求在证据不足时强行给出唯一根因。
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层质量下降但 HTTP 200 正常怎么监测?
事故判断必须超出 HTTP 状态,检测业务质量。
用业务终态与抽样事实核对监测,如报告覆盖缺失、引用不支持、退款状态不符。HTTP 200 只说明请求被处理,不说明任务达标。保留人工反馈与语义抽检,自动质量指标先校准,再按任务类型观察,避免把裁判分直接当事实成功。
沿着这个回答继续深入
第 2 层线上评分裁判也随发布升级,成功率下降能归因 Agent 吗?
父问引入质量监测,子问增加测量器自身变更。
不能直接。冻结旧裁判或用同一锚点让两者复评,核对真实业务后置条件与人工样本,再区分行为变化和测量变化。事故记录标明评分器版本;若硬事实同样下降再调查执行链路,不让评分口径变更掩盖或制造事故。
沿着这个回答继续深入
第 3 层裁判无法及时恢复,是否必须等质量真值再止血?
父问发现监测不可靠,继续讨论证据不足时的处置边界。
不用。若已有危险写入、预算异常等可信信号,可以先执行范围明确、可回滚的限流或关闭相关能力,同时保留证据。对纯语义质量保持未知并人工抽检;紧急操作依据风险事实,而不是假定所有分数下降都是模型变差。
第 1 层回滚后在途任务怎么办?
止血和回滚后仍有执行中的业务状态需要处理。
按读、待审、正在提交和未知效果分组。可停止新的危险动作,保留已执行账本;旧任务需兼容版本或显式迁移,重验权限、批准与资源状态。不能清队列就当任务从未执行,也不能让回滚后的 worker 盲目重放旧写操作。
第 1 层哪些信息应该进入事故日志?
因果定位依赖可靠记录和事实假设分离。
记录发现时间、影响范围、已知事实与未知项、运行配置、采取的操作和效果、责任角色及下一步。使用脱敏任务/事件标识关联受控证据,保留关键回执;不要把密钥或客户正文复制到广泛共享日志,也不把尚未验证的假设写成根因。
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
改变的条件:总账单上升主要由需求增加。
延伸问题:应该立即切便宜模型吗?
先核对任务量、单任务真实用量和重试比例,确认容量与预算风险;需求增长不证明效率回退。按业务限额与服务目标扩容或排队,模型切换仍需能力回归,不能因总账单变化仓促改变质量。
保持不变的原理:总量、单位量与任务构成分开归因。
改变的条件:风险集中在小范围高影响写入。
延伸问题:总体成功率 99% 是否允许继续?
先停止该类写动作或受影响路径,核对目标交易和未知回执,保留业务键与批准记录。高风险违规不应被总体平均掩盖;修复后针对同类窗口回归,不能只观察全站曲线恢复。
保持不变的原理:止血按实际损害与风险范围决定,平均分不能覆盖禁令。
依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
给“工具 403 激增、轮数翻倍、成功率下降”的三张指标图写处置顺序。