跳到正文
Agent 应用开发
知识目录选择核心方向与细分内容

SYSTEMATIC LEARNING / 分层专题

RAG 的证据流与故障定位

追踪同一条证据在召回、排序、上下文和回答中的变化,理解每一步为什么可能丢失答案。

学习目标:能够依据必要证据定位首个失效阶段,并比较不同修复的条件与代价。

内容核对2026-10-04 · 每层有独立讲解、任务与检查

按这个知识点的熟悉程度选择起点。当前层:进阶 · 定位故障。完成任务后可以继续下一层;阅读与自检不自动代表掌握。

本层学习目录

先补齐必要概念

适合:已经搭建 RAG,需要定位质量退化。

召回
从资料库找出可能相关的候选,不表示它们最终进入模型输入。
重排
重新排列候选的优先级,影响有限上下文中先放哪些材料。
必要证据
足以支持本问题结论的材料集合,可能同时需要正文和例外条款。
证据支持
结论是否被实际材料及适用条件支持;有引用链接也可能没有支持。

原理怎样一步步成立?

RAG:入库与作答的两条证据流
  1. 入库环节

    原文 → 带租户和版本的 chunk → 匹配模型的文档向量;保存来源与内容摘要。

  2. 查询

    可信身份 + 问题 → 同一模型的查询向量;旧快照或新查询缺向量时先重建。

  3. 检索

    先过滤权限和有效版本 → 向量/BM25 候选 → RRF 排名。

  4. 上下文环节

    按预算选择材料,核对必要证据集合:一般条款 + 电池例外。

  5. 回答验收

    核对结构、引用与条件;缺证据走 unknown。自由文本语义单独审核。

先定位证据最早在哪一步缺失。默认向量来自实际本地 Embedding 快照,生成回复仍是人工夹具,语义为 not_scored。

逐步解释原理
  1. 确认资料

    原始资料存在、有效且有权使用。

  2. 召回与排序

    记录候选标识及排名。

  3. 组装上下文

    保留必要材料、条件与来源标识。

  4. 生成与核对

    检查每项结论及拒答是否符合证据。

进阶 · 定位故障

把一次答错变成分阶段实验

本层目标:能够保留复现条件、找到证据丢失点并验证修复。

固定输入世界

记录问题、改写、权限、知识版本、分块、检索渠道与候选规模。对失败样本人工标注必要证据。没有这些条件,今天答对、明天答错可能只是资料变化,不能可靠归因于某个参数。

根据首个缺口选择修复

缺少精确产品编号时考虑关键词召回;候选包含正确材料但排序低时检查重排;排序正确、例外被截掉时修上下文组装。混合检索融合的是多个排名或经过明确校准的信号,不能随意将不同量纲分数相加。Azure 的 RRF 是具体实现的一种排名融合机制,不代表所有系统都采用它。

修复后检查新代价

增大 top-k 可能提高候选覆盖,也可能增加噪声、成本和输入长度。固定有答案、无答案、旧版本与权限受限样本,比较阶段结果以及最终证据支持。一次个案成功只证明该样本改善,不能推导整体效果。

运行实验,观察反例

固定证据标识列表的管线诊断;不执行向量检索、真实重排、语言模型或语义裁判。

Python 3.10+ · 默认运行只使用标准库 · 在你的电脑运行

  1. 核对 necessary evidence 的两块材料
  2. 运行上下文缺失反例
  3. 分别改变候选与回答支持条件
下载 rag_evidence.py ↓
python3 rag_evidence.py
查看本入口脚本
"""Trace evidence survival through fixed lists; no search or LLM is executed."""
import json


def diagnose(required, candidates, ranked, context, supported_claims):
    if not required.issubset(set(candidates)):
        return "retrieval"
    if not required.issubset(set(ranked)):
        return "ranking"
    if not required.issubset(set(context)):
        return "context"
    if not supported_claims:
        return "generation"
    return "supported"


def demo():
    required = {"policy-current", "policy-exception"}
    candidates = ["old-policy", "policy-current", "policy-exception"]
    ranked = ["policy-current", "policy-exception", "old-policy"]
    stage = diagnose(required, candidates, ranked, ranked[:1], True)
    fixed = diagnose(required, candidates, ranked, ranked[:2], True)
    assert stage == "context" and fixed == "supported"
    return dict(first_failure=stage, fixed_evidence_check=fixed,
                generation_still_needs_review=True)


if __name__ == "__main__":
    print(json.dumps(demo(), sort_keys=True))

本地运行的预期输出

{"first_failure": "context", "fixed_evidence_check": "supported", "generation_still_needs_review": true}
  • 定位最早证据缺口
  • 集合检查与语义检查分开
  • 最终修复需核对真实结论
查看运行环境、输出和校验记录 →

本层验收任务

为“候选第 30 名有正确证据,但最终只用 5 块”写诊断与对照实验。

逐条验收自评

正在读取此浏览器记录…

收起答案,检查理解

所有问题都增大 top-k,有什么可能的退化?

延伸原理与知识练习

遇到不熟悉的原理,先阅读实现、连续追问和迁移案例,再独立说明前提与边界。作答与笔记保存到原有账号记录。

本专题的全部关联解析与练习(4 道)

依据与验证范围

原理依据来自公开资料;数字、案例和任务是本站教学设计。离线实验验证本页注明的范围,学习效果仍需通过独立任务与反馈判断。