Agent 应用开发会员账号
知识目录选择核心方向与细分内容
知识单元 22进阶场景设计约 12 分钟

理解 → 实现 → 排错 → 取舍

证据支持、部分回答与可校准的拒答

考察证据充分性、逐项引用、冲突处理与拒答校准。

Grounding拒答引用

知识内容核对 2026-10-03 · 原题来源核对 2026-10-02

这个知识点,你想学到哪一步?

按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。

先理解

刚接触这个知识点

补齐先备概念,读原理与反例,再用自己的话解释为什么。

从核心原理开始 →

再实现

准备把原理写进代码

理解实现步骤与边界,完成小任务,对照验收要求检查结果。

阅读实现与取舍 →

会排错

需要处理故障与条件变化

沿连续追问定位失效前提,再比较迁移案例,说明方案应如何调整。

沿问题继续深入 →

能取舍

需要设计或评审方案

结合工程推演与资深自评标准,解释方案的适用条件、代价和替代选择。

分析工程场景 →
知识单元目录

LEARN · PRACTICE · REFLECT

知识学习与个人记录

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 证据支持、部分回答与可校准的拒答

先理解核心原理

先备概念:相关性与逻辑支持、主张分解、有答案与无答案评测

引用证明有一个来源,不证明来源支持当前结论。回答范围应由可核对的主张与证据关系决定,证据不足时缩小结论或补信息,不能用相似度填补。

从主题相关到结论成立还有距离

用户问“本版本是否支持取消任务”,文档讲任务管理且得分很高,却只说明旧版本支持暂停。它相关,但没有支持这个具体主张。每个关键结论应能定位到证据中的对象、版本、条件和数值;引用整个文档可能掩盖证据缺口。

拒答不是单一开关

证据完整时回答;支持部分内容时给出已知范围并标明缺口;问题缺少会改变结果的条件时澄清;资料过期或互相冲突时说明分歧并继续查。无法回答本身也是合理结果。反例是相关文档缺失时引用别处再用模型常识补全,这会把未验证推断包装为知识库答案。

把判断落到主张层

先列出答案必须回答的主张,再给每项标记支持、冲突、过期或缺失。直接引文支持明确陈述,跨文档推导还要显示推导步骤与共同适用条件。高相似度只能帮助找到阅读对象,模型自报信心也不是可靠的正确概率。重要数值与业务口径可以由确定性计算或人工核对补充。

同时约束错误回答和错误拒答

只追求低幻觉可能让系统对所有问题拒答,看似安全但没有学习价值。分别统计有答案样本的正确覆盖、无答案样本的错误回答、部分回答的支持程度和澄清质量;用固定版本资料并重复评测随机波动。拒答阈值依任务风险与样本校准,来源中的评测方法支持这个流程,不保证某个通用分数能自动完成它。

用一个问题检查理解

RAG 引用了文档却仍在胡说,如何判断应该回答还是拒答?

检索到相关文档只说明主题相关,不代表证据支持当前结论。我会把回答拆为可核对主张,要求每项关键数字和判断对应具体证据;区分证据缺失、过期和冲突。证据不足时回答已知部分并指出缺口,必要时澄清或继续检索。拒答阈值要在有答案和无答案样本上校准,不能依赖模型自报的信心分。

实现与取舍

引用正确有两层

首先引用必须真实存在、用户可访问且指向正确版本;其次被引用片段必须支持紧邻结论。链接到整篇文档不等于证明了其中的数字。将“产品支持 SSO”和“当前套餐包含 SSO”分成两个主张,可发现模型把一般能力误扩展成具体权益。

证据状态决定下一步

缺少必要字段时可进行一次有预算的补检;问题有实体歧义时先澄清;来源冲突时并列说明来源、时间与适用范围。不能把不同年份、不同地区的条款拼成一个新规则。对于用户当前无权访问的证据,不能通过引用摘要泄露内容,也不能用“拒答理由”暴露隐藏文档标题。

拒答不是越多越安全

建立可回答、不可回答、部分可回答和冲突问题四类集合。测有效回答正确率、错误强答率、错误拒答率以及引用支持率。先确定业务损失,再选阈值;单个向量相似度在不同查询和语料间不天然可比,模型自报置信度也需要外部校准。

评审与线上验证

对重要事实使用字段检查或独立计算,对开放结论可用经人工校准的裁判辅助,但保留人工抽查。记录缺失证据类别,为补齐知识库提供输入。用户纠正可进入待审核反馈集,不能直接作为真实标准答案写回检索库,否则会把一次错误反馈变成持续污染。

工程推演

场景
面试假设:回答引用产品总介绍,却误称基础套餐含企业 SSO。
设计决策
把套餐权益拆为主张,检索对应版本的套餐证据。
验证目标
证据不支持时说明缺口,拒绝推出不存在的权益。
适用边界
阈值应按业务场景校准,无法保证所有生成完全无误。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

允许一般知识辅助解释

改变的条件:从封闭知识库变为来源加常识

延伸问题:资料只解释重试机制,可以补充通用工程建议吗?

推导与参考解答

可以在业务允许时清楚分开“资料明确说明”和“基于工程原理的建议”,建议写明前提并给独立依据。不能补出该产品未记载的功能或配置。对于只准引用内部资料的模式,证据不足就限制答案范围。

保持不变的原理:生成的每个具体主张都要有可说明的依据,推断不能伪装成来源原话。

信息随时间变化

改变的条件:答案曾有依据,现在知识版本落后

延伸问题:旧引用真实存在,还能回答“现在支持吗”?

推导与参考解答

注明资料版本与日期,检查当前发布记录;没有当前证据时只能说旧资料如何描述,并说明无法确认现状。旧答案缓存要依知识版本失效。给出“曾支持”不能逻辑推出“现在支持”,尤其有弃用或地区差异时。

保持不变的原理:证据不仅要相关和存在,还要适用于问题所问的时间。

易错点

  • 有引用就认为有依据
  • 把模型信心当概率
  • 只优化正确率不统计错误拒答

参考资料

依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
能逐项检查引用片段是否确实支持相邻结论。
中高级信号
提出四类证据样本,同时统计错误强答和错误拒答。
资深信号
将证据时效、权限、裁判校准和反馈审核串起来。

继续做进阶研究实验

政策变化后,旧上下文为什么不能继续用?

把检索前过滤的思想迁移到记忆版本与恢复。观察撤销后已有草稿怎样失效。

阅读全文与故障分析 → · 下载可靠性实验 v3 ↓

python3 cli.py memory-put --db memory.sqlite
python3 cli.py submit --db memory.sqlite
python3 cli.py run --db memory.sqlite --lease-seconds 2 --fault after_draft
python3 cli.py memory-forget --db memory.sqlite
# 等待至少 2 秒后分别执行
python3 cli.py run --db memory.sqlite
python3 cli.py inspect --db memory.sqlite

保留证据,逐条核对

  • 首次退出后 draft 检查点已存在。
  • memory-forget 后恢复得到 failed 与 memory_changed_or_expired。
  • 没有 publish 检查点;解释失效阻断与彻底删除的区别。

验证本地作用域、版本与撤销阻断;旧检查点仍保留,不提供日志、备份和检查点的彻底删除。

动手验证 按需完成 · 建议 15 分钟

给三条主张配两段证据,标记支持、矛盾和不足,并写最终答复。

展开验收要求与检查点
  • 不支持的主张不会强答
  • 冲突有来源与时间
  • 已知部分仍可清晰交付

重点检查

  • 区分相关性与支持性
  • 评估强答和拒答两类损失
  • 处理冲突、时效和引用权限