AFAgent Field Notes会员账号
知识目录选择核心方向与细分内容
Q22进阶场景设计约 12 分钟

证据支持、部分回答与可校准的拒答

RAG 引用了文档却仍在胡说,如何判断应该回答还是拒答?

考察证据充分性、逐项引用、冲突处理与拒答校准。

Grounding拒答引用

知识内容核对 2026-10-03 · 原题来源核对 2026-10-02

本题目录

READ · UNDERSTAND · TRANSFER

阅读理解,按需巩固

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 证据支持、部分回答与可校准的拒答

先理解核心原理

先备概念:相关性与逻辑支持、主张分解、有答案与无答案评测

引用证明有一个来源,不证明来源支持当前结论。回答范围应由可核对的主张与证据关系决定,证据不足时缩小结论或补信息,不能用相似度填补。

从主题相关到结论成立还有距离

用户问“本版本是否支持取消任务”,文档讲任务管理且得分很高,却只说明旧版本支持暂停。它相关,但没有支持这个具体主张。每个关键结论应能定位到证据中的对象、版本、条件和数值;引用整个文档可能掩盖证据缺口。

拒答不是单一开关

证据完整时回答;支持部分内容时给出已知范围并标明缺口;问题缺少会改变结果的条件时澄清;资料过期或互相冲突时说明分歧并继续查。无法回答本身也是合理结果。反例是相关文档缺失时引用别处再用模型常识补全,这会把未验证推断包装为知识库答案。

把判断落到主张层

先列出答案必须回答的主张,再给每项标记支持、冲突、过期或缺失。直接引文支持明确陈述,跨文档推导还要显示推导步骤与共同适用条件。高相似度只能帮助找到阅读对象,模型自报信心也不是可靠的正确概率。重要数值与业务口径可以由确定性计算或人工核对补充。

同时约束错误回答和错误拒答

只追求低幻觉可能让系统对所有问题拒答,看似安全但没有学习价值。分别统计有答案样本的正确覆盖、无答案样本的错误回答、部分回答的支持程度和澄清质量;用固定版本资料并重复评测随机波动。拒答阈值依任务风险与样本校准,来源中的评测方法支持这个流程,不保证某个通用分数能自动完成它。

回到问题:怎样回答?

检索到相关文档只说明主题相关,不代表证据支持当前结论。我会把回答拆为可核对主张,要求每项关键数字和判断对应具体证据;区分证据缺失、过期和冲突。证据不足时回答已知部分并指出缺口,必要时澄清或继续检索。拒答阈值要在有答案和无答案样本上校准,不能依赖模型自报的信心分。

实现与取舍

引用正确有两层

首先引用必须真实存在、用户可访问且指向正确版本;其次被引用片段必须支持紧邻结论。链接到整篇文档不等于证明了其中的数字。将“产品支持 SSO”和“当前套餐包含 SSO”分成两个主张,可发现模型把一般能力误扩展成具体权益。

证据状态决定下一步

缺少必要字段时可进行一次有预算的补检;问题有实体歧义时先澄清;来源冲突时并列说明来源、时间与适用范围。不能把不同年份、不同地区的条款拼成一个新规则。对于用户当前无权访问的证据,不能通过引用摘要泄露内容,也不能用“拒答理由”暴露隐藏文档标题。

拒答不是越多越安全

建立可回答、不可回答、部分可回答和冲突问题四类集合。测有效回答正确率、错误强答率、错误拒答率以及引用支持率。先确定业务损失,再选阈值;单个向量相似度在不同查询和语料间不天然可比,模型自报置信度也需要外部校准。

评审与线上验证

对重要事实使用字段检查或独立计算,对开放结论可用经人工校准的裁判辅助,但保留人工抽查。记录缺失证据类别,为补齐知识库提供输入。用户纠正可进入待审核反馈集,不能直接作为真实标准答案写回检索库,否则会把一次错误反馈变成持续污染。

工程推演

场景
面试假设:回答引用产品总介绍,却误称基础套餐含企业 SSO。
设计决策
把套餐权益拆为主张,检索对应版本的套餐证据。
验证目标
证据不支持时说明缺口,拒绝推出不存在的权益。
适用边界
阈值应按业务场景校准,无法保证所有生成完全无误。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

允许一般知识辅助解释

改变的条件:从封闭知识库变为来源加常识

延伸问题:资料只解释重试机制,可以补充通用工程建议吗?

推导与参考解答

可以在业务允许时清楚分开“资料明确说明”和“基于工程原理的建议”,建议写明前提并给独立依据。不能补出该产品未记载的功能或配置。对于只准引用内部资料的模式,证据不足就限制答案范围。

保持不变的原理:生成的每个具体主张都要有可说明的依据,推断不能伪装成来源原话。

信息随时间变化

改变的条件:答案曾有依据,现在知识版本落后

延伸问题:旧引用真实存在,还能回答“现在支持吗”?

推导与参考解答

注明资料版本与日期,检查当前发布记录;没有当前证据时只能说旧资料如何描述,并说明无法确认现状。旧答案缓存要依知识版本失效。给出“曾支持”不能逻辑推出“现在支持”,尤其有弃用或地区差异时。

保持不变的原理:证据不仅要相关和存在,还要适用于问题所问的时间。

易错点

  • 有引用就认为有依据
  • 把模型信心当概率
  • 只优化正确率不统计错误拒答

参考资料

依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
能逐项检查引用片段是否确实支持相邻结论。
中高级信号
提出四类证据样本,同时统计错误强答和错误拒答。
资深信号
将证据时效、权限、裁判校准和反馈审核串起来。

巩固练习 按需完成 · 建议 15 分钟

给三条主张配两段证据,标记支持、矛盾和不足,并写最终答复。

展开验收要求与检查点
  • 不支持的主张不会强答
  • 冲突有来源与时间
  • 已知部分仍可清晰交付

重点检查

  • 区分相关性与支持性
  • 评估强答和拒答两类损失
  • 处理冲突、时效和引用权限