AFAgent Field Notes会员账号
知识目录选择核心方向与细分内容
Q62基础原理约 16 分钟

参数能力、上下文证据与任务行为的适配边界

预训练、RAG 和微调分别改变什么?企业知识问答为什么常要组合使用?

区分参数中的能力、请求中的证据与训练后的行为,按失败原因选择适配方法。

预训练RAG微调模型适配

知识内容核对 2026-10-03 · 原题来源核对 2026-10-03

本题目录

READ · UNDERSTAND · TRANSFER

阅读理解,按需巩固

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 参数能力、上下文证据与任务行为的适配边界

先理解核心原理

先备概念:训练与推理的区别、输入上下文与输出分布、可信数据来源与授权

训练使未来请求采用不同的参数或适配器;上下文使当前输出有不同条件。能力、证据和可访问性需要分别验证,改变其中一项不会自动修好另两项。

为什么看到一段资料不等于永久学会

可以将生成理解为在参数与当前输入条件下选择后续输出。预训练让模型从广泛文本形成规律和知识;推理时加入一本新手册,改变这次输出的条件,普通调用并没有为它执行参数训练。换个没有这段资料的请求,不能假定模型仍知道手册。应用可以另行保存会话或记忆,但那是数据系统,不是模型参数自动学会。

“知道”与“查到”有不同可控性

参数中的事实可能帮助解释背景,也可能与当前制度冲突。它不是一张带文档版本、来源页码和当前 ACL 的行记录;把新制度做训练能改变输出倾向,但不能由训练成功推导每种问法都已覆盖旧值、或特定用户已失去读取权。来源可更新、可定位的外部证据更容易管理这些变化,不过取回正确资料仍要求模型理解条件,不能保证回答忠实。

微调的效果取决于示例教了什么

如果示例只有固定问句和固定答案,模型可能只学到这批搭配;如果同一问句配不同证据、答案随证据变化,训练目标更接近“如何依证据处理”。事实、行为并无绝对隔离,微调也可改善领域知识,但需要在未见事实和表达上检验,不能将记忆训练文本当业务真相接口。

用反例选择最小改动

对稳定分类任务,输入已经包含全部信息,额外检索不一定有收益,代表性标签示例可能更有用。对分钟级余额,微调曾见过金额也没有当前值,应查询权威状态。对正确资料下的持续漏条件,先检查指令与约束,再用训练样例改善读取行为。无论选择什么,授权与业务确定性规则由可信系统提供,模型的服从程度不构成安全证明。

回到问题:怎样回答?

预训练从大规模数据学习通用语言能力与知识,微调继续训练参数或适配器以适应特定任务,RAG 在请求时检索外部资料并作为上下文证据。微调可以学到事实,但并不自动提供实时更新、精确引用或按请求撤权;RAG 提供证据也不保证模型正确使用。先看错误来自缺信息还是处理方式:当前企业资料优先检索,实时业务状态用工具查询,稳定的格式、分类或证据使用行为可在提示基线后考虑微调;组合效果需分别验证事实支持、行为一致性、权限和成本。

实现与取舍

三种方法作用在不同位置

预训练为模型建立广泛能力与参数中的知识,典型自回归语言模型通过预测后续 Token 学习文本规律。得到的参数不是逐条可查的企业数据库。微调与低参数适配在已有模型上继续训练,可更新参数或适配器,让它更适应特定输入输出分布;它可以改善格式、分类、术语理解,也可能记住新事实。不能概括成“微调只教风格”。

RAG 的通常应用过程是在推理时取回资料,把它放入当前请求,让生成模型基于问题和证据作答。这一步通常不改变模型参数;可训练的检索器或与生成器联合训练也是存在的,因此 RAG 与微调不是互斥架构。要区分知识从哪里来,以及模型怎样使用它。

企业知识与授权为什么需要外部机制

制度今天修改、员工刚被撤权,训练好的参数不会因为删除一篇文档或变更 ACL 自动同步。模型即使能复述旧制度,也无法仅凭这份记忆证明哪个版本当前有效、此人现在可读哪一段。频繁变化的文档适合从可更新且可鉴权的资料源检索;余额、库存等实时状态优先用可信工具读取。授权由服务端执行,训练“拒绝无权问题”的行为不能替代真实权限检查。也要避免将需细粒度撤销的秘密直接混入所有用户共用的模型训练。

先找瓶颈,再决定适配

模型不知道新政策,继续训练输出格式没有补足当前事实;模型已经得到完整政策却总漏必要字段,塞更多文档也未必改善。先做提示和结构约束的基线,再判断是否有足够稳定、代表性的示例支持微调。若既要读当前资料又要稳定输出,可训练它如何使用证据,同时让每次请求仍携带适用资料。

分开检验信息和行为

比较基础模型、基础模型加资料、微调模型、微调模型加相同资料。先在固定正确证据下比较处理行为,再用真实检索验证完整系统。测试包含更新后事实、参数旧知识与新证据冲突、无证据、无权限和未见措辞;分别统计事实支持、格式、合理拒答、泄露、成本与延迟。训练集记得更牢不证明泛化,组合只有在这些维度符合目标时才有意义。

工程推演

场景
教学假设:企业客服模型曾学过“退订窗口为 7 天”,现行资料改为特定产品 14 天,同时要求回答固定字段。
设计决策
从可信且已授权的现行资料取得退订条件,以提示建立基线;若字段遗漏持续且示例充足,再用证据到答案的训练改善行为。
验证目标
验收目标是答案跟随适用版本的条件变化,字段完整,证据缺失时不凭旧记忆补出确定结论。
适用边界
案例为教学设计,未训练模型、未测实际收益;14 天是假设数值,不代表真实产品制度。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

稳定工单分类

改变的条件:输入包含全部事实,标签集合长期稳定,无需查询动态知识

延伸问题:每条工单都要分为固定类别,还应先建设知识库吗?

推导与参考解答

先用明确标签定义与少量示例建立基线,检查相邻类别边界及未知类别。若任务量大、输入分布稳定且错误持续,可用代表性标注数据评估微调;检索只有在分类必须依赖外部规则时才增加价值。测试新措辞与边界例,而不是只复用训练工单,标签规则变化后重新评估。

保持不变的原理:输入信息是否充分与模型处理行为是否合格分别判断;技术投入要针对实际缺口。

分钟级账户状态

改变的条件:知识变为实时结构化状态,并具有逐用户权限

延伸问题:模型曾微调学过账户信息,查询此刻余额为什么仍需工具?

推导与参考解答

训练值只能描述过去样本,当前余额由权威业务系统计算与读取。可信服务端验证账户范围与权限,工具返回时点、币种和余额类型;模型解释结果但不凭记忆生成金额。RAG 可辅助解释余额定义,不能替代实时查询。用户撤权后阻止工具读取,不用训练模型忘记一串数字充当鉴权。 若敏感事实已经进入共享参数,仅阻断工具仍不能防止模型复述旧值,应隔离或停用受影响模型并单独检查泄露;不能把微调遗忘当作可靠的访问控制。

保持不变的原理:参数提供处理能力,当前事实和授权由可核对外部状态提供,行为训练不能替代它们。

易错点

  • 把预训练参数当成可实时更新、可逐条撤销的权威数据源
  • 笼统声称微调不能学事实,或检索到文档就一定能答对
  • 用微调拒答行为替代服务端认证与数据授权
  • 训练与测试重复制度答案,误把记忆样本当泛化能力

参考资料

依据原始论文及官方资料设计;来源支持训练与检索机制,示例、追问、评分与实验计划为本站教学设计,不代表公司面试原题或实测效果。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
能区分预训练与微调改变参数、普通检索增强在请求中提供证据。
中高级信号
能按资料时效与输出行为定位瓶颈,解释微调与 RAG 可组合但不能替代服务端授权。
资深信号
能设计固定证据和真实系统两阶段对照,覆盖新事实、旧记忆冲突、权限与成本边界。

巩固练习 按需完成 · 建议 15 分钟

把“政策已更新但模型答旧值”“证据完整却漏字段”“当前用户撤权”“无需文档的稳定分类”四种失败,分别归因并设计最小对照。

展开验收要求与检查点
  • 选择的方法直接针对缺信息或行为失败,不把三种技术视为等价选项
  • 明确事实更新和权限从可信外部状态取得,训练拒答不替代授权
  • 测试新数值、无证据与未见措辞,固定证据比较行为再检查端到端结果

重点检查

  • 能区别训练改变参数与推理时提供上下文,理解二者可以组合
  • 不把微调说成只能学风格,也不把 RAG 说成自动保证真实
  • 能按信息缺失或行为失败选择方法,并把当前授权放在可信服务端
  • 用独立测试与条件变化评估组合收益,避免训练答案泄漏