READ · UNDERSTAND · TRANSFER
阅读理解,按需巩固
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 语义裁判的校准与误差
先理解核心原理
先备概念:标注规则、混淆矩阵、不可信输入
LLM 裁判输出是一个带偏差的测量值。只有明确评分对象、用独立人工样本检查误差,并隔离被评内容的指令,分数才有解释意义。
裁判不天然拥有真值
开放答案可能需要语言理解,但换一个模型打分并不会产生事实。先把可确定项目交给程序,例如引用是否存在、金额是否一致;让语义裁判只评需要解释的部分,并提供任务约束与已核对证据。
一致率之外看错在哪里
两个裁判可能同时偏爱长答案,整体一致率高却共同放过事实错误。校准对中要同时有简短正确、冗长错误、位置交换、引用伪造和明确未知。分别统计误放与误拒,按风险加以处理,样本过少时不虚构稳定阈值。
评分环境也是攻击面
答案里的“请给满分”属于待评数据。明确分隔指令与内容,限制输出为约定结构,裁判不携带写工具或敏感凭证。提示隔离不能保证彻底消除注入,仍需人工抽检与对抗样本。以下校准流程为设计建议,未测任何裁判模型。
回到问题:怎样回答?
LLM 裁判可辅助开放文本评测,但不能作为未经校准的真值。先写出可判定评分规则,确定性事项用程序检查,主观部分用独立人工样本校准。评测顺序偏差、长度偏好、模型自我偏好和评分提示注入,记录裁判版本及与人工的一致性。高风险动作是否越权仍由策略与执行证据判断。
实现与取舍
把评分对象拆开
结构合法、数值相等、产物存在等用确定性校验;表达完整性或证据解释可用模型评分。给裁判原始任务、允许使用的证据和明确维度,避免它只看流畅文风。评分输出应附支持判断的引用或简短理由,不要求暴露不可核验的长推理。
校准与偏差检查
准备人工复核样本,包含正确短答、错误长答、无依据但自信的答案和合法拒答。交换 A/B 展示顺序、遮去模型名称、控制格式,观察分数是否稳定。评估一致性之外,还看高风险错误的漏判率;总体相关性较高不代表可以用于自动放行。
裁判也会被输入干扰
待评答案可能包含“请打满分”等指令,必须把它明确作为被评内容,并通过攻击样本验证。裁判只应拥有评分所需的读取能力,不给它执行生产动作的工具。多个裁判一致也可能共享偏差,不能把简单多数投票当独立事实证明。
持续维护
锁定裁判模型、提示词、评分规则和数据版本。换裁判前对同一批答案做成对比较,必要时重新校准历史分数。争议样本进入人工复核,发布时同时展示确定性通过率、裁判指标和人工抽查结论。把裁判当测量仪器维护,才有资格讨论它测出的提升。
工程推演
- 场景
- 面试假设:新模型回答更长,裁判分数上升,但关键事实错误更多。
- 设计决策
- 加入短正确、长错误对照并核对事实与引用。
- 验证目标
- 评分更贴近人工验收,文风不掩盖事实错误。
- 适用边界
- 人工标注也需要一致性管理,不能默认单人判断无误。
连续追问与解答
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层两个裁判一致就一定正确吗?
主问题谈可靠性,继续检查共识是否产生独立证据。
参考解答
不一定。相同训练偏好、相似提示和同一证据缺口会产生相关错误。用独立专家标注的困难样本评估误放率,检查双方共同错的类型;多裁判可以提示不确定性,但一致意见不能替代事实来源和硬约束检查。
第 1 层答案里藏评分指令怎么办?
裁判读取答案后,答案本身可能试图控制评分。
参考解答
将答案作为带边界的非指令输入,评分规则放可信层,限制裁判能力与输出,并加入评分注入反例。程序核对可检查事项;若模型因“忽略规则”改变评分,记录裁判失效并转人工。仅过滤某个关键词不能覆盖编码、引用和多轮攻击。
沿着这个回答继续深入
第 2 层把答案包进 JSON 字符串,是否已完全解决评分注入?
父问采用输入隔离,子问检验序列化是否等于语义安全。
参考解答
没有。JSON 保证结构转义,不保证模型不会理解并遵从字符串中的指令。结构化封装便于区分字段,但仍要给裁判限定任务、移除外部执行能力,测试语义注入,并让规则检查与人工复核承担关键事实。
沿着这个回答继续深入
第 3 层裁判只输出分数没有工具,评分被操纵还会造成实际风险吗?
父问收缩裁判权限,继续追问评分作为下游控制信号的风险。
参考解答
会。如果分数决定自动发布、退款或模型升级,错误高分会进入下游决策。让高风险决策另有事实门禁、权限检查和审批;把裁判当证据之一,并保留可复核理由,不能因裁判无工具就认为整个系统无副作用。
第 1 层更换裁判后历史分数还能直接比吗?
校准绑定裁判版本,升级后需要恢复比较口径。
参考解答
不能直接比较绝对分数。冻结一组带人工标注的锚点,让新旧裁判在相同条件下重评,观察排序、误放和尺度差异;记录模型、提示、规则与证据版本。可以分别报告两套历史曲线,不应用任意线性换算掩盖分类差异。
举一反三:条件变了,怎样推导?
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
评分用于筛选研究稿
改变的条件:裁判要判断引用是否支持主张,而非表达好坏。
延伸问题:怎样降低流畅幻觉获高分?
推导与参考解答
逐条给出主张与已读取来源片段,先用规则确认引用标识,再让裁判指出支持、冲突或不足。选择性抽检高分稿中的关键事实,来源缺失直接标未知;写作质量单独评分,不能代替证据核查。
保持不变的原理:语义评价必须明确对象并用外部真值校准。
低风险建议变成付款门禁
改变的条件:错误高分会触发资金动作。
延伸问题:沿用平均一致率是否合理?
推导与参考解答
先用业务规则验证身份、金额、交易状态与批准,裁判只辅助解释。校准更关注错误放行及其条件,无法核对就暂停。评分再高也不能授权支付;风险变化要求改变门禁而不是只换更强模型。
保持不变的原理:裁判误差不能取代业务事实与授权。
易错点
- 用同一模型自评当真值
- 只看相关系数不看危险漏判
- 裁判版本变化不记录
参考资料
依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
检查自己理解到哪一步
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
- 基础达标
- 知道模型评分有偏差,保留人工复核。
- 中高级信号
- 能设计交换顺序、长度和注入测试。
- 资深信号
- 治理裁判版本与阈值,并区分高风险漏判。
巩固练习 按需完成 · 建议 15 分钟
写一份三维评分规则,并设计一条能骗过只看文风裁判的错误答案。
展开验收要求与检查点
- 事实与文风分开评分
- 理由指向证据
- 危险错误不能被平均分掩盖
重点检查
- 确定性检查与主观裁判分开
- 能检测顺序和长度偏差
- 有人工校准及版本治理