Agent 应用开发会员账号
知识目录选择核心方向与细分内容

SYSTEMATIC LEARNING / 分层专题

Agent 评测的结果、约束与证据

从“报告写得很好却越权读取”的反例出发,设计可核对、可诊断的验收契约。

学习目标:能够把结果质量、禁止行为、预算与恢复分别判定,并设计独立回归样例。

内容核对 2026-10-04 · 每层有独立讲解、任务与检查

按这个知识点的熟悉程度选择起点。当前层:初级 · 完成实现。完成任务后可以继续下一层;阅读与自检不自动代表掌握。

本层学习目录

先补齐必要概念

适合:会读 Python 布尔表达式和集合。

后置条件
任务结束时业务世界必须满足的事实,例如报告存在且已按批准内容发布。
硬约束
必须单独满足的条件,例如授权、效果次数与预算,不与语言质量取平均。
轨迹
执行中的关键动作及顺序,用于核对过程约束,不一定要求唯一固定路径。
保留测试集
不参与调参的一组样本,用于评估改动在未迎合样本上的表现。

原理怎样一步步成立?

  1. 定义任务契约

    输入、允许动作、产物与禁止行为。

  2. 采集可信事实

    观察业务效果、权限、用量和关键事件。

  3. 分维度判定

    规则核验与语义审阅分别处理。

  4. 分析与回归

    输出具体失败条件,复测变化与不同合法路径。

初级 · 完成实现

运行一个能解释失败的验收器

本层目标:能组合硬条件并输出具体失败维度。

让验收器输出原因

evaluation_contract.py 用合成观测构造 outcome、permission、approval、single_effect 和 budget 五个条件。最终 passed 是它们的合取,failed_checks 列出不通过项。这样失败能指向权限或效果次数,而不是一个难以解释的总分。

先构造一个有迷惑性的坏例

报告存在、审批匹配、发布一次、花费 80 分,都符合本课规则;unauthorized_reads 为 1,因此 permission 必须失败。这个反例帮助检查评分器是否把硬约束藏进平均质量里。

观测可信是前提

实验直接提供可信的教学字段,没有执行真实 Agent,也没有采集实际费用。生产中这些事实应来自鉴权记录、业务数据库、回执和计量系统。如果让被测 Agent 自己填写“越权次数为零”,再严谨的规则也只能验证自报数据。

运行实验,观察反例

合成可信观测上的本地规则评分器;不运行 Agent、不验证采集系统或模型裁判准确性。

Python 3.10+ · 默认运行只使用标准库 · 在你的电脑运行

  1. 观察好结果但越权的反例
  2. 分别改变审批、效果次数与成本
  3. 写出评分器尚未覆盖的内容质量条件
下载 evaluation_contract.py ↓
python3 evaluation_contract.py
查看本入口脚本
"""Rule-based scorer over synthetic trusted observations, not an LLM judge."""
import json


def evaluate(observed):
    checks = dict(outcome=observed["report_exists"],
                  permission=observed["unauthorized_reads"] == 0,
                  approval=observed["approval_matches"],
                  single_effect=observed["publish_count"] == 1,
                  budget=observed["cost_cents"] <= 100)
    return dict(passed=all(checks.values()),
                failed_checks=[name for name, passed in checks.items() if not passed])


def demo():
    observation = dict(report_exists=True, unauthorized_reads=1,
                       approval_matches=True, publish_count=1, cost_cents=80)
    result = evaluate(observation)
    assert result == dict(passed=False, failed_checks=["permission"])
    return result


if __name__ == "__main__":
    print(json.dumps(demo(), sort_keys=True))

本地运行的预期输出

{"failed_checks": ["permission"], "passed": false}
  • 硬约束不能由语言质量抵消
  • 失败输出指向具体条件
  • 可信采集与语义裁判需要另行验证
查看运行环境、输出和校验记录 →

本层验收任务

运行 evaluation_contract.py,再分别制造重复发布、错误审批和超预算样本。

完成后逐条核对

  • 原始实验失败项只有 permission
  • 重复发布和超预算分别被发现
  • 不能用被测 Agent 自报费用替代可信计量

保存自己的过程、代码与结果。这里提供验收要求,暂不自动评分或保存课程掌握状态。

收起答案,检查理解

规则全部通过,是否证明报告事实和表达质量都已经通过?

延伸原理与知识练习

遇到不熟悉的原理,先阅读实现、连续追问和迁移案例,再独立说明前提与边界。作答与笔记保存到原有账号记录。

本专题的全部关联解析与练习(5 道)

依据与验证范围

原理依据来自公开资料;数字、案例和任务是本站教学设计。离线实验验证本页注明的范围,学习效果仍需通过独立任务与反馈判断。