AFAgent Field Notes会员账号
知识目录选择核心方向与细分内容
Q42高级原理约 18 分钟

随机任务的成功率与重试口径

同一道题跑十次只有六次成功,怎样汇报和选择上线版本?

考察随机性、任务级统计、pass@k 与稳定性。

pass@k稳定性统计

知识内容核对 2026-10-03 · 原题来源核对 2026-10-02

本题目录

READ · UNDERSTAND · TRANSFER

阅读理解,按需巩固

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 随机任务的成功率与重试口径

先理解核心原理

先备概念:比例估计、重复实验、任务分组

一次可靠、多次至少一次成功、每次都成功是不同问题。指标必须绑定用户实际的尝试政策,并保留任务之间与同一任务重复之间的差异。

先决定用户得到几次机会

用户只允许发送一次邮件时,五次中成功一次没有意义;代码探索允许多候选并由测试挑选,才有理由考察多次尝试。若能准确识别成功并且尝试独立、每次成功概率固定为 p,至少一次成功为 1−(1−p)^k,全部成功为 p^k。缺少这些前提时应实测对应政策,不能硬套公式。

任务数与运行数分开

十个任务各跑十次,包含一百次运行,但对新任务的覆盖仍只有十个。报告每题通过次数、分层结果及整体口径;同一题共享难度和环境,不能把所有运行当一百个独立任务来夸大泛化证据。

不确定性也是结果

小样本比例容易波动。同一总体、独立且具有共同成功概率的伯努利样本,可报告 Wilson 等区间;异质固定任务集不能不加说明地直接套用二项区间;多次运行按任务分组分析,必要时以任务为单位重采样,并说明前提。温度为零也未承诺端到端确定性,工具数据、服务版本和执行调度仍会变化。本单元公式是条件推导,没有新增模型实测。

回到问题:怎样回答?

报告单次成功率和重复运行分布,并说明任务数、每题运行次数、采样设置与费用。至少一次成功和连续多次都成功衡量不同目标,不能把多次尝试里的最好结果当单次可靠性。对同一任务集成对比较版本,按任务聚类估计不确定性,观察关键风险和成本;上线选择应匹配用户实际允许的重试次数。

实现与取舍

明确分母和交付方式

十次中成功六次是该任务在指定条件下的观测结果,不是对所有任务准确率的证明。实际产品若只运行一次,就应看单次表现;若会自动尝试多次,必须把所有尝试的费用、时延和副作用算入。可重复写动作并不总允许通过多次试错寻找一次成功。

不同指标回答不同问题

至少一次成功适合评估多候选探索潜力,而多次均成功更接近稳定性要求。不要混淆 pass@k 与需要每次都可靠的业务目标。独立同分布假设下可用 1-(1-p)^k 估算至少一次成功,但实际同一任务的失败常相关,不能直接把估算当测量结果。

比较两个版本

固定工具环境、数据快照、允许预算和验收,逐题比较结果。简单与困难任务分别观察,避免一个版本只在大量容易题上提升。重复运行属于同一任务的相关观测,置信估计可按任务分组重采样,而不是把所有尝试当独立新题。小样本改善应明确不确定性。

上线门槛

定义关键违规为独立阻断项,质量、成本与尾延迟各有门槛。新版本若成功率略高但成本翻倍,应看每次成功交付成本和用户等待是否可接受。先灰度并监测真实失败,再决定扩大流量;不要因为一次漂亮演示就跳过重复性评估。

工程推演

场景
面试假设:版本 A 十次成功六次,版本 B 七次,但 B 用量翻倍。
设计决策
扩大固定任务集成对比较,报告单次质量和总尝试成本。
验证目标
能判断改进是否稳定且符合实际交付要求。
适用边界
小样本不支持确定结论,需要报告不确定性。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

代码建议允许测试选择

改变的条件:用户接受多候选,外部副作用发生在选定后。

延伸问题:应怎样选择版本?

推导与参考解答

评估整个候选生成和测试选择流程,报告预算内真实通过、误选与总耗时;另外保留首候选质量。多尝试收益必须扣除测试与生成成本,不能只展示最佳补丁。

保持不变的原理:成功率与尝试和选择政策一起定义。

自动退款禁止重复尝试效果

改变的条件:任务带资金副作用,最多一个业务退款。

延伸问题:十次调用六次返回成功是否等于 60%?

推导与参考解答

先核对十次是十个独立退款任务还是同一业务键的重发;后者可能只有一个效果。对独立任务统计真实退款及违规重复,对重发统计恢复与对账能力,不能把请求回执当业务样本。

保持不变的原理:分母是明确任务,业务效果与调用次数分开。

易错点

  • 只保留最好一次
  • 重复尝试不计成本
  • 把相关重复样本当独立任务

参考资料

依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
完整报告重复运行的成功次数、失败次数及全部尝试成本。
中高级信号
能区分一次、多次至少一次和多次均成功。
资深信号
采用成对任务比较、分组不确定性及独立风险门槛。

巩固练习 按需完成 · 建议 15 分钟

解释 A、B 在五个任务各跑三次的结果应如何汇总,哪些结论不能直接推出。

展开验收要求与检查点
  • 不择优删失败
  • 重复次数与预算透明
  • 风险违规单独报告

重点检查

  • 指标分母与用户重试策略一致
  • 理解重复观测的相关性
  • 按质量成本风险综合决策