READ · UNDERSTAND · TRANSFER
阅读理解,按需巩固
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 随机任务的成功率与重试口径
先理解核心原理
先备概念:比例估计、重复实验、任务分组
一次可靠、多次至少一次成功、每次都成功是不同问题。指标必须绑定用户实际的尝试政策,并保留任务之间与同一任务重复之间的差异。
先决定用户得到几次机会
用户只允许发送一次邮件时,五次中成功一次没有意义;代码探索允许多候选并由测试挑选,才有理由考察多次尝试。若能准确识别成功并且尝试独立、每次成功概率固定为 p,至少一次成功为 1−(1−p)^k,全部成功为 p^k。缺少这些前提时应实测对应政策,不能硬套公式。
任务数与运行数分开
十个任务各跑十次,包含一百次运行,但对新任务的覆盖仍只有十个。报告每题通过次数、分层结果及整体口径;同一题共享难度和环境,不能把所有运行当一百个独立任务来夸大泛化证据。
不确定性也是结果
小样本比例容易波动。同一总体、独立且具有共同成功概率的伯努利样本,可报告 Wilson 等区间;异质固定任务集不能不加说明地直接套用二项区间;多次运行按任务分组分析,必要时以任务为单位重采样,并说明前提。温度为零也未承诺端到端确定性,工具数据、服务版本和执行调度仍会变化。本单元公式是条件推导,没有新增模型实测。
回到问题:怎样回答?
报告单次成功率和重复运行分布,并说明任务数、每题运行次数、采样设置与费用。至少一次成功和连续多次都成功衡量不同目标,不能把多次尝试里的最好结果当单次可靠性。对同一任务集成对比较版本,按任务聚类估计不确定性,观察关键风险和成本;上线选择应匹配用户实际允许的重试次数。
实现与取舍
明确分母和交付方式
十次中成功六次是该任务在指定条件下的观测结果,不是对所有任务准确率的证明。实际产品若只运行一次,就应看单次表现;若会自动尝试多次,必须把所有尝试的费用、时延和副作用算入。可重复写动作并不总允许通过多次试错寻找一次成功。
不同指标回答不同问题
至少一次成功适合评估多候选探索潜力,而多次均成功更接近稳定性要求。不要混淆 pass@k 与需要每次都可靠的业务目标。独立同分布假设下可用 1-(1-p)^k 估算至少一次成功,但实际同一任务的失败常相关,不能直接把估算当测量结果。
比较两个版本
固定工具环境、数据快照、允许预算和验收,逐题比较结果。简单与困难任务分别观察,避免一个版本只在大量容易题上提升。重复运行属于同一任务的相关观测,置信估计可按任务分组重采样,而不是把所有尝试当独立新题。小样本改善应明确不确定性。
上线门槛
定义关键违规为独立阻断项,质量、成本与尾延迟各有门槛。新版本若成功率略高但成本翻倍,应看每次成功交付成本和用户等待是否可接受。先灰度并监测真实失败,再决定扩大流量;不要因为一次漂亮演示就跳过重复性评估。
工程推演
- 场景
- 面试假设:版本 A 十次成功六次,版本 B 七次,但 B 用量翻倍。
- 设计决策
- 扩大固定任务集成对比较,报告单次质量和总尝试成本。
- 验证目标
- 能判断改进是否稳定且符合实际交付要求。
- 适用边界
- 小样本不支持确定结论,需要报告不确定性。
连续追问与解答
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层pass@5 高是否代表一次就可靠?
主问题汇报多次成功,需防止把重试指标当成一次可靠性。
参考解答
不代表。pass@5 关注五次内至少一次成功,单次用户体验应看 pass@1 或实际一次尝试成功率。若用户无法判断哪次成功,或重试会重复收费与副作用,多次最优结果甚至不可用于服务;需要评测选择器和整套重试政策。
沿着这个回答继续深入
第 2 层只允许只读重试且能自动验证答案,怎样评估五次策略?
父问发现 pass@5 依赖可识别成功,子问补齐实际选择政策。
参考解答
把“生成、验证、决定是否再试”当一个任务政策,记录真实最大尝试数、停止条件、验证器错误和总成本。不能评测时事后选最好答案而线上没有选择器;也不能把初次成功后的闲置尝试计入必要费用。
沿着这个回答继续深入
第 3 层验证器会把错误答案判成功,重试指标还可信吗?
父问用验证器停止重试,继续检查验证器失误对指标的传播。
参考解答
不能直接称为任务成功率。分别用可信终态标注验证真实成功与验证器误放,测试提前停止的影响。若只能得到验证器通过率,明确命名并保留样本复核;更多尝试可能放大误放机会,而不是提高真实可靠性。
第 1 层同一题跑百次算百个独立样本吗?
统计次数增多之后,还要检查观测单位是否独立。
参考解答
不算一百个独立任务。它能描述该题在给定环境下的波动,但同题运行共享结构,可能还共享服务故障。比较版本应在同一任务集成对运行,分开报告任务覆盖与运行次数;不确定性分析需保留任务层相关性。
第 1 层为什么温度为零仍应验证重复性?
复现控制不仅涉及模型采样参数。
参考解答
温度控制采样的一部分,并不固定检索数据、工具回执、服务实现和并行时序。即使模型输出完全一致,运行时的网络失败仍可能影响终态。重复评估用于发现整个系统的波动,记录模型与环境设置而非假定参数等于确定性。
举一反三:条件变了,怎样推导?
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
代码建议允许测试选择
改变的条件:用户接受多候选,外部副作用发生在选定后。
延伸问题:应怎样选择版本?
推导与参考解答
评估整个候选生成和测试选择流程,报告预算内真实通过、误选与总耗时;另外保留首候选质量。多尝试收益必须扣除测试与生成成本,不能只展示最佳补丁。
保持不变的原理:成功率与尝试和选择政策一起定义。
自动退款禁止重复尝试效果
改变的条件:任务带资金副作用,最多一个业务退款。
延伸问题:十次调用六次返回成功是否等于 60%?
推导与参考解答
先核对十次是十个独立退款任务还是同一业务键的重发;后者可能只有一个效果。对独立任务统计真实退款及违规重复,对重发统计恢复与对账能力,不能把请求回执当业务样本。
保持不变的原理:分母是明确任务,业务效果与调用次数分开。
易错点
- 只保留最好一次
- 重复尝试不计成本
- 把相关重复样本当独立任务
参考资料
依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
检查自己理解到哪一步
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
- 基础达标
- 完整报告重复运行的成功次数、失败次数及全部尝试成本。
- 中高级信号
- 能区分一次、多次至少一次和多次均成功。
- 资深信号
- 采用成对任务比较、分组不确定性及独立风险门槛。
巩固练习 按需完成 · 建议 15 分钟
解释 A、B 在五个任务各跑三次的结果应如何汇总,哪些结论不能直接推出。
展开验收要求与检查点
- 不择优删失败
- 重复次数与预算透明
- 风险违规单独报告
重点检查
- 指标分母与用户重试策略一致
- 理解重复观测的相关性
- 按质量成本风险综合决策