--- id: 2026-07-18-002 date: 2026-07-18 status: distilled tags: [benchmarking, baseline, self-comparison, simulation, research-validity] sources: ["https://gernot-heiser.org/benchmarking-crimes.html#self"] references: [] accessed: 2026-07-18 --- # 不要只和自己做 benchmark ## 原始输入 > 学习:https://gernot-heiser.org/benchmarking-crimes.html#self - 直接来源:[Gernot Heiser, Systems Benchmarking Crimes — Only evaluate against yourself](https://gernot-heiser.org/benchmarking-crimes.html#self) - 访问日期:2026-07-18 - 学习范围:以 `#self` 锚点对应的小节为主,并读取相邻的 proper baseline 段落以确定上下文。 ## 内容蒸馏 “Only evaluate against yourself” 是 improper comparison of benchmark results 的一种。只证明当前系统比自己的旧版本更快,说明内部取得了进步,但没有给读者一个足以判断该进步是否重要、是否有竞争力、是否接近合理上界的外部参照。 正确 baseline 不是固定答案,而是由 claim 决定。它可能是公认标准或当前 state of the art,也可能是理论最优值、硬件极限,或没有受到新机制扰动的原始系统。关键不是“多放一个 competitor”,而是选择读者真正需要的参照来判断 claim。 更隐蔽的问题是“模型和自己比较”:先用若干未充分验证的简化假设建立模型,再为该模型设计方案,最后在包含完全相同假设的模拟系统中评价方案。这个闭环可以产生漂亮结果,却没有检验假设是否对应现实,因此无法支持现实有效性或预测能力。 这条原则的深层含义是:评测必须给方法留下被独立证伪的机会。只在自己定义的问题、假设和评价器中胜出,可能证明内部一致性,但不能自动证明外部有效性。 ## Taste 信号 ### 明确偏好 - 无。用户提供了学习链接,但没有直接声明对原文措辞或全部判断的赞同程度。 ### 推断信号 - 不接受仅与作者自己的旧版本比较,就宣称方法重要、领先或有普遍意义。 - baseline 应从研究 claim 反推:它必须让读者判断真正关心的差距,而不是选择最方便或最有利的参照。 - 对仿真和模型结果保持独立性要求:不能用相同假设构造问题、方法和 evaluator,再把内部一致性写成现实有效性。 - benchmark 的目标不只是产生好看的数值,还要提供 reality check 和可证伪性。 ### 领域知识 - Heiser 将 only evaluate against yourself 归为 improper comparison 的一种,并认为显著性需要与 accepted standard 比较。 - 相邻的 proper baseline 小节列出多种可能参照:SOTA、理论最优或硬件极限,以及未扰动系统。 - 原文区分了明显的“只和自己旧版本比”与更隐蔽的“模型在包含同样假设的模拟器中验证自己”;后者缺少基本现实校验。 - 本次只精读 `#self` 及其 baseline 上下文,没有把整篇 benchmarking crimes 列表都视为本次确认内容。 ## 边界与反例 - 自我比较并非没有价值。它适合 regression testing、ablation、定位单次改动收益和追踪开发进展;问题是让它承担超出其证据范围的 headline claim。 - “独立基线”不总是另一个可运行系统。对于某些 claim,理论上界、硬件极限或未扰动系统可能是更正确的参照。 - 仿真或简化模型在真实系统难以构建、机制需要隔离或上界需要估算时仍然必要;但必须说明假设,并用独立数据、sensitivity 或真实系统进行适当校验。 - 原文使用了强烈的评审措辞。本次沉淀其研究有效性原则,不自动继承其修辞强度。 - 用户仅提供链接,因此新增画像条目标记为 `暂定`,等待后续直接反馈或更多一致证据。 ## 可执行影响 - 审计 evaluation 时先写清 headline claim,再逐项问:当前 baseline 能否判断该 claim,还是只能证明系统比自己以前更好? - 对每个对比标注 baseline 角色:accepted standard、SOTA、unperturbed system、theoretical optimum、hardware limit 或 internal ablation。 - 内部 baseline 可以保留,但不能替代与当前外部标准的公平比较;若外部比较不可行,需要明确限制并收窄 claim。 - 对模型或模拟器检查“假设闭环”:问题定义、方法和 evaluator 是否共享了未经现实验证的同一假设? - 若存在闭环,要求至少一种独立校验:真实系统测量、未参与建模的数据、不同模型的交叉验证,或关键假设的 sensitivity analysis。 - review 时把“只有自我比较且支撑 headline claim”标为 `NEEDS EVIDENCE`;若导致核心结论无法判断,则升级为 `Blocking`。 ## 画像更新 - 新增:[实验评测 / 自我比较不能代替独立基线](../TASTE.md#实验评测--自我比较不能代替独立基线) - 新增:[模型评测 / 不允许同一组假设闭环自证](../TASTE.md#模型评测--不允许同一组假设闭环自证)