Files
ai-dist/learnings/2026-07-18-002-do-not-benchmark-against-yourself.md
2026-07-20 15:26:30 +08:00

5.0 KiB
Raw Blame History

id, date, status, tags, sources, references, accessed
id date status tags sources references accessed
2026-07-18-002 2026-07-18 distilled
benchmarking
baseline
self-comparison
simulation
research-validity
https://gernot-heiser.org/benchmarking-crimes.html#self
2026-07-18

不要只和自己做 benchmark

原始输入

学习:https://gernot-heiser.org/benchmarking-crimes.html#self

内容蒸馏

“Only evaluate against yourself” 是 improper comparison of benchmark results 的一种。只证明当前系统比自己的旧版本更快,说明内部取得了进步,但没有给读者一个足以判断该进步是否重要、是否有竞争力、是否接近合理上界的外部参照。

正确 baseline 不是固定答案,而是由 claim 决定。它可能是公认标准或当前 state of the art也可能是理论最优值、硬件极限或没有受到新机制扰动的原始系统。关键不是“多放一个 competitor”而是选择读者真正需要的参照来判断 claim。

更隐蔽的问题是“模型和自己比较”:先用若干未充分验证的简化假设建立模型,再为该模型设计方案,最后在包含完全相同假设的模拟系统中评价方案。这个闭环可以产生漂亮结果,却没有检验假设是否对应现实,因此无法支持现实有效性或预测能力。

这条原则的深层含义是:评测必须给方法留下被独立证伪的机会。只在自己定义的问题、假设和评价器中胜出,可能证明内部一致性,但不能自动证明外部有效性。

Taste 信号

明确偏好

  • 无。用户提供了学习链接,但没有直接声明对原文措辞或全部判断的赞同程度。

推断信号

  • 不接受仅与作者自己的旧版本比较,就宣称方法重要、领先或有普遍意义。
  • baseline 应从研究 claim 反推:它必须让读者判断真正关心的差距,而不是选择最方便或最有利的参照。
  • 对仿真和模型结果保持独立性要求:不能用相同假设构造问题、方法和 evaluator再把内部一致性写成现实有效性。
  • benchmark 的目标不只是产生好看的数值,还要提供 reality check 和可证伪性。

领域知识

  • Heiser 将 only evaluate against yourself 归为 improper comparison 的一种,并认为显著性需要与 accepted standard 比较。
  • 相邻的 proper baseline 小节列出多种可能参照SOTA、理论最优或硬件极限以及未扰动系统。
  • 原文区分了明显的“只和自己旧版本比”与更隐蔽的“模型在包含同样假设的模拟器中验证自己”;后者缺少基本现实校验。
  • 本次只精读 #self 及其 baseline 上下文,没有把整篇 benchmarking crimes 列表都视为本次确认内容。

边界与反例

  • 自我比较并非没有价值。它适合 regression testing、ablation、定位单次改动收益和追踪开发进展问题是让它承担超出其证据范围的 headline claim。
  • “独立基线”不总是另一个可运行系统。对于某些 claim理论上界、硬件极限或未扰动系统可能是更正确的参照。
  • 仿真或简化模型在真实系统难以构建、机制需要隔离或上界需要估算时仍然必要但必须说明假设并用独立数据、sensitivity 或真实系统进行适当校验。
  • 原文使用了强烈的评审措辞。本次沉淀其研究有效性原则,不自动继承其修辞强度。
  • 用户仅提供链接,因此新增画像条目标记为 暂定,等待后续直接反馈或更多一致证据。

可执行影响

  • 审计 evaluation 时先写清 headline claim再逐项问当前 baseline 能否判断该 claim还是只能证明系统比自己以前更好
  • 对每个对比标注 baseline 角色accepted standard、SOTA、unperturbed system、theoretical optimum、hardware limit 或 internal ablation。
  • 内部 baseline 可以保留,但不能替代与当前外部标准的公平比较;若外部比较不可行,需要明确限制并收窄 claim。
  • 对模型或模拟器检查“假设闭环”:问题定义、方法和 evaluator 是否共享了未经现实验证的同一假设?
  • 若存在闭环,要求至少一种独立校验:真实系统测量、未参与建模的数据、不同模型的交叉验证,或关键假设的 sensitivity analysis。
  • review 时把“只有自我比较且支撑 headline claim”标为 NEEDS EVIDENCE;若导致核心结论无法判断,则升级为 Blocking

画像更新