“代码在我的电脑上能跑”并不等于实验可以复现。对个人研究项目来说,不必一开始就搭建复杂平台,但至少应让环境、参数和输入数据的来源可追溯。
固定一个明确入口
我倾向于把主要实验收敛到一条命令,并让所有可变设置进入配置文件:
python -m experiments.train --config configs/baseline.yaml
这样做的价值不在于命令短,而在于运行入口唯一。临时调试仍然可以存在,但进入报告的结果应能回到明确配置。
记录真正影响结果的信息
依赖版本、随机种子、数据快照、代码提交和硬件信息通常值得保留。日志中还应写入实际解析后的配置,避免默认值变动后无法解释旧结果。
做一次干净重建
环境整理完成后,最有效的检查是在新目录中从零执行。如果缺少文件、隐含路径或手工步骤,这一步会很快暴露问题。可复现性不是项目结束时补写的一页说明,而是研究过程中的持续约束。