论文复现不是让 Agent “跑出同样数字”。必须锁定论文版本、官方仓库提交、数据版本、随机种子、硬件和指标实现,才能解释差异。
开始前先准备什么
先确认论文正式版本、官方仓库与许可证,记录目标表格或指标及其数据切分。

建议建立 reproduction.md,写清论文链接、仓库 URL、目标提交、目标表格行、训练/验证/测试切分、允许误差、硬件预算和预计时间。还要区分“使用公开检查点评估”“重新训练模型”和“重做数据预处理”,它们是不同层级的复现,不能混用一个结论。
实际操作步骤
- 让 Agent 只读 README、环境文件、训练入口和评估脚本,画出从数据到指标的路径。
- 创建隔离环境并锁定依赖;无法满足旧 CUDA 或系统库时记录替代,不伪装一致。
- 先运行作者提供的最小示例或评估脚本,再决定是否进行完整训练。
- 保存命令、提交哈希、随机种子、日志和输出;对照论文时报告误差和可能原因。
第一轮可以使用下面的只读提示:
不要改代码或安装依赖。阅读 README、锁文件、数据准备脚本、
训练入口和评估脚本。列出从原始数据到论文指标的调用路径,
每一步输入、输出与命令,并标明依赖、随机种子、硬件假设,
以及 README 与实际代码不一致的位置。
Cursor Prompting 官方文档说明可用 @文件、@文件夹和 Git diff 附加上下文。已知入口时直接附加环境与评估文件;不确定时让 Agent 搜索,但每项结论都要给出代码位置。
固定代码、环境与数据
先用 git rev-parse HEAD记录提交。按仓库已有方法创建隔离环境;如果只给了宽泛版本范围,应保存本次完整依赖清单。一个最小记录可能包括:
git rev-parse HEAD
python --version
python -m pip freeze > artifacts/pip-freeze.txt
python evaluate.py --config configs/baseline.yaml --seed 42
最后一行只是命令结构示例,真实入口、配置和参数必须来自仓库,不能让 Agent 猜。还应记录操作系统、CUDA/驱动、GPU 型号和关键库版本。数据要记录下载来源、许可、文件哈希、样本数和切分;来源不明或许可不清时应停止。
核对指标计算而不只看数字
打开评估脚本,确认平均方式、阈值、忽略标签、后处理和四舍五入。相同的 Accuracy、F1 或 BLEU 名称可能有不同实现。让 Agent 给出从模型输出到最终指标的函数链,再用一个很小的手工样本复算。第一次运行尽量不改官方代码;兼容性修复要单独提交,并保留原错误和修改理由。
如果使用 Cursor Projects,还要理解其边界。Cursor Projects 官方文档说明,Project 的协调 Agent 负责规划与委派,代码由其他 Agent 完成,并运行于 Cloud Agents;该功能还有套餐和隐私模式限制。处理未公开论文、受限数据或敏感代码前应先确认政策。
怎样验证结果
验收结果不是必须完全相同,而是实验可重复、指标计算路径明确、差异有证据且未挑选有利运行。
报告至少列出论文值、本次单次值或多次均值、绝对差异、环境偏差和日志路径。结果偏低时按数据版本与切分、预处理、检查点、依赖与硬件、随机种子、批大小、评估模式、指标实现的顺序排查。不要先盲目调参,也不要用测试集反复选择最有利结果。
常见错误
- 不要让 Agent 下载来源不明的数据。
- 不要把测试集用于调参。
- 不要只记录最终最好一次结果。
适用边界
算力、数据许可和作者未公开细节可能阻止完全复现;这些限制应明确写入报告。
相关问答
结果低于论文就是代码错吗?
不一定;先核对数据、预处理、依赖、种子、硬件和指标实现。
可以让 Cursor 自动改训练代码吗?
先跑官方基线;任何改动都应单独记录并与原版比较。
资料与适用范围
本文根据 2026 年 10 月 1 日核验的 Cursor Projects 官方文档、Cursor Prompting 官方文档整理。示例流程未在你的设备、账号或仓库中实测,界面、方案、权限和项目命令应以当前环境为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32658.html