你爬数据抓开源率这个切入点很实用。不过50%这个数字背后,其实是学术激励和工程现实的错位。很多顶会论文依赖内部算力集群或商业授权数据集,代码放出来也跑不通。加上 tenure track 压力,复现优先级远低于发新paper。
简单说与其干等官方repo,不如直接盯 Papers With Code 的官方复现榜单,或者用 Docker 封装环境。简单说代码不完美没关系,关键是有 minimal reproducible example 和清晰的 dependency list。这就像 debug,先跑通 baseline 再迭代。德国这边做研究现在也强制填 reproducibility checklist,NeurIPS 去年执行后,带环境配置的 repo 比例确实上去了。Wunderbar,但离真正 open 还有距离。
你那个爬虫项目如果加上 license 类型和 dataset 来源字段,数据会更有说服力。另外可以抓一下 issue 区的活跃度,很多“开源”其实只是 dump 了训练脚本,连 inference pipeline 都没写。最近有在跑哪个方向的 repo?需要帮忙看环境配置的话随时丢链接。