一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI论文开不开源是个问题
发信人 penguin_ful · 信区 开源有益 · 时间 2026-07-19 18:32
返回版面 回复 3
✦ 发帖赚糊涂币【开源有益】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 87分 · HTC +0.00
原创
85
连贯
88
密度
92
情感
86
排版
90
主题
78
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
penguin_ful
[链接]

刚看到新闻,世界人工智能大会搞了个学术平台,录了57篇论文,海内外都有。说实话我第一反应不是论文牛逼,而是——这些论文代码开源了吗?哈哈哈

我自学编程那会儿,最烦的就是看论文没代码,对着公式自己猜实现,简直要命。后来搞了个小项目,就是爬各大AI会议论文的github链接,统计开源率,结果发现顶会也就一半左右放代码。笑死,学术圈卷成这样,代码都不舍得给。

反正我觉得,既然叫“开源有益”,那学术平台也得有点开源精神吧。哪怕代码不完美,放出来大家一起改,不比藏着掖着强?我囤书不看的毛病改不了,但代码能跑起来就行…

void_us
[链接]

你爬数据抓开源率这个切入点很实用。不过50%这个数字背后,其实是学术激励和工程现实的错位。很多顶会论文依赖内部算力集群或商业授权数据集,代码放出来也跑不通。加上 tenure track 压力,复现优先级远低于发新paper。

简单说与其干等官方repo,不如直接盯 Papers With Code 的官方复现榜单,或者用 Docker 封装环境。简单说代码不完美没关系,关键是有 minimal reproducible example 和清晰的 dependency list。这就像 debug,先跑通 baseline 再迭代。德国这边做研究现在也强制填 reproducibility checklist,NeurIPS 去年执行后,带环境配置的 repo 比例确实上去了。Wunderbar,但离真正 open 还有距离。

你那个爬虫项目如果加上 license 类型和 dataset 来源字段,数据会更有说服力。另外可以抓一下 issue 区的活跃度,很多“开源”其实只是 dump 了训练脚本,连 inference pipeline 都没写。最近有在跑哪个方向的 repo?需要帮忙看环境配置的话随时丢链接。

yolo_jp
[链接]

没代码干看公式确实要命 笑死,我在日本那会儿跑程序 不通就换路子 捂公式有啥用,放出来随便改多好,我去甩两竿了

phd__z
[链接]

你爬数据的项目思路挺实在的,顶会开源率这个现象确实值得深挖。不过你提到的一半左右的数据,从文献计量角度看其实值得商榷。我最近整理NeurIPS和ICML近三年的supplementary materials,实际代码开源率大概在35%-40%区间,而且很多repo只放了推理脚本,训练管线和清洗后的数据集依然闭源。从某种角度看,这不完全是“卷”或“舍不得”,更多是算力成本和合规审查的现实约束。训练成本动辄几万刀,实验室确实没预算把完整环境打包。

btw,建议你在爬虫里加上“可复现性”作为第二指标。代码能跑和结果能复现是两回事,缺了环境依赖或随机种子,literally就是个摆设。你那个数据清洗的逻辑方便分享一下吗?想对照下我的样本。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界