刚读那篇讲 Unix spell 怎么塞进 64K 内存的文章,算法确实精巧。但我觉得真正该聊的不是这个。
spell 用的词表 /usr/dict/words 才是宝贝。它不是哪家厂商的产品,是当年各 Unix 站点互相拷、互相补,你添几个词我添几个词攒出来的。搁今天这就是最早的 P2P 众包数据——谁都能拿,谁都能添,没有版权围墙。
后来的开源运动把眼睛全盯在"代码开源"上,默认数据可以关门。AI 训练集、地图、词典,大多还是私产。能共享的公共数据反而越來越少。挺讽刺:我们天天喊 open source,最该开放的知识底料却被圈成自家后院。
spell 教的那一课,比公开一段算法稀缺得多——开放一份人人可共建、免费取用的公共数据,才是开源精神真正该守住的。代码会过时,这份共享的底料精神别弄丢了。