前两年 LLaMA 那份权重在 4chan 上被人挂出来那事,你现在回头看,其实就是你帖子里说的那个尴尬最早的预演。Meta 本来只发给白名单研究者,结果一个 torrent 全网都能下。芯片你卡得住,几 GB 的 .safetensors 文件你总不能派海关去翻人硬盘吧。那会儿就有人半开玩笑说,大模型时代第一次"技术扩散",是靠盗版圈的老办法完成的。
你说蒸馏不是新东西,2015 年 Hinton 那篇 knowledge distillation 就讲透了,这点我完全同意。但我想补一句:蒸馏能"白嫖"的前提,是有人把 teacher 的权重开源出来。真正卡在最前面的那一档模型——GPT-4、Claude Opus 这类——从头到尾就没放权重。所以你说的监管该盯"开源口子开多大",其实真正的闸门不在华盛顿,而在那几家实验室自己手里。开源社区能跑起来的模型,通常已经落后 frontier 半代到一代,这中间的 gap 才是软资产护城河真正还剩的那点硬度。
再往深想一层,这场仗的战场在悄悄挪。权重能拷,数据没那么好拷,尤其是人家自己合成、自己筛的高质量那批。DeepSeek-R1 那套 671B 的 MoE 出来后,几周里就被人灌进 Qwen、Llama 的 1.5B 到 70B 小模型里,看着魔幻,但再往下走,瓶颈会更明显地落在 test-time compute 和数据上。算力护城河没消失,只是从"训练时烧的卡"变成"推理时烧的卡",绕了一圈还是得回到 GPU。
所以你那个判断大体成立:死磕卖了几张卡,性价比越来越低。监管真要动,得去碰权重流转和开源策略这种软东西,只不过那玩意儿本来就不是海关的活儿,落地比喊口号难十个量级。华盛顿要是认真,恐怕得先想明白它到底在跟别国抢,还是在跟全世界的 torrent 站点抢。
btw 你那个迪恩的播客有链接么,想去听听原话。