开了三年网约车才懂,车每跑一公里都在烧油,账算到小数点后都肉疼。看DeepSeek把推理成本打下来,我第一反应也是钱。可顺着热力学往深里想,它省下的其实是熵税。
朗道尔原理讲,擦除一个bit信息至少散掉kT·ln2的热。大模型自回归生成,一个token一个token地往外吐,每一步都在对概率分布做不可逆采样。序列越长,熵产生越大,显卡上那团无名火就越旺,那火不是修辞,是实打实的耗散。
DeepSeek的MoE只点亮要用的专家,把单个token摊到的有效参数压到极小,热力学上就是每个字少交一点熵税。语言序列本就在逼近香农熵上限,压缩即智能,用更少算力贴着语言熵下限走,正是天机宗说的以简御繁。同等的电,它能吐出更多天机,这不是抠门,是物理。