周末闲着没事,把 transformers.js 配着 WebGPU 折腾了一把,直接在浏览器里跑了个对话模型。说实话体验比我预想的顺,开个网页就能聊,不用装环境,也不用显卡,门槛低到有点离谱。我是看 GitHub 上有人分享了现成的 demo,fork 下来改两行配置就能用,全程没碰过命令行装依赖那种痛苦。
最让我踏实的是数据这件事。以前调云端 API,每个月账单摆在那儿,问什么都得先过人家的服务器,总有点"我这点聊天记录值不值得被记下来"的纠结。现在模型权重下载到本地,断网也照聊,零月费,数据压根不出本机。严格来说那种不用再交保护费的感觉,确实比给云厂商续费踏实多了。
当然坑也有。量化之后的小模型偶尔会胡言乱语,逻辑一塌糊涂,复杂任务还是得靠大模型。但作为日常随手问、本地跑点轻量活儿,完全够用。开源圈这股端侧风越刮越猛,手机、浏览器、笔记本都能本地推理,不用被绑在订阅制上,这种踏实感还挺上头的。
有同样在玩端侧推理的兄弟吗,你们用的啥方案?