最近摸鱼摸得有点凶,在机器上装了个 ollama,本地直接拽个小模型下来跑 不用联网不用绑卡,敲一行 ollama run llama3 就完事了哈哈
以前想玩大模型总觉得门槛好高,要注册要 key 要信用卡,烦死。这种就舒服,本地推理数据全在自己硬盘上,隐私怪狂喜。真的假的写代码卡壳了丢个问题过去,它偶尔瞎编但胜在秒回还不要钱,気持ちいい
我那台破本跑7b稍微有点喘,凑合能玩。你们本地都跑的啥模型,求安利几个
最近摸鱼摸得有点凶,在机器上装了个 ollama,本地直接拽个小模型下来跑 不用联网不用绑卡,敲一行 ollama run llama3 就完事了哈哈
以前想玩大模型总觉得门槛好高,要注册要 key 要信用卡,烦死。这种就舒服,本地推理数据全在自己硬盘上,隐私怪狂喜。真的假的写代码卡壳了丢个问题过去,它偶尔瞎编但胜在秒回还不要钱,気持ちいい
我那台破本跑7b稍微有点喘,凑合能玩。你们本地都跑的啥模型,求安利几个
你那破本跑 7b 喘就换 q4 量化版,显存直接砍半还秒回。写代码的话试试 qwen2.5
你这破本跑7b喘成这样还能凑合玩,已经算很有毅力了。不联网不绑卡这点我举双手赞成,现在随便点个啥都要手机号实名,本地自己硬盘上跑才是真清净。
"偶尔瞎编但秒回不要钱"这句把我逗乐了,这不就是免费但靠不住的嘴替嘛,跟你那个记错事还特能侃的老同学一个德行。倒想问你,7b往下有啥轻量又没那么爱胡说八道的,给咱这种懒人指条明路?
我那破本跟你半斤八两,一跑模型风扇转得跟要起飞似的。不过秒回还不要钱是真的爽,比起我半夜抽卡沉船起码不花钱哈哈
楼主说的"偶尔瞎编"其实可以再精确一点。本地小模型跑在笔记本上,7b这个体量基本得靠4-bit量化才能塞进显存,量化一旦激进,权重精度就掉,幻觉率跟着上去了。所以从某种角度看,"秒回免费"和"编故事"是同一件事的两面,不是它运气不好答错,而是这个参数规模加这个压缩比之下的正常表现。
想少编一点,要么换量化更克制的版本(但你本子估计扛不住),要么试专为消费级显卡调过的小模型。我这边试过几个,具体的晚点整理下型号发上来。
你那个"破本"显存多大?凑合能跑的话,量化档位其实比模型名字更值得研究。