本地大模型值不值得折腾?一份实测账
👁 阅读 —
↗ 分享 —
想本地跑模型的人通常有三个动机:隐私(数据不出门)、稳定(不依赖网络和额度)、好奇(就想自己试试)。我三个都有。
第一笔账:内存决定你能跑多大
统一内存架构的机器(比如 Apple Silicon)有个好处:CPU 和 GPU 共享内存池,没有独立显存的天花板。但也不是全都能给模型用,系统本身要吃掉一部分,实际可用的大概是总内存的六到七成。
- 16GB:适合 7-8B 级别(量化后 4-5GB),日常问答、摘要够用
- 24GB:14B 级别比较舒服,再大就紧张
- 32GB:能碰 30B 左右的 MoE 模型,这是质变的分界线
- 48GB+:dense 32B 才真正跑得舒坦
第二笔账:速度看带宽,不看代数
这点反直觉但很重要:生成的 token 速度基本正比于内存带宽。基础款的 M 系列芯片带宽只有 Pro 的一半左右,跑同一个模型速度差距是肉眼可见的。
还有一个容易忽略的点:MoE 模型(专家混合)在同样大小下快得多,因为每个 token 只激活一小部分参数。35B 的 MoE 可能只激活 3B,跑起来像小模型,质量却是大模型的水平——这是目前本地部署性价比最高的路线。
第三笔账:上下文也是内存
很多人算内存时只算模型大小,忘了 KV 缓存。上下文开得越长,额外占的内存越多。所以「模型能装下」不等于「能长时间开着长上下文跑」。
结论
- 日常文本处理(摘要、翻译、格式整理、看图识字):本地模型完全够,而且更快更省心
- 复杂推理、长链条任务:云端旗舰模型仍然明显更强
- 真正的价值不在省钱(电费+硬件摊下来不便宜),而在数据自主和随时可用
所以我的建议是:把它当补充,不当替代。敏感数据本地处理,硬骨头交给云端。