F小峰 · 笔记
2026-09-14本地部署实测硬件

本地大模型值不值得折腾?一份实测账

👁 阅读 ↗ 分享

想本地跑模型的人通常有三个动机:隐私(数据不出门)、稳定(不依赖网络和额度)、好奇(就想自己试试)。我三个都有。

第一笔账:内存决定你能跑多大

统一内存架构的机器(比如 Apple Silicon)有个好处:CPU 和 GPU 共享内存池,没有独立显存的天花板。但也不是全都能给模型用,系统本身要吃掉一部分,实际可用的大概是总内存的六到七成。

第二笔账:速度看带宽,不看代数

这点反直觉但很重要:生成的 token 速度基本正比于内存带宽。基础款的 M 系列芯片带宽只有 Pro 的一半左右,跑同一个模型速度差距是肉眼可见的。

还有一个容易忽略的点:MoE 模型(专家混合)在同样大小下快得多,因为每个 token 只激活一小部分参数。35B 的 MoE 可能只激活 3B,跑起来像小模型,质量却是大模型的水平——这是目前本地部署性价比最高的路线。

第三笔账:上下文也是内存

很多人算内存时只算模型大小,忘了 KV 缓存。上下文开得越长,额外占的内存越多。所以「模型能装下」不等于「能长时间开着长上下文跑」。

结论

所以我的建议是:把它当补充,不当替代。敏感数据本地处理,硬骨头交给云端。