为什么要本地跑
用云端 API 很方便,但本地跑开源模型有它不可替代的价值:
- 隐私:数据不出本机,适合处理敏感资料;
- 成本:一次性硬件投入,之后随便用,没有按 token 计费;
- 可控:不受服务商限流、下线、涨价影响,还能自由微调。
代价是效果通常不及最顶尖的闭源模型,且吃硬件(尤其是显存/内存)。
量化:用一点精度换可运行性
原始模型参数是 16 位浮点,非常占空间。量化把参数压到 8 位、4 位甚至更低,大幅降低显存/内存占用,让消费级设备也能跑,代价是轻微的精度损失。
常见的经验是:4 位量化(如 Q4)在大多数日常任务里,与原始精度的差距肉眼几乎不可见,却能把体积压到约四分之一,是性价比很高的选择。
用 Ollama 快速上手
Ollama 把“下载 + 加载 + 提供接口”这一套封装得很简单。装好后,一条命令即可拉取并运行:
ollama run qwen3
第一次会自动下载模型,之后直接进入对话。它还提供一个本地 HTTP 接口,方便你在自己的程序里调用:
curl http://localhost:11434/api/generate -d '{
"model": "qwen3",
"prompt": "用一句话解释什么是向量数据库"
}'
选多大的模型
一个粗略的参考:
- 7B 级别:8GB 显存或 16GB 内存基本能跑,适合日常问答、总结;
- 14B~32B:需要更大显存,效果更好;
- 70B 及以上:对个人设备门槛较高,通常要多卡或走云端。
先从小模型试起,够用就好,不必一上来追求最大。
小结
本地大模型这两年门槛降得很快,一台还不错的个人电脑,配合 Ollama 这类工具,就能拥有一个完全属于自己的、离线可用的 AI 助手。