为什么要本地跑

用云端 API 很方便,但本地跑开源模型有它不可替代的价值:

  • 隐私:数据不出本机,适合处理敏感资料;
  • 成本:一次性硬件投入,之后随便用,没有按 token 计费;
  • 可控:不受服务商限流、下线、涨价影响,还能自由微调。

代价是效果通常不及最顶尖的闭源模型,且吃硬件(尤其是显存/内存)。

量化:用一点精度换可运行性

原始模型参数是 16 位浮点,非常占空间。量化把参数压到 8 位、4 位甚至更低,大幅降低显存/内存占用,让消费级设备也能跑,代价是轻微的精度损失。

常见的经验是:4 位量化(如 Q4)在大多数日常任务里,与原始精度的差距肉眼几乎不可见,却能把体积压到约四分之一,是性价比很高的选择。

用 Ollama 快速上手

Ollama 把“下载 + 加载 + 提供接口”这一套封装得很简单。装好后,一条命令即可拉取并运行:

ollama run qwen3

第一次会自动下载模型,之后直接进入对话。它还提供一个本地 HTTP 接口,方便你在自己的程序里调用:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3",
  "prompt": "用一句话解释什么是向量数据库"
}'

选多大的模型

一个粗略的参考:

  • 7B 级别:8GB 显存或 16GB 内存基本能跑,适合日常问答、总结;
  • 14B~32B:需要更大显存,效果更好;
  • 70B 及以上:对个人设备门槛较高,通常要多卡或走云端。

先从小模型试起,够用就好,不必一上来追求最大。

小结

本地大模型这两年门槛降得很快,一台还不错的个人电脑,配合 Ollama 这类工具,就能拥有一个完全属于自己的、离线可用的 AI 助手。