本地部署开源大模型完全指南:从选型到跑通
想在自己电脑上跑大模型,数据不出本地、还免费?本文带你从模型选型、硬件要求到用 Ollama 一键跑通,小白也能上手。
把大模型部署在本地,好处很实在:数据不出本地更隐私、离线可用、长期免费、不受额度限制。过去这需要不少工程经验,如今借助开源工具,普通人也能几步跑通。本文讲清楚怎么做。
一、先搞清楚:你的电脑能跑多大的模型
模型大小用参数量(B=十亿)衡量,运行主要吃显存/内存。经量化(压缩)后的经验值大致是:
- 7B/8B 模型:需要约 8GB 内存或显存,普通带独显的电脑、甚至 16GB 内存的 Mac 就能跑。
- 13B/14B 模型:约 16GB。
- 32B~70B 模型:需要 32GB 以上,或专业显卡。
入门建议从 7B/8B 起步,速度和效果平衡最好。
二、选哪个模型
中文场景推荐优先考虑对中文友好的开源模型,例如通义千问(Qwen)系列、DeepSeek 系列;通用英文能力强的有 Llama 系列。想要小而快就选 7B/8B 的指令版(Instruct/Chat)。
三、最简单的方式:用 Ollama 一键跑
Ollama 是目前本地跑大模型最省心的工具,Windows/Mac/Linux 都支持。步骤:
- 到 Ollama 官网下载安装。
- 打开终端,输入一行命令即可下载并运行,例如:
ollama run qwen2.5(模型名以官网库为准)。 - 下载完成后,终端里就能直接对话;它同时会在本地开一个 API 接口,方便别的程序调用。
想要图形界面聊天,可以再装一个 Open WebUI,接上 Ollama 就有类似 ChatGPT 的网页界面。
四、常见坑与建议
- 下载慢:模型文件动辄几个 GB,第一次要耐心,或配置国内镜像。
- 跑不动/很卡:换更小的模型或量化程度更高的版本(如 q4)。
- 中文效果一般:优先选中文优化过的模型,别硬用纯英文模型。
- 别期待和 GPT-4/Claude 一样:本地小模型胜在隐私、免费、可控,复杂推理仍不及顶级闭源模型,按场景选择。
五、本地模型适合做什么
本地模型非常适合:处理隐私文档、离线翻译/总结、给个人知识库做问答(配合 RAG)、开发测试。既省钱又安心。等你玩熟 7B,再按需要升级更大的模型即可。