零基础本地跑大模型:Ollama 完整上手教程
把大模型跑在自己电脑上有三个实在的好处:数据不出本地、没有调用费用、断网也能用。Ollama 是目前门槛最低的方案,下面这套流程照着做就行。
一、能不能跑?先看配置
| 模型规模 | 最低内存 | 体验 |
|---|---|---|
| 1.5B ~ 3B | 8GB | 流畅,适合摘要、分类 |
| 7B ~ 8B | 16GB | 推荐档位,日常够用 |
| 14B | 32GB | 明显更聪明,速度变慢 |
| 32B 以上 | 64GB+ 或独显 | 需要显卡加速 |
有独立显卡(8GB 显存以上)会快很多,但纯 CPU 也能跑,只是每秒输出的字数少一些。
二、安装
Windows / macOS 直接去官网下安装包,双击装完即可。Linux 一行命令:
curl -fsSL https://ollama.com/install.sh | sh装完打开终端,敲:
ollama --version有版本号输出就成了。
三、拉模型并对话
以一个 7B 中文模型为例:
ollama run qwen2.5:7b第一次会自动下载(几个 GB,耐心等)。下完直接进入对话界面,输入问题回车即可。退出敲 /bye。
常用命令:
ollama list # 看已下载的模型
ollama pull <模型名> # 只下载不运行
ollama rm <模型名> # 删除模型释放空间
ollama ps # 看当前加载的模型四、选哪个模型?
- 中文通用:
qwen2.5:7b,中文最顺,综合最均衡 - 写代码:
qwen2.5-coder:7b,补全和改 bug 明显更强 - 轻量快速:
qwen2.5:3b,老笔记本也能跑 - 英文推理:
llama3.1:8b
不确定就先装 7B 通用款,不合适再换,删除很方便。
五、用 API 调用(重点)
Ollama 启动后会在本地开一个服务,默认端口 11434。这才是它真正的价值——任何程序都能调。
最简单的 curl 测试:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "用一句话解释什么是向量数据库",
"stream": false
}'Python 调用(兼容 OpenAI 格式,这点很关键):
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # 随便填,本地不校验
)
resp = client.chat.completions.create(
model="qwen2.5:7b",
messages=[{"role": "user", "content": "帮我写一段清理日志的 shell 脚本"}],
)
print(resp.choices[0].message.content)因为兼容 OpenAI 接口,你现有的代码基本改一行 base_url 就能切到本地。
六、给模型定制人格
新建一个文件 Modelfile:
FROM qwen2.5:7b
PARAMETER temperature 0.3
SYSTEM """
你是一名严谨的技术文档助手。
回答必须简洁,能用列表就不用段落,不确定的地方要明确说明。
"""然后:
ollama create mydoc -f Modelfile
ollama run mydoc以后 mydoc 就是你的专属模型了。
七、几个新手常踩的坑
- 下载卡住:国内网络建议配置镜像或代理,别硬等
- 内存爆了:换小一号的模型,或者关掉浏览器再跑
- 回答很傻:多半是模型太小,7B 是体验分水岭
- 端口冲突:设环境变量
OLLAMA_HOST=0.0.0.0:11435换端口 - 想让局域网访问:同样设
OLLAMA_HOST=0.0.0.0,注意安全
八、下一步可以做什么
跑通之后,最有价值的两个方向:
- 接一个本地知识库(RAG),让它读你的文档再回答
- 接进现有工具,比如浏览器插件、笔记软件、代码编辑器
本地模型不会替代云端旗舰,但它给了你一个永远在线、绝对私密、零边际成本的助手。对很多场景来说,这就够了。