
为什么要在本地跑大模型?
上个月把家里吃灰的零刻SER5 Mini PC翻出来装了个Ubuntu,本来就想当个下载机用。结果GitHub上刷到jamesob/local-llm这个项目快1000星了,突然来了兴致——要不试试本地跑个大模型?
说白了就是不想每次都调API,贵不说,隐私数据总归不放心。本地跑的好处很明显:离线可用、零延迟、数据不出家门。
硬件配置和选型
我这台SER5是AMD Ryzen 5 5560U + 32GB内存,核显是Vega 7。内存是关键——7B模型至少要16GB,13B模型建议32GB起步。如果显存不够,CPU推理虽然慢点但能用。
选Ollama的原因很简单:一条命令装好,模型管理方便,自带API接口。比自己编译llama.cpp省事太多。
安装步骤
装好Ubuntu 22.04之后,三步搞定:
- 装Ollama:一行命令
curl -fsSL https://ollama.ai/install.sh | sh,自动处理依赖和环境变量 - 拉模型:
ollama pull qwen2.5:7b,大概4.4GB,我这网络下完大概10分钟 - 装Open WebUI:
docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui:main,浏览器打开localhost:3000就能用
实际效果
Qwen2.5 7B在5560U上跑,生成速度大概8-10 tokens/s,日常问答完全够用。写代码的时候稍慢,但比等API响应还是快的。13B模型也能跑,就是降到3-4 tokens/s,勉强能用。
Open WebUI界面跟ChatGPT差不多,支持多轮对话、文件上传、Markdown渲染。局域网内其他设备也能访问,手机上也能用。
踩坑记录
- 内存不够:一开始跑13B模型直接OOM,后来发现是Docker默认内存限制太低,在
/etc/docker/daemon.json里加了"default-runtime": "runc"才解决 - 中文乱码:终端默认UTF-8没问题,但Open WebUI里偶尔显示方块,重启容器就好了
- 自动更新:Ollama有自动更新机制,跑着跑着服务重启了。后来在systemd配置里关掉了
AutoUpdate
总结
本地大模型已经不是玩具了,7B模型在32GB内存的Mini PC上完全能干正事。如果你也有闲置的小主机,值得一试。数据安全、离线可用、零成本,这三条就够值了。
文章评论