本地跑大模型:Ollama + Open WebUI部署实战

2026年7月6日 57点热度 0人点赞 0条评论
文章配图

为什么要本地跑AI?

云端API虽然方便,但有三个绕不开的问题:数据隐私、网络依赖、持续成本。对于开发者来说,本地跑一个大模型,写代码时做个补全、处理文档时做个摘要,是非常实用的能力。

硬件要求

不同模型的硬件需求参考:

  • 7B模型(如Llama 3.1 8B):8GB内存起步,有独显更好
  • 13B模型:16GB内存 + 8GB显存
  • 70B模型:64GB内存 + 24GB显存(或用量化版)

没有GPU也能跑,CPU推理虽然慢一些,但日常使用完全够用。

安装Ollama

Ollama是最简单的大模型运行工具,一行命令安装:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后拉取模型:

ollama pull llama3.1:8b
ollama pull qwen2.5:14b

部署Open WebUI

Ollama只有命令行界面,搭配Open WebUI就有了漂亮的聊天界面:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

访问 http://localhost:3000 就能用了,支持多模型切换、对话历史、文件上传。

实际使用体验

在N100 + 16GB内存的环境下:

  • Llama 3.1 8B:约15 tokens/s,写代码补全够用
  • Qwen 2.5 14B(Q4量化):约8 tokens/s,质量明显更高
  • 中文支持:Qwen系列的中文能力确实比Llama好不少

进阶玩法

  • API集成:Ollama兼容OpenAI格式,现有工具直接对接
  • RAG:配合向量数据库做本地知识库问答
  • 代码补全:接入Continue插件,IDE里直接用
  • 多模型路由:简单问题用小模型,复杂问题用大模型

总结

本地跑AI的门槛已经很低了,一台普通电脑就能玩起来。如果你还没试过,强烈建议动手试试,体验和用API完全是两个感觉。

💡 关注esxi.cn,获取更多AI本地部署实战教程。

veenyi

这个人很懒,什么都没留下

文章评论