【2026最新】Windows/Linux 本地部署 DeepSeek / Llama 3 完整教程(含 Ollama + Open WebUI 一键整合包)
下载地址:https://pan.quark.cn/s/3d95d4112cd9
提取码:svmg
为什么要自己部署大模型?
2026年了,大模型已经不再是实验室里的黑科技。DeepSeek-V3、Llama 3.3 等开源模型的性能已经逼近甚至超过了很多商业闭源模型。但当你把公司的代码、客户的隐私数据、内部的商业文档一股脑扔进云端 API 的时候,有没有想过——这些数据去了哪里?
大模型私有化部署,就是把模型跑到你自己的电脑或服务器上,数据不离开本地网络,彻底解决隐私焦虑。而且现在有了 Ollama 这样的工具,部署一个大模型比装一个 Office 还简单,一条命令就能搞定,完全不需要机器学习背景。
本文覆盖以下场景:
- 想在 Windows 笔记本上跑一个 DeepSeek 写代码写文档
- 想在 Linux 服务器上搭建团队内部使用的私密 AI 助手
- 想要一个类似 ChatGPT 的聊天界面(Open WebUI)
- 想离线运行——断网也能用
- 想针对自己的 GPU 显存做最优配置
第一步:安装 Ollama(大模型运行引擎)
Ollama 是目前最流行的本地大模型运行工具,它把模型下载、量化、推理、API 调用全部打包成一条龙服务。支持 Windows、macOS、Linux 三大平台。
Windows 安装
最简单的方式:去 Ollama 官网 下载 Windows 安装包(约700MB),双击运行,一路 Next 就完成了。安装完后任务栏右下角会出现一个羊驼图标,说明 Ollama 已经在后台运行。
如果你不想去官网下载,也可以用我打包好的一键整合包(见文章顶部),里面包含了免安装版 Ollama,解压即用。
Linux 安装
一行命令搞定(需要 curl):
curl -fsSL https://ollama.com/install.sh | sh
安装完成后,Ollama 会自动以后台服务方式运行。可以用 systemctl status ollama 检查运行状态。
第二步:下载并运行 DeepSeek 模型
Ollama 安装好之后,下载模型就是一句话的事。以下是几种常用模型及其推荐的量化版本:
| 模型 | 推荐版本 | 显存要求 | 适用场景 |
|---|---|---|---|
| DeepSeek-V3 | deepseek-v3:latest |
24GB+ | 最强中文能力,适合开发/写作 |
| DeepSeek-R1 | deepseek-r1:8b |
8GB+ | 推理能力突出,逻辑分析 |
| DeepSeek-Coder-V2 | deepseek-coder-v2:16b |
12GB+ | 代码生成与补全 |
| Llama 3.3 | llama3.3:70b |
40GB+ | 通用最强,英文场景 |
| Llama 3.1 8B | llama3.1:8b |
6GB+ | 入门首选,低配也能跑 |
| Qwen 2.5 | qwen2.5:14b |
10GB+ | 中文理解均衡选手 |
以 DeepSeek-R1 8B 为例,下载和运行:
# 下载模型(首次会自动下载,约4.7GB) ollama pull deepseek-r1:8b # 直接运行,进入交互对话模式 ollama run deepseek-r1:8b
首次下载可能需要几分钟到半小时不等,取决于你的网速。下载完成后就可以断网离线使用了。
第三步:安装 Open WebUI(图形化聊天界面)
Ollama 自带命令行交互,但每次都要敲命令太硬核了。Open WebUI 提供了一个跟 ChatGPT 一模一样的网页聊天界面,支持多轮对话、历史记录、文件上传,甚至还能管理多个模型。
Docker 部署(推荐)
前提:你的电脑已安装 Docker。如果没有,先装 Docker Desktop。
docker run -d -p 3000:8080 \ --add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/data \ --name open-webui \ --restart always \ ghcr.io/open-webui/open-webui:main
启动后打开浏览器访问 http://localhost:3000,注册一个本地账号(数据纯本地存储),就能在网页里跟 DeepSeek 聊天了。
Windows 免 Docker 部署
如果你不想装 Docker,整合包里也提供了免安装版 WebUI,解压后双击 start.bat 即可启动。
第四步:GPU 显存优化——让模型跑得更快
大模型对显存非常敏感。显存不够,模型就会"降级"到 CPU 推理,速度可能慢 10 倍以上。下面是一些关键的优化策略:
1. 根据显存选择合适的量化版本
| 你的显卡 | 显存 | 推荐模型大小 |
|---|---|---|
| GTX 1060 / RTX 2060 | 6GB | 7B~8B(如 llama3.1:8b、deepseek-r1:8b) |
| RTX 3060 / RTX 4060 | 12GB | 13B~16B(如 deepseek-coder-v2:16b、qwen2.5:14b) |
| RTX 3090 / RTX 4090 | 24GB | 34B~70B(如 deepseek-v3、llama3.3:70b) |
| A100 / H100 | 40~80GB | 70B+,可跑满血版本或同时加载多个模型 |
2. 配置 Ollama 并发与上下文长度
修改 Ollama 的环境变量可以优化性能。Windows 用户在系统环境变量中添加,Linux 用户编辑 /etc/systemd/system/ollama.service:
# 设置并行请求数(默认1,建议不超过GPU数量的2倍) OLLAMA_NUM_PARALLEL=2 # 最大加载模型数(默认1) OLLAMA_MAX_LOADED_MODELS=2 # 上下文窗口大小(默认2048,可根据显存调大) OLLAMA_CONTEXT_LENGTH=4096 # 强制使用GPU(默认auto) OLLAMA_GPU_LAYERS=35
3. 使用 GGUF 离线权重文件
如果你的服务器完全不能联网,或者想精确控制量化等级(Q4_K_M、Q5_K_M、Q8_0 等),可以用 GGUF 格式的离线权重文件。整合包里已经包含了常用模型的 GGUF 文件和 Ollama Modelfile 模板,直接导入即可:
# 创建 Modelfile echo "FROM ./deepseek-r1-8b-q4_k_m.gguf" > Modelfile # 导入 Ollama ollama create deepseek-r1-custom -f Modelfile # 运行 ollama run deepseek-r1-custom
常见问题 FAQ
Q1:Ollama 下载模型太慢怎么破?
模型文件通常存储在 Ollama 的官方仓库(registry.ollama.ai),国内直连可能只有几百 K/s。可以使用镜像加速,或者直接从本整合包的夸克网盘下载已下载好的模型文件,放到 Ollama 的 models 目录(Windows 默认在 C:\Users\你的用户名\.ollama\models,Linux 在 /usr/share/ollama/.ollama/models)。
Q2:显存不够能不能跑?
能。Ollama 支持 CPU 推理(纯内存运行),只是速度会慢很多。8B 模型在 16GB 内存的笔记本上大约每秒 3~8 个 token,用来读文档、做简单问答还是可用的。还可以通过 OLLAMA_GPU_LAYERS 参数混合推理——部分层跑 GPU,部分层跑 CPU。
Q3:DeepSeek 和 Llama 3 怎么选?
如果你主要处理中文任务(写文章、读中文文档、中文客服),DeepSeek 是首选,它的中文理解和生成能力明显更强。如果你做的是多语言任务或者英文为主,Llama 3 的生态更成熟,工具链支持更好。两者都是开源可商用,不用担心授权问题。
Q4:部署完能对外提供服务吗?
当然可以。Ollama 默认会在 localhost:11434 启动一个兼容 OpenAI API 格式的接口,你可以直接用任何支持 OpenAI 协议的客户端连接它。Open WebUI 也支持多用户管理,可以给团队成员各自分配账号,搭建企业内部 AI 助手平台。
Q5:更新模型版本怎么操作?
# 拉取最新版本 ollama pull deepseek-r1:8b # 查看本地已安装的模型 ollama list # 删除旧版本释放空间 ollama rm deepseek-r1:8b-old
总结
用 Ollama + Open WebUI 部署本地大模型,整个过程的核心步骤其实就三句话:
- 装 Ollama——下载安装,一分钟搞定
- 拉模型——
ollama pull deepseek-r1:8b - 启界面——Docker 一行命令启动 Open WebUI
整个过程不需要机器学习理论,不需要 Python 环境配置,不需要显卡驱动调参。只要你的电脑内存够大(16GB以上)或者有张独立显卡,就能跑起来一个完全属于自己的 AI 助手。
大模型私有化部署的浪潮已经来了。2026年,把 AI 控制权握在自己手里,不是什么技术难题,而是一个"做还是不做"的选择。
📦 资源包再次提醒
整合包包含:免安装版 Ollama + Open WebUI + 常用模型 GGUF 权重 + GPU 优化配置文件
下载地址:https://pan.quark.cn/s/3d95d4112cd9
提取码:svmg
如果你在部署过程中遇到任何问题,或者想了解更高级的配置(如多卡并行、LoRA 微调、API 负载均衡),欢迎在评论区留言或通过 联系页面 找到我。