【2026最新】Windows/Linux 本地部署 DeepSeek / Llama 3 完整教程(含 Ollama + Open WebUI 一键整合包)

2026-08-11 · 大模型部署 · AI 工具
📦 一键部署资源包(免安装 Ollama + Open WebUI + 常用模型权重 + GPU 优化配置)
下载地址:https://pan.quark.cn/s/3d95d4112cd9
提取码:svmg

为什么要自己部署大模型?

2026年了,大模型已经不再是实验室里的黑科技。DeepSeek-V3、Llama 3.3 等开源模型的性能已经逼近甚至超过了很多商业闭源模型。但当你把公司的代码、客户的隐私数据、内部的商业文档一股脑扔进云端 API 的时候,有没有想过——这些数据去了哪里?

大模型私有化部署,就是把模型跑到你自己的电脑或服务器上,数据不离开本地网络,彻底解决隐私焦虑。而且现在有了 Ollama 这样的工具,部署一个大模型比装一个 Office 还简单,一条命令就能搞定,完全不需要机器学习背景。

本文覆盖以下场景:

第一步:安装 Ollama(大模型运行引擎)

Ollama 是目前最流行的本地大模型运行工具,它把模型下载、量化、推理、API 调用全部打包成一条龙服务。支持 Windows、macOS、Linux 三大平台。

Windows 安装

最简单的方式:去 Ollama 官网 下载 Windows 安装包(约700MB),双击运行,一路 Next 就完成了。安装完后任务栏右下角会出现一个羊驼图标,说明 Ollama 已经在后台运行。

如果你不想去官网下载,也可以用我打包好的一键整合包(见文章顶部),里面包含了免安装版 Ollama,解压即用。

Linux 安装

一行命令搞定(需要 curl):

curl -fsSL https://ollama.com/install.sh | sh

安装完成后,Ollama 会自动以后台服务方式运行。可以用 systemctl status ollama 检查运行状态。

第二步:下载并运行 DeepSeek 模型

Ollama 安装好之后,下载模型就是一句话的事。以下是几种常用模型及其推荐的量化版本:

模型 推荐版本 显存要求 适用场景
DeepSeek-V3 deepseek-v3:latest 24GB+ 最强中文能力,适合开发/写作
DeepSeek-R1 deepseek-r1:8b 8GB+ 推理能力突出,逻辑分析
DeepSeek-Coder-V2 deepseek-coder-v2:16b 12GB+ 代码生成与补全
Llama 3.3 llama3.3:70b 40GB+ 通用最强,英文场景
Llama 3.1 8B llama3.1:8b 6GB+ 入门首选,低配也能跑
Qwen 2.5 qwen2.5:14b 10GB+ 中文理解均衡选手

以 DeepSeek-R1 8B 为例,下载和运行:

# 下载模型(首次会自动下载,约4.7GB)
ollama pull deepseek-r1:8b

# 直接运行,进入交互对话模式
ollama run deepseek-r1:8b

首次下载可能需要几分钟到半小时不等,取决于你的网速。下载完成后就可以断网离线使用了。

第三步:安装 Open WebUI(图形化聊天界面)

Ollama 自带命令行交互,但每次都要敲命令太硬核了。Open WebUI 提供了一个跟 ChatGPT 一模一样的网页聊天界面,支持多轮对话、历史记录、文件上传,甚至还能管理多个模型。

Docker 部署(推荐)

前提:你的电脑已安装 Docker。如果没有,先装 Docker Desktop

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

启动后打开浏览器访问 http://localhost:3000,注册一个本地账号(数据纯本地存储),就能在网页里跟 DeepSeek 聊天了。

Windows 免 Docker 部署

如果你不想装 Docker,整合包里也提供了免安装版 WebUI,解压后双击 start.bat 即可启动。

第四步:GPU 显存优化——让模型跑得更快

大模型对显存非常敏感。显存不够,模型就会"降级"到 CPU 推理,速度可能慢 10 倍以上。下面是一些关键的优化策略:

1. 根据显存选择合适的量化版本

你的显卡 显存 推荐模型大小
GTX 1060 / RTX 2060 6GB 7B~8B(如 llama3.1:8b、deepseek-r1:8b)
RTX 3060 / RTX 4060 12GB 13B~16B(如 deepseek-coder-v2:16b、qwen2.5:14b)
RTX 3090 / RTX 4090 24GB 34B~70B(如 deepseek-v3、llama3.3:70b)
A100 / H100 40~80GB 70B+,可跑满血版本或同时加载多个模型

2. 配置 Ollama 并发与上下文长度

修改 Ollama 的环境变量可以优化性能。Windows 用户在系统环境变量中添加,Linux 用户编辑 /etc/systemd/system/ollama.service

# 设置并行请求数(默认1,建议不超过GPU数量的2倍)
OLLAMA_NUM_PARALLEL=2

# 最大加载模型数(默认1)
OLLAMA_MAX_LOADED_MODELS=2

# 上下文窗口大小(默认2048,可根据显存调大)
OLLAMA_CONTEXT_LENGTH=4096

# 强制使用GPU(默认auto)
OLLAMA_GPU_LAYERS=35

3. 使用 GGUF 离线权重文件

如果你的服务器完全不能联网,或者想精确控制量化等级(Q4_K_M、Q5_K_M、Q8_0 等),可以用 GGUF 格式的离线权重文件。整合包里已经包含了常用模型的 GGUF 文件和 Ollama Modelfile 模板,直接导入即可:

# 创建 Modelfile
echo "FROM ./deepseek-r1-8b-q4_k_m.gguf" > Modelfile

# 导入 Ollama
ollama create deepseek-r1-custom -f Modelfile

# 运行
ollama run deepseek-r1-custom

常见问题 FAQ

Q1:Ollama 下载模型太慢怎么破?

模型文件通常存储在 Ollama 的官方仓库(registry.ollama.ai),国内直连可能只有几百 K/s。可以使用镜像加速,或者直接从本整合包的夸克网盘下载已下载好的模型文件,放到 Ollama 的 models 目录(Windows 默认在 C:\Users\你的用户名\.ollama\models,Linux 在 /usr/share/ollama/.ollama/models)。

Q2:显存不够能不能跑?

能。Ollama 支持 CPU 推理(纯内存运行),只是速度会慢很多。8B 模型在 16GB 内存的笔记本上大约每秒 3~8 个 token,用来读文档、做简单问答还是可用的。还可以通过 OLLAMA_GPU_LAYERS 参数混合推理——部分层跑 GPU,部分层跑 CPU。

Q3:DeepSeek 和 Llama 3 怎么选?

如果你主要处理中文任务(写文章、读中文文档、中文客服),DeepSeek 是首选,它的中文理解和生成能力明显更强。如果你做的是多语言任务或者英文为主,Llama 3 的生态更成熟,工具链支持更好。两者都是开源可商用,不用担心授权问题。

Q4:部署完能对外提供服务吗?

当然可以。Ollama 默认会在 localhost:11434 启动一个兼容 OpenAI API 格式的接口,你可以直接用任何支持 OpenAI 协议的客户端连接它。Open WebUI 也支持多用户管理,可以给团队成员各自分配账号,搭建企业内部 AI 助手平台。

Q5:更新模型版本怎么操作?

# 拉取最新版本
ollama pull deepseek-r1:8b

# 查看本地已安装的模型
ollama list

# 删除旧版本释放空间
ollama rm deepseek-r1:8b-old

总结

用 Ollama + Open WebUI 部署本地大模型,整个过程的核心步骤其实就三句话:

  1. 装 Ollama——下载安装,一分钟搞定
  2. 拉模型——ollama pull deepseek-r1:8b
  3. 启界面——Docker 一行命令启动 Open WebUI

整个过程不需要机器学习理论,不需要 Python 环境配置,不需要显卡驱动调参。只要你的电脑内存够大(16GB以上)或者有张独立显卡,就能跑起来一个完全属于自己的 AI 助手。

大模型私有化部署的浪潮已经来了。2026年,把 AI 控制权握在自己手里,不是什么技术难题,而是一个"做还是不做"的选择。

📦 资源包再次提醒

整合包包含:免安装版 Ollama + Open WebUI + 常用模型 GGUF 权重 + GPU 优化配置文件

下载地址:https://pan.quark.cn/s/3d95d4112cd9

提取码:svmg

如果你在部署过程中遇到任何问题,或者想了解更高级的配置(如多卡并行、LoRA 微调、API 负载均衡),欢迎在评论区留言或通过 联系页面 找到我。