直接开门见山。很多人一看这个标题,以为 DeepSeek 是像微信、QQ 那样,在 Windows 上找个 exe 双击一下就能装好的软件。真不是这样。DeepSeek 目前的使用形态有三条路:网页直接用、API 接入工具、本地部署大模型权重。只有第三条路严格意义上叫“安装”,也是网上搜索量最大、踩坑最多的一条。这篇文章我就把三条路全部梳理一遍,重点放在第三条路的完整实操上,从环境准备到模型下载,再到接入 VSCode、Codex 这些日常工具,最后附上我实际踩过的坑和排查方法。
1. 先搞清楚你要装的是什么
在动手之前,必须先弄明白一个问题:DeepSeek 不是一个“应用程序”,而是一个大语言模型。它有两种存在形式:一是官方托管的在线服务,你通过网页或 API 访问;二是开源出来的模型权重文件,你需要下载到自己的电脑上,再用推理框架加载运行。这两种形式的“安装”方式完全不同。
1.1 三条路径的选型分析
我把三条路径的适用人群和优劣列个表,你先对号入座,再往下看。
| 路径 | 适合人群 | 优点 | 缺点 |
|---|---|---|---|
| 官方网页版 | 轻度使用、不想折腾的人 | 零安装,浏览器打开即用 | 功能受限,不能深度定制 |
| API 接入 | 开发者、需要把 AI 集成到工作流的人 | 灵活,可编程调用,接入各种工具 | 按 token 计费,需要联网 |
| 本地部署 | 追求数据隐私、离线使用、折腾党 | 数据不出本机,免费,可深度定制 | 对硬件要求高,安装配置有门槛 |
我的建议是:如果你只是想体验一下 DeepSeek 的能力,直接去官网用网页版,别折腾本地部署。但如果你是开发者,或者想把 DeepSeek 接入到 VSCode、Codex、自己写的脚本里,那 API 和本地部署都值得搞。本地部署最大的价值是隐私和免费,但前提是你得有一台配置还过得去的电脑。
1.2 硬件门槛,先泼盆冷水
本地部署 DeepSeek 不是下载个程序那么简单,你下载的是几十个 GB 的模型文件,然后需要 GPU 或 CPU 来跑推理。这里给你一个参考标准:
- 纯 CPU 推理:能跑,但速度慢。7B 参数量的小模型,每秒能跑几个 token 就算不错,14B 以上基本是煎熬。适合应急体验,不适合日常用。
- GPU 推理(NVIDIA 显卡):这是正路。显存 6GB 以上可以流畅跑 7B 模型,12GB 以上能跑 14B,32GB 以上才能比较舒服地跑 32B 模型。显存不够就得靠量化版模型硬撑。
- 内存:至少 16GB,建议 32GB。模型加载到内存和显存的机制不一样,但内存太小会直接导致加载失败。
如果你电脑配置比较差,也不是不能玩,但你要管理好预期——把目标定在跑通 7B 或 14B 的量化版模型上,别一上来就想跑满血版。后面我会讲怎么选模型。
2. 安装前的准备工作
在正式安装之前,建议把环境理顺。这里说一句实话:在 Windows 上玩本地大模型,原生环境体验很差,强烈建议先装 WSL。WSL(Windows Subsystem for Linux)可以让你在 Windows 里跑一个真正的 Linux 子系统,绝大多数 AI 推理框架都是优先支持 Linux 的,你在 WSL 里操作会顺手得多。
2.1 开启 WSL 和 Windows Terminal
开启 WSL 其实只要一条命令。以管理员身份打开 PowerShell 或 Windows Terminal,执行:
wsl --install这条命令会自动完成三件事:启用 WSL 功能、安装默认的 Ubuntu 发行版、安装 WSL2 内核。装完重启电脑,就有一个 Ubuntu 环境可用了。
重启之后,建议把 Windows Terminal 设为默认终端。这个工具比原来的 cmd 和 PowerShell 好用太多,支持多标签页、自定义主题、分屏,而且 WSL 集成得非常自然。在 Microsoft Store 里搜索 Windows Terminal 安装即可,免费。
如果你不想用 WSL,坚持在原生 Windows 环境跑,也可以,但后面很多排查方法可能对不上号,因为大部分踩坑经验都默认 WSL 环境。这里我建议按 WSL 路线走。
2.2 装好 Git 和基础工具
在 WSL 里,先把基础工具链装好:
sudo apt update && sudo apt upgrade -y sudo apt install git curl wget python3 python3-pip build-essential -yGit 用来拉取开源项目代码,curl 和 wget 用来下载文件,Python 是很多 AI 工具链的运行时基础。这些都是后面少不了的。
另外,如果你还需要在 Windows 原生侧做开发,Git for Windows 也建议装一个,直接从官网下载安装包,一路下一步就行。这个工具在后续拉取模型仓库时会用到,虽然 WSL 里的 Git 也能用,但 Windows 侧的文件操作效率更高。
3. 本地部署实操:Ollama + DeepSeek
现在开始动真格的。本地部署大模型的方案其实有好几个,比如Ollama、LM Studio、vLLM、llama.cpp。对于普通用户和大多数开发者,我最推荐 Ollama。原因有三个:安装简单、命令管理模型方便、对 Windows 友好。
3.1 为什么选 Ollama
Ollama 把大模型的下载、加载、推理、API 暴露全部封装成了一层极简的命令行接口。你不需要关心模型权重文件放在哪里,不需要手动配置推理框架,不需要折腾 GPU 驱动和 CUDA(至少大部分情况下不需要)。你要做的只是两件事:告诉 Ollama 你要哪个模型,然后运行它。
对比一下各个方案你就明白了:
| 方案 | 优点 | 缺点 |
|---|---|---|
| Ollama | 安装一条命令,使用一条命令,生态好 | 自定义空间小,高级配置不够灵活 |
| LM Studio | 有图形界面,适合纯小白 | 功能相对较弱,命令行生态不如 Ollama |
| vLLM | 性能强,吞吐高,适合生产环境 | 配置复杂,Windows 原生基本跑不了 |
| llama.cpp | 最底层,控制力最强 | 需要编译,门槛高,不适合新手 |
对于“在 Windows 上安装 DeepSeek 的完整指南”这个需求,Ollama 就是最合适的答案。
3.2 安装 Ollama 并下载 DeepSeek 模型
Ollama 官方提供了 Windows 原生安装包,也支持 Linux。如果你按我前面说的装了 WSL,其实有两种安装方式:
方式一:Windows 原生安装(适合不想进 WSL 的)
去 Ollama 官网下载 Windows 安装包,双击安装。装完以后,Ollama 会作为一个后台服务运行,你在 CMD 或 PowerShell 里就能敲ollama命令。
方式二:WSL 内安装(推荐)
在 WSL 终端里执行:
curl -fsSL https://ollama.com/install.sh | sh这是官方提供的一键安装脚本,装完以后直接用。
无论哪种方式,装完验证一下:
ollama --version能看到版本号就说明安装成功。
接下来是下载 DeepSeek 模型。DeepSeek 官方开源了多个规模的模型,在 Ollama 上都有对应的 tag。常用的几个:
# 最小版本,CPU 也能跑,适合尝鲜 ollama run deepseek-r1:1.5b # 均衡版本,显存 6GB 以上可以跑 ollama run deepseek-r1:7b # 效果更好,推荐显存 12GB 以上 ollama run deepseek-r1:14b注意,ollama run这个命令会先自动下载模型,下载完直接进入交互式对话界面。你可以直接在里面提问,比如输入“你好”,模型会开始回复。如果只是想下载不进入对话,可以用ollama pull deepseek-r1:7b。
模型文件大小和硬件需求的对应关系,我用实际数据说下:
| 模型 | 文件大小 | 最低内存 | 推荐显存 |
|---|---|---|---|
| deepseek-r1:1.5b | 约 1.1GB | 8GB | 无要求,纯 CPU 可跑 |
| deepseek-r1:7b | 约 4.7GB | 16GB | 6GB |
| deepseek-r1:14b | 约 9GB | 16GB | 12GB |
| deepseek-r1:32b | 约 20GB | 32GB | 24GB |
你可能会问:“网上说的 DeepSeek-R1 满血版 671B 为什么没列出来?”那个版本光模型文件就要一千多 GB,不是普通个人电脑能跑的,别想了。
3.3 启动 API 服务,供其他工具调用
Ollama 启动后,默认会自动在http://localhost:11434上暴露一个 API 服务。也就是说,你在 Ollama 里跑起一个模型后,本机的其他程序可以直接通过 HTTP 请求去调用这个模型。
验证一下 API 是否可用,在浏览器或命令行访问:
curl http://localhost:11434会返回Ollama is running,说明服务正常。
接下来你就可以用任何支持 OpenAI API 格式的工具去连接它了。这里有个关键点:Ollama 的 API 兼容 OpenAI 的接口格式,所以很多原本对接 OpenAI 的工具,只需要把地址改成本地地址就能用。DeepSeek 官方 API 的地址是https://api.deepseek.com,本地 Ollama 的地址是http://localhost:11434/v1,这就是“接入”的本质——换 base URL 而已。
4. 把 DeepSeek 接入日常工具
模型跑起来了,API 服务也通了,接下来就是重头戏:把它接到你日常使用的工具里。这里我讲三个最常见的接入场景:VSCode 编程辅助、OpenAI Codex 命令行、以及自己写 Python 脚本调用 API。
4.1 VSCode 接入 DeepSeek
VSCode 是目前最主流的代码编辑器,接 AI 编程助手基本是刚需。常见的接入方式是安装 Continue 或 Cline 这类插件。
以 Continue 为例,打开 VSCode 扩展市场,搜索“Continue”,安装后进入设置界面。你需要配置一个模型提供商,选择“Ollama”或者“OpenAI-compatible API”,然后填写:
- API Base URL:
http://localhost:11434/v1 - Model:
deepseek-r1:7b(或你下载的模型名)
配置完成后,在 Continue 插件面板里选中这个模型,就可以开始对话了。你在写代码的时候,选中一段代码让 AI 解释、补全、找 bug,它都是在本地调用的,数据不会出机器。
如果你用 Cline,配置方法类似,也是填 base URL 和模型名。这里有个小技巧:如果你的 Ollama 里跑的是代码专用的模型(比如 deepseek-coder 系列的变体),在 VSCode 里的表现会比通用对话模型好很多。DeepSeek 本身就偏代码推理,在代码场景下体验不错。
4.2 Codex 接入 DeepSeek
Codex 是 OpenAI 开源的命令行编程代理工具,它可以读取整个项目上下文、自动改代码、执行命令,甚至自己提交代码。它默认支持的是 OpenAI 的 API,但 OpenAI 的账号和付费对很多人来说是个坎,所以接 DeepSeek 就成了一个热门玩法。
Codex 的配置方式不复杂。它支持通过环境变量或配置文件指定 OpenAI 兼容的 API 地址。在 Windows 上,你可以用以下方式设置环境变量:
$env:OPENAI_BASE_URL = "http://localhost:11434/v1" $env:OPENAI_API_KEY = "ollama" # 本地服务不校验 key,随便填一个然后启动 Codex,它会用这个地址去访问“OpenAI 兼容 API”,而背后接的就是本地跑着的 DeepSeek。如果你用的是硅基流动这类第三方服务商,把 base URL 换掉、key 换成自己的就行。
这里要特别注意:本地 Ollama 跑模型的速度决定 Codex 的实际体验。Codex 这类代理工具会进行多轮推理、工具调用,每一轮都要等待模型输出,如果模型推理速度太慢,整个流程会变得很煎熬。所以如果你要用 Codex + DeepSeek 本地部署,至少跑 14B 以上的模型才有点实用价值。
4.3 Python 脚本调用 API
如果你有自己的脚本和自动化需求,用 Python 调用 Ollama 的 API 是最灵活的方式。可以用官方的openaiPython SDK,因为接口是兼容的:
from openai import OpenAI client = OpenAI( base_url="http://localhost:11434/v1", api_key="ollama", # 本地服务不校验,随便填 ) response = client.chat.completions.create( model="deepseek-r1:7b", messages=[ {"role": "system", "content": "你是一个靠谱的助手。"}, {"role": "user", "content": "用一句话说明什么是大语言模型。"} ], stream=False, ) print(response.choices[0].message.content)这个脚本的本机和远端 API 都能跑,区别只在 base_url 和 api_key。也就是说,你写的代码不需要改动逻辑,只要切换配置就能从本地模型切换到官方 DeepSeek API 或者其他服务商。这对开发来说非常友好。
如果你不想依赖openai这个第三方库,直接用 Python 标准库发 HTTP 请求也行:
import json import urllib.request data = json.dumps({ "model": "deepseek-r1:7b", "messages": [{"role": "user", "content": "你好"}], "stream": False }).encode("utf-8") req = urllib.request.Request( "http://localhost:11434/v1/chat/completions", data=data, headers={"Content-Type": "application/json"} ) with urllib.request.urlopen(req) as resp: result = json.loads(resp.read().decode("utf-8")) print(result["choices"][0]["message"]["content"])这两种方式都可以,看你对第三方库的接受程度。
5. 常见问题与排查手册
这一节是我实际踩坑的记录。本地部署 DeepSeek 最烦的不是装不上,而是装上了跑起来各种小问题。我把高频问题整理成表,你对着查。
5.1 高频问题速查表
| 现象 | 可能原因 | 解决方法 |
|---|---|---|
ollama命令不是内部或外部命令 | Ollama 未安装或未加入 PATH | 重新安装,或手动添加 Ollama 安装目录到系统 PATH |
ollama run下载速度极慢 | 网络问题 | 检查网络;考虑使用镜像源(后面详述) |
| 模型加载后回复速度极慢 | 纯 CPU 推理,或显存不足导致内存交换 | 降低模型参数量,或改用量化版本模型 |
| API 请求返回 404 | 请求路径不对 | 确认使用的是/v1/chat/completions而不是/api/generate |
| 端口冲突 | 其他程序占用了 11434 | 修改 Ollama 监听端口或用netstat排查 |
| 显存不足但模型硬要往 GPU 塞 | Ollama 默认尝试 GPU | 设置环境变量将模型强制跑在 CPU 上:OLLAMA_HOST=127.0.0.1 OLLAMA_CPU_ONLY=1 |
5.2 网络问题与镜像加速
国内下载 HuggingFace 和 Ollama 上的模型经常很慢,这是很多人卡住的第一道坎。我的经验是,先试试能不能正常下载,如果速度极慢或直接超时,就改用镜像源。老的下载方法会用到一些已被屏蔽的服务,现在更稳妥的方式是用 ModelScope(魔搭)或硅基流动提供的模型仓库镜像。
比如用 ModelScope 的方式,在 WSL 里先安装 Python SDK:
pip install modelscope然后写个简单脚本下载模型到本地目录,再用 Ollama 从本地导入。不过这步略折腾,适合实在下不动模型的情况。如果你只是用 Ollama,也可以在启动时指定镜像源,设置环境变量:
export OLLAMA_HOST=127.0.0.1:11434这一步是改监听端口的,不解决下载问题。真正解决下载问题要看你的网络环境,不同地区差异很大,这里我只说结论:多试几个源,总有一个快的。另外下载模型不要频繁中断重试,Ollama 支持断点续传,让它挂在那等就好。
5.3 命令行窗口闪退与脚本异常
很多人在 Windows 上双击某个脚本或运行 Python 文件时,窗口一闪就没了,也没看清楚报错。这个问题几乎都是脚本执行出错后窗口自动关闭导致的。
排查方法是:打开 CMD 或 PowerShell,手动切到脚本所在目录,然后执行脚本。这样窗口不会自动关,错误信息会留在屏幕上。还有个常见原因是 Windows 的脚本执行策略,如果是 PowerShell 脚本报“禁止运行脚本”,执行一下:
Set-ExecutionPolicy RemoteSigned -Scope CurrentUser这条命令允许本机已签名和本地创建的脚本运行,是开发调试的标配操作。
5.4 端口被占用怎么处理
本地跑了很多服务之后,端口冲突是家常便饭。DeepSeek 相关的本地服务默认端口是 11434(Ollama),如果你发现服务起不来,先查端口占用:
netstat -ano | findstr 11434会输出占用进程的 PID 和一个状态信息。再用:
taskkill /PID <PID> /F强制结束该进程。或者反过来,你只是想确认端口通不通,用netstat查一下监听状态,别急着杀进程。Windows 上排查端口问题的核心思路就是这两条命令,够用了。
5.5 模型效果不如官方网页版
这个是本地部署用户问得最多的问题。原因很直接:你本地跑的是小参数模型,官方网页版用的是超大规模模型,效果自然有差距。这不是安装问题,是硬件决定的物理差距。
我的建议是,本地部署的价值在于免费、隐私、可定制,不在于追平官方效果。如果你追求顶级效果,直接用官方网页版或 API 更合适。本地部署更适合做实验、学习、定制化开发,比如用 DeepSeek 做代码补全、跑自动化脚本、研究模型行为。
6. 进阶玩法与我的实操心得
最后聊几个进阶方向,这些是我在实际使用中觉得很有价值的东西,也是一些网上不太容易找到的实操细节。
把 Ollama 玩成团队共享服务:Ollama 默认只监听本机回环地址,但如果你的电脑在局域网内,可以让同事一起用。修改环境变量:
export OLLAMA_HOST=0.0.0.0:11434这样同一局域网内的其他设备就能通过你的 IP 地址访问模型服务。比如你的电脑 IP 是192.168.1.100,同事把 API 地址配成http://192.168.1.100:11434/v1就能用。不过在开放前记得想清楚,局域网内任何人都能调用,注意用量。
在 Windows 上装 Docker 跑 DeepSeek 服务:如果你熟悉 Docker,可以用容器化的方式部署,性能和隔离性更好。Windows 上安装 Docker Desktop 后,拉取一个带推理框架的镜像,比如ollama/ollama镜像,然后直接跑容器。这种方式的优点是可复现、好迁移,换机器不用重新折腾环境。缺点是对新手来说又多了一层概念。
Codex 接入的进阶配置:Codex 不只是命令行聊天,它可以在项目目录下读取文件、修改代码、执行 Git 操作。我在实操中把 DeepSeek 接入 Codex 之后,让它做了一个简单的 Python 爬虫项目,从搭骨架到写完核心逻辑,模型全程参与。缺点是本地模型在多轮工具调用时速度会有点吃紧,需要耐心等。如果你需要更高吞吐,用 DeepSeek 官方 API 会比本地模型快得多——但从成本上说,本地部署胜在免费,没有 token 焦虑。我在实际使用中还有个体会:如果你要在本地跑模型供 Codex 这类代理工具使用,建议用专门的代码模型而非对话模型。DeepSeek 系列本身就有较强的代码能力,默认模型在代码任务上已经很能打。接着是调用参数:把 temperature 调到 0.1 以下,代码生成的稳定性会明显上升,天马行空的编造会少很多。
这玩法往后还能继续扩展:把本地模型接入到自动化测试流程,或者接进自己的知识库做 RAG。核心逻辑都是相通的——模型跑在那里,API 挂在那里,你的想象力才是上限。