一、部署架构
Windows11 + Ollama + Qwen3.5:4B
二、windows电脑配置
Ollama是一个开源的本地大模型运行框架,对硬件门槛很低,仅要求:
Windows 10/11 64 位系统;
内存≥8GB;
支持 AVX 指令集(11 代酷睿全部支持);
本次实践的笔记本电脑配置如下:
- CPU:11 代英特尔 i5-1135G7 4 核 8 线程
- 内存:16GB(可用 15.8GB)
- 核显:Iris Xe Graphics(128MB 显存,共享内存)
核显系统:Win11 25H2
电脑配置越高,可以通过Ollama部署的大模型就越大。根据本电脑的硬件配置,适合部署4B(40亿个)参数及以下的大模型,7B及以上的大模型就不适合本电脑,内存不够。
三、基于Ollama部署大模型步骤
基于Ollama部署大模型,步骤如下:
安装Ollama、进入window终端(CMD/PowerShell)、Ollama拉取大模型、Ollama启动大模型、大模型对话交互。
3.1安装Ollama
- 打开官网:OllamaOllama is the easiest way to automate your work using open models, while keeping your data safe.
https://ollama.com/
- 点击Download、Download for Windows下载安装包,如图1、图2所示。
- 双击安装包,一路默认下一步,自动完成安装
- 安装完成后,电脑开始菜单会出现「Ollama」,同时后台自动启动 Ollama 服务(无需手动启动)
图1. Ollama官网
图2. 点击“Download for Windows”开始下载
3.2 进入window终端(CMD/PowerShell)
通过cmd命令进入windows终端,或者打开Powershell终端。
- 快捷键
Win + R,输入cmd回车,打开命令提示符 - 或者右键开始菜单,选择“Windows 终端 (管理员)”
图3. 点击“命令提示符”,进入CMD终端
3.3 Ollama拉取大模型
在cmd终端执行Ollama命令,拉取大模型。
ollama pull qwen3.5:4b图4. 拉取大模型
3.4 Ollama启动大模型
拉取大模型后,可以继续通过命令,查看已经部署好的大模型、启动大模型。
查看本地已经拉取部署好的大模型:
ollama list启动一个大模型:
ollama run qwen3.5:4b图5. 查看本地部署的大模型
3.5 大模型对话交互
上一步通过命令(ollam run qwen3.5:4b)启动大模型后,就会出现下图所示的大模型对话交互界面。首先,cmd终端会提示“Send a message”。然后,你输入想问的问题,就能得到答案。
大模型先给出思考过程,再逐步给出问题的答案。
图6. cmd终端对话大模型
四、大模型交互升级
如果希望通过可视化的界面与大模型交互,可以安装open-webui工具。
在cmd终端运行下面代码后,电脑右下角工具栏出现ollama图标,如图7所示。
点击“Open Ollama”,就可以进入Ollama的可视化交互界面,如图8所示。
ollama run open-webui图7. 电脑右下角工具栏出现ollama图标
点击“New Chat”,就可以进入聊天界面。跟上面终端交互类似,已经提示了“Send a message”。用户输入问题,大模型就会逐步返回思考过程、答案。
图8. Ollama可视化交互界面
大模型名字右侧有云朵、下载标志,就意味着这些模型未部署在本地,可以云端调用。大模型qwen3.5:4b右侧没有任何标识,意味着已经本地化部署好了,可直接免费、安全的使用。
图9. 显示本地部署的大模型qwen3.5:4b
Launch,就可以进入其他工具部署界面。比如想继续部署智能体Claude Code、OpenClaw、Codex,可以复制命令,比如ollama launch claude,然后进入windows的CMD中,执行命令安装对应的智能体工具。
ollama launch claude图10. Launch板块的内容
五、Ollama常用命令小结
查看版本与帮助:
ollama --version ollama -h ollama run -h # 看run命令专属参数大模型下载与管理:
# 拉取(下载)模型 ollama pull qwen3.5:4b # 查看本地已经下载全部模型 ollama list # 简写:ollama ls # 查看模型详情(参数、模板、系统提示词) ollama show qwen3.5:4b # 删除本地模型,释放磁盘空间 ollama rm qwen3.5:4b # 复制模型(做自定义模型副本) ollama cp qwen3.5:4b my-qwen # 推送模型到远程仓库(个人很少用) ollama push my-qwen模型运行、对话、停止:
# 启动模型,进入终端交互式聊天 ollama run qwen3.5:4b # 查看当前正在内存中运行的模型 ollama ps # 停止正在运行的模型,释放内存/显存 ollama stop qwen3.5:4blaunch 启动智能体套件:
ollama launch ollama launch claude --model qwen3.5:4b大模型运行控制:
# 低温度,适合标书问答、事实类任务 ollama run qwen3.5:4b --temperature 0.1 # 扩大上下文窗口,可以读更长标书文档 ollama run qwen3.5:4b --ctx-size 8192 # --verbose 输出详细日志,排查速度、内存问题 ollama run qwen3.5:4b --verbose自定义模型(Modelfile,微调后打包进 ollama 用这个):
# 根据Modelfile创建自定义模型 ollama create bid-qwen -f ModelfileModelfile示例:
FROM qwen3.5:4b PARAMETER temperature 0.2 PARAMETER num_ctx 8192 SYSTEM "你是投标标书问答专家,严格依据标书内容回答"