10 分钟快速上手 Dolphin 2.9.1 Yi 1.5 34b:开源大模型本地部署新手教程
【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b
想在自己的电脑上运行一个能写代码、能对话、还能调用工具的开源大模型吗?Dolphin 2.9.1 Yi 1.5 34b 就是这样一个优秀的选择。它是基于零一万物 Yi-1.5-34B 微调的开源大模型,采用 Apache 2.0 协议(可免费商用),MMLU 评测高达 77.4 分,支持 8K 上下文与 ChatML 对话格式。本文是一篇面向新手的开源大模型本地部署教程,带你 10 分钟完成从下载模型到本地运行的全流程。
Dolphin 2.9.1 Yi 1.5 34b 是什么?为什么值得部署?
Dolphin 系列由 Cognitive Computations 团队打造,Dolphin 2.9.1 Yi 1.5 34b 是其中口碑极佳的版本。它基于 Yi-1.5-34B 基础模型做全参数微调(FFT,16bit),融合了 Dolphin-2.9、OpenHermes-2.5、CodeFeedback、orca-math、Agent-FLAN 等多个高质量数据集,因此兼具对话、代码生成、数学推理和函数调用能力,甚至可以当 Agent 使用。
| 核心参数 | 数值 |
|---|---|
| 参数规模 | 34B(60 层 Transformer) |
| 基础模型 | Yi-1.5-34B(LLaMA 架构) |
| 上下文长度 | 8K(位置编码采用扩展 RoPE) |
| 对话格式 | ChatML(<|im_start|>/<|im_end|>) |
| 评测成绩 | MMLU 77.4 分 |
| 开源协议 | Apache 2.0(允许商用) |
| 权重格式 | bfloat16,共 15 个 safetensors 分片 |
想了解模型的训练细节与评测数据,可以直接查看项目里的 README.md;模型的完整参数定义(如 60 层、隐藏维度 7168、rope_theta 等)记录在 config.json 中;分词器配置(ChatML 模板、特殊 token 定义)则见 tokenizer_config.json。模型权重总量约 68GB,由 model.safetensors.index.json 索引 15 个分片文件,结构一目了然。
本地部署前的硬件配置要求(显存与内存怎么选)
部署大模型前,先对照下表确认你的硬件是否达标。显存决定模型能否完整加载,内存则影响加载速度。
| 部署方式 | 显存/内存需求 | 适合人群 |
|---|---|---|
| bfloat16 原版全量 | 约 68GB 显存(需 A100/H100 或双卡) | 企业/实验室 |
| 8bit 量化 | 约 36GB 显存(RTX A6000 级别) | 高端工作站 |
| 4bit 量化(GPTQ/AWQ) | 约 20GB 显存(RTX 4090 足够) | 个人玩家 |
| GGUF 量化(Q4_K_M) | 约 20GB,可 CPU/GPU 混合运行 | 普通用户首选 |
对新手来说,最推荐的路径是:先用本仓库的 bfloat16 权重 + Transformers 验证效果,日常使用则下载 GGUF 量化版以降低门槛。
第一步:快速获取模型文件(下载与目录结构)
最方便的方式是使用 git 克隆整个仓库(需要先安装 git-lfs 大文件插件):
git lfs install git clone https://link.gitcode.com/i/0220eb95e2a6dc050abfbc071e6ba4db克隆完成后,目录内包含 15 个model-0000X-of-00015.safetensors权重分片、model.safetensors.index.json 权重索引,以及 config.json、generation_config.json、tokenizer.json、tokenizer.model 等配置文件。只要整个目录保持完整,Transformers 就能自动识别加载。
第二步:使用 Transformers 一行代码加载模型(最快上手方法)
如果你有足够显存,安装依赖后即可用 HuggingFace Transformers 加载原版模型:
pip install transformers torch acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("./dolphin-2.9.1-yi-1.5-34b", device_map="auto") tokenizer = AutoTokenizer.from_pretrained("./dolphin-2.9.1-yi-1.5-34b")模型会自动按 ChatML 模板拼接对话,注意在加载时设置trust_remote_code=False(本模型为标准 LLaMA 架构,无需远程代码),推理时记得do_sample=True以发挥其对话风格。
第三步:低显存方案:Ollama / llama.cpp 量化部署
显存不足 24GB 的读者,推荐下载社区发布的 GGUF 量化版(Q4_K_M 约 20GB),配合 Ollama 一键运行:
ollama create dolphin-2.9.1-34b -f Modelfile ollama run dolphin-2.9.1-34b在 Modelfile 中指定 GGUF 文件路径并填入 ChatML 模板(见下一节)即可。Ollama 自动做显存/内存调度,普通 16GB 内存的电脑也能跑起来,只是速度稍慢。追求性能的进阶玩家,还可以用 llama.cpp 的llama-server启动一个 OpenAI 兼容的本地 API 服务。
第四步:进阶方案:vLLM 高性能推理部署
需要把模型开放给多人使用、追求高吞吐?vLLM 是当前最流行的高性能推理框架:
pip install vllm vllm serve ./dolphin-2.9.1-yi-1.5-34b --max-model-len 8192启动后会自动提供 OpenAI 兼容接口(默认http://localhost:8000/v1),业务系统只需改一行 base_url 即可接入,非常省心。
ChatML 对话模板格式详解(必须掌握的调用方式)
Dolphin 2.9.1 使用 ChatML 格式,手动调用时请严格遵循如下结构(<|im_end|>为结束标记):
<|im_start|>system You are Dolphin, a helpful AI assistant.<|im_end|> <|im_start|>user 你的问题写在这里<|im_end|> <|im_start|>assistant系统提示词可自由替换(如设定角色、指定输出语言)。若通过 vLLM 或 Ollama 调用,这些框架会自动套用 tokenizer_config.json 中内置的chat_template,无需手写。
新手常见问题与避坑指南
- 显存不足(OOM):改用 GGUF 或 4bit 量化版本;或将
max-model-len调小,减少 KV Cache 占用。 - 对话总以英文回复:在 system 提示中明确要求“用中文回答”即可。
- 上下文超长报错:本模型原生 8K 上下文,超长内容需自行截断或改用长上下文版本。
- 关于“无审查”特性:Dolphin 过滤了对齐数据,模型遵从度极高,对外提供服务前请务必自行叠加安全对齐层,并对生成内容负责。
总结
Dolphin 2.9.1 Yi 1.5 34b 是一个性能与灵活性兼备的开源大模型:Apache 2.0 可商用、77.4 的 MMLU 成绩、支持函数调用与 Agent 场景。按照本文的开源大模型本地部署教程,先克隆 模型仓库 验证原版,再按硬件情况选择 Transformers、Ollama 或 vLLM 方案,10 分钟内就能让这只“海豚”在本地为你工作。动手试试吧!🐬
【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考