textgen 本地大模型桌面应用:从下载到跑通 API 的快速避坑指南
【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen
textgen(也就是大家熟知的 text-generation-webui)是一个开源的本地大模型运行工具:装在你自己电脑上,聊天、看图片、调工具、跑微调,全程离线,数据不出内网。它还能对外提供一个兼容 OpenAI/Anthropic 的 API,等于给一堆现成应用换了个本地后端。适合三类人:想在自己显卡上白嫖大模型的玩家、需要隐私隔离的团队、以及想搭本地 API 给别的项目用的开发者。
最短路径:三步跑起来
🚀 不用记一堆命令,按顺序做就行:
- 拿代码:
git clone https://gitcode.com/GitHub_Trending/te/textgen - 进目录,运行对应操作系统的启动脚本:Linux 跑
./start_linux.sh,Windows 双击start_windows.bat,macOS 跑start_macos.sh。脚本会问你 GPU 类型(NVIDIA/AMD/CPU),选完它自动装好依赖 - 浏览器打开
http://127.0.0.1:7860,界面就出来了
模型方面最简单的是 GGUF 格式:下一个模型文件,丢进 user_data/models/ 文件夹,UI 会自动识别。以后每次启动还是跑同一个start_脚本就行。
按硬件挑依赖文件,别装错
想跳过脚本用 pip 手动装(完整安装,支持训练、更多后端),依赖文件要按硬件对号入座,装错了轻则慢、重则直接报错:
| 你的硬件 | 依赖文件 |
|---|---|
| NVIDIA 显卡 | requirements/full/requirements.txt |
| AMD 显卡 | requirements/full/requirements_amd.txt |
| 纯 CPU | requirements/full/requirements_cpu_only.txt |
| Apple M 系列芯片 | requirements/full/requirements_apple_silicon.txt |
| Apple Intel 老款 Mac | requirements/full/requirements_apple_intel.txt |
装完用python server.py启动即可。只跑浏览器版、不需要训练的话,可以装轻量的 requirements/portable/ 里的文件,并加--portable参数,磁盘占用小得多。
五个最值得动的配置点
所有启动参数都可以写进 user_data/CMD_FLAGS.txt,每行一个,下次启动自动生效,不用反复敲命令行。挑五个真正省事的:
--model 模型文件名.gguf—— 启动时直接加载指定模型,省掉每次在 Model 标签页里手点--api—— 开启 OpenAI/Anthropic 兼容的 API 服务,用法示例见 docs/12 - OpenAI API.md--listen—— 让局域网里其他设备也能访问你的界面,配合防火墙放行端口--load-in-8bit—— 8 位量化加载模型,显存直接减半起步;显存还紧张就换--load-in-4bit(仅限 Transformers 后端)--ctx-size 16384—— 指定上下文长度(模型一次能"记住"多少 token),别超过模型本身支持的上限
生成风格不想每次手调?user_data/presets/ 里自带 Creative、Deterministic、Top-P 几套预设,在 Parameters 标签页一键切换,参数含义可以参考 docs/03 - Parameters Tab.md。
服务器上用 Docker 隔离部署
🐳 在共享服务器上跑,容器化最干净,互不污染。以 NVIDIA 卡为例:
ln -s docker/nvidia/Dockerfile docker/nvidia/docker-compose.yml .把配置软链到根目录(AMD/Intel/CPU 换对应目录)cp docker/.env.example .env,然后编辑.env:按你的显卡设置TORCH_CUDA_ARCH_LIST(终端跑nvidia-smi可查),把APP_RUNTIME_GID改成你宿主机的用户组 id(id -g查看)docker compose up --build
构建完访问同样的 7860 端口。AMD、Intel 和 CPU 版本的 docker/ 目录结构完全一样,换目录名就行。
常见坑,提前绕开
- 显存爆了(CUDA out of memory):先降量化位数(
--load-in-4bit),再考虑把 KV 缓存压缩(--cache-type q8_0) - 界面识别不到模型:GGUF 直接放 user_data/models/ 下;但 Transformers 多文件模型必须放在 models 里新建的子文件夹中,且必须用完整安装
- 局域网打不开:确认加了
--listen,防火墙放行了 7860 端口 - 依赖打架、装环境反复报错:优先上 Docker,或者干脆用官方
start_脚本让它自己用 Miniforge 建环境 - CPU 跑太慢:加
--cpu --threads 8之类的线程参数微调,但预期管理好——CPU 推理和 GPU 是两个世界
把--model和--api写进CMD_FLAGS.txt,重启一次机器你都能秒进工作状态——剩下的就等你把第一个模型拖进来试试手感了。
【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考