textgen 本地大模型桌面应用:从下载到跑通 API 的快速避坑指南
2026/8/31 10:29:02 网站建设 项目流程

textgen 本地大模型桌面应用:从下载到跑通 API 的快速避坑指南

【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen

textgen(也就是大家熟知的 text-generation-webui)是一个开源的本地大模型运行工具:装在你自己电脑上,聊天、看图片、调工具、跑微调,全程离线,数据不出内网。它还能对外提供一个兼容 OpenAI/Anthropic 的 API,等于给一堆现成应用换了个本地后端。适合三类人:想在自己显卡上白嫖大模型的玩家、需要隐私隔离的团队、以及想搭本地 API 给别的项目用的开发者。

最短路径:三步跑起来

🚀 不用记一堆命令,按顺序做就行:

  1. 拿代码:git clone https://gitcode.com/GitHub_Trending/te/textgen
  2. 进目录,运行对应操作系统的启动脚本:Linux 跑./start_linux.sh,Windows 双击start_windows.bat,macOS 跑start_macos.sh。脚本会问你 GPU 类型(NVIDIA/AMD/CPU),选完它自动装好依赖
  3. 浏览器打开http://127.0.0.1:7860,界面就出来了

模型方面最简单的是 GGUF 格式:下一个模型文件,丢进 user_data/models/ 文件夹,UI 会自动识别。以后每次启动还是跑同一个start_脚本就行。

按硬件挑依赖文件,别装错

想跳过脚本用 pip 手动装(完整安装,支持训练、更多后端),依赖文件要按硬件对号入座,装错了轻则慢、重则直接报错:

你的硬件依赖文件
NVIDIA 显卡requirements/full/requirements.txt
AMD 显卡requirements/full/requirements_amd.txt
纯 CPUrequirements/full/requirements_cpu_only.txt
Apple M 系列芯片requirements/full/requirements_apple_silicon.txt
Apple Intel 老款 Macrequirements/full/requirements_apple_intel.txt

装完用python server.py启动即可。只跑浏览器版、不需要训练的话,可以装轻量的 requirements/portable/ 里的文件,并加--portable参数,磁盘占用小得多。

五个最值得动的配置点

所有启动参数都可以写进 user_data/CMD_FLAGS.txt,每行一个,下次启动自动生效,不用反复敲命令行。挑五个真正省事的:

  1. --model 模型文件名.gguf—— 启动时直接加载指定模型,省掉每次在 Model 标签页里手点
  2. --api—— 开启 OpenAI/Anthropic 兼容的 API 服务,用法示例见 docs/12 - OpenAI API.md
  3. --listen—— 让局域网里其他设备也能访问你的界面,配合防火墙放行端口
  4. --load-in-8bit—— 8 位量化加载模型,显存直接减半起步;显存还紧张就换--load-in-4bit(仅限 Transformers 后端)
  5. --ctx-size 16384—— 指定上下文长度(模型一次能"记住"多少 token),别超过模型本身支持的上限

生成风格不想每次手调?user_data/presets/ 里自带 Creative、Deterministic、Top-P 几套预设,在 Parameters 标签页一键切换,参数含义可以参考 docs/03 - Parameters Tab.md。

服务器上用 Docker 隔离部署

🐳 在共享服务器上跑,容器化最干净,互不污染。以 NVIDIA 卡为例:

  1. ln -s docker/nvidia/Dockerfile docker/nvidia/docker-compose.yml .把配置软链到根目录(AMD/Intel/CPU 换对应目录)
  2. cp docker/.env.example .env,然后编辑.env:按你的显卡设置TORCH_CUDA_ARCH_LIST(终端跑nvidia-smi可查),把APP_RUNTIME_GID改成你宿主机的用户组 id(id -g查看)
  3. docker compose up --build

构建完访问同样的 7860 端口。AMD、Intel 和 CPU 版本的 docker/ 目录结构完全一样,换目录名就行。

常见坑,提前绕开

  • 显存爆了(CUDA out of memory):先降量化位数(--load-in-4bit),再考虑把 KV 缓存压缩(--cache-type q8_0
  • 界面识别不到模型:GGUF 直接放 user_data/models/ 下;但 Transformers 多文件模型必须放在 models 里新建的子文件夹中,且必须用完整安装
  • 局域网打不开:确认加了--listen,防火墙放行了 7860 端口
  • 依赖打架、装环境反复报错:优先上 Docker,或者干脆用官方start_脚本让它自己用 Miniforge 建环境
  • CPU 跑太慢:加--cpu --threads 8之类的线程参数微调,但预期管理好——CPU 推理和 GPU 是两个世界

--model--api写进CMD_FLAGS.txt,重启一次机器你都能秒进工作状态——剩下的就等你把第一个模型拖进来试试手感了。

【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询