一台电脑跑通大模型、文生图与语音合成:LocalAI 完整使用指南
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
LocalAI 是一个开源的本地 AI 引擎:一个很小的核心负责对外提供 OpenAI、Anthropic 兼容的接口,而真正干活的模型后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等)按需单独拉取,用多少装多少。文本、图像、视频、语音这几类模型都能在普通硬件上本地运行,纯 CPU 机器也够用,不强制 GPU。它内置了网页界面,装好模型就能直接对话、出图、合成语音,不用手写配置文件。
一条命令跑起来:三种安装方式
本地跑 AI 最劝退的地方,往往是环境搭建。LocalAI 把这件事压到一条命令:大多数用户用容器启动,几秒后浏览器打开http://localhost:8080就能看到界面。
容器方式(推荐)
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest有对应显卡时换一张镜像即可,核心命令不变:
| 你的硬件 | 容器镜像 | 追加参数 |
|---|---|---|
| 只有 CPU | localai/localai:latest | 无 |
| NVIDIA 显卡 | localai/localai:latest-gpu-nvidia-cuda-12 | --gpus all |
| AMD(ROCm) | localai/localai:latest-gpu-hipblas | --device=/dev/kfd --device=/dev/dri |
| Intel(oneAPI) | localai/localai:latest-gpu-intel | --device=/dev/dri/card1 |
| 任意 Vulkan 显卡 | localai/localai:latest-gpu-vulkan | 无 |
装完模型后,LocalAI 会按你的显卡能力自动挑后端,这一步通常不用手动干预。
macOS 桌面版
下载并双击 DMG 安装。由于安装包没有 Apple 签名,首次启动前在终端执行一次:
sudo xattr -d com.apple.quarantine /Applications/LocalAI.app命令行方式
适合已经熟悉终端、想自定义参数的人。核心逻辑同样是"启动 + 顺带装模型":
local-ai run qwen3-4b三种方式最后都落在同一个网页界面,后续操作一致。源码结构上,核心在 cmd/,后端引擎放在 backend/,想深入了解可以看 docs/content/overview.md。
能力地图:它到底能替你干什么
把 LocalAI 当成一台"本地 AI 工具箱"来看更直观。下面按能力拆,每种能力都对应一个可直接调用的接口,网页界面里也有对应入口。
和大模型对话:本地版的 OpenAI 接口
在网页的 Chat 页选一个已装模型,输入问题就能收到回复;想接入自己的程序,把地址指向http://localhost:8080即可,走的是 OpenAI 兼容端点:
curl http://localhost:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen3-4b","messages":[{"role":"user","content":"你好"}]}'同一套核心还支持 Anthropic Messages 接口和 Open Responses 接口,接口切换见 docs/content/features/。
文生图:在本地跑 Stable Diffusion 与 Flux
在模型库搜图像模型(如 Flux 的 ggml 版),装好后向图像生成端点发一句描述就能出图。负向提示词用|分隔,拼在正向词后面:
curl http://localhost:8080/v1/images/generations \ -H "Content-Type: application/json" \ -d '{"prompt":"A cute baby sea otter","size":"512x512"}'图像能力细节见 docs/content/features/image-generation.md。
语音两头通:合成与识别
TTS 走文本转语音端点,ASR 走语音转文本端点,两者都挂在统一接口下。Piper、Coqui、Kokoro、Vibevoice 等引擎按需加载,支持多语言、多音色。
视觉与多模态:让模型"看"和"听"
除文本外,LocalAI 还能做图像理解(Vision)、目标检测、嵌入向量、重排序、说话人识别等。一个请求进来,核心按模型类型路由到对应后端,互不干扰——某块后端出问题不会拖垮其余部分。这个"小核心 + 可插拔后端"的设计是它的关键结构,示意图见 docs/content/overview.md。
内置智能体:给模型工具,让它自己干活
Agents 页里可以新建一个智能体,给它配置工具、系统提示词,然后开始对话;它会按需调用工具、执行代码、读取文件,涉及状态变更的动作会先征求你同意。智能体支持 MCP(Model Context Protocol),是核心的一部分,不用单独安装。
模型库:一键装几百个模型,先估好显存
打开 Models 页,有两个视图:Explore用来浏览、比较、安装;Installed管理已装模型的运行、停用、配置编辑。安装时界面会直接给出预计下载体积和预计显存占用,并用绿色/红色标出你的机器装不装得下(按 95% 余量判断),省得装一半才OOM。
想换来源,也可以在 Runtime Settings 里加自定义模型库;模型定义文件本身是 YAML,仓库里 gallery/ 目录就是一批现成示例。
没显卡也能跑:硬件与性能
LocalAI 的底线是纯 CPU。要跑得更快或塞进更大的模型,按硬件调三处即可:
- 量化档位:显存紧张就选 Q4_K_M 之类的低量化版本,体积和内存占用都小;
- 上下文长度:
context_size越大越吃内存,够用就好; - 显存管理:用
--max-active-backends=1只留一个模型在内存里,或开空闲看门狗自动卸载长期不用的模型。
后端引擎以独立进程 + 独立镜像运行,装、升级、删都不碰核心,一个后端出错不影响整体。这个"按需拉取"的设计决定了它只占用你用到的那部分资源。
从单机到多机:分布与多人
单台不够时,LocalAI 支持水平扩展:加入 GPU 工作节点自注册、P2P 联邦做负载均衡、大模型跨机分片。多人环境则用LOCALAI_AUTH=true开启用户认证,配 API 密钥、角色和用量配额。多机拓扑可参考 docs/content/features/distributed-mode.md。
出问题时:先自检这几步
别急着翻社区,先跑几个诊断命令定位问题:
| 现象 | 先查什么 | 处理方向 |
|---|---|---|
| 8080 连不上 | 进程是否在跑、端口是否被占 | docker logs local-ai、查端口占用 |
| 模型 404 | 模型名是否和/v1/models返回的一致 | 核对名字,确认文件在 models 目录 |
| 加载失败 | 后端是否装对(GGUF 配llama-cpp) | local-ai backends list补装 |
| 内存爆掉 | 量化档位、上下文大小 | 降量化、降context_size、low_vram: true |
诊断命令与完整排查见 docs/content/getting-started/troubleshooting.md。
下一步
- 容器里跑起来后,先装一个 CPU 友好的小模型(如
qwen3-4b),跑通第一次对话; - 到 Models → Explore 装一个图像模型,试一下
/v1/images/generations; - 需要接自己的程序时,把 OpenAI SDK 的地址指向
http://localhost:8080; - 想加能力(智能体、多用户、分布),再回到能力地图按需展开。
官方文档入口在 docs/content/,特性清单见 docs/content/features/。从一条docker run开始,先把"能对话"跑通,剩下的能力随用随装。
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考