一台电脑跑通大模型、文生图与语音合成:LocalAI 完整使用指南
2026/8/31 9:06:41 网站建设 项目流程

一台电脑跑通大模型、文生图与语音合成:LocalAI 完整使用指南

【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI

LocalAI 是一个开源的本地 AI 引擎:一个很小的核心负责对外提供 OpenAI、Anthropic 兼容的接口,而真正干活的模型后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等)按需单独拉取,用多少装多少。文本、图像、视频、语音这几类模型都能在普通硬件上本地运行,纯 CPU 机器也够用,不强制 GPU。它内置了网页界面,装好模型就能直接对话、出图、合成语音,不用手写配置文件。

一条命令跑起来:三种安装方式

本地跑 AI 最劝退的地方,往往是环境搭建。LocalAI 把这件事压到一条命令:大多数用户用容器启动,几秒后浏览器打开http://localhost:8080就能看到界面。

容器方式(推荐)

docker run -ti --name local-ai -p 8080:8080 localai/localai:latest

有对应显卡时换一张镜像即可,核心命令不变:

你的硬件容器镜像追加参数
只有 CPUlocalai/localai:latest
NVIDIA 显卡localai/localai:latest-gpu-nvidia-cuda-12--gpus all
AMD(ROCm)localai/localai:latest-gpu-hipblas--device=/dev/kfd --device=/dev/dri
Intel(oneAPI)localai/localai:latest-gpu-intel--device=/dev/dri/card1
任意 Vulkan 显卡localai/localai:latest-gpu-vulkan

装完模型后,LocalAI 会按你的显卡能力自动挑后端,这一步通常不用手动干预。

macOS 桌面版

下载并双击 DMG 安装。由于安装包没有 Apple 签名,首次启动前在终端执行一次:

sudo xattr -d com.apple.quarantine /Applications/LocalAI.app

命令行方式

适合已经熟悉终端、想自定义参数的人。核心逻辑同样是"启动 + 顺带装模型":

local-ai run qwen3-4b

三种方式最后都落在同一个网页界面,后续操作一致。源码结构上,核心在 cmd/,后端引擎放在 backend/,想深入了解可以看 docs/content/overview.md。

能力地图:它到底能替你干什么

把 LocalAI 当成一台"本地 AI 工具箱"来看更直观。下面按能力拆,每种能力都对应一个可直接调用的接口,网页界面里也有对应入口。

和大模型对话:本地版的 OpenAI 接口

在网页的 Chat 页选一个已装模型,输入问题就能收到回复;想接入自己的程序,把地址指向http://localhost:8080即可,走的是 OpenAI 兼容端点:

curl http://localhost:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen3-4b","messages":[{"role":"user","content":"你好"}]}'

同一套核心还支持 Anthropic Messages 接口和 Open Responses 接口,接口切换见 docs/content/features/。

文生图:在本地跑 Stable Diffusion 与 Flux

在模型库搜图像模型(如 Flux 的 ggml 版),装好后向图像生成端点发一句描述就能出图。负向提示词用|分隔,拼在正向词后面:

curl http://localhost:8080/v1/images/generations \ -H "Content-Type: application/json" \ -d '{"prompt":"A cute baby sea otter","size":"512x512"}'

图像能力细节见 docs/content/features/image-generation.md。

语音两头通:合成与识别

TTS 走文本转语音端点,ASR 走语音转文本端点,两者都挂在统一接口下。Piper、Coqui、Kokoro、Vibevoice 等引擎按需加载,支持多语言、多音色。

视觉与多模态:让模型"看"和"听"

除文本外,LocalAI 还能做图像理解(Vision)、目标检测、嵌入向量、重排序、说话人识别等。一个请求进来,核心按模型类型路由到对应后端,互不干扰——某块后端出问题不会拖垮其余部分。这个"小核心 + 可插拔后端"的设计是它的关键结构,示意图见 docs/content/overview.md。

内置智能体:给模型工具,让它自己干活

Agents 页里可以新建一个智能体,给它配置工具、系统提示词,然后开始对话;它会按需调用工具、执行代码、读取文件,涉及状态变更的动作会先征求你同意。智能体支持 MCP(Model Context Protocol),是核心的一部分,不用单独安装。

模型库:一键装几百个模型,先估好显存

打开 Models 页,有两个视图:Explore用来浏览、比较、安装;Installed管理已装模型的运行、停用、配置编辑。安装时界面会直接给出预计下载体积预计显存占用,并用绿色/红色标出你的机器装不装得下(按 95% 余量判断),省得装一半才OOM。

想换来源,也可以在 Runtime Settings 里加自定义模型库;模型定义文件本身是 YAML,仓库里 gallery/ 目录就是一批现成示例。

没显卡也能跑:硬件与性能

LocalAI 的底线是纯 CPU。要跑得更快或塞进更大的模型,按硬件调三处即可:

  • 量化档位:显存紧张就选 Q4_K_M 之类的低量化版本,体积和内存占用都小;
  • 上下文长度context_size越大越吃内存,够用就好;
  • 显存管理:用--max-active-backends=1只留一个模型在内存里,或开空闲看门狗自动卸载长期不用的模型。

后端引擎以独立进程 + 独立镜像运行,装、升级、删都不碰核心,一个后端出错不影响整体。这个"按需拉取"的设计决定了它只占用你用到的那部分资源。

从单机到多机:分布与多人

单台不够时,LocalAI 支持水平扩展:加入 GPU 工作节点自注册、P2P 联邦做负载均衡、大模型跨机分片。多人环境则用LOCALAI_AUTH=true开启用户认证,配 API 密钥、角色和用量配额。多机拓扑可参考 docs/content/features/distributed-mode.md。

出问题时:先自检这几步

别急着翻社区,先跑几个诊断命令定位问题:

现象先查什么处理方向
8080 连不上进程是否在跑、端口是否被占docker logs local-ai、查端口占用
模型 404模型名是否和/v1/models返回的一致核对名字,确认文件在 models 目录
加载失败后端是否装对(GGUF 配llama-cpplocal-ai backends list补装
内存爆掉量化档位、上下文大小降量化、降context_sizelow_vram: true

诊断命令与完整排查见 docs/content/getting-started/troubleshooting.md。

下一步

  • 容器里跑起来后,先装一个 CPU 友好的小模型(如qwen3-4b),跑通第一次对话;
  • 到 Models → Explore 装一个图像模型,试一下/v1/images/generations
  • 需要接自己的程序时,把 OpenAI SDK 的地址指向http://localhost:8080
  • 想加能力(智能体、多用户、分布),再回到能力地图按需展开。

官方文档入口在 docs/content/,特性清单见 docs/content/features/。从一条docker run开始,先把"能对话"跑通,剩下的能力随用随装。

【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询