AIRI 网页版上手指南:从模型“大脑“到眼睛、耳朵与嘴巴的完整配置实战
2026/9/12 17:22:48 网站建设 项目流程

AIRI 网页版上手指南:从模型"大脑"到眼睛、耳朵与嘴巴的完整配置实战

【免费下载链接】airi💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-sama's altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi

这篇指南以 AIRI 网页版(apps/stage-web)的官方手册为核心,带你完成从零开始的完整上手流程:先为 AIRI 配置大模型"大脑",再通过"机体模块"为它接入语音合成、语音识别与视觉能力,最后用角色卡(Character Card)统一定义性格与各模块的模型偏好。读完本文,你将掌握网页版的模型服务来源配置、TTS/STT 提供商接入、麦克风选择与角色卡编辑的完整实操路径,并能结合仓库源码理解每一步背后的实现机制。

欢迎来到 AIRI

AIRI 网页版本身是一个"空壳躯体"——它拥有 Live2D/3D 形象、聊天面板、背景与语音交互能力,但真正驱动对话的"大脑"(大语言模型)需要由你首次配置。页面会在初始化时引导你点击"开始吧"进入模型配置页,这一步对应源码中的首次配置流程(可参考 onboarding 状态存储),完成后 AIRI 才能开始回应你的对话。

第一步:给 AIRI 一个"大脑"

选择服务来源

在模型配置页,首先需要选择你的大模型服务来源(Provider)。网页版支持:

  • OpenAI官方 API;
  • DeepSeek等国内主流模型服务;
  • Ollama本地模型服务;
  • 以及所有兼容 OpenAI 格式的第三方 API 站点

这些可选项在仓库中分别对应独立的配置页面,例如 Ollama 提供商配置页、官方提供商配置页,以及用于任意 OpenAI 兼容端点的通用页[providerId].vue(位于同一目录)。选择来源后需要填写两项关键信息:

  1. API 密钥(API Key):从服务商控制台申请,用于鉴权;
  2. Base URL:仅在 OpenAI 兼容 API 时需要填写,即大模型提供商的 API 端点地址。

官方手册以**硅基流动(SiliconFlow)**为例演示了这一填写过程——它本质上是 OpenAI 兼容站点,因此需要把硅基流动提供的端点填入 Base URL,并粘贴对应的 API 密钥。

从源码实现看,任意 OpenAI 兼容提供商都会按 OpenAI 协议构造请求:模型列表通过listModels拉取,对话请求则经@xsai/generate-text@xsai/stream-text等库发出(见 apps/stage-web 依赖清单)。这意味着只要端点兼容 OpenAI 格式,理论上均可接入。

选择模型

配置好服务来源后,从模型列表中选择一个你喜欢的 AI 模型作为 AIRI 的大脑。这里有一条官方提示值得留意:

::: tip 如果你使用的模型带有思考(Reasoning)功能,生成回复可能需要很长时间。建议使用非思考模型以提高对话流畅度。 :::

原因在于思考模型在回答前会先生成大量推理 token,流式返回的首字延迟(TTFT)明显变长。如果你追求边聊边听的实时体验,建议优先选择非思考模型,或通过设置里的"温度(temperature)/Top-P"等采样参数调节回复风格——这些参数在首页语音输入与文本对话中统一生效(见 consciousness 模块 中的activeTemperatureactiveTopP状态)。

开始你的第一条对话

完成模型配置后,直接在首页对话框输入文字即可与 AIRI 对话。对话由 chat store 统一管理会话与流式输出,AIRI 会以流式方式逐字生成回复。

第二步:眼睛、耳朵和嘴巴——机体模块

文字对话之外,AIRI 还提供了丰富的语音交互。点击页面右上角的设置 → 机体模块,即可为 AIRI 添加各类交互能力。机体模块入口由useModulesList动态生成(见 机体模块首页),每个模块是一个可独立配置的"器官",对应仓库中packages/stage-pages/src/pages/settings/modules/目录下的独立页面。

让 AIRI 开口说话(发声 / TTS)

语音合成(Text-to-Speech)是让 AIRI"开口"的核心模块,配置页为 speech.vue。

  • 点击发声进入语音合成配置。网页版自带了一个 Kokoro TTS 本地来源,但它不支持中文,因此需要点击新增一个支持中文的语音合成提供商来源;
  • 填入新来源的相关内容(API 密钥、端点等)后,回到发声页面,在提供商列表中选择刚才新增的语音合成提供商即可生效。

仓库中预置了大量 TTS 提供商模板,例如 Kokoro 本地 TTS、VOICEVOX、ElevenLabs、OpenAI 音频语音 以及通用的 OpenAI 兼容语音合成 等,均可作为新增来源。

配置完成后,发声模块还支持以下细节调节(对应 speech 模块状态存储):

  • 选择模型与音色(Voice):切换提供商后,useSpeechStore会自动通过listProviderVoices拉取该提供商下的音色目录(Voice Catalog),并按配置指纹(SHA-256)缓存,避免配置变化后使用过期音色(见 provider store 中的音色目录实现);
  • 音调(Pitch)与语速(Rate):默认音调为0、语速为1,可通过滑块调节;
  • SSML:ElevenLabs、Microsoft Speech 等提供商支持 SSML 标记,可对语句进行更精细的韵律控制(generateSSML会为支持的提供商生成<speak>/<voice>/<prosody>结构的 SSML 文档);
  • 试听:页面内置预览播放器,可即时试听所选音色的效果。

让 AIRI 听见声音(听觉 / STT)

打字聊天有时候太麻烦,这时就需要为 AIRI 配置语音转文字(Speech-to-Text)能力,配置入口为听觉模块(hearing.vue)。

  • 浏览器自带的 STT(Web Speech API)对中文的支持不完整,因此依然需要点击新建一个转文字来源;
  • 仓库提供了多种转文字提供商模板,例如 浏览器 Web Speech API、OpenAI 音频转写、OpenAI 兼容转写 以及阿里云 NLS 实时转写等;
  • 配置好语音转文字提供商后,还需要选择一个可用的麦克风。你可以在 AIRI 首页对话框中点击麦克风图标来切换麦克风设备以及打开/关闭转文字开关。

这条语音链路在源码中有完整实现(见 首页 index.vue):useVAD使用 AudioWorklet 实现的语音活动检测(VAD)监听说话开始/结束(Worklet 代码见 apps/stage-web/src/workers/vad),说话结束时调用transcribeForRecording或流式转写transcribeForMediaStream,将音频转为文本后通过chatStore.ingest送入对话——这就是"按住麦克风说话,AIRI 文字回复"的完整闭环。

让 AIRI 看见你(视觉模块)

官方手册对此模块标注为"未完工,静待花开"。从源码结构看,视觉模块(vision.vue)及其底层编排器(见 vision 模块存储)已处于开发中,配置页与模型提供商选择逻辑均已搭建,但完整能力尚未开放,可以持续关注后续版本。

第三步:角色卡(Character Card)

内置角色卡 ReLU

AIRI 内置了一张名为ReLU的角色卡,你也可以自己为模型编写角色卡。切换方式有两种:首页右上角的切换角色卡按钮,或从设置中切换。

从源码可见,ReLU 是仓库中的默认角色卡:初始化时会创建一张name: 'ReLU'的默认卡(见 airi-card.ts 中的默认卡定义),卡片版本为1.0.0,并在角色切换组件中作为默认展示(见 character-switcher-drawer 测试)。

角色卡内容

角色卡本质上是 AIRI 的"人格配置文件",包含:

  • 名称(name):角色的名字;
  • 描述(description):角色背景设定;
  • 性格(personality):语气、说话风格、行为倾向等;
  • 行为(behavior):角色在对话中的响应方式。

这些内容高度自定义,决定了 AIRI 的"灵魂"。角色卡通过extensions.airi扩展字段承载结构化的模块配置(见 airi-card.ts),并支持创建、编辑、删除与云端同步(见 characters store 中的createCharacterStoreController)。

角色卡设置

角色卡最强大的能力在于:每张角色卡都可以为每个机体模块选择特定的模型提供商,通过切换角色卡即可快速切换整套模型方案。

以默认 ReLU 卡为例,其extensions.airi.modules结构为:

{ "consciousness": { "provider": "", "model": "" }, "speech": { "provider": "", "model": "", "voice_id": "" }, "vision": { "provider": "", "model": "" } }

也就是说,一张角色卡可以同时记录"思考用哪个模型(consciousness)""说话用哪个 TTS 提供商和音色(speech)""看东西用哪个视觉模型(vision)"。例如你可以创建一张"中文聊天专用卡"(搭配支持中文的 TTS 提供商),再创建一张"英文助手卡"(搭配 OpenAI 官方语音),在首页右上角一键切换,整套声音与模型偏好随之切换,无需反复进入设置页逐个修改。

需要注意的一个细节:speech-noop是一个特殊占位提供商,代表"有意静音/未配置"状态(源码注释明确将其定义为Intentional mute),切换角色卡时它会被视为未配置的发声状态,而不是真正的语音提供商。

结语

至此,你已经完成了 AIRI 网页版的三步配置:为它接上大模型"大脑"、通过机体模块赋予它发声与听觉、再用角色卡把这一切组织成可一键切换的人格方案。后续无论是接入更多 OpenAI 兼容服务、更换 TTS 音色,还是等待视觉模块的正式开放,都可以在上述配置入口中随时调整。相关英文与日文版手册可分别在 英文文档 与 日文文档 查看,桌面端(Electron)与移动端(Capacitor)的部署形态则可在 apps/stage-tamagotchi 与 apps/stage-pocket 中进一步探索。

【免费下载链接】airi💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-sama's altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询