它在整套工作流里处在什么位置
很多人对 AI 角色的理解,还停在“输入一句话,屏幕回一段文字”。AIRI 处理的环节更靠前也更靠后:前面接收你的声音,中间把对话交给大语言模型,后面再让角色用声音和形象回应。它更像把几种现成能力拼成一个可用角色的控制台,而不是自己训练出一个角色模型。
这点决定了使用方式。你需要先想清楚角色从哪里获得语言能力、声音和外观,再考虑要不要把它接入游戏或聊天平台。AIRI 支持多家模型 API,也列出了 Ollama、vLLM、SGLang 等本地或自托管推理接口;选择哪一种,会直接影响你的账号、费用、隐私安排和配置难度。
把流程拆开看:声音或文字是输入,模型服务负责生成回复,语音合成把回复变成可听见的话,Live2D 或 VRM 则把回应落到屏幕上的角色动作。AIRI 的价值在于尝试把这些原本分散的步骤接起来。
- 输入:已列出浏览器音频输入、Discord 音频输入,以及客户端语音识别和说话检测。
- 处理:可接入 OpenAI、Claude、DeepSeek、Qwen、Gemini 等多种服务,也列出本地推理相关选项。
- 输出:支持多供应商语音合成;角色画面可使用 Live2D 或 VRM 模型,并有自动眨眼、视线跟随、待机眼部动作等动画能力。
- 接入位置:项目列出了浏览器版、桌面版和移动端方向,并已勾选 Telegram、Discord 聊天能力。
输入不是“画一张角色图”,而是准备角色素材和连接
如果你是冲着视觉表现来的,需要先纠正一个预期:AIRI 不是文生图、换脸或图片编辑工具。它没有在资料中承诺用一句提示词生成角色立绘,也没有披露素材版权、商用授权或导出规则。它能控制的,是你准备好的 Live2D 或 VRM 角色模型。
Live2D 可以理解为二维角色立绘加上可动部件,VRM 则是常见的三维虚拟形象格式。对使用者来说,这意味着画风控制主要发生在“你选什么模型、模型本身做得怎样”,而不是在 AIRI 里调一个画风滑块。想要二次元平面角色,关注 Live2D;想要三维角色和动作表现,关注 VRM。
素材和版权要分开处理。AIRI 使用 MIT 许可证开放项目代码,但这不自动等于你拿到的 Live2D、VRM 模型、语音服务或第三方模型 API 都可以商用。项目资料没有给出统一的角色素材授权说明,准备公开直播、视频或商业内容前,应逐项核对模型与服务提供方的条款。
处理环节:语音、模型和记忆并不等于一键自动化
AIRI 已经列出客户端语音识别、客户端说话检测,以及 ElevenLabs、Microsoft/Azure Speech、OpenAI 兼容 TTS、阿里云百炼和本地 Kokoro TTS 等语音合成来源。对用户的实际意义是,你不必把“听懂你说话”和“用角色声音说出来”锁死在同一家服务上,选择空间比较大。
但选择空间也带来配置责任。不同模型 API 和语音服务的开通方式、计费、可用地区、密钥管理各不相同,AIRI 的资料没有给出一套统一费用,也没有说所有组合都免配置。项目还标注了浏览器内数据库支持,而更完整的 Memory Alaya 仍是 WIP,不能把“角色会长期记住一切”当作已经完成的承诺。
- 想用云端模型的人,可以从项目已支持的 API 供应商中挑选,但费用由对应供应商决定,AIRI 未披露统一价格。
- 想优先在自己设备或服务器处理的人,可留意 Ollama、vLLM、SGLang 等已列出的接口;实际硬件需求和模型效果取决于你选的推理方案。
- 想做连续角色设定的人,应把记忆功能当作需要核对版本状态的一环,而不是默认就成熟可靠的基础能力。
输出到哪里:角色形象、游戏和聊天平台
AIRI 的“输出”不只是一段语音。已完成的清单包含 Live2D 与 VRM 控制、对应动画,以及 Telegram、Discord 聊天。这让它比较适合放在直播桌面、社群频道或个人电脑上,作为一个有形象的交互入口。是否好看,取决于模型素材;是否说得自然,取决于你接入的语言模型和语音服务。
游戏是它最容易被误解的部分。项目将 Minecraft 标为可玩,将 Factorio 标注为 WIP,同时说明已有概念验证和演示;Kerbal Space Program 也出现在已勾选清单中,但其后附有“announcement TBD”。这些信息能说明项目正在把角色接入游戏行为,不足以推出任意游戏都能自动操作,更不能替代你对具体版本、游戏环境和接入方式的确认。
更贴近现实的两种用法:一是给已有的 Live2D 或 VRM 角色接上语音对话,作为桌面或网页中的互动角色;二是把角色接到 Discord、Telegram 这样的既有交流场所。前者重点是形象和声音的统一,后者重点是连接配置和模型服务的稳定性。
上手门槛与现在该注意什么
对不懂开发的用户,AIRI 并非只有源码可碰。项目提供 Windows 安装包、macOS 安装包入口,也给出 Windows 的 winget、Scoop 安装方式和 macOS 的 Homebrew Cask 命令;浏览器版本可在其站点使用。至少在“先打开看看界面和方向”这一步,门槛低于从源码搭一个 AI 角色项目。
不过,只要你想换模型供应商、接 Discord、使用本地推理,或者继续开发桌面版与移动端,就会遇到密钥、设备、服务连接和开发环境等问题。源码开发说明使用 pnpm;桌面版与移动端各有单独命令。我的判断是,普通用户先从浏览器或发布版认识角色交互是否合胃口,再决定要不要深入配置,成本会更可控。
- 适合:手上已有 Live2D 或 VRM 角色素材,想为角色补上语音和对话的人。
- 适合:想研究 AI VTuber、数字角色、游戏与聊天平台连接方式,并愿意处理配置的人。
- 不太适合:只想上传一张图片就生成可商用角色视频,或要求安装后无需配置、功能状态完全稳定的人。
- 版本状态:项目明确说明仍处早期开发阶段,路线图中也保留了多个 WIP 项目,安装前应先看最新 Release 和文档。
编辑判断
AIRI 最有意思的地方,不是把“AI 陪聊”换了一个更炫的外壳,而是认真把声音、角色模型、模型接口、社群和游戏这些环节放到同一个项目里。它适合对“我的虚拟角色能不能离开聊天框”有明确想法的人,而不是替所有人省掉选择和配置的万能软件。
如果让我自己现在上手,我会先用一个权属清楚的 Live2D 或 VRM 模型,选定一个自己能管理费用和账号的模型服务,只验证语音对话与形象表现这条最短链路。等角色的声音、回复风格和外观都稳定后,再考虑 Discord、Telegram 或游戏接入。这样更容易知道问题出在素材、模型服务,还是连接配置,而不会一次把所有环节搅在一起。
官方入口包括 文档站、GitHub 项目页 和 Release 页面。项目主语言为 TypeScript,代码采用 MIT 许可证;至于角色素材、模型调用和语音服务的可用条件,请分别以各自页面的条款为准。
AIPG AI导航专注于收录和解读 AI 工具、AI 网站与智能体资源。




