AIRI:把会说话的虚拟角色放到自己设备上的开源项目

AI开源项目6天前发布
27 0 0
AIRI:把会说话的虚拟角色放到自己设备上的开源项目|AI 生成封面图
AIRI:把会说话的虚拟角色放到自己设备上的开源项目|AI 生成封面图
工作流定位:airi 更像是一个图像创作类项目。AIRI 是一个开源的 AI 虚拟角色项目,重点不只是聊天,而是把语音、Live2D 或 VRM 形象、游戏和 Discord、Telegram 接到同一个角色上。适合想自己部署数字伙伴、研究 AI VTuber 工作流的人;只想立刻获得稳定陪聊服务的人,要先看清它仍在早期开发阶段。关键词:ai-companion、ai-vtuber、airi、digital-life、grok-companion

AIRI 最具体的一点,是它没有把 AI 角色限制在一个聊天网页里:项目已经列出浏览器麦克风输入、客户端语音识别、语音合成、Live2D 和 VRM 形象控制,也把 Minecraft、Factorio、Discord、Telegram 放进了同一套目标里。换成大白话,它想做的是一个能开口、能动、有角色外观,还能被接到不同场景中的数字伙伴。这个方向很吸引人,但它仍处在早期开发阶段,别把它当成下载后什么都不用管的成品应用。

工作流基础信息

  • 项目定位:💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-sama’s altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.
  • GitHub:moeru-ai/airi
  • 官网:https://airi.moeru.ai/docs/
  • 主语言:TypeScript
  • 开源协议:MIT
  • 热度:46,331 stars

它在整套工作流里处在什么位置

很多人对 AI 角色的理解,还停在“输入一句话,屏幕回一段文字”。AIRI 处理的环节更靠前也更靠后:前面接收你的声音,中间把对话交给大语言模型,后面再让角色用声音和形象回应。它更像把几种现成能力拼成一个可用角色的控制台,而不是自己训练出一个角色模型。

这点决定了使用方式。你需要先想清楚角色从哪里获得语言能力、声音和外观,再考虑要不要把它接入游戏或聊天平台。AIRI 支持多家模型 API,也列出了 Ollama、vLLM、SGLang 等本地或自托管推理接口;选择哪一种,会直接影响你的账号、费用、隐私安排和配置难度。

把流程拆开看:声音或文字是输入,模型服务负责生成回复,语音合成把回复变成可听见的话,Live2D 或 VRM 则把回应落到屏幕上的角色动作。AIRI 的价值在于尝试把这些原本分散的步骤接起来。

  • 输入:已列出浏览器音频输入、Discord 音频输入,以及客户端语音识别和说话检测。
  • 处理:可接入 OpenAI、Claude、DeepSeek、Qwen、Gemini 等多种服务,也列出本地推理相关选项。
  • 输出:支持多供应商语音合成;角色画面可使用 Live2D 或 VRM 模型,并有自动眨眼、视线跟随、待机眼部动作等动画能力。
  • 接入位置:项目列出了浏览器版、桌面版和移动端方向,并已勾选 Telegram、Discord 聊天能力。

输入不是“画一张角色图”,而是准备角色素材和连接

如果你是冲着视觉表现来的,需要先纠正一个预期:AIRI 不是文生图、换脸或图片编辑工具。它没有在资料中承诺用一句提示词生成角色立绘,也没有披露素材版权、商用授权或导出规则。它能控制的,是你准备好的 Live2D 或 VRM 角色模型。

Live2D 可以理解为二维角色立绘加上可动部件,VRM 则是常见的三维虚拟形象格式。对使用者来说,这意味着画风控制主要发生在“你选什么模型、模型本身做得怎样”,而不是在 AIRI 里调一个画风滑块。想要二次元平面角色,关注 Live2D;想要三维角色和动作表现,关注 VRM。

素材和版权要分开处理。AIRI 使用 MIT 许可证开放项目代码,但这不自动等于你拿到的 Live2D、VRM 模型、语音服务或第三方模型 API 都可以商用。项目资料没有给出统一的角色素材授权说明,准备公开直播、视频或商业内容前,应逐项核对模型与服务提供方的条款。

处理环节:语音、模型和记忆并不等于一键自动化

AIRI 已经列出客户端语音识别、客户端说话检测,以及 ElevenLabs、Microsoft/Azure Speech、OpenAI 兼容 TTS、阿里云百炼和本地 Kokoro TTS 等语音合成来源。对用户的实际意义是,你不必把“听懂你说话”和“用角色声音说出来”锁死在同一家服务上,选择空间比较大。

但选择空间也带来配置责任。不同模型 API 和语音服务的开通方式、计费、可用地区、密钥管理各不相同,AIRI 的资料没有给出一套统一费用,也没有说所有组合都免配置。项目还标注了浏览器内数据库支持,而更完整的 Memory Alaya 仍是 WIP,不能把“角色会长期记住一切”当作已经完成的承诺。

  • 想用云端模型的人,可以从项目已支持的 API 供应商中挑选,但费用由对应供应商决定,AIRI 未披露统一价格。
  • 想优先在自己设备或服务器处理的人,可留意 Ollama、vLLM、SGLang 等已列出的接口;实际硬件需求和模型效果取决于你选的推理方案。
  • 想做连续角色设定的人,应把记忆功能当作需要核对版本状态的一环,而不是默认就成熟可靠的基础能力。

输出到哪里:角色形象、游戏和聊天平台

AIRI 的“输出”不只是一段语音。已完成的清单包含 Live2D 与 VRM 控制、对应动画,以及 Telegram、Discord 聊天。这让它比较适合放在直播桌面、社群频道或个人电脑上,作为一个有形象的交互入口。是否好看,取决于模型素材;是否说得自然,取决于你接入的语言模型和语音服务。

游戏是它最容易被误解的部分。项目将 Minecraft 标为可玩,将 Factorio 标注为 WIP,同时说明已有概念验证和演示;Kerbal Space Program 也出现在已勾选清单中,但其后附有“announcement TBD”。这些信息能说明项目正在把角色接入游戏行为,不足以推出任意游戏都能自动操作,更不能替代你对具体版本、游戏环境和接入方式的确认。

更贴近现实的两种用法:一是给已有的 Live2D 或 VRM 角色接上语音对话,作为桌面或网页中的互动角色;二是把角色接到 Discord、Telegram 这样的既有交流场所。前者重点是形象和声音的统一,后者重点是连接配置和模型服务的稳定性。

上手门槛与现在该注意什么

对不懂开发的用户,AIRI 并非只有源码可碰。项目提供 Windows 安装包、macOS 安装包入口,也给出 Windows 的 winget、Scoop 安装方式和 macOS 的 Homebrew Cask 命令;浏览器版本可在其站点使用。至少在“先打开看看界面和方向”这一步,门槛低于从源码搭一个 AI 角色项目。

不过,只要你想换模型供应商、接 Discord、使用本地推理,或者继续开发桌面版与移动端,就会遇到密钥、设备、服务连接和开发环境等问题。源码开发说明使用 pnpm;桌面版与移动端各有单独命令。我的判断是,普通用户先从浏览器或发布版认识角色交互是否合胃口,再决定要不要深入配置,成本会更可控。

  • 适合:手上已有 Live2D 或 VRM 角色素材,想为角色补上语音和对话的人。
  • 适合:想研究 AI VTuber、数字角色、游戏与聊天平台连接方式,并愿意处理配置的人。
  • 不太适合:只想上传一张图片就生成可商用角色视频,或要求安装后无需配置、功能状态完全稳定的人。
  • 版本状态:项目明确说明仍处早期开发阶段,路线图中也保留了多个 WIP 项目,安装前应先看最新 Release 和文档。

编辑判断

AIRI 最有意思的地方,不是把“AI 陪聊”换了一个更炫的外壳,而是认真把声音、角色模型、模型接口、社群和游戏这些环节放到同一个项目里。它适合对“我的虚拟角色能不能离开聊天框”有明确想法的人,而不是替所有人省掉选择和配置的万能软件。

如果让我自己现在上手,我会先用一个权属清楚的 Live2D 或 VRM 模型,选定一个自己能管理费用和账号的模型服务,只验证语音对话与形象表现这条最短链路。等角色的声音、回复风格和外观都稳定后,再考虑 Discord、Telegram 或游戏接入。这样更容易知道问题出在素材、模型服务,还是连接配置,而不会一次把所有环节搅在一起。

官方入口包括 文档站GitHub 项目页Release 页面。项目主语言为 TypeScript,代码采用 MIT 许可证;至于角色素材、模型调用和语音服务的可用条件,请分别以各自页面的条款为准。

AIPG AI导航专注于收录和解读 AI 工具、AI 网站与智能体资源。

© 版权声明

相关文章

没有相关内容!

暂无评论

AIRI:把会说话的虚拟角色放到自己设备上的开源项目
none
暂无评论...