教程中心 进阶玩法

语音全指南

让 ta 听懂你说的话(STT),也让 ta 用自己的声音回应你(TTS)。触发方式怎么选、各种语音服务怎么配、怎么训练专属声线,这一篇讲透。

约 10 分钟 进阶

语音能做什么

配好语音后,你们的相处会立体很多:

  • 游戏里连麦——不用停下手里的操作打字,直接开口跟 ta 说话。
  • 手机通话——在虚拟手机里给 ta 打电话,实时语音对聊,还能一起看看屏幕。
  • ta 的声音——短信朗读、游戏内说话、通话回应,都用 ta 自己的声线。

两个概念先分清:STT(语音识别)负责「ta 听懂你」,TTS(语音合成)负责「ta 开口说话」。它们分开配置、互不依赖——只想让 ta 有声音、自己继续打字,完全可以只配 TTS。

语音识别(STT)

KOA 的语音识别在你的电脑本地完成:识别模型内置在启动器里,不需要额外的 Key,你的声音也不会上传到任何服务器。

需要配置的只有两样,都在启动器的 API 页:

  • 识别语言——选你平时说话的语言,识别更准。
  • 触发方式——「智能检测」或「按键说话」,下一节详细讲。

首次使用语音时,启动器会自动准备识别模型(如需下载会显示进度条,已为大陆网络做了镜像优化),耐心等一小会儿就好,之后不用再等。

两种触发方式

在 API 页选择适合你的触发方式:

方式怎么用适合场景
智能检测(VAD) 开启后自动检测你在说话,说完自动识别发送 沉浸连麦:双手不离开键盘鼠标,像跟队友开黑一样自然聊
按键说话 V 开始说话,说完再按结束 环境有杂音(室友说话、放着音乐),或者不想让 ta 听到你的每句自言自语

小差异提醒:我的世界里按 V 即可用语音;饥荒是在游戏面板里打开 STT 开关后全程连麦。

语音合成(TTS)总览

TTS 让 ta 开口说话。最重要的一件事先记住:TTS 是在角色设定的 TTS 页配置的,不在 API 页——因为声音是跟着角色走的,每个恋人可以有自己的声线,切换角色时声线自动跟着切换。

打开「资料」页 → 进入你的恋人的编辑页 → 找到「TTS」页,选择一种语音服务:

服务费用特点
Edge TTS免费零配置开箱即用,预设音色
ElevenLabs按用量付费音色逼真自然,支持自定义声音
MiniMax TTS按用量付费音色丰富,支持声音码自定义音色
OpenAI TTS(兼容)按用量付费兼容硅基流动等第三方服务
GPT-SoVITS 情感特化(本地)免费KOA 内置训练工具,从零训练自己的声线
GPT-SoVITS 推理特化包(本地)免费本地推理不限量,直接用现成模型
GPT-SoVITS 原生(本地)免费对接官方原版 GPT-SoVITS

上面四种云端服务按配置难度从低到高排列;三种 GPT-SoVITS 本地方案不需要网络,声音数据不出你的电脑——区别在于你手上已有什么:已有训练好的模型选「推理特化包」,想从零训练选「情感特化」,已经在跑官方原版选「原生」。

Edge 免费 TTS

最低门槛的选择:不需要任何 Key,免费使用。在 TTS 页选择 Edge TTS,挑一个你喜欢的预设音色,保存即可;但需要魔法。

先用 Edge 让 ta 开口,以后想要更贴合 ta 气质的声线,再升级到下面几种。

ElevenLabs TTS

音色非常自然逼真,还支持克隆自定义声音。ElevenLabs 提供有限的免费额度,超出后按用量计费。

  1. 注册 ElevenLabs

    ElevenLabs 官网注册账号,在个人设置中获取 API Key。

  2. 填入 KOA

    在角色的「TTS」页选择「ElevenLabs」,填入 API Key,从音色列表中选一个适合 ta 的声音。

  3. 试听保存

    试听确认是 ta 的感觉,保存生效。

MiniMax TTS

音色选择更丰富,还支持声音码——输入声音码即可使用对应的自定义音色,给 ta 一把独一无二的嗓音。

  1. 注册 MiniMax 开放平台

    到 MiniMax 开放平台注册账号,按平台指引获取 API 凭证。

  2. 填入 KOA

    在角色的 TTS 页选择 MiniMax,填入平台凭证,选择音色——有声音码就填声音码。

  3. 试听保存

    试听确认是 ta 的感觉,保存生效。

OpenAI 兼容 TTS

除了 OpenAI 官方,任何兼容 OpenAI TTS 接口的服务都能用——比如硅基流动等平台。

配置方法:在 TTS 页选择 OpenAI TTS,把 API 地址改成对应服务商提供的地址,填入该服务的 Key,选择音色即可。

GPT-SoVITS 情感特化训练工具

想让 ta 用只属于你的声线说话?KOA 内置了一套可视化的声线训练工具——从准备素材到训练再到部署,全程在浏览器里点点点,不需要任何命令行知识。训练完成后一键部署为本地 TTS 服务,KOA 直接连上就能用。

本工具基于开源项目 GPT-SoVITS 及社区生态开发,是 KOA 附赠的免费工具,不属于 KOA 付费激活的功能范围。训练出的声音请仅用于个人用途,遵守你所在地区的相关法规。

你需要准备什么

  • NVIDIA 独立显卡——训练需要 GPU 算力,集成显卡跑不动。工具内有显存参考表帮你判断你的显卡够不够用。
  • GPT-SoVITS 官方整合包——约 8 GB,提供训练所需的运行环境和预训练模型。工具页面内有下载指引,从官方渠道获取。
  • 角色的语音素材——一段干净的角色语音(游戏配音、动画台词等均可),工具内自带切分和标注功能。
  1. 下载官方整合包

    在启动器「工具」页找到「GPT-SoVITS 情感特化训练工具」,按页面指引下载官方 GPT-SoVITS 整合包并解压。RTX 50 系显卡请下载带 -nvidia50 后缀的版本。

  2. 绑定目录

    在工具页选择你解压后的整合包目录,KOA 会自动识别并注入训练面板文件。之后 KOA 更新时面板也会自动跟着更新。

  3. 启动面板、训练声线

    点击「启动」,面板会在浏览器中打开。面板内有完整的新手指南,跟着走就行:创建项目 → 导入音频 → 自动切分标注 → 格式化 → 开始训练。训练时间取决于显卡性能和数据量,通常几十分钟到几小时不等。

  4. 部署为 TTS 服务

    训练完成后在面板的部署页一键部署。首次部署需要联网安装几个小依赖(面板已配置国内镜像),之后不再需要网络。

  5. 连接 KOA

    在角色的「TTS」页选择「GPT-SoVITS 情感特化 (本地)」,地址默认已经填好(http://127.0.0.1:9881)。刷新音色列表选中你训练的模型,还可以为 ta 的每句话挑一种说话情绪。

训练面板在 KOA 启动器运行期间保持可用。关闭启动器时面板和部署服务会一起关闭(训练进行中时会先弹确认)。

日常使用:一键启动 API

训练部署过一次之后,日常使用不需要每次都打开面板走部署流程。「工具」页提供了一键启动 API 的快捷卡片——点一下就能直接启动 TTS 服务供 KOA 调用,省去开面板的步骤。

GPT-SoVITS 推理特化包

如果你已经有训练好的 GPT-SoVITS 模型(自己训练过、或从社区拿到现成模型),可以用推理特化包直接跑——不需要再训练,模型搬进去就能用。

  1. 下载推理特化包

    到 ModelScope 的 aihobbyist/GPT-SoVITS-Inference 页面下载整合包并解压。cu124 / cu128 两个版本对应不同的 CUDA 版本:显卡驱动较新选 cu128,启动报错就换另一个。

  2. 放入你的模型

    把训练好的 GPT / SoVITS 模型和参考音频放进推理包的模型目录,参照包内示例的层级摆放(模型名 / 参考语言 / 情绪参考音频)。

  3. 启动 API 服务

    运行推理包里的 API 启动脚本,记下窗口里显示的端口(一般是 8001)。KOA 使用期间这个窗口要保持开着。

  4. 连接 KOA

    在角色的「TTS」页选择「GPT-SoVITS Inference Plugin (本地)」,接口地址填 http://127.0.0.1:8001(端口以上一步窗口显示的为准,地址请用 127.0.0.1,不要填 0.0.0.0)。刷新音色列表选中你的模型,还可以为 ta 挑一种说话情绪。

GPT-SoVITS 原生

如果你已经在跑 GPT-SoVITS 官方原版的 api_v2.py,可以直接对接,不需要换推理特化包。

在角色的「TTS」页选择「GPT-SoVITS 原生 (本地)」,接口地址填你的 API 地址(默认 http://127.0.0.1:9880)。

官方原版不提供模型列表接口,KOA 无法自动拉取音色列表——你需要在 TTS 页手动填写参考音频路径等参数。如果觉得麻烦,建议换用上面的推理特化包或情感特化训练工具,模型直接搬过去就行,不需要重新训练。

双语模式

如果 ta 的设定说的是外语,或者你想边谈恋爱边练语言——在角色设定的 TTS 页开启双语模式,虚拟手机的短信和语音通话会以双语呈现,看得懂也听得懂,不用切出去查词典。

常见问题排查

ta 听不到我说话

  • 检查 Windows 设置里的麦克风权限,以及麦克风有没有被别的程序占用。
  • 确认 API 页的触发方式:选了「按键说话」就要按 V 才会开始识别。
  • 识别语言选的和你实际说的是否一致。

ta 不出声

  • 确认在角色设定的 TTS 页(不是 API 页)选好了服务并保存。
  • 用 MiniMax / OpenAI 兼容服务时,检查凭证是否有效、余额是否充足。
  • 到启动器「日志」页看 TTS 相关报错,通常能直接看到原因。

情感特化训练工具启动失败

  • 检查端口 9877 是否被占用——如果你自己手动跑过面板,关掉那个实例再从 KOA 启动。
  • 确认绑定的目录是官方 GPT-SoVITS 整合包的解压目录(里面应该有 runtime 文件夹和 GPT_SoVITS 文件夹)。

情感特化部署后 KOA 连不上

  • 确认在面板的部署页已经成功部署(部署日志没有报错)。
  • 在角色「TTS」页确认选的是「GPT-SoVITS 情感特化 (本地)」而不是其它 GPT-SoVITS 选项。
  • 地址用默认的 http://127.0.0.1:9881 不要改,除非你手动换过部署端口。

GPT-SoVITS 推理特化包拉不到模型 / 音色列表是空的

  • 确认跑的是「推理特化包」(AI-Hobbyist 维护的推理专用版本)——官方原版没有模型列表接口,KOA 读不到它的模型。如果你用的是官方原版,切换到「GPT-SoVITS 原生 (本地)」通道,或换用推理特化包。
  • 接口地址的端口要和推理包 API 窗口显示的一致(一般是 8001),并确认那个窗口没有被关掉。
  • 地址用 127.0.0.1,不要填 0.0.0.0(那是服务的监听写法,不是访问地址)。

玩游戏时本地 TTS 突然不出声

如果 ta 平时好好的,一开游戏(尤其是我的世界等吃显卡的游戏)就不说话了——这是 TTS 推理和游戏在抢显卡资源。GPT-SoVITS 推理默认会尽量多占显存,游戏也要大量显存——两边一起跑,显存不够时 TTS 会静默失败(不报错、不提示,只是没有声音)。

按推荐顺序试试这几个方案:

  • 限制 TTS 显存占用——找到你的 GPT-SoVITS 推理服务的 Python 启动文件(api_v2.py 或类似文件),在文件顶部找到 import torch,紧跟其后加一行:
    torch.cuda.set_per_process_memory_fraction(0.4)
    这样 TTS 最多只用 40% 的显存,给游戏留出空间。12 GB 显卡建议 0.4,8 GB 建议 0.45,6 GB 建议 0.5。如果加了之后不玩游戏时 TTS 也报错,就把数字调大一些。
  • 降低游戏画面配置——关闭光影、降低渲染距离和分辨率,都能释放出大量显存给 TTS 使用。光影开关的影响最大:光影可能额外吃掉 4-6 GB 显存。
  • 换用不吃显卡的 TTS——如果显卡实在带不动两头跑,可以把 TTS 切成 Edge TTS(免费且不用显卡)或其它云端服务,游戏性能也完全不受影响。

查看显存使用情况:打开任务管理器 → 「性能」 → 「GPU」 → 看「专用 GPU 内存」。如果已经接近总量,就是显存不够了。

还是解决不了?导出诊断包,到帮助中心指引的渠道反馈。