语音能做什么
配好语音后,你们的相处会立体很多:
- 游戏里连麦——不用停下手里的操作打字,直接开口跟 ta 说话。
- 手机通话——在虚拟手机里给 ta 打电话,实时语音对聊,还能一起看看屏幕。
- ta 的声音——短信朗读、游戏内说话、通话回应,都用 ta 自己的声线。
两个概念先分清:STT(语音识别)负责「ta 听懂你」,TTS(语音合成)负责「ta 开口说话」。它们分开配置、互不依赖——只想让 ta 有声音、自己继续打字,完全可以只配 TTS。
语音识别(STT)
KOA 的语音识别在你的电脑本地完成:识别模型内置在启动器里,不需要额外的 Key,你的声音也不会上传到任何服务器。
需要配置的只有两样,都在启动器的 API 页:
- 识别语言——选你平时说话的语言,识别更准。
- 触发方式——「智能检测」或「按键说话」,下一节详细讲。
首次使用语音时,启动器会自动准备识别模型(如需下载会显示进度条,已为大陆网络做了镜像优化),耐心等一小会儿就好,之后不用再等。
两种触发方式
在 API 页选择适合你的触发方式:
| 方式 | 怎么用 | 适合场景 |
|---|---|---|
| 智能检测(VAD) | 开启后自动检测你在说话,说完自动识别发送 | 沉浸连麦:双手不离开键盘鼠标,像跟队友开黑一样自然聊 |
| 按键说话 | 按 V 开始说话,说完再按结束 | 环境有杂音(室友说话、放着音乐),或者不想让 ta 听到你的每句自言自语 |
小差异提醒:我的世界里按 V 即可用语音;饥荒是在游戏面板里打开 STT 开关后全程连麦。
语音合成(TTS)总览
TTS 让 ta 开口说话。最重要的一件事先记住:TTS 是在角色设定的 TTS 页配置的,不在 API 页——因为声音是跟着角色走的,每个恋人可以有自己的声线,切换角色时声线自动跟着切换。
打开「资料」页 → 进入你的恋人的编辑页 → 找到「TTS」页,选择一种语音服务:
| 服务 | 费用 | 特点 |
|---|---|---|
| Edge TTS | 免费 | 零配置开箱即用,预设音色 |
| ElevenLabs | 按用量付费 | 音色逼真自然,支持自定义声音 |
| MiniMax TTS | 按用量付费 | 音色丰富,支持声音码自定义音色 |
| OpenAI TTS(兼容) | 按用量付费 | 兼容硅基流动等第三方服务 |
| GPT-SoVITS 情感特化(本地) | 免费 | KOA 内置训练工具,从零训练自己的声线 |
| GPT-SoVITS 推理特化包(本地) | 免费 | 本地推理不限量,直接用现成模型 |
| GPT-SoVITS 原生(本地) | 免费 | 对接官方原版 GPT-SoVITS |
上面四种云端服务按配置难度从低到高排列;三种 GPT-SoVITS 本地方案不需要网络,声音数据不出你的电脑——区别在于你手上已有什么:已有训练好的模型选「推理特化包」,想从零训练选「情感特化」,已经在跑官方原版选「原生」。
Edge 免费 TTS
最低门槛的选择:不需要任何 Key,免费使用。在 TTS 页选择 Edge TTS,挑一个你喜欢的预设音色,保存即可;但需要魔法。
先用 Edge 让 ta 开口,以后想要更贴合 ta 气质的声线,再升级到下面几种。
ElevenLabs TTS
音色非常自然逼真,还支持克隆自定义声音。ElevenLabs 提供有限的免费额度,超出后按用量计费。
-
注册 ElevenLabs
到 ElevenLabs 官网注册账号,在个人设置中获取 API Key。
-
填入 KOA
在角色的「TTS」页选择「ElevenLabs」,填入 API Key,从音色列表中选一个适合 ta 的声音。
-
试听保存
试听确认是 ta 的感觉,保存生效。
MiniMax TTS
音色选择更丰富,还支持声音码——输入声音码即可使用对应的自定义音色,给 ta 一把独一无二的嗓音。
-
注册 MiniMax 开放平台
到 MiniMax 开放平台注册账号,按平台指引获取 API 凭证。
-
填入 KOA
在角色的 TTS 页选择 MiniMax,填入平台凭证,选择音色——有声音码就填声音码。
-
试听保存
试听确认是 ta 的感觉,保存生效。
OpenAI 兼容 TTS
除了 OpenAI 官方,任何兼容 OpenAI TTS 接口的服务都能用——比如硅基流动等平台。
配置方法:在 TTS 页选择 OpenAI TTS,把 API 地址改成对应服务商提供的地址,填入该服务的 Key,选择音色即可。
GPT-SoVITS 情感特化训练工具
想让 ta 用只属于你的声线说话?KOA 内置了一套可视化的声线训练工具——从准备素材到训练再到部署,全程在浏览器里点点点,不需要任何命令行知识。训练完成后一键部署为本地 TTS 服务,KOA 直接连上就能用。
本工具基于开源项目 GPT-SoVITS 及社区生态开发,是 KOA 附赠的免费工具,不属于 KOA 付费激活的功能范围。训练出的声音请仅用于个人用途,遵守你所在地区的相关法规。
你需要准备什么
- NVIDIA 独立显卡——训练需要 GPU 算力,集成显卡跑不动。工具内有显存参考表帮你判断你的显卡够不够用。
- GPT-SoVITS 官方整合包——约 8 GB,提供训练所需的运行环境和预训练模型。工具页面内有下载指引,从官方渠道获取。
- 角色的语音素材——一段干净的角色语音(游戏配音、动画台词等均可),工具内自带切分和标注功能。
-
下载官方整合包
在启动器「工具」页找到「GPT-SoVITS 情感特化训练工具」,按页面指引下载官方 GPT-SoVITS 整合包并解压。RTX 50 系显卡请下载带
-nvidia50后缀的版本。 -
绑定目录
在工具页选择你解压后的整合包目录,KOA 会自动识别并注入训练面板文件。之后 KOA 更新时面板也会自动跟着更新。
-
启动面板、训练声线
点击「启动」,面板会在浏览器中打开。面板内有完整的新手指南,跟着走就行:创建项目 → 导入音频 → 自动切分标注 → 格式化 → 开始训练。训练时间取决于显卡性能和数据量,通常几十分钟到几小时不等。
-
部署为 TTS 服务
训练完成后在面板的部署页一键部署。首次部署需要联网安装几个小依赖(面板已配置国内镜像),之后不再需要网络。
-
连接 KOA
在角色的「TTS」页选择「GPT-SoVITS 情感特化 (本地)」,地址默认已经填好(
http://127.0.0.1:9881)。刷新音色列表选中你训练的模型,还可以为 ta 的每句话挑一种说话情绪。
训练面板在 KOA 启动器运行期间保持可用。关闭启动器时面板和部署服务会一起关闭(训练进行中时会先弹确认)。
日常使用:一键启动 API
训练部署过一次之后,日常使用不需要每次都打开面板走部署流程。「工具」页提供了一键启动 API 的快捷卡片——点一下就能直接启动 TTS 服务供 KOA 调用,省去开面板的步骤。
GPT-SoVITS 推理特化包
如果你已经有训练好的 GPT-SoVITS 模型(自己训练过、或从社区拿到现成模型),可以用推理特化包直接跑——不需要再训练,模型搬进去就能用。
-
下载推理特化包
到 ModelScope 的 aihobbyist/GPT-SoVITS-Inference 页面下载整合包并解压。cu124 / cu128 两个版本对应不同的 CUDA 版本:显卡驱动较新选 cu128,启动报错就换另一个。
-
放入你的模型
把训练好的 GPT / SoVITS 模型和参考音频放进推理包的模型目录,参照包内示例的层级摆放(模型名 / 参考语言 / 情绪参考音频)。
-
启动 API 服务
运行推理包里的 API 启动脚本,记下窗口里显示的端口(一般是 8001)。KOA 使用期间这个窗口要保持开着。
-
连接 KOA
在角色的「TTS」页选择「GPT-SoVITS Inference Plugin (本地)」,接口地址填
http://127.0.0.1:8001(端口以上一步窗口显示的为准,地址请用 127.0.0.1,不要填 0.0.0.0)。刷新音色列表选中你的模型,还可以为 ta 挑一种说话情绪。
GPT-SoVITS 原生
如果你已经在跑 GPT-SoVITS 官方原版的 api_v2.py,可以直接对接,不需要换推理特化包。
在角色的「TTS」页选择「GPT-SoVITS 原生 (本地)」,接口地址填你的 API 地址(默认 http://127.0.0.1:9880)。
官方原版不提供模型列表接口,KOA 无法自动拉取音色列表——你需要在 TTS 页手动填写参考音频路径等参数。如果觉得麻烦,建议换用上面的推理特化包或情感特化训练工具,模型直接搬过去就行,不需要重新训练。
双语模式
如果 ta 的设定说的是外语,或者你想边谈恋爱边练语言——在角色设定的 TTS 页开启双语模式,虚拟手机的短信和语音通话会以双语呈现,看得懂也听得懂,不用切出去查词典。
常见问题排查
ta 听不到我说话
- 检查 Windows 设置里的麦克风权限,以及麦克风有没有被别的程序占用。
- 确认 API 页的触发方式:选了「按键说话」就要按 V 才会开始识别。
- 识别语言选的和你实际说的是否一致。
ta 不出声
- 确认在角色设定的 TTS 页(不是 API 页)选好了服务并保存。
- 用 MiniMax / OpenAI 兼容服务时,检查凭证是否有效、余额是否充足。
- 到启动器「日志」页看 TTS 相关报错,通常能直接看到原因。
情感特化训练工具启动失败
- 检查端口 9877 是否被占用——如果你自己手动跑过面板,关掉那个实例再从 KOA 启动。
- 确认绑定的目录是官方 GPT-SoVITS 整合包的解压目录(里面应该有
runtime文件夹和GPT_SoVITS文件夹)。
情感特化部署后 KOA 连不上
- 确认在面板的部署页已经成功部署(部署日志没有报错)。
- 在角色「TTS」页确认选的是「GPT-SoVITS 情感特化 (本地)」而不是其它 GPT-SoVITS 选项。
- 地址用默认的
http://127.0.0.1:9881不要改,除非你手动换过部署端口。
GPT-SoVITS 推理特化包拉不到模型 / 音色列表是空的
- 确认跑的是「推理特化包」(AI-Hobbyist 维护的推理专用版本)——官方原版没有模型列表接口,KOA 读不到它的模型。如果你用的是官方原版,切换到「GPT-SoVITS 原生 (本地)」通道,或换用推理特化包。
- 接口地址的端口要和推理包 API 窗口显示的一致(一般是 8001),并确认那个窗口没有被关掉。
- 地址用
127.0.0.1,不要填 0.0.0.0(那是服务的监听写法,不是访问地址)。
玩游戏时本地 TTS 突然不出声
如果 ta 平时好好的,一开游戏(尤其是我的世界等吃显卡的游戏)就不说话了——这是 TTS 推理和游戏在抢显卡资源。GPT-SoVITS 推理默认会尽量多占显存,游戏也要大量显存——两边一起跑,显存不够时 TTS 会静默失败(不报错、不提示,只是没有声音)。
按推荐顺序试试这几个方案:
-
限制 TTS 显存占用——找到你的 GPT-SoVITS 推理服务的 Python 启动文件(
api_v2.py或类似文件),在文件顶部找到import torch,紧跟其后加一行:torch.cuda.set_per_process_memory_fraction(0.4)
这样 TTS 最多只用 40% 的显存,给游戏留出空间。12 GB 显卡建议 0.4,8 GB 建议 0.45,6 GB 建议 0.5。如果加了之后不玩游戏时 TTS 也报错,就把数字调大一些。 - 降低游戏画面配置——关闭光影、降低渲染距离和分辨率,都能释放出大量显存给 TTS 使用。光影开关的影响最大:光影可能额外吃掉 4-6 GB 显存。
- 换用不吃显卡的 TTS——如果显卡实在带不动两头跑,可以把 TTS 切成 Edge TTS(免费且不用显卡)或其它云端服务,游戏性能也完全不受影响。
查看显存使用情况:打开任务管理器 → 「性能」 → 「GPU」 → 看「专用 GPU 内存」。如果已经接近总量,就是显存不够了。
还是解决不了?导出诊断包,到帮助中心指引的渠道反馈。