多模态语音修复 · Multimodal Speech Restoration
让每一个声音
让每一个声音
都被清晰听见
有人吐字不清,有人失去了声音,有人口音浓重、难被听懂。我们用 AI 让这些声音重新变得清晰、自然,却始终是他自己的声音。
多模态语音修复系统 · ASR | LLM | TTS 三级架构 · 端侧部署 · 低延迟
言语链(Speech Chain):一句话要从说话人的大脑出发,经喉与口发声、在空气里传播,最后到达听者的大脑。中间哪一步出了问题,声音就会传得不清楚;我们的系统,就是用来补上出问题的那一步的。
Choose a Demo
选择一个演示,现在观看
01
构音障碍 · Dysarthria
把含糊的话,实时说清楚
听得出对方在说话,但听不清内容。系统在近乎实时下,把含糊语音转写、补全,再用清晰自然的声音说出来。
Demo 1 · 视频演示
构音障碍语音修复演示
把视频放入
videos/demo1.mp4 即可自动播放工作原理 HOW IT WORKS
含糊的语音
发音不清、断续的原始声音
→
听写
ASR 语音识别
先“听懂”你说的话,转成文字
→
补全
LLM 大模型
理解并补全你想表达的完整意思
→
发声
TTS 语音合成
用清晰自然的声音说出来
02
无喉 / 术后 · Laryngectomy
把机械嗓音,换回自然人声
喉切除后只能靠电子喉发声,声音机械、生硬。当前我们把电子喉的声音实时转换成健康自然的人声;未来再用喉部肌电(EMG)直接重建语音。
1
电子喉声音转换
CURRENT · 当前阶段
阶段一 · 电子喉转换
电子喉声音 → 健康自然人声
把视频放入
videos/demo2.mp4 即可自动播放工作原理 EL VOICE → NATURAL VOICE
电子喉
机械嗓音
目前无喉群体最通用的发声方案,声音机械、单调
→
AI 声音转换
Voice Conversion
实时把机械嗓音转成清晰、有起伏的自然声音
→
健康自然人声
听起来像正常说话的声音,便于日常交流
2
喉部肌电(EMG)语音重建
NEXT · 未来计划
阶段二 · EMG(备用)
喉肌电采集与重建
竖屏视频放入
videos/demo2b.mp4工作原理 EMG → SPEECH
喉部贴片
贴在颈部皮肤,无创、无需手术,佩戴方便
肌电信号EMG
发声肌肉活动时产生微弱电流,被贴片实时读出
解码重建
模型把电信号“翻译”回原本想说的话
重建语音
发不出声,肌肉的“暗号”还在 → 变回自然语音
现场展示 LIVE DEVICE
现场展示的即为 EMG 采集设备:可实时看到喉部贴片如何采集肌电波形并同步显示信号曲线。此部分为未来计划,在现有框架上小幅改动即可接入。
03
口音转换 · Accent
修正发音,保留你的声音
只修正听不清的非母语发音,保留你本人的音色。一个滑杆,从轻度修饰到完全标准化,还会自动匹配母语者的节奏。
现场体验对着麦克风说一句带口音的话,立刻听到修正后、依然是你自己的声音
现在就试
Nova 语音助手
REAL-TIME
端到端 176 ms
ASR 1 ms
LLM 首字 38 ms
TTS 首块 129 ms
音色 Speaker 1
USER · 带口音输入
喂喂,你好,听得清楚吗NOVA · 清晰输出(保留原声)
你好呀,听得很清楚呢,有什么可以帮你的吗?口音强度 ACCENT ECHO
轻度修正保留明显个人特色,仅理顺关键发音
保留本人音色
适用人群
同一套系统也服务说话含糊与无喉术后人群:让表达更清楚,同时始终是“自己的声音”。
备用录像 · Backup
备用录像 · 口音转换
口音转换 · 备用录像
把视频(demo3.mp4 或 .mov)放入
videos/ 即可自动播放