欢迎光临北京软件和信息服务业协会官方网站
火种说|三天一个 Demo,上百个应用:一个 OpenBMB 社区开发者的 AI 语音炼化之路
发布日期:2026-09-14    来源:面壁智能    分享到:

这一期的火种有些不同,当绝大多数团队还在沿用"语音识别—大模型—语音合成"三段式串行链路,忍受着无法打断、回应生硬、毫无真人感的对话体验时,深圳耐思人工智能技术负责人大明哥,已经带着团队走出了一条完全不同的技术道路。


他们基于 OpenBMB 开源社区的 VoxCPM 语音合成模型,自研了 S2S、MDN、QUIC 三条全语音链路,提出了"前端挂起式打断"这一颠覆性交互思路,还搭建了面向数字分身人格刻画的六库系统。从明星 AI 生日祝福,到老人数字回忆录,再到 AI 采访助手,他们用"三天一个 MVP"的节奏,一年落地上百个 AI 语音商业化应用。


3702c8f8-4124-411a-9539-0ca1bbba5659.png


01.当 AI 学会了“被打断”

“今年 1 到 9 月份,我们做了上百个应用” 大明哥云淡风轻地说。但是,我们来计算一下,9 个月完成上百个应用,意味着平均每三天一个 MVP。而支撑这种“闪电战”式研发节奏的,是一套以 VoxCPM 为语音合成底座的 AI 语音中台。


但在展开这套技术底座之前,我们需要先回答一个问题:为什么市面上绝大多数 AI 语音产品,无论声音多好听,听起来依然“像机器”?


目前全行业最通用的语音交互方案,是一条标准的串行流水线——ASR→LLM→TTS。这条链路开发门槛低、组件选择多,能让团队在很短时间内搭出一个能用的语音对话 Demo。但是,能做出来 Demo 和产品真正能用、好用,是两回事。


大明哥把这条链路的三个致命硬伤归结为同一个词 —— “活人感”。


988eadad-81c7-4086-8c74-5a633f4be0cb.png


  • 不可打断:真人聊天时,插话、打断、抢话是常态;可在这条链路里,AI 一旦开始播报,就必须把整段话读完,用户只能被动等待。“传统端到端语音链路应用到实时对话中,响应速度和交流的‘活人感’都不够。”

  • 响应滞后:一次回答要依次经过识别、推理、合成、推流四个环节,每一环都要等上一环彻底结束才能开始,延迟逐级累积。

  • 没有呼吸感:真人说话有停顿、有换气、有语气助词,而传统语音合成是匀速、平直、无停顿的机械朗读。


正是看到了这套通用架构的天花板,大明哥决定从底层重构整套语音交互体系。


02.三条自研语音链路

一套语音合成底座

大明哥团队以 VoxCPM 为语音合成底座,自研了三套差异化语音链路:S2S、MDN、QUIC。三链路并行、按需调度、场景互补。


24b3dbc8-55f4-4c9e-968b-90bf023c91df.png


S2S 链路主打长文本、高质感、无交互的播报场景,适合有声内容、固定文案配音、祝福语音这类不需要实时对话的业务。它使用 VoxCPM 完整版,参数量更大,情绪和韵律细节的表现力更强,换来的是“成品级”的听感。


MDN 链路全称“Multi-Direct-Nature”——多链路、直接响应、自然交互。这是耐思团队最核心的杀手锏架构,专门解决实时对话中的“自然打断”问题。


真人聊天是怎么进行的?当你正在长篇讲述一个观点,中途被对方插话,你会短暂停下来,给对方表达的空间;对方说完,你给一句简短回应,然后接着把刚才没说完的话继续讲完。这套“停一下—听你说—回应你—接着说”的节奏,就是活人感的来源。


MDN 架构用三条流式线程并行协作:一号线程负责主表达,二号线程在用户打断的瞬间输出“嗯?哦?好”这类极短的口语缓冲,三号线程负责语义判断——决定是接续还是丢弃。大明哥团队在大量真实对话场景落地后,对 MDN 做了彻底重构,打断后的动作从“恢复”变成了“判断”:“链路是否接续,不由打断动作决定,完全由三号线程的语义判断结果决定。”


QUIC 链路则把传输层从 WebSocket 全面升级为 QUIC 协议,解决了 TCP 的“队头阻塞”问题,配合前端挂起机制,实现了超低延迟的实时交互。


三条链路不是简单的版本迭代,而是互补共存。同一套业务能力,可以根据场景选择链路:要品质走 S2S,要交互走 MDN,要极致低延迟加 QUIC。


03.   Nano与完整版:

一轻一重,各司其职

VoxCPM 开源项目提供两个版本:完整版和 Nano 轻量化版本。大明哥团队对这两个版本做了清晰的分工。


VoxCPM-Nano 推理算力开销低,单卡支持超高并发,推理时延极低,被优先供给 MDN 实时交互链路。“Nano 版主要在效率上有极大的提升,特别是在实时语音对话流式输出的情况下,能保持非常稳定的音频质量。”


VoxCPM 完整版参数量更大,情绪、韵律细节的表现力更强,适合生成长文本、长音频,比如播客、长时间播报、有声自传这类需要精品听感的内容。


一轻一重、各司其职的模型分工,让团队在交互体验和计算成本之间找到了平衡点。而在声音克隆这件事上,耐思团队搭建了平台级克隆系统,相似度已经能达到 95% 以上。


但真正让大明哥兴奋的,是 VoxCPM 对副语言标签的支持。“啊”“哦”“嗯”,甚至笑声,这些在传统 TTS 里被忽略的“边角料”,在真实对话中恰恰是“润滑剂”。更精妙的是,团队在 VoxCPM 的服务端注入了毫秒级停顿标签,用中括号加毫秒数表示,比如 [400]、[600]、[800]。而这些标签由 LLM 自动注入,而非人工规定。他表示:“我们不会做太多机械化的输入,我们相信 AI 生成的能力。”


04.前端挂起

重新定义“打断”

f8a3a091-99e8-49c0-868c-da87dbac5f9f.png


行业里绝大多数团队实现打断的方式,是“服务端叫停”:用户说话,前端采集到人声信号上报后端,后端下发指令终止 TTS 模型的推理。这条链路存在一个无法消除的硬性延迟,从用户开口到指令穿过网络到达模型侧,用户能清晰感知到“AI 慢半拍才停下来”。


大明哥团队换了一条完全不同的路径:前端挂起。


“打断的核心并不是阻止它生成。阻止它生成再快,也需要在服务端深入到模型端进行叫停,这个动作本身就有无法克服的延时。所以我们换了一种做法——在前端打断。”


所谓前端挂起,就是后端模型永不停止生成。AI 持续推理、持续生成音频流,源源不断地推送到前端;前端拿到音频分片后,根据当前对话状态决定播放、挂起、缓存还是丢弃。用户打断时,前端并不切断音频,而是把播放器临时静音、把音频流挂起缓存;用户说完之后,再根据语义判断决定是接续还是丢弃。


“前端并没有打断,而是挂起。挂起的过程,就相当于真实人与人交流的过程中,A 在说话,B 突然打断,A 只是临时停下来回应一下,回应完之后继续把没说完的话讲完。”


这套设计的精妙之处在于,它把“打断”从网络层问题变成了本地播放控制问题。后端不需要接收任何停止指令,自然就没有“叫停延迟”;前端控制播放时机,响应速度几乎为零。


05.一个底座,上百个应用

在不同场景里传递温度

“明星来了”是耐思团队面向文娱 IP 粉丝经济推出的产品。用户购买明星联名款生日蛋糕,扫码后即可触发由明星本人音色合成的专属生日祝福。


团队找来明星的公开音频,通过降噪、去背景音、分离人声等处理,提取出干净的音色样本,再通过 VoxCPM 完成声音克隆。更巧妙的是,团队用明星的歌声样本来合成生日歌翻唱——“用歌手的声音唱生日歌,比干巴巴地念一句‘生日快乐’更有感染力”。目前这个项目处于小范围灰度测试阶段,用户反馈非常热烈。


如果说“明星来了”是技术赋能情感消费,那么“AI 史记”就是技术承载人文关怀。


大明哥发现,很多老人都有强烈的倾诉欲,想把一生经历讲给后辈听,但年轻人往往没有时间听,也没耐心听。团队的做法是:老人每天和 AI 聊一小段,系统把录音归档,自动进行事件概括和篇章结构化,最终生成老人的个人自传文本,再用 VoxCPM 合成为有声自传。


这个项目最动人的细节是方言。VoxCPM 支持合成不同地方语种和方言,如果用户是河南人,合成出来的有声自传就是用河南话讲的。“乡音是最能唤醒记忆和情感的东西,当老人听到 AI 用自己熟悉的家乡话讲着那些陈年往事,那种亲切感和归属感,是普通话无法替代的。”


在“明星来了”和“AI 史记”之外,这套技术底座还孵化出了 AI 采访助手——记者和 AI 对话生成采访纲要,AI 分身带着规则去采访嘉宾,嘉宾在自然对话中完成访谈。本期《火种说》的访谈资料,也正是由大明哥自己的产品完成的——用自己造的工具讲述自己的故事。


06.   六库系统:

数字分身的灵魂

bcef1e1a-ab4a-4b5a-8b0f-14270bd648eb.png


声音只是载体。要让数字分身真正“活”起来,还需要性格、记忆、说话习惯、价值观念。大明哥团队为此设计了六库系统(A/B/C/D/E/F),一套面向数字人物本体刻画的完整数据库体系:


A 库是人格参数库,包含上千条人格特质标签;B 库是参数赋值库,为每个标签填入这个人的真实具体取值;C 库是场景逻辑映射库,系统根据当前对话场景动态激活 A 库中对应的人格标签,输出差异化的应答风格,这是整套系统最核心的突破;D 库是语言风格库,复刻人物的口头禅、惯用句式、措辞习惯;E 库是事件概括记忆库,存储人物一生中的关键事件,但不主动穿插进对话,只作为背景档案;F 库是原始素材校验库,从根本上杜绝大模型编造不存在的经历。


六库系统直接加载在 GPU 显存里运行,省去磁盘 IO 开销,检索和调用在毫秒级完成。配合 MDN 链路和 QUIC 协议,形成了完整的闭环:“它跟人说话一样,可能会边说边想。‘嗯,让我想想’这个过程中大概会有一秒钟的延时,那这个延时足够去调用六库系统了。”


从底层模型到传输协议,从交互架构到人物刻画框架,大明哥团队用两年时间,把一个开源模型打磨成了一整套可复用的语音技术底座,又用这套底座孵化了上百个商业应用。


回望整个项目历程,大明哥特别提到了 OpenBMB 开源社区的一个瞬间:“最早我在部署 VoxCPM 版本的时候,还没有支持副语言标签的能力,我就在社区群里跟开发者反馈,他们很快就做出了反应,在下一个版本的优化里就加入了这个功能,而且做得非常好。”从提需求到功能落地,只隔了一个版本的距离。“这种响应提升了我们的信心,让我们没有任何后顾之忧地去想象和开发新的应用,做一些更大胆的市场创新。”


这或许才是开源最本质的价值。不是免费,不是代码,而是让创新者相信,他们不是孤军奋战。当开源模型遇到懂场景的开发者,碰撞出的不只是 Demo,而是一个又一个真实、有温度的产品。


“AI 时代,一切都有无限的可能性。让我们一起跟着 AI 进化吧。作为一个开源社区的开发者,我认为这是一个最好的时代,也是我们最好的学习和提升的机会。”

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.