审阅于 2026 年 9 月 29 日。多年来,一套语音助手可以被画成三个方框:语音识别把音频转成文本,语言模型决定说什么,文本转语音再把答案变回音频。这一序列通常被概括为“聆听、思考、说话”。它依然有用,尤其适合需要文字记录、严格检查或可替换组件的工作流。但它已不再是语音 AI 唯一严肃的设计方案。
较新的系统可以直接处理实时音频,在一轮话语尚未清晰结束前就开始工作,并在说话时继续聆听。这一变化不只是合成语音变得更快,而是从交换音频文件或完整轮次,转向管理持续进行的对话——包括停顿、打断、重音和背景声。
什么是“聆听、思考、说话”语音流水线?
传统语音 AI 流水线通常包含三个核心阶段:
- 聆听:自动语音识别(ASR),也叫语音转文本,把用户音频转换成文字。
- 思考:语言模型或对话系统理解这些文字,可能调用工具,并生成文本回复。
- 说话:文本转语音(TTS)把回复合成为音频。
在基础实现中,每个阶段都要等待上一个阶段完成。这样架构容易理解和控制,却也让每个边界都可能成为延迟点或信息瓶颈。现代级联系统可以在阶段之间流式传递部分结果,因此不应把“流水线”误解成“天生就慢”。真正的区别在于,文本是否仍是聆听、推理与说话之间强制性的交接形式。
为什么三阶段模型不太像真实对话
延迟会在边界处累积
语音系统必须判断一次停顿意味着“我说完了”,还是仅仅表示“我在思考”。等得太久,对话会拖沓;过早作出判断,又会抢用户的话。端点检测之后,识别、模型推理、语音合成、网络传输以及任何工具调用,都会占用一部分响应时间预算。
人类的对话节奏提供了一个要求很高的参照。2009 年一项覆盖十种语言问答序列的研究发现,人们普遍倾向于减少沉默和重叠,回应时机的差异处在相对有限的范围内。这并不意味着所有产品都必须达到 200 毫秒:人与人交谈不同于客服通话、翻译会话,也不同于要访问慢速数据库的语音代理。但它确实解释了,为什么多出一秒却没有说明的沉默很容易被察觉。
OpenAI 在 2024 年发布 GPT-4o 时提供了一组有用的历史对比。此前的 ChatGPT Voice Mode 使用三个独立模型,搭配 GPT-3.5 时平均延迟 2.8 秒,搭配 GPT-4 时为 5.4 秒;据报告,端到端 GPT-4o 对音频作出回应最快只需 232 毫秒,平均为 320 毫秒。这些数字描述的是当时发布版本及其测试条件,并不保证适用于每一种网络、设备或使用工具的应用。它们说明了架构为何会成为用户体验的一部分。
文字记录是语音的压缩版本
文本擅长记录词语,但传统文字记录可能丢掉会改变理解方式的线索:犹豫、重音、语速、笑声、口音、多人重叠说话和非语音声音。“没问题”可能表示赞同、无奈,也可能带着恼火。如果没有其他组件保留这些声学线索,纯文本推理阶段在三种情况下收到的可能都是同一句话。
这并不意味着每套系统都应推断情绪,也不意味着一个人的发声方式能可靠揭示其意图。情绪识别可能难以跨文化适用,在高风险场景中也可能并不恰当。这里更具体的架构要点是:音频包含纯文本没有的信息,因此一旦设计丢弃音频,之后就无法再利用这些信息。
对话不是轮次分明的整齐序列
人们会打断、重叠说话、重新组织句子,也会用“对”“嗯哼”或“明白了”之类简短的回应信号。半双工助手一次只允许一方处于活动状态:先听,停止聆听,再说话。全双工系统则可以在输出音频的同时继续监听用户,从而在用户开口时停下、让出话轮或作出调整。
这比增加一个打断按钮困难得多。系统要把真正的插话与背景人声或无害的回应信号区分开,停止尚未播放的音频,并让对话状态与用户实际听到的内容保持一致。2025 年推出的 Full-Duplex-Bench 体现了这种评测重点的变化:它测试轮次交接行为,而不只评估文字记录或答案质量。
什么正在取代旧流水线?
没有唯一的替代方案。语音 AI 正分化为三种大体模式。
1. 流式级联
ASR、语言推理和 TTS 仍彼此独立,但不再像三个密封方框那样运作。识别模块持续输出部分文本,模型可以逐步准备工作,语音合成也能从回复中第一个稳定片段开始。轮次模型同时利用静音和语言语境,判断用户是否已经说完。
这种方式保留了明确的文字记录、模块化供应商和熟悉的策略检查点。对于结构化客服、受监管工作流和已有文本代理,它往往是务实的选择。其质量取决于编排:部分文字记录可能变化,推测性工作可能出错,而激进的端点判断虽然能节省时间,也会增加打断。
2. 原生语音到语音模型
语音原生模型接收音频表征并生成音频,不要求把文字记录作为核心推理接口。系统仍可为字幕、日志或内部辅助而生成文本,但模型能够直接利用声学信息。
Kyutai 的 Moshi 研究是一个清晰的公开案例。它把用户与助手音频表示为并行流,并被设计为持续聆听和生成。论文报告,其研究系统理论延迟为 160 毫秒,实际约为 200 毫秒。Moshi 还在“Inner Monologue(内心独白)”中使用与时间对齐的文本,这提醒我们,语音原生并不一定意味着完全没有文本。
3. 语音前端与代理后端组成的混合系统
正在形成的生产模式往往是混合式的。实时音频模型负责时机、话轮交接和口语表达,另一个代理或服务则处理更深层的推理、检索、权限与工具使用。语音层可以先回应用户或提出澄清问题,与此同时,后端检查日历、查询订单或规划多个步骤。
这种分工对设备和呼叫中心都很重要。在一部AI 代理手机中,语音或许是表达目标最快的方式,但真正的实用性取决于请求之后发生什么:语境、工具、权限、执行和恢复。Meydo 关于 Meydo OS 与 DroiClaw 的介绍描述了一个相关的系统级目标——把多模态输入连接到基于权限的行动,而不是把语音仅仅当成一项独立聊天功能。
新的设计单位是交互闭环
音频一旦变为连续流,团队需要设计的就不只是识别准确率和声音质量。交互闭环包括:
- 轮次检测:用户是在停顿、已经说完,还是等待回应?
- 插话:用户开口时,应该取消、暂停还是改变当前回答?
- 回应信号:系统能否在不夺走话轮的情况下表示已听到?
- 依据:哪些词语、音频线索、屏幕语境和工具结果支撑这次回应?
- 行动边界:哪些任务可以继续,哪些必须确认?
- 恢复:用户能否纠正姓名、撤销操作,或在打断后继续?
- 状态:模型是否记得说过什么、播放了什么,以及工具实际完成了什么?
自然的声音可能让错误显得更可信,而不是更不可信。对于后果重大的操作,对话速度不应取消确认、授权或可见记录。只有底层操作已经得到验证,一句快速的“完成了”才有价值。
为什么级联系统不会消失
原生音频确有优势,但架构选择是一种权衡,而不是成熟度排名。OpenAI 当前的语音代理指南把语音到语音会话定位为自然、低延迟交互的合适方案,把链式流水线定位为可预测工作流、已有文本代理和需要明确控制中间阶段的合适方案。
团队在以下情况下可能更适合选择级联:
- 需要可长期保存、可检查的文字记录;
- 任何内容说出口前都要进行确定性的文本检查;
- 希望独立替换 ASR、模型或语音供应商;
- 需要针对特定语言的组件或自定义词汇;
- 需要围绕工具和受监管决策设置清晰审计点;或
- 希望围绕已经验证的文本工作流,以较低成本增加语音层。
如果打断、富有表现力的传达、快速轮次交接或声学语境是体验核心,原生或混合实时音频设计可能更合适。许多产品会同时支持两者:日常对话走流畅的语音路径,敏感操作走受控路径。
如何评估现代语音 AI 系统
不要根据精心打磨的单轮演示下判断。应在现实条件下测试整个闭环。
- 测量不止一种延迟。记录从轮次结束到首段音频的时间、得到有用答案的时间,以及完成操作的时间。既要报告典型情况,也要报告慢速情况,而不只是最佳一次。
- 打断它。尝试尽早纠正、较晚插话和简短回应信号。确认播放会停止,而且下一次回答不会依赖用户从未听到的内容。
- 改变音频条件。使用能反映目标用户的口音、语言切换、姓名、数字、轻声说话、噪声和多人说话。
- 检查工具与确认步骤。操作前验证参数,操作后从目标系统读取结果。说话时充满信心,并不能证明操作已经完成。
- 检查文字记录的行为。如果存储文字记录,要弄清它是权威记录,还是仅为音频模型理解内容的粗略表达。
- 测试失败情形。断开网络、延迟工具、拒绝权限,再纠正一个识别错误的实体。恢复质量往往比理想路径更重要。
- 审查隐私与保留政策。确认原始音频、文字记录、声纹和工具结果在哪里处理、保留,以及谁能访问。
“聆听、思考、说话”之后是什么?
下一代模型更接近持续聆听、逐步理解、谨慎行动、自适应表达。这些活动可以重叠。助手或许在判断一轮话语即将结束时就开始准备回复,在说话时继续聆听,并在委派任务的同时持续向用户说明进展。
这并不会淘汰旧流水线,而是让它不再被视为所有语音体验的默认思维模型。胜出的架构将是最适合任务的架构:在时机和表达重要时使用原生音频,在检查和控制重要时采用模块化阶段,在对话必须连接到可靠行动时使用混合架构。
常见问题
什么是语音到语音 AI?
语音到语音 AI 接收口语输入,并在直接处理音频的同时生成口语输出。系统仍可提供文字记录,但它不一定是 ASR 系统、文本模型与 TTS 之间必经的桥梁。
全双工在语音 AI 中是什么意思?
全双工意味着系统可以同时聆听和生成音频。在实际应用中,一个有用的全双工代理还要能识别打断与回应信号,停止或调整输出,并在语音重叠后维持准确状态。
原生音频模型总是比 ASR–LLM–TTS 流水线更快吗?
不是。原生模型去掉了一部分串行边界,但实际延迟还取决于模型大小、硬件、网络传输、端点判断、工具调用和播放。流式处理良好的级联可以胜过部署不佳的原生模型。应测量完整应用。
语音原生模型仍会使用文本吗?
可以。文本可用于支持推理、字幕、搜索、安全检查或日志。“语音原生”意味着模型能直接使用或生成音频表征,并不要求所有内部或外部表征都只能是音频。
声音更像人的语音 AI 会更准确吗?
不会。自然的时机和富有表现力的语音能改善交互,却不能验证事实或操作。准确性、工具结果、权限和操作后检查必须单独评估。
披露与来源
本文分析公开的技术文档和研究,并非对某一特定商业系统的基准测试。Meydo 在个人 AI 设备领域拥有商业利益。性能取决于模型、硬件、网络条件、语言和应用设计。
- OpenAI:《Hello GPT-4o》(2024 年 5 月 13 日)
- OpenAI API:语音代理——语音到语音与链式架构(访问于 2026 年 9 月 29 日)
- OpenAI API:实时对话(访问于 2026 年 9 月 29 日)
- Kyutai:Moshi——用于实时对话的语音-文本基础模型(2024 年)
- Full-Duplex-Bench:评估全双工口语对话模型轮次交接能力的基准(2025 年)
- Stivers 等:对话轮次交接的普遍性与文化差异(PNAS,2009 年)
