
语音转写正变成AI系统的实时感知层。
智东西9月2日报道,今日,Meta推出由Meta超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe。
该模型提供实时流式自动语音识别(ASR)、支持超过20位说话人的语音分割以及端点控制功能,支持多语言,能处理超过1小时的长音频,可实现无缝语码切换,并通过语言、关键词和上下文偏好来提高识别准确率。
从示例来看,无论是讲中文、中式英语口音,还是中英文混合表达,这款模型的转写速度和效果都相当不错。

Muse Voice Transcribe在Artificial Analysis流式语音转文本和公开语音分割基准测试中排名第一。(模型收录和排名截至2026年9月1日。)

该模型可通过Meta Model API、Mac版Meta AI和Muse Code使用。
其API定价为每1000分钟3美元(约合人民币20元),每小时0.18美元(约合人民币1.21元)。

可识别超1小时长音频、
中英文夹杂、20多个人同时说
Muse Voice Transcribe已使用70多种语言进行训练,其中25种语言经过全面验证。
在初始版本中,Meta建议用户试用25种已验证的语言,同时也提供对更多语言的支持。

语言切换方面,Muse Voice Transcribe原生支持任意语码转换,无论是在句子内部还是句子之间,还利用上下文信息进一步提高了识别准确率。
在下面的示例中,说话者随意转换中英文,结果能被识别得既快又准。

其模型原生支持超过1小时的长音频输入和超过20位的说话者,无需后处理。

只需单击一下,Meta AI和Muse Code的语音听写功能即可由Muse Voice Transcribe提供支持。


它可以与任何应用程序配合使用,并可与Meta AI以及屏幕上的任何窗口配合使用,完成各种任务——只需按住“Fn”键即可尝试。

以流式自动语音识别为基础,
动态调整延迟兼顾速度和准确率
Muse Voice Transcribe是Muse Spark系列中的一个自回归多模态模型。
音频以80ms(12.5Hz)为单位进行处理,每个音频片段都被转换为一个软token。对于每个音频片段,模型会决定是继续监听下一个音频片段,还是输出一个文本token。
当模型决定继续监听时,它会预测一个<|next_audio|>特殊token,并将其替换<|next_audio|>为下一个输入的实际音频片段。

当音频流停止时,Meta会插入一个特殊<|empty_audio|>token来告知模型没有更多音频片段。模型收到<|empty_audio|>,也就是“后续已没有音频输入”的信号后,就会直接输出所有剩余的文本token,不再生成任何<|next_audio|>token。

由于模型可以完全控制何时监听,因此它会在转写单词之前决定需要多少音频上下文信息(被称为“延迟”)。准确率和延迟之间存在权衡。
模型等待预测的时间越长,转写结果就越准确,但延迟也越高。
Muse Voice Transcribe具有“自适应延迟”功能,可根据每个单词的难度动态调整延迟。这是通过强化学习(RL)实现的,其中词错误率(WER)奖励和延迟奖励以乘法方式组合。
通过自适应延迟,该模型在速度和准确性权衡方面实现了帕累托前沿,以最终转写时间衡量。

基于ASR构建分区和端点功能
以流式ASR为基础,可通过引入额外的特殊token轻松支持其他音频感知任务。
为了实现说话人分割,Meta引入一个<|start_of_turn|>token来指示潜在的说话人切换,并引入一个<|speaker_{A-Z}|>tag来区分不同的说话人。
说话人切换时,<|start_of_turn|>会立即被预测,而说话人tag的预测则会延迟到音频块的末尾。
来自同一说话人的音频也可以通过这种方式被<|start_of_turn|>切分成多个片段,这些切分片段的说话人tag都将相同。
以下是一个说话人分离的token序列示例(为简化演示省略了<|next_audio|>):
<|start_of_turn|>Hello, how are you doing?<|speaker_A|><|start_of_turn|> Did anything fun over the weekend?<|speaker_A|><|start_of_turn|> Hey I'm good!<|speaker_B|>
对于语音端点检测,Meta引入一个<|speech_onset|>token来标记语音的开始,并引入一个<|speech_endpoint|>token来标记用户说话结束。
以下是一个语音端点检测的token序列示例(为简化演示省略了<|next_audio|>):
<|speech_onset|>Hey Meta, what's the weather in Menlo Park?<|speech_endpoint|> [silence] <|speech_onset|>What should I wear today?<|speech_endpoint|>
Meta使用流式ASR同时训练这两个任务,并在ASR奖励信号基础上,分别针对说话人分离和语音端点检测任务增加额外奖励。
结语:语音识别向
持续在线的“耳朵”演进
在现实场景中,人们交流的情景非常复杂,比如多语言交杂、有人时不时插话、多人说话声音重叠等等,以及可能连续聊上几十分钟甚至几个小时。Muse Voice Transcribe此次重点展示的能力,便对这些真实场景的转写质量优化非常有帮助。
语音转写正在从一个独立的“语音转文字”工具,变成AI系统的实时感知层。下一阶段竞争的核心会同时落在低延迟、长上下文、多说话人、多语言与语境理解上,并最终与大模型的推理、记忆和工具调用融合。届时,“听见”只是入口,系统还要知道谁在说、什么时候说完、这句话和前面有什么关系,以及接下来该做什么。
文章来自于微信公众号 “智东西”,作者 “智东西”
【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。
项目地址:https://github.com/Henry-23/VideoChat
在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址:https://github.com/PeterH0323/Streamer-Sales