实时语音转文字赛道,今天迎来了一位重磅玩家。Meta正式发布Muse Voice Transcribe,这是其首款支持实时流式处理的音频感知模型。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(约合20.2元人民币),折合每小时仅0.18美元。这个价格直接杀入目前Whisper、Deepgram等竞品的地盘,但Meta显然不止想靠低价取胜——它在技术层面做了几个关键差异点。

边说边转,自动区分20+说话人
这款模型最大的亮点,是把流式自动语音识别、说话人分离和端点检测整合在同一个流程中完成。所谓“流式”,就是人们说话的同时进行转录,无需等待整段音频结束再输出结果,而是持续以小片段形式输出文本,大幅降低延迟。这对实时会议记录、通话字幕、直播辅助等场景非常关键——用户开口,系统就能实时吐出文字,不用等录音结束再单独处理。
Muse Voice Transcribe能区分超过20个不同说话人的录音,同时还能识别说话人何时停止说话,从而自动判定输入边界。语言支持方面,模型覆盖70多种语言,首发已验证25种语言;支持超过一小时的音频输入,并且可以在句子内或句子间进行自然语言切换。开发者还可以通过语言、关键词和上下文偏置,针对特定语言、术语或场景提升识别准确率。

自适应延迟机制:速度与精度的平衡术
为了平衡实时响应和识别准确率这对天然矛盾,Meta引入了一个名为“自适应延迟”的动态决策机制。系统不会对所有单词做固定的速度-精度权衡,而是针对每个词判断需要多少额外音频再输出识别结果:对于容易识别的语音,系统会更快提交转录结果;而对于模糊不清、包含大量专业术语或处于复杂语境中的词,则利用更多上下文音频信息来提升准确率。
据Meta官方消息,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜上排名第一。但客观来看,这个榜单的衡量标准更偏向学术基准,实际落地效果还需要看多语言、嘈杂环境等真实场景表现。Meta这次选择先开放API而非直接集成到自家产品中,也说明它希望先通过开发者生态来打磨模型——毕竟,在实时语音领域,微软Azure Speech和Google Cloud Speech-to-Text已经深耕多年,Muse想要真正突围,除了技术指标,还得看生态整合的深度。