Meta实时音频模型:同时转录20人,每千分钟3美元

实时语音转文字赛道,今天迎来了一位重磅玩家。Meta正式发布Muse Voice Transcribe,这是其首款支持实时流式处理的音频感知模型。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(约合20.2元人民币),折合每小时仅0.18美元。这个价格直接杀入目前Whisper、Deepgram等竞品的地盘,但Meta显然不止想靠低价取胜——它在技术层面做了几个关键差异点。

image.png

边说边转,自动区分20+说话人

这款模型最大的亮点,是把流式自动语音识别、说话人分离和端点检测整合在同一个流程中完成。所谓“流式”,就是人们说话的同时进行转录,无需等待整段音频结束再输出结果,而是持续以小片段形式输出文本,大幅降低延迟。这对实时会议记录、通话字幕、直播辅助等场景非常关键——用户开口,系统就能实时吐出文字,不用等录音结束再单独处理。

Muse Voice Transcribe能区分超过20个不同说话人的录音,同时还能识别说话人何时停止说话,从而自动判定输入边界。语言支持方面,模型覆盖70多种语言,首发已验证25种语言;支持超过一小时的音频输入,并且可以在句子内或句子间进行自然语言切换。开发者还可以通过语言、关键词和上下文偏置,针对特定语言、术语或场景提升识别准确率。

image.png

自适应延迟机制:速度与精度的平衡术

为了平衡实时响应和识别准确率这对天然矛盾,Meta引入了一个名为“自适应延迟”的动态决策机制。系统不会对所有单词做固定的速度-精度权衡,而是针对每个词判断需要多少额外音频再输出识别结果:对于容易识别的语音,系统会更快提交转录结果;而对于模糊不清、包含大量专业术语或处于复杂语境中的词,则利用更多上下文音频信息来提升准确率。

据Meta官方消息,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜上排名第一。但客观来看,这个榜单的衡量标准更偏向学术基准,实际落地效果还需要看多语言、嘈杂环境等真实场景表现。Meta这次选择先开放API而非直接集成到自家产品中,也说明它希望先通过开发者生态来打磨模型——毕竟,在实时语音领域,微软Azure Speech和Google Cloud Speech-to-Text已经深耕多年,Muse想要真正突围,除了技术指标,还得看生态整合的深度。

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,可联系本站进行审核删除。
(0)
AI快讯网编辑-青青AI快讯网编辑-青青
胖东来前8月卖超195亿,闭店店卖13亿
上一篇 5小时前
马斯克:AI十年全球经济增20%-30%,人形机器人10亿台
下一篇 3小时前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注