Meta发布实时音频感知AI模型Muse Voice Transcribe,支持20余人分轨转写
PANews|2026年09月02日 01:08
Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1,000分钟音频3美元(约合每小时0.18美元)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时可同步输出文字,无需等待完整录音结束后再处理。模型支持70余种语言(25种已验证)、超1小时音频及多语言切换,可在包含20余名说话者的录音中分离不同发言者。Meta引入自适应延迟机制,对易识别语音快速输出,对复杂词语调用更多上下文以兼顾速度与准确度。(IT之家援引9to5Mac)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接