发布日期:2026-09-04 01:11点击次数:145

Meta 正式进军竞争激烈的实时语音转文字市场,出全新音频感知模型 Muse Voice Transcribe。该模型由 Meta Superintelligence Labs 开发,支持流式转录、端点检测及过 20 人的说话人分离(Diarization),其公开 API 处理每小时音频的价格仅为 0.18 美元。
Muse 旨在实时处理语音而非等待录音结束,支持过小时的长音频、缝多语言代码切换及语言和关键词偏向。该模型在 70 多种语言上训练,初始发布时验证了其中 25 种语言的准确。值得注意的是,虽然支持 20 多名说话人是显著优势,但这并非行业纪录:Speechmatics 实时服务默认支持 50 人(可增至 100 人),Amazon Transcribe 则支持多 30 人。
说话人分离成为核心语音堆栈济源防火门胶
随着转录内容接入下游 AI 系统,区分"说了什么"与"是谁说的"至关重要。错误的说话人归属会致会议记录、客服分析及规工作流不可靠。Muse 将说话人归属直接整至自回归多模态架构中,通过"自适应延迟"机制平衡字错率与延迟,统训练 ASR、说话人分离和端点检测,而非将其作为立的下游过程。
在 Meta Model API 中,说话人分离被列为操作模式,提供基于轮次(turn-level)而非单词的时间戳,标签仅限于会话范围。
价比与准确率的双重优势济源防火门胶
Muse 的定价策略具侵略。每 1000 分钟 3 美元(即每小时 0.18 美元)的费率,使其在包含说话人分离的服务中处于市场低位。相比之下,万能胶生产厂家Deepgram 含说话人分离的综成本约为每小时 0.47 美元,AssemblyAI 约为 0.57 美元,而 OpenAI GPT Live Transcribe 达 1.02 美元且未列出说话人分离。Soniox 虽以每小时 0.12 美元便宜,但仅支持多 15 名说话人。
在准确率面,Meta 提供的基准数据显示,Muse 在 Artificial Analysis 流式索引中的字错率(WER)为 3.1,优于 Cartesia Ink-2(3.4)、ElevenLabs Scribe v2(3.6)及 Qwen3 ASR Flash(3.7)等竞品。在 AMI-IHM 等数据集上,其平均说话人分离错误率为 17.5,同样低于竞争对手。
尽管存在部署限制——如仅提供基于轮次的时间戳、默认并发 8 个流、单会话长 60 分钟——但 Muse 凭借容量实时说话人分离、低延迟转录及低廉价格,为企业开发者构建会议系统、实时助手及环境 AI 提供了具竞争力的新选择,同时也迫使竞争对手在说话人意识准确和总体运营成本上展开新轮较量。
【星途科讯 图文丨 LCC 发于 ZAKER 科技,转载请注明出处】相关词条:储罐保温 异型材设备 钢绞线厂家 玻璃丝棉厂家 万能胶厂家
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》济源防火门胶 ,以此来变相勒索商家索要赔偿的违法恶意行为。