新闻详情

小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源工业级目标说话人语音识别大模型CocktailASR-1,瞄准多人同时讲话的“鸡尾酒会难题”。该模型改变传统ASR任务输入方式,可在嘈杂环境中精准锁定并识别目标说话人语

新闻源ai2026-09-11 18:05:00真实数据
小米开源工业级目标说话人语音识别大模型 CocktailASR-1

该模型彻底改变了传统语音识别的任务输入方式,采用基于参考声纹的目标说话人识别机制。用户只需提供一段参考音频,模型便会利用声纹嵌入精准定位目标说话人,在多人混合音频中只转录该特定人物的语音,而其他人说话的内容、混响以及背景噪声均会被自动过滤,从而将复杂的混合音频任务转化为高效的目标说话人识别。

在底层架构设计上,CocktailASR-1采用了一个端到端的大语言模型架构,具体由 D2V2音频编码器、Adapter 以及大模型解码器串联组成,且所有权重均整合在同一个检查点中。在实际使用时,输入格式为将参考音频与目标单声道音频进行拼接,中间插入一秒静音作为分隔。这种设计让模型具备极高的通用性,无论是单人还是复杂的多元场景,无需切换模型即可一气呵成。

多项基准测试数据验证了该模型的强悍实力。在模拟多说话人测试中,其在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上的字错率(WER)分别压低至4.11% 和2.90%。相比之下,同赛道的多款知名模型在混合场景下表现全军覆没,例如在 LibriMix3mix 测试中,部分竞品的字错率高达76% 到121% 不等,而 CocktailASR-1的字错率仅为12.29%,展现出了颠覆性的降维打击优势。即便是面对更具挑战的真实会议录制场景,如 AMI SDM 和 AliMeeting Far,该模型也大幅领先现有的各类解决方案。而在单人场景下,其在 LibriSpeech、WenetSpeech 以及 CommonVoice-zh 等数据集上也实现了全面超越。

除了突破性的识别精度外,该模型在工程落地和实用性方面还具备两大亮点功能。首先是强大的负样本拒识能力。当参考音频对应的人并不参与当前对话时,模型能够直接输出空文本,从而有效防止智能音箱、车载语音助手等智能设备被旁人的声音误触发。测试显示其在多个数据集上的负样本拒识率表现优异。其次,模型支持思维链推理功能,能够在输出最终答案前通过特定的标签展示其判断说话人的推理过程,虽然该功能对精度影响极小,但极大提升了系统的可解释性与调试便利性。

目前,CocktailASR-1的相关代码已在 GitHub 按照 Apache2.0协议正式开源,且具备极简的依赖环境,仅需 torch、torchaudio、transformers 和 soundfile 等基础库即可轻松从 HuggingFace 加载并部署使用。小米此次在语音技术底层逻辑上的全新转向,标志着语音识别正从传统的“捕获所有声音”正式迈向聚焦于“锁定一个声音”的全新发展阶段。

小米发布表格数据基础大模型Xiaomi-TabLDM,一次预训练即可跨数据集直接完成分类回归,打破“一表一模型”。其采用大规模合成数据预训练、双流特征分组、稀疏MoE等,在TALENT、OpenML-CTR23等基准中处第一梯队,回归表现突出且推理高效;工业场景材料性能预测精度提升130%,生产误差降54%,小样本适配优势明显。

3000元内国产工业读码器需求上涨。海康MVIDC005X适合标准化产线,新大陆NLSNVF200适物流仓储,研祥金码R1000/R3000系列AI读码器强于狭小工位、反光疑码、高速动态读码,综合性价比突出。低速静态选R1000,高速反光选R3000。选型核心是工况匹配,可满足中小制造产线追溯需求。

今天(9月4日),OpenAI 发布新一代前沿模型 GPT-6Astra,并直接甩下一句:Welcome to the AGI era(欢迎来到AGI时代)。 最近的大模型行业,新模型的出现简直像坐火箭。9月仅仅过去了四天,就有四家海外巨头轮番上阵。第一天,Anthropic宣布推出Claude Fable5.1和Mythos5.1。第二天,谷歌发布了Gemini3.8Flash和专攻网络安全的Gemini3.8Flash Cyber,Meta祭出Muse Spark1.3。 国内市场的发布节奏同样快得惊人

工厂流水线工业读码器是产品追溯、工序绑定、物料管控的核心硬件。选型需关注动态读码速度、复杂码解码、机身尺寸、防护等级、协议兼容性五大指标。主流品牌推荐研祥金码、海康机器人、康耐视、基恩士。趋势为AI智能读码、性能升级、国产化标准化,适用于高速、狭小工位、复杂环境及PLC/MES/WMS对接,研祥金码识别率达99.99%。

零犀科技以因果大模型切入高合规垂直场景,定位AI Native,按业务结果收费。其自研因果推理模型融合行业数据,打造销售智能体与数字劳动力,实现从线索触达到交付转化的全AI闭环,已在保险、金融、汽车、教育等行业落地,服务泰康、京东科技等客户,2024年实现首年盈利。

当地时间本月8日,OpenAI对外公布重磅成果,其一款尚未对外发布、数学能力显著强于GPT-6 Astra的内部大模型,借助约1万个AI智能体协同工作,仅耗时88小时,完成纳维 - 斯托克斯存在性与光滑性问题的证明。 这是克雷数学研究所2000年提出的七大千禧年大奖难题之一,悬赏奖金100万美元,困扰数学界近90年。 纳维-斯托克斯方程是描述流体运动的基础方程,广泛用于气象预报、�

AI日报要点:千问办公上线Qwen3.8-Flash,推双模式;智谱开源GLM-5.3-Flash,价格降至1/40;腾讯混元1.8B翻译模型压缩至440MB,用于B站弹幕实时翻译;北京首例AIGC商业秘密案罚10万;京东发布“超脑”3.0物流大模型;FF发布两款机器人;谷歌升级Gemini Live语音;Claude Cowork内置浏览器,可独立完成网页操作。

作者与评论
内容主体继续静态化,互动层改为统一动态域。评论、点赞、收藏和关注作者后面都复用这套链路。
同类热榜

先做统一评论域,后面视频、图集、音乐和专题页直接复用。

评论区

优先展示置顶和高互动评论

相关推荐
ai

Anthropic 披露:今年已阻止多起利用 AI 研发生物武器的尝试

《金融时报》报道,Anthropic称今年已阻止多起科学家利用其AI开展可能助研生物武器的研究,列举五起案例,涉事者绕过管控、混淆目的以规避安全防护。事件凸显AI对公共安全的

2026-09-11 16:29:00

ai

蚂蚁集团韩歆毅宣告智能体“ChatGPT”时刻已至

2026年外滩大会上,蚂蚁集团CEO韩歆毅表示,智能体商业的“ChatGPT时刻”已全面到来。智能体正从能力展示工具迈入真实交易阶段,成为连接用户需求与真实供给的核心商业入口

2026-09-11 15:24:00

ai

告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者

2026-09-11 14:58:00

ai

DeepSeek V4.1-Flash登陆WorkBuddy,开启限时免费试用

AI服务平台WorkBuddy宣布全面上线DeepSeek最新V4.1-Flash模型,并开启两周免费试用,降低开发者与用户体验门槛。该模型已登陆DeepSeek API,具备原生多模态支持能力,用户调

2026-09-11 14:53:00

ai

OpenAI 开放 GPT-Live-1 API:每分钟 0.05 美元,把 ChatGPT 同款语音能力交给开发者

OpenAI向开发者开放GPT-Live-1语音模型API,可将ChatGPT语音功能集成到应用中,构建全双工语音助手,支持实时听说并自然处理打断与停顿。语音前端每分钟0.05美元,后台复杂

2026-09-11 14:48:00

ai

Cursor发布Projects功能,一人指挥数千个AI智能体承包大型开发

9月10日,Cursor推出Projects(beta版),标志软件开发“第三纪元”加速到来。该功能面向功能开发、大规模迁移、完整应用构建等大型复杂任务,引入“协调者智能体”调度数千

2026-09-11 14:18:00