新闻详情

告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者

新闻源ai2026-09-11 14:58:00真实数据
告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

传统语音智能体在应对复杂的对话场景时,往往容易在停顿、打断或转换话题时显得非常脆弱。而 GPT-Live-1采用单一模型同时处理输入与输出音频,在架构设计上实现了颠覆性的简化。它不仅支持即时响应打断,还能将深层推理以及工具调用无缝委派给后端的文本模型,让对话在后台持续进行的同时保持高度的灵活性。

在实际性能表现和应用场景上,该模型带来了多项核心优势。首先是卓越的中断处理能力,在早期测试中,语言学习平台 Speak 发现它将思考停顿期间的中断减少了近80%。其次,开发者可以通过系统提示词来定制智能体的语气、节奏与对话风格,并能完美处理背景噪声和静默上下文,非常适合用于电话客服、餐饮预订以及长会话交互。在基准测试中,其搭配中等推理强度的 GPT-6Astra 后表现名列前茅。

目前,GPT-Live-1已在 API 中全面可用,前端语音层的定价为每分钟0.05美元。多位行业合作伙伴如 Yelp、Intercom 等均表示,该模型大幅提升了轮次切换的准确性,让 AI 语音支持真正走出了走走停停的节奏,实现了如真人面对面般自然流畅的全新体验。

本期AI日报:OpenAI上线GPT-Live-1 API,支持打断与工具调用;DeepSeek V4.1-Flash登陆WorkBuddy免费试用;谷歌推出Gemini Windows应用;蚂蚁集团称智能体商业“ChatGPT时刻”已至;环球音乐联手ElevenLabs共建正版AI音乐平台;SpaceX AI直播用Grok Bot三天建公司;商汤“小浣熊”移动端上线;支付宝升级AI钱包与三大“AI收”能力。

OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,官方将其定义为全球智能水平最高、对齐效果最优的生成式AI模型。 其训练工作在美国德州Stargate超算基地完成,动用超过10万张GPU完成预训练,也是OpenAI首次大规模使用前代模型参与监督训练的旗舰产品。 该模型上下文窗口达到105万token,最大输出128000 token,知识截止时间为2026年4月30日。

当地时间本月8日,OpenAI对外公布重磅成果,其一款尚未对外发布、数学能力显著强于GPT-6 Astra的内部大模型,借助约1万个AI智能体协同工作,仅耗时88小时,完成纳维 - 斯托克斯存在性与光滑性问题的证明。 这是克雷数学研究所2000年提出的七大千禧年大奖难题之一,悬赏奖金100万美元,困扰数学界近90年。 纳维-斯托克斯方程是描述流体运动的基础方程,广泛用于气象预报、�

GPT-6Astra与V2Fun协作实现3D建模:前者负责理解、拆解、规划、组装及规则结构代码生成,后者生成挖掘机、人物、铠甲等复杂曲面,形成可继续编辑的混合资产。这种分工降低Token消耗,缩短建模时间;V2Fun2.0升级8K贴图,推动3D生成从单一工具转向Agent调度基础能力。

OpenAI发布Images 2.5,提升图像细节并新增草图标注;曹操出行联合豆包在京杭苏提供AI打车;达芬奇21.1接入Claude Code和ChatGPT Codex;智元布局触觉赛道,京东推物理AI加速计划;联通魅族发布99克全语音AI手机;DeepSeek Flash系列降价;首部AIGC武侠片《山竹刀》上线。

OpenAI发布GPT-6 Astra,称迈向通用AI;英伟达129亿美元收购Hugging Face;小红书清理近12万条AI虚假医美探店内容;奥特曼证实自研人形机器人,强调“机器人大脑”;谷歌Workspace接入Gemini语音;GPT Image 2.5未发先热;阿里千问办公首月用户破3000万,开源上下文底座;Oura智能戒指提交IPO申请。

亮源新创发布并开源通用导航大脑LightNav-0,基于Real2Sim2Real将2000+真实场景转化为4000+小时训练数据,实现跨本体、跨任务、跨场景零样本真机泛化,无需额外数据或微调,并在公开视觉语言导航基准上全面领先;团队还将开放更贴近真实使用的多机器人、多场景、长程评测体系。

DeepSeek V4.1 Flash多模态超Pro;Suno v6支持图/视频/语音转音乐与精准编辑;AMD PRO 495将推超20款迷你主机;Prime Video上线AI口型同步;原神声音被仿冒获赔75万;OpenAI调整ChatGPT广告屏蔽竞品并开放GPT-5.6/6语音;Kimi联合金山云等进军企业市场。

北京时间2026年9月4日凌晨,OpenAI正式推出新一代旗舰模型GPT-6Astra。距离GPT-5首次亮相约一年,距上一个重要更新版本GPT-5.6仅过去两个月,OpenAI便以"代际跃迁"定义此次发布。公司总裁格雷格·布罗克曼在发布会上直言:"欢迎来到AGI时代。"

作者与评论
内容主体继续静态化,互动层改为统一动态域。评论、点赞、收藏和关注作者后面都复用这套链路。
同类热榜

先做统一评论域,后面视频、图集、音乐和专题页直接复用。

评论区

优先展示置顶和高互动评论

相关推荐
ai

小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源工业级目标说话人语音识别大模型CocktailASR-1,瞄准多人同时讲话的“鸡尾酒会难题”。该模型改变传统ASR任务输入方式,可在嘈杂环境中精准锁定并识别目标说话人语

2026-09-11 18:05:00

ai

Anthropic 披露:今年已阻止多起利用 AI 研发生物武器的尝试

《金融时报》报道,Anthropic称今年已阻止多起科学家利用其AI开展可能助研生物武器的研究,列举五起案例,涉事者绕过管控、混淆目的以规避安全防护。事件凸显AI对公共安全的

2026-09-11 16:29:00

ai

蚂蚁集团韩歆毅宣告智能体“ChatGPT”时刻已至

2026年外滩大会上,蚂蚁集团CEO韩歆毅表示,智能体商业的“ChatGPT时刻”已全面到来。智能体正从能力展示工具迈入真实交易阶段,成为连接用户需求与真实供给的核心商业入口

2026-09-11 15:24:00

ai

DeepSeek V4.1-Flash登陆WorkBuddy,开启限时免费试用

AI服务平台WorkBuddy宣布全面上线DeepSeek最新V4.1-Flash模型,并开启两周免费试用,降低开发者与用户体验门槛。该模型已登陆DeepSeek API,具备原生多模态支持能力,用户调

2026-09-11 14:53:00

ai

OpenAI 开放 GPT-Live-1 API:每分钟 0.05 美元,把 ChatGPT 同款语音能力交给开发者

OpenAI向开发者开放GPT-Live-1语音模型API,可将ChatGPT语音功能集成到应用中,构建全双工语音助手,支持实时听说并自然处理打断与停顿。语音前端每分钟0.05美元,后台复杂

2026-09-11 14:48:00

ai

Cursor发布Projects功能,一人指挥数千个AI智能体承包大型开发

9月10日,Cursor推出Projects(beta版),标志软件开发“第三纪元”加速到来。该功能面向功能开发、大规模迁移、完整应用构建等大型复杂任务,引入“协调者智能体”调度数千

2026-09-11 14:18:00