新闻详情

OpenAI正式上线GPT-Live-1 API:支持打断处理、工具调用与电话智能体

OpenAI推出GPT-Live-1并开放API,支持全双工实时语音应用。该模型将语音理解与输出整合于同一架构,打破传统“语音转文字—大模型推理—文字转语音”的多段式流程,降低延迟

新闻源ai2026-09-11 08:52:00真实数据
OpenAI正式上线GPT-Live-1 API:支持打断处理、工具调用与电话智能体

在核心技术架构上,GPT-Live-1实现了语音理解与语音输出在同一模型中的深度整合。它打破了传统模式中“语音转文字、大语言模型推理、文字转语音”的多次衔接壁垒,从而大幅降低了系统延迟。该模型全面支持全双工对话,不仅能让系统在输出语音的同时依然聆听用户的声音,还能在对话过程中精准处理打断、停顿以及背景噪声等复杂场景。

除了流畅的交互体验,GPT-Live-1在功能扩展和场景落地上也展现出极高的灵活性。开发者可以通过系统提示词轻松调整模型的语气、语速和对话风格,并配置后端模型、工具及智能体框架。同时,该模型支持原生语音识别转写和回复文本,具备字母数字理解、关键词偏置及轮次检测能力。它可以与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。在实际应用场景中,它能够无缝切入电话场景,胜任餐厅预订、客户服务等全双工语音智能体任务。

实际应用层面的成效同样显著。在早期评估中,语言学习平台Speak接入GPT-Live-1后,学习者在思考停顿期间的误打断次数较此前基于轮次的系统减少了将近80%;医疗服务平台也通过该模型精简了架构,大幅削减了代码量。在OpenAI公布的评测中,GPT-Live-1在Full Duplex Bench测试中的表现比GPT-Realtime-2.1高出30个百分点,并在搭配GPT-6Astra中等推理强度时,在Tau3端到端语音智能体任务测试中荣登榜首。

目前,GPT-Live-1已正式在API中提供,其前端语音层的定价为每分钟0.05美元(按每小时计算约为3美元),后端模型和智能体工具的费用另行计算。与此同时,OpenAI还进一步扩展了其实时语音选项,新增了Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等多款全新声音,并计划在未来数月内持续增加更多的语音和语言支持,全面加速智能语音生态的普及。

本期AI日报:OpenAI上线GPT-Live-1 API,支持打断与工具调用;DeepSeek V4.1-Flash登陆WorkBuddy免费试用;谷歌推出Gemini Windows应用;蚂蚁集团称智能体商业“ChatGPT时刻”已至;环球音乐联手ElevenLabs共建正版AI音乐平台;SpaceX AI直播用Grok Bot三天建公司;商汤“小浣熊”移动端上线;支付宝升级AI钱包与三大“AI收”能力。

豆包输入法Windows版V0.9.0发布,适配Win10/11,实现Windows、macOS、iOS、Android、鸿蒙全平台覆盖。语音优先,长按右Alt唤起,支持多方言、中英混输、术语识别,弱网无网可用。键盘输入基于大模型语义联想、长句补全、随打随纠;支持云同步词库、跨设备粘贴;无广告,内存占用合理,可自定义设置。

OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,官方将其定义为全球智能水平最高、对齐效果最优的生成式AI模型。 其训练工作在美国德州Stargate超算基地完成,动用超过10万张GPU完成预训练,也是OpenAI首次大规模使用前代模型参与监督训练的旗舰产品。 该模型上下文窗口达到105万token,最大输出128000 token,知识截止时间为2026年4月30日。

OpenAI发布GPT-6 Astra,称迈向通用AI;英伟达129亿美元收购Hugging Face;小红书清理近12万条AI虚假医美探店内容;奥特曼证实自研人形机器人,强调“机器人大脑”;谷歌Workspace接入Gemini语音;GPT Image 2.5未发先热;阿里千问办公首月用户破3000万,开源上下文底座;Oura智能戒指提交IPO申请。

DeepSeek V4.1 Flash多模态超Pro;Suno v6支持图/视频/语音转音乐与精准编辑;AMD PRO 495将推超20款迷你主机;Prime Video上线AI口型同步;原神声音被仿冒获赔75万;OpenAI调整ChatGPT广告屏蔽竞品并开放GPT-5.6/6语音;Kimi联合金山云等进军企业市场。

小米澎程官微宣布,智能表盘2将于9月7日正式上线小米汽车App商城,支持小米澎程、小米SU7/SU7 Ultra以及YU7全系列车型。 据了解,智能表盘2在交互和结构上进行了全新升级,加入可转头设计,并提供更加丰富的表情反馈。 智能表盘2可以与用户进行眼神交流”,轻轻触碰还会触发专属表情,不仅能够听懂指令,也更注重情绪化互动体验。

当地时间本月8日,OpenAI对外公布重磅成果,其一款尚未对外发布、数学能力显著强于GPT-6 Astra的内部大模型,借助约1万个AI智能体协同工作,仅耗时88小时,完成纳维 - 斯托克斯存在性与光滑性问题的证明。 这是克雷数学研究所2000年提出的七大千禧年大奖难题之一,悬赏奖金100万美元,困扰数学界近90年。 纳维-斯托克斯方程是描述流体运动的基础方程,广泛用于气象预报、�

北京时间2026年9月4日凌晨,OpenAI正式推出新一代旗舰模型GPT-6Astra。距离GPT-5首次亮相约一年,距上一个重要更新版本GPT-5.6仅过去两个月,OpenAI便以"代际跃迁"定义此次发布。公司总裁格雷格·布罗克曼在发布会上直言:"欢迎来到AGI时代。"

作者与评论
内容主体继续静态化,互动层改为统一动态域。评论、点赞、收藏和关注作者后面都复用这套链路。
同类热榜

先做统一评论域,后面视频、图集、音乐和专题页直接复用。

评论区

优先展示置顶和高互动评论

相关推荐
ai

小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源工业级目标说话人语音识别大模型CocktailASR-1,瞄准多人同时讲话的“鸡尾酒会难题”。该模型改变传统ASR任务输入方式,可在嘈杂环境中精准锁定并识别目标说话人语

2026-09-11 18:05:00

ai

Anthropic 披露:今年已阻止多起利用 AI 研发生物武器的尝试

《金融时报》报道,Anthropic称今年已阻止多起科学家利用其AI开展可能助研生物武器的研究,列举五起案例,涉事者绕过管控、混淆目的以规避安全防护。事件凸显AI对公共安全的

2026-09-11 16:29:00

ai

蚂蚁集团韩歆毅宣告智能体“ChatGPT”时刻已至

2026年外滩大会上,蚂蚁集团CEO韩歆毅表示,智能体商业的“ChatGPT时刻”已全面到来。智能体正从能力展示工具迈入真实交易阶段,成为连接用户需求与真实供给的核心商业入口

2026-09-11 15:24:00

ai

告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者

2026-09-11 14:58:00

ai

DeepSeek V4.1-Flash登陆WorkBuddy,开启限时免费试用

AI服务平台WorkBuddy宣布全面上线DeepSeek最新V4.1-Flash模型,并开启两周免费试用,降低开发者与用户体验门槛。该模型已登陆DeepSeek API,具备原生多模态支持能力,用户调

2026-09-11 14:53:00

ai

OpenAI 开放 GPT-Live-1 API:每分钟 0.05 美元,把 ChatGPT 同款语音能力交给开发者

OpenAI向开发者开放GPT-Live-1语音模型API,可将ChatGPT语音功能集成到应用中,构建全双工语音助手,支持实时听说并自然处理打断与停顿。语音前端每分钟0.05美元,后台复杂

2026-09-11 14:48:00