
传统语音智能体在应对复杂的对话场景时,往往容易在停顿、打断或转换话题时显得非常脆弱。而 GPT-Live-1采用单一模型同时处理输入与输出音频,在架构设计上实现了颠覆性的简化。它不仅支持即时响应打断,还能将深层推理以及工具调用无缝委派给后端的文本模型,让对话在后台持续进行的同时保持高度的灵活性。
在实际性能表现和应用场景上,该模型带来了多项核心优势。首先是卓越的中断处理能力,在早期测试中,语言学习平台 Speak 发现它将思考停顿期间的中断减少了近80%。其次,开发者可以通过系统提示词来定制智能体的语气、节奏与对话风格,并能完美处理背景噪声和静默上下文,非常适合用于电话客服、餐饮预订以及长会话交互。在基准测试中,其搭配中等推理强度的 GPT-6Astra 后表现名列前茅。
目前,GPT-Live-1已在 API 中全面可用,前端语音层的定价为每分钟0.05美元。多位行业合作伙伴如 Yelp、Intercom 等均表示,该模型大幅提升了轮次切换的准确性,让 AI 语音支持真正走出了走走停停的节奏,实现了如真人面对面般自然流畅的全新体验。
本期AI日报:OpenAI上线GPT-Live-1 API,支持打断与工具调用;DeepSeek V4.1-Flash登陆WorkBuddy免费试用;谷歌推出Gemini Windows应用;蚂蚁集团称智能体商业“ChatGPT时刻”已至;环球音乐联手ElevenLabs共建正版AI音乐平台;SpaceX AI直播用Grok Bot三天建公司;商汤“小浣熊”移动端上线;支付宝升级AI钱包与三大“AI收”能力。
OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,官方将其定义为全球智能水平最高、对齐效果最优的生成式AI模型。 其训练工作在美国德州Stargate超算基地完成,动用超过10万张GPU完成预训练,也是OpenAI首次大规模使用前代模型参与监督训练的旗舰产品。 该模型上下文窗口达到105万token,最大输出128000 token,知识截止时间为2026年4月30日。
当地时间本月8日,OpenAI对外公布重磅成果,其一款尚未对外发布、数学能力显著强于GPT-6 Astra的内部大模型,借助约1万个AI智能体协同工作,仅耗时88小时,完成纳维 - 斯托克斯存在性与光滑性问题的证明。 这是克雷数学研究所2000年提出的七大千禧年大奖难题之一,悬赏奖金100万美元,困扰数学界近90年。 纳维-斯托克斯方程是描述流体运动的基础方程,广泛用于气象预报、�
GPT-6Astra与V2Fun协作实现3D建模:前者负责理解、拆解、规划、组装及规则结构代码生成,后者生成挖掘机、人物、铠甲等复杂曲面,形成可继续编辑的混合资产。这种分工降低Token消耗,缩短建模时间;V2Fun2.0升级8K贴图,推动3D生成从单一工具转向Agent调度基础能力。
OpenAI发布Images 2.5,提升图像细节并新增草图标注;曹操出行联合豆包在京杭苏提供AI打车;达芬奇21.1接入Claude Code和ChatGPT Codex;智元布局触觉赛道,京东推物理AI加速计划;联通魅族发布99克全语音AI手机;DeepSeek Flash系列降价;首部AIGC武侠片《山竹刀》上线。
OpenAI发布GPT-6 Astra,称迈向通用AI;英伟达129亿美元收购Hugging Face;小红书清理近12万条AI虚假医美探店内容;奥特曼证实自研人形机器人,强调“机器人大脑”;谷歌Workspace接入Gemini语音;GPT Image 2.5未发先热;阿里千问办公首月用户破3000万,开源上下文底座;Oura智能戒指提交IPO申请。
亮源新创发布并开源通用导航大脑LightNav-0,基于Real2Sim2Real将2000+真实场景转化为4000+小时训练数据,实现跨本体、跨任务、跨场景零样本真机泛化,无需额外数据或微调,并在公开视觉语言导航基准上全面领先;团队还将开放更贴近真实使用的多机器人、多场景、长程评测体系。
DeepSeek V4.1 Flash多模态超Pro;Suno v6支持图/视频/语音转音乐与精准编辑;AMD PRO 495将推超20款迷你主机;Prime Video上线AI口型同步;原神声音被仿冒获赔75万;OpenAI调整ChatGPT广告屏蔽竞品并开放GPT-5.6/6语音;Kimi联合金山云等进军企业市场。
北京时间2026年9月4日凌晨,OpenAI正式推出新一代旗舰模型GPT-6Astra。距离GPT-5首次亮相约一年,距上一个重要更新版本GPT-5.6仅过去两个月,OpenAI便以"代际跃迁"定义此次发布。公司总裁格雷格·布罗克曼在发布会上直言:"欢迎来到AGI时代。"