新闻详情

告别配音“对不上嘴”!亚马逊Prime Video重磅上线AI口型同步技术

亚马逊Prime Video全面上线AI口型同步功能,可精准对齐演员嘴部动作与真人配音音轨,解决跨语言配音时画面与声音脱节的痛点。该功能率先应用于德国剧集《贵族高中:我们之间

新闻源ai2026-09-10 16:08:00真实数据

作为该功能的全球首发落地项目,目前这项技术率先支持德国热门剧集《贵族高中:我们之间的鸿沟》的英语配音版。全球订阅用户已经可以在该剧的第一季和第二季中体验到这一全新的视听效果。同时,亚马逊官方确认,即将在12月9日上线的第三季也将同步支持该项AI口型同步功能,并在未来逐步扩展到更多影视作品中。

在技术实现层面,Prime Video的这项创新融合了最前沿的人工智能与视觉特效技术,确保演员在说出翻译后的台词时,面部视觉效果与听觉声音能够完美契合。值得注意的是,随着生成式AI在视频领域的快速普及,整个行业都在积极布局这一赛道。例如,Meta和YouTube近期也相继面向创作者推出了人工智能自动配音功能,并自带“口型同步”选项,让视频中的人物看起来就像是在直接使用观众偏好的语言进行交流。

回顾这一功能的演进过程,亚马逊其实早有布局。早在去年,Prime Video便已经开始在《熙德:传奇》、《我的鹦鹉妈妈》以及《久别重逢》等12部精选电影和电视剧中,针对英语和西班牙语进行“AI辅助”配音的初步试验。随着此次正式上线与规模化应用,流媒体的全球化内容分发正迎来一场全新的技术升级。

燃影特拍团队使用索尼FX5在400米山地速降赛道拍摄实验短片《隐入林间》。FX5兼具电影质感与紧凑轻便机身,5轴防抖、最高240fps升格、三原生ISO及CineAlta色彩操控,实现无人机、跟拍车、穿戴设备多平台部署,在竹林暗光与强光交替等极限环境中稳定完成专业拍摄。

本文针对 DGX Spark 本地存储限制,提出基于绿算存储节点与 Solidigm NVMe SSD 的 KV Cache Offload 方案,通过 RDMA 接入远程 JBOF 扩展容量。实测远程存储读写带宽超 10GB/s,在 vLLM/LMCache 下 TTFT 和吞吐量与本地 SSD 相当,部分场景更优,可独立扩展容量并支持跨节点缓存共享,适用于 SOHO/边缘 AI。

OpenAI发布Images 2.5,提升图像细节并新增草图标注;曹操出行联合豆包在京杭苏提供AI打车;达芬奇21.1接入Claude Code和ChatGPT Codex;智元布局触觉赛道,京东推物理AI加速计划;联通魅族发布99克全语音AI手机;DeepSeek Flash系列降价;首部AIGC武侠片《山竹刀》上线。

联想携IDC发布首部《AI主机》白皮书,将其定义为面向L3级自主智能体的边缘算力新物种,具备本地推理、任务执行与数据存储一体化能力,支持“端-边-云”协同。该品类直击算力成本与数据安全痛点,五年TCO最高可降67%,产品覆盖入门到企业级。IDC预测2030年出货约700万台、市场约770亿元。

AI编程Agent存在跨会话、跨Agent及上下文压缩导致的三层失忆,仅扩大窗口无法解决。MemoraX Code通过独立记忆层提取并复用项目经验,分编码、仓库、流程、个人四类记忆,跨平台继承。实测Token消耗降57%,耗时减半,AML评测居首,提升长期工程效率。

NVIDIA在Gamescom发布DLSS 4.5光线重建,支持30余款游戏;《战争机器:事变日》《控制:共振》《007初露锋芒》等将支持DLSS4.5/RTX技术。多家发行商支持RTX Spark。RTX Remix升级支持DLSS4.5,推出《恐惧杀手RTX》《上古卷轴III:晨风》RTX MOD。AOC发布首款5K G-SYNC Pulsar显示器,华硕、LG推多款G-SYNC兼容显示器。

Bigme大我获电子纸产业联盟“电子纸80帧/秒创新应用首创奖”。其自研驱动算法与智能清残影技术,将墨水屏刷新率从30Hz提至80Hz,兼顾画质。此前已获三项首创奖;HiBreak+Pro等三款产品实现80帧/秒高刷,覆盖手机、办公本场景。未来将继续以真实用户体验为准绳深耕算法与交互。

本期AI日报:OpenAI上线GPT-Live-1 API,支持打断与工具调用;DeepSeek V4.1-Flash登陆WorkBuddy免费试用;谷歌推出Gemini Windows应用;蚂蚁集团称智能体商业“ChatGPT时刻”已至;环球音乐联手ElevenLabs共建正版AI音乐平台;SpaceX AI直播用Grok Bot三天建公司;商汤“小浣熊”移动端上线;支付宝升级AI钱包与三大“AI收”能力。

Vidda C5无界Master凭三色激光投影系统性突破获IFA Honoree Awards。其不拼单一参数,而是分层重构家庭巨幕体验:首发MCL3A+QuaLas42激光器、液冷散热与DMD芯片实现高亮稳定;自研千山AI影像平台精准提升画质;自研哈勃镜头实现无损灵活安装,标配JBL 2.1音响,并通过莱茵护眼认证。获奖印证底层技术创新驱动完整影院体验获国际肯定。

作者与评论
内容主体继续静态化,互动层改为统一动态域。评论、点赞、收藏和关注作者后面都复用这套链路。
同类热榜

先做统一评论域,后面视频、图集、音乐和专题页直接复用。

评论区

优先展示置顶和高互动评论

相关推荐
ai

小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源工业级目标说话人语音识别大模型CocktailASR-1,瞄准多人同时讲话的“鸡尾酒会难题”。该模型改变传统ASR任务输入方式,可在嘈杂环境中精准锁定并识别目标说话人语

2026-09-11 18:05:00

ai

Anthropic 披露:今年已阻止多起利用 AI 研发生物武器的尝试

《金融时报》报道,Anthropic称今年已阻止多起科学家利用其AI开展可能助研生物武器的研究,列举五起案例,涉事者绕过管控、混淆目的以规避安全防护。事件凸显AI对公共安全的

2026-09-11 16:29:00

ai

蚂蚁集团韩歆毅宣告智能体“ChatGPT”时刻已至

2026年外滩大会上,蚂蚁集团CEO韩歆毅表示,智能体商业的“ChatGPT时刻”已全面到来。智能体正从能力展示工具迈入真实交易阶段,成为连接用户需求与真实供给的核心商业入口

2026-09-11 15:24:00

ai

告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者

2026-09-11 14:58:00

ai

DeepSeek V4.1-Flash登陆WorkBuddy,开启限时免费试用

AI服务平台WorkBuddy宣布全面上线DeepSeek最新V4.1-Flash模型,并开启两周免费试用,降低开发者与用户体验门槛。该模型已登陆DeepSeek API,具备原生多模态支持能力,用户调

2026-09-11 14:53:00

ai

OpenAI 开放 GPT-Live-1 API:每分钟 0.05 美元,把 ChatGPT 同款语音能力交给开发者

OpenAI向开发者开放GPT-Live-1语音模型API,可将ChatGPT语音功能集成到应用中,构建全双工语音助手,支持实时听说并自然处理打断与停顿。语音前端每分钟0.05美元,后台复杂

2026-09-11 14:48:00