
v6最大亮点之一是支持多模态创作。用户不再局限于文字提示,可直接上传图片、视频或语音备忘录(voice memo),系统就能将其转化为音乐。例如,基于一张图片的氛围、一段视频的情绪,或一段语音备忘录中的哼唱与描述,即可生成对应风格的歌曲。
同时,创作者可对已生成的歌曲进行精准局部修改,无需重新生成整首作品:
此外,模型对音乐语言的理解显著提升,能更好地把握人声、乐器、结构、情绪、参考风格与整体氛围,让复杂创意更容易落地。
Suno 强调,v6是从零开始训练的新一代模型,使用了来自合作伙伴的授权数据以及用户数据,并融入了团队此前积累的技术与偏好学习成果。平台仍禁止直接提示生成特定知名艺术家或歌曲的仿作。官方还透露,未来将探索让艺术家自愿参与的 AI 混音等新体验,并为权利方创造新的收益机会。
目前,Suno v6已开始全球推送。创作者可在平台直接体验三大模型,用更少时间实现从灵感到成品的完整闭环。AIbase 将持续关注后续更新与用户反馈。
DeepSeek V4.1 Flash多模态超Pro;Suno v6支持图/视频/语音转音乐与精准编辑;AMD PRO 495将推超20款迷你主机;Prime Video上线AI口型同步;原神声音被仿冒获赔75万;OpenAI调整ChatGPT广告屏蔽竞品并开放GPT-5.6/6语音;Kimi联合金山云等进军企业市场。
豆包输入法Windows版V0.9.0发布,适配Win10/11,实现Windows、macOS、iOS、Android、鸿蒙全平台覆盖。语音优先,长按右Alt唤起,支持多方言、中英混输、术语识别,弱网无网可用。键盘输入基于大模型语义联想、长句补全、随打随纠;支持云同步词库、跨设备粘贴;无广告,内存占用合理,可自定义设置。
网易有道上线免费AI语音Agent“网易呏哥说”,支持Mac/Windows。语音输入效率达键盘5倍,热词识别率超99%,支持124语种互译。其自研ASR可过滤口语冗余,输出直接可用的结构化文本,云端零留存护隐私。该产品补齐“表达输入”场景,推动语音输入向理解意图、连接Agent执行延伸。
本期AI日报:OpenAI上线GPT-Live-1 API,支持打断与工具调用;DeepSeek V4.1-Flash登陆WorkBuddy免费试用;谷歌推出Gemini Windows应用;蚂蚁集团称智能体商业“ChatGPT时刻”已至;环球音乐联手ElevenLabs共建正版AI音乐平台;SpaceX AI直播用Grok Bot三天建公司;商汤“小浣熊”移动端上线;支付宝升级AI钱包与三大“AI收”能力。
阿里云今日宣布AI视频生成模型Wan3.0正式版上线。该模型于8月6日开启公测,主打稳定、真实、有质感,在视频时长、输入格式和画面一致性上实现了大幅升级。核心能力方面,Wan3.0支持单次原生生成最长30秒连续视频,能够完成完整叙事和复杂运镜镜头。 输入方式上,Wan3.0在行业内首次支持doc、xls、ppt、pdf、md等文档文件直接输入生成视频,同时兼容图文音视频等多类参考素�
天猫上线AI空间站整合阿里云等;谷歌Gemini 3.8 Flash发布但复杂任务不稳;百度基础模型部引北美专家升级文心;谷歌推Google Pics对标Canva;豆包上线多Agents与Mac操控;月之暗面递表港交所估值冲500亿美元;腾讯公益版WorkBuddy发布;Anthropic新模型Fable5.1编码强且最高降本45%。
小米智能摄像机视频通话版2今日开售,定价499元,较众筹429元略贵。产品适合老人儿童,机身按键可一键视频通话,新增360°水平云台,配3.97英寸屏和大按键,操作更友好。支持微信、米家App及设备间通话,三种呼叫方式;双麦降噪扬声器提升清晰度。画质升级800万像素4K,带红外夜视,1.5T算力增强AI识别,并支持澎湃智联及天气、闹钟信息显示。