关于ZAKER Skills 合作
钛媒体 2小时前

没有 AI 味的 AI 音乐来了,Mureka V9.5 交出满分音乐答卷

AI 音乐这两年火得很快,打开任何一个音乐平台,AI 生成的歌单已经多到刷不完。听得多了你会发现一个问题,这些歌听起来都挺像那么回事,却又总觉得差点意思。

旋律从头到尾挤得满满当当,没有一个小节舍得停下来喘口气。人声像被伴奏活活埋掉的配角,怎么都冒不出来。段落之间一个力度撑到底,前一段还在深情款款,后一段突然不知道拐到哪儿去了。情绪断层、结构割裂,像是把几首不同歌的片段硬拼在了一起。

这倒不是哪家产品的问题,整个行业的路子多少都有点偏。很长时间里,行业里把堆满编配当成了完成度,多层乐器一叠,第一耳确实热闹,但经不起细听。热闹底下空落落的,什么都没说出来。这种 AI 味儿太重的歌,很难直接拿去做商用发行。

7 月 19 日,昆仑万维天工 AI 在 2026 世界人工智能大会上发布了新一代音乐生成底座 Mureka V9.5,同时推出了基于这个底座的 O3 反思式音乐推理方案,以及一个全新的创作 Agent 体验。

V9.5 的方向很明确,做更克制、更真实、更贴合创作意图的音乐,说白了就是更有人味儿、更少 AI 味儿。O3 的思路是用 test-time scaling 让音乐思考从一次性规划变成持续推演,写一段回头看一段,不对就改。创作 Agent 则是把定稿改成了版本化管理,创作不再是一锤子买卖。

Mureka V9.5 发布现场

Mureka V9.5 官方视频

一、不是堆编配,是给音乐留出呼吸空间

Mureka 的技术路线叫 MusiCoT,核心思路是让模型在生成音频之前先形成一套音乐思维,从全曲结构到局部细节,粗到细地组织创作,而不是逐帧瞎蒙。

V9.5 在这个基础上往前推了一步,它开始思考一首真实的歌到底是怎么成立的。编配不用时刻拉满,声部得学会呼吸,情绪推进得有留白,所有声音上的选择都该为创作意图服务。它不再追求第一耳让你觉得好厉害,而是在一个更真实的音乐框架里,把 Prompt 控制、人声表现、音质和情绪表达做扎实。

(AI 自动分析画面的场景、动作和情绪,创作更贴合内容的配乐)

我们回头扫了一遍样本,一致的感觉是,它听起来更克制、更真实,也更不像 AI 写的。

歌曲《夜色缓缓》

定位:中文流行,对标国内流行市场,情绪捕捉准确

提示词:以柔和钢琴、中文流行,氛围合成器和渐进式弦乐构建电影感情绪,男声贴近演唱,细腻、克制,从低声诉说逐渐走向情感释放。整体像雨夜里未说出口的告别,忧伤但温柔,不煽情却充满力量。

Featuring soft piano, Chinese pop influences, atmospheric synth layers, and gradual strings to create a cinematic emotional atmosphere. Intimate male vocals with delicate, restrained delivery, building from quiet storytelling to emotional release. Like an unspoken goodbye on a rainy night, melancholic yet tender, powerful without being dramatic.

歌曲《Melted Chrome 2》分版

定位:一首标准的西海岸 G-Funk,风格极佳,对小众曲风的捕捉,风格极致表达,对合成器和地域文化理解,理解曲风的风格表达,音效选取的有特点,编曲层层递进

提示词:

迷幻西海岸 G-Funk 街头说唱。深沉滑动的合成器低音、Moog 哨音、Talkbox 氛围、温暖 Rhodes、哇音吉他与复古磁带质感,配合松弛靠后的鼓点和沙哑男声,营造低底盘夜间巡游般的迷幻街头氛围。

Psychedelic West Coast G-Funk street rap, featuring deep sliding synth bass, a melted Moog whistle lead, talkbox haze, warm Rhodes, muted wah guitar, warped cassette textures, and a lazy behind-the-beat groove. Raw raspy male vocals deliver relaxed, human street storytelling over a smoky lowrider night-cruise atmosphere, with no trap hi-hats, drill patterns, or EDM drops.

传统 AI 音乐的习惯做法是默认叠多层乐器、持续填充旋律,觉得这样才有完成感。V9.5 把配器逻辑整个翻了过来,声部怎么进怎么出、乐器什么时候上什么时候撤、强弱动态怎么走,全部看提示词的情绪和曲风来定。无效声部主动砍掉,给主旋律和人声腾位置,给情绪转折留白。它在学真人编曲那种轻重交替、张弛有度的习惯。

(仅需上传一张照片与一小段清晰人声 , 即可快速生成专属 Character)

数据上显示,同一轮 100 首样本的盲测里,V9.5 在旋律、人声、音质和编配上都有提升,指令精准度从 6.92 提到了 7.62。

具体到四个评测维度:第一,编配上它更克制,不把配器密度等同于音乐质量,为主旋律、人声和情绪变化留出了呼吸空间。第二,音乐框架上它更真实,声部进入、段落推进与动态关系更接近真实创作,减少了模板化和复杂堆叠感。第三,人声表现良品率达到 61.0%,情绪、唱腔和伴奏之间的关系更自然,听起来更可信。第四,意图优先于炫技这一点尤其明显,97.0% 的控制良品率和 95.7% 的曲风完全体现比例,说明复杂度更多被用于服务 Prompt,而不是掩盖音乐判断。

一句话总结,V9.5 的任务是把歌做得更自然。

二、不是生成得更多,是想得更深

如果说 V9.5 解决的是听起来像不像人做的,O3 解决的就是想得够不够深。

O3 跑在 V9.5 之上,用 test-time scaling 把 MusiCoT 的推理过程拉长了。从能看到的层面来说,它不是简单地把生成拉长或者算更久,而是让模型在生成过程中持续问自己:当前这段旋律还在为整首歌服务吗?编配是不是又把主唱淹了?情绪是不是透支了?结构有没有跑偏?多出来的算力,被用来回头看和自己改,让音乐思维一步步收敛,而不是一次决定后一条道走到黑。

具体来说,这种反思式推理覆盖四个能力。首先,全曲目标不丢,MusiCoT 先定好结构、情绪和表达方向,后面每一步判断都回到这个全局目标,不是走一步看一步。其次,生成中持续审视,模型不光判断局部好不好听,还检查当前选择有没有破坏整首歌的一致性。再次,发现偏差后自己改,旋律、编配、人声或情绪跑偏了,后续决策会重新校准,有点像创作者写完一段回头听,觉得不对,删了重来。最后是成本,更高的推理成本换的不是算力炫耀,而是审视、修正和收敛的空间。

这套机制能有效,前提是底座先有了真实感。V9.5 提供了一个更克制、更自然的基底,O3 不需要从一个充满 AI 堆叠感的结果开始补救,而是在一个已经不错的底子上打磨。

歌曲《误差》

定位:更拟真的音色,编曲可以理解提示词的感觉

Minimal Electronic / Cosmic Pop。晶莹合成器脉冲、低频氛围无人声与极简电子纹理,描绘一座漂浮在沉睡星球轨道上的空间站,冰冷、空旷、遥远。整体像隔着舷窗凝望深空,缓慢、克制、沉思,充满失重感与未知感。 Minimal Electronic / Cosmic Pop,Featuring crystal-like synth pulses, soft sub drones, minimal electronic textures, and vast spatial reverb. A cold and distant soundscape inspired by a drifting orbital station, creating a feeling of weightlessness, isolation, and quiet contemplation.

歌曲《Still in the Room》

定位:更稳定的编曲,完整的编曲,模型可以完整的捕捉曲风。

提示词:Dream Pop。混响吉他、漂浮感男声与柔和氛围合成器营造朦胧梦境质感,温暖贝斯和松弛鼓组支撑空间感,整体像私人房间里的夜晚独处,迷离、内省、温柔而有距离感。

Prompt:Dream Pop, featuring reverb-rich guitars, floating male vocals, soft atmospheric pads, warm bass, and restrained drums. A hazy and intimate soundscape with a private studio feeling, blending dreamy textures, emotional distance, and gentle melodic hooks.

方向性数据也支持这个判断。此前一轮 100 首实验中,推理扩展把听感良品率从 35% 提到了 43%,综合可用率从 35% 提到 39%。这说明更充分的音乐 CoT 加 test-time scaling 这条路有继续提升质量的潜力。

(评测范围:100 首歌曲样本。数字来自同一轮候选对照;" 更有人味、更少 AI 味 " 来自评审对样本的回扫归因,是对音乐形态、编配克制和真实感的综合判断,不是由单一数值直接定义。)

当然,这个结果是基于前期底座的,只是用来验证技术方向,不代表新版 V9.5 下的最终 O3 指标。

V9.5 负责把歌做得更自然,O3 负责交付前多看多想多修一遍。两个组合在一起,实现的是一件事,从一次性生成跨到完整思考打磨,把复盘、修正、收敛的流程嵌进模型生成的每一步。

三、从 0 到 1 到行业登顶,一条自主可控的技术路线

Mureka V9.5 的克制和真实感不是这一代突然冒出来的。

Mureka 是昆仑万维天工 Skywork AI 自研的,国内最早实现端到端落地的通用 AI 音乐大模型。从 2 年前开始投入,2024 年初初代产品 SkyMusic 1.0 内测,打通了文本转歌曲、多乐器伴奏、人声合成的完整闭环,完成从 0 到 1 的落地,也开启了国内通用 AI 音乐工业化的探索。

一年后,Mureka V6 加 O1 正式发布,全球首次落地 MusiCoT 音乐思维链框架,颠覆了逐帧生成的逻辑,先规划全曲结构再填充细节。同步推出的初代推理增强 O 系列支持 10 种语言词曲生成,覆盖流行、摇滚、爵士、电子等全品类,上线后迅速积累了全球数百万创作者用户。到 2025 年底的 V7.6 加 O2 迭代,重点优化了人声质感、混音声场和提示词理解精度,大幅降低了模板化编曲问题,同时开放完整 API 生态,服务全球数千家企业开发者,落地短视频、游戏、播客、影视配乐等商用场景。

真正的转折出现在 2026 年初。Mureka V8 在国际权威 AI 音乐评测榜单拿下人声、器乐双榜第一,综合实力超越 Suno、Udio、Google Lyria 等海外主流竞品,完成了从可用到可直接商用发布的质变。MusiCoT 体系全面成熟,同步与太合音乐等头部音乐集团达成产业战略合作。同年 3 月 V9 亮相,进一步收紧编配逻辑,弱化过度堆叠的 AI 听觉特征,优化曲风辨识度和用户意图匹配度,为 V9.5 的真实感底座打下了基础。

到 7 月 V9.5 加 O3 组合登场,放弃堆砌声部制造饱满感的老路子,重构真实音乐创作的底层逻辑。O3 全新的反思式推理架构落地,试图从根上解决 AI 音乐结构割裂、情绪断层、表达失真的老问题。

横向对比的话,早期竞品大多靠加厚配器、密集声部来制造丰富感,旋律拥挤、人声被盖、段落无留白这些毛病很常见。Mureka 整条路线一直坚持模拟人类音乐人的创作逻辑,先全局结构,再局部细节。V9.5 和 O3 的组合把这条路线的优势进一步拉开了。

历史同口径评测数据显示,Mureka 系列在整体听感、成品音质、综合可用率上长期领先海外竞品 Suno V5.5,之前只在复杂提示词精准度上有点小差距,V9.5 已经把这块短板补齐了,曲风还原和提示词匹配都做到了同轮第一。

(历史竞品对照)

四、从 " 定稿创作 " 走向 " 版本化工作流 "

很长一段时间里,全球 AI 音乐行业的竞争焦点都停在声音多的层面上。Mureka V9.5 加 O3 的组合给出了另一种答案:AI 音乐的核心竞争力不是声音多,而是像人一样思考、创作、打磨。

对不同的人来说,这件事的意义不一样。对普通创作者,输入一段文字就能拿到人声自然、编曲有层次、情绪完整的歌,不需要后期花大量时间删多余声部、修僵硬人声。对专业音乐人,V9.5 的克制基底适合做创作草稿、副歌灵感、配乐基底,O3 的自我修正功能可以省掉反复试听调整的功夫。对企业客户,更高的综合可用率、稳定的音频健康度、精准的风格还原,短视频、游戏、影视、有声内容批量配乐的门槛和成本都在往下走。

但最值得关注的,其实是创作 Agent 带来的工作流变化。传统音乐创作和多数 AI 音乐工具,还是生成一首歌然后定稿的逻辑,创作本质上是个低频、高成本、看运气的事。

(一次对话,灵活调用所用能力)

Mureka 对创作的理解发生了根本变化,创作不再是写出一首歌,而是在版本空间里做选择、做判断、做迭代。

产品层面,这个理念落地成三个空间。探索空间,同一创意快速出多个版本,打开可能性。控制空间,在旋律、人声、结构等维度上局部保留和替换,精确到段。执行空间,Studio 把操作 DAW 变成指挥创作,门槛降了,上限升了。创作者可以把更多时间花在审美决策上,而不是反复试错。

创作 Agent 界面

从更大的视角看,Mureka 已经不是一个单一模型或功能,而是在长成一个平台。

内容形态是 AI 原生的,作品可以版本化、可以二创、可以持续进化,这跟传统音乐平台承载的内容形态天然不同。双边价值同时成立,对创作者提供效率、上限和工作流,对普通用户提供表达、参与和关系连接。商业模型也是三条线并行,订阅、创作工具 Studio、B 端分发加 API。

AI 重塑视频、游戏、音乐与全球文娱圆桌论坛照片

这次 WAIC 上,昆仑万维除了 Mureka V9.5,还同步发布了 Matrix-3.5 世界模型和 Riemann-1.0 底层底座,这次发布是昆仑万维在 "4+3"AGI 战略下的关键动作,即以四大 SOTA 模型为技术底座,支撑 AI 短剧、AI 音乐、AI 游戏三大 AI 原生平台经济体。

在同期举行的 AI 重塑视频、游戏、音乐与全球文娱圆桌论坛上,自己的 AI 音乐创作体验:" 我今天早上还让 Mureka V9.5 生成两首歌,很不错。一首是参照杨宗纬的《空白格》生成的抒情歌,另一首是模仿颜人中的风格,写了一首关于中年危机的歌。词写得挺触动人心的。"

随后,王珞丹也谈到了她与音乐人朋友的交流经历:" 我有个做音乐的朋友,他跟我分享了一个很有意思的案例。他在编曲环节把任务交给了 AI 软件,结果生成了两个完全不同的版本。他让我盲选,问我更喜欢哪一个。我选完之后,他才告诉我,我喜欢的那个版本其实是 AI 做的。"

从音乐到语言到多模态,一个完整的 AI Native 平台正在成形。Mureka 是这个平台上的音乐基础设施,也是目前感知度最高的入口之一。

Mureka 的长线目标非常明确,不把 AI 当成快速生成音乐的捷径工具,而是打造一套原生的 AI 多模态创作基础设施,让 AI 成为音乐人真正的创作伙伴。

未来 AI 音乐的竞争,最终比的也许不是谁家模型最大,谁能率先建起一套真正理解音乐审美、能持续自我进化、把好听变成可控系统能力的创作基础设施,谁就拿到了下一张门票。Mureka V9.5 加 O3 加创作 Agent 这一套组合拳,像是在回应这个行业正在发生的变化。(本文首发于钛媒体 APP)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容