谷歌音乐大模型Lyria 3.5来了:一键生成三分钟完整歌曲,人声逼真到惊人

2026年9月,谷歌DeepMind正式将音乐大模型Lyria 3.5全面接入Gemini应用与API,这是继7月底登陆Google Flow Music后的最大规模推送。作为谷歌目前音质最佳的音乐生成模型,Lyria 3.5支持44.1kHz立体声输出、最长三分钟完整曲式结构(主歌-副歌-桥段),并在人声表现、旋律编排与创作控制三大维度实现了跨越式提升。更值得关注的是,Lyria 3.5仅使用授权数据训练,所有生成内容均嵌入SynthID隐形水印——在Suno、Udio深陷版权诉讼的当下,谷歌试图以合规路线重新定义AI音乐生成的游戏规则。

Lyria 3.5是什么?谷歌DeepMind的旗舰音乐大模型
Lyria是谷歌DeepMind专为音乐创作设计的深度生成架构。从早期的AudioLM、MusicLM,到2023年底与YouTube“Dream Track”合作的初代Lyria,谷歌一直在解决AI生成音乐中的连贯性与听感拟真度问题。2026年2月,谷歌推出Lyria 3,支持通过文字或图片生成最长30秒歌曲并整合至YouTube Shorts的Dream Track功能;3月又发布Lyria 3 Pro,将生成时长扩展至3分钟。
而音乐大模型Lyria 3.5则是这一系列中真正的分水岭。2026年7月29日,谷歌在官方博客宣布在Google Flow Music中推出Lyria 3.5。同年9月4日,谷歌将Lyria 3.5全面接入Gemini应用(Web端和移动端)及Gemini API,同时面向开发者开放Google AI Studio和Google Vids。这意味着任何用户都可以通过Gemini直接调用这个音乐大模型来创作歌曲。
音乐大模型Lyria 3.5的核心技术架构
底层架构:Latent Diffusion的音频进化
根据DeepMind官方发布的Model Card,音乐大模型Lyria 3.5采用latent diffusion(潜在扩散)架构,应用于时间音频潜在空间进行扩散生成。训练数据为带有不同粒度文本标注的音频数据。模型通过有监督微调(SFT)结合人类反馈与Critic反馈的强化学习进行后训练。
硬件层面,Lyria 3.5使用谷歌的Tensor Processing Units(TPU)进行训练,软件层面采用JAX和ML Pathways。这种架构使其能够在保持音频连贯性的同时,支持最长三分钟的完整歌曲生成。
两大核心端点:灵活适配不同场景
音乐大模型Lyria 3.5通过两个核心端点提供服务:
- lyria-3.5(完整版) :生成包含完整曲式结构(主歌、副歌、桥段)的最长3分钟歌曲,44.1kHz立体声MP3或WAV格式输出
- lyria-3-clip-preview(预览版) :生成30至60秒的音乐片段,适合快速原型制作
用户可在30秒至3分钟之间任意指定时长。
多模态输入:文字+图片双驱动
音乐大模型Lyria 3.5不仅支持文字提示词(描述曲风、乐器、BPM与情绪),还支持上传最多10张图片,由视觉画面的色彩、场景与光影激发编曲风格。这一多模态能力将音乐大模型的创作入口从纯文本扩展到了视觉灵感层面。
Lyria 3.5的音乐性突破:从片段到完整歌曲
旋律结构:告别“从头到尾一个节奏”
传统AI音乐最被诟病的问题是“从头到尾同一个节奏循环”。音乐大模型Lyria 3.5在音乐性方面的核心突破,在于能生成结构更丰富、更复杂且听感更自然的旋律。
用户可以在提示词中使用结构标签引导歌曲发展——带有时间戳的[Verse](主歌)、[Chorus](副歌)、[Bridge](桥段)标签。模型能理解复杂的和声结构,让曲目在段落之间自然过渡,在延长的时间跨度内保持结构连贯性。简单说,音乐大模型Lyria 3.5生成的是一首“有开头、有发展、有高潮、有结尾”的完整歌曲,而非一段循环播放的旋律片段。
44.1kHz CD级立体声:音质跨越式升级
音乐大模型Lyria 3.5输出44.1kHz CD级立体声采样率。这摆脱了过往音频模型常见的单声道低频混浊或高频失真问题,呈现开阔的声场定位。官方评估显示,Lyria 3.5在音频保真度上相比Lyria 2有显著提升。
Lyria 3.5的人声革命:AI唱歌终于像真人了
情感表达与发音准确率
音乐大模型Lyria 3.5最大的升级在于人声。谷歌称,新模型生成的人声拥有更自然、更具情绪表达力的演唱效果,同时改善了发音准确率,使AI演唱更加接近真人。
具体来说,Lyria 3.5的人声突破体现在三个层面:
- 情感层次更细腻:不再是机械的平铺直叙,而是能模仿细微的人类声音变化
- 发音更准确:大幅降低传统AI歌声常见的吞字或发音模糊现象
- 多语言支持:支持八种语言的歌词生成与演唱
有评测者反馈,Lyria 3.5的人声高频毛刺感相比之前版本有明显改善。甚至有测试显示,Lyria 3.5能够比较清晰地演唱印尼语歌词——这对于跨语种的音乐创作者而言意义重大。
结构化人声稳定性
音乐大模型Lyria 3.5还解决了旧版本生成长音频时的关键痛点——“副歌无法复现”或“后半段音质崩溃”的问题。人声咬字与结构过渡更贴合实际歌曲设计,使得整首歌从第一句到最后一句保持一致的演唱质量。
Lyria 3.5的创作控制:让AI成为创作伙伴
节奏、时长与段落控制
音乐大模型Lyria 3.5赋予创作者更灵活的控制能力:
- 节奏控制:用户可直接设定歌曲的BPM(每分钟节拍数)
- 时长控制:在30秒至3分钟之间精确指定
- 段落控制:通过时间戳标签指定[Verse]、[Chorus]、[Bridge]等结构
Flow Music的精细化编辑生态
音乐大模型Lyria 3.5搭载于Google Flow Music平台。作为谷歌旗下的AI音乐创作平台,Flow Music提供多项编辑功能:
- 修改曲目特定段落
- 重写或翻译歌词
- 更换乐器
- 在不破坏整曲结构的前提下调整节拍
- 单独调整人声、鼓点和贝斯等独立轨道
音乐大模型Lyria 3.5还支持导出独立的人声、鼓和贝斯分轨,专为干净的分轨拆分工作流而设计。用户可以通过自然语言持续修改歌曲,对旋律、歌词、风格、节奏以及整体氛围进行迭代,而无需每次重新生成整首歌曲。谷歌希望借助Lyria 3.5让AI更像创作伙伴,而不仅仅是一次性的音乐生成工具。
横向对比:Lyria 3.5 vs Suno vs Udio
在AI音乐生成赛道,音乐大模型Lyria 3.5面临的主要竞争对手是Suno和Udio。以下为详细横向对比:
| 对比维度 | 谷歌Lyria 3.5 | Suno(v4/v5.5) | Udio |
|---|---|---|---|
| 发布时间 | 2026年7月29日(Flow Music)/ 2026年9月4日(Gemini) | v4: 2024年11月 / v5.5: 2026年 | 2024年 |
| 最长曲目 | 3分钟 | 约4分钟(v4)/ 约8分钟(v5.5顶配) | 约2分钟 |
| 音频质量 | 44.1kHz立体声 | 44.1kHz | 32kHz |
| 人声表现 | 八种语言,情感细腻、发音准确 | 行业标杆级人声(2024年标准) | 人声表现中等 |
| 分轨导出 | 人声、鼓、贝斯独立分轨 | 仅Suno Studio顶配支持12轨 | 不支持 |
| 创作控制 | 段落标签+时间戳+BPM+时长控制 | Extend、Cover、Persona、Remaster | 基础控制 |
| 水印 | SynthID隐形水印(全部输出) | 有水印(部分版本) | 有水印 |
| 训练数据 | 仅使用授权数据(谷歌声明) | 面临Sony Music版权诉讼 | 面临Sony Music版权诉讼 |
| 免费额度 | Flow Music注册送500积分(约15-50首) | 每日50积分 | 有限免费 |
| 付费方案 | Starter $6/月 | Pro $10/月、Premier $30/月 | Standard $10/月、Pro $30/月 |
| 平台生态 | Gemini App + Google AI Studio + Google Vids + Flow Music | 独立App + Web | 独立App + Web |
| 独立评测排名 | 易用性首选 | 综合最佳 | 排名靠后 |
从对比中可以清晰看到,音乐大模型Lyria 3.5在音频质量(44.1kHz)、分轨导出、创作控制和版权合规方面具有明显优势;Suno在曲目长度和人声基准方面仍保持竞争力;而谷歌最大的差异化优势在于其生态系统整合与合规训练数据。
版权与合规:Lyria 3.5的护城河
授权数据训练:与Suno/ Udio的本质区别
音乐大模型Lyria 3.5最引人注目的声明在于训练数据来源。谷歌表示,Lyria 3.5仅使用授权内容训练——具体而言,使用的是谷歌和YouTube“根据其服务条款、合作伙伴协议和适用法律有权使用”的素材。
这一声明的背景至关重要。Suno和Udio目前正面临Sony Music的版权诉讼。2026年3月,美国各地的独立音乐人还对谷歌提起诉讼,指控其使用从YouTube未经授权获取的受版权保护的录音来训练Lyria 3。而音乐大模型Lyria 3.5明确打出“仅授权数据”的标签,试图在版权争议中建立护城河。
SynthID隐形水印:每一首都有“身份证”
音乐大模型Lyria 3.5生成的所有音频均通过Interactions API统一调度,并嵌入SynthID隐形水印。SynthID是谷歌DeepMind开发的数字水印技术,具备以下特性:
- 人耳无法察觉
- 可抵抗压缩、重采样等常见音频处理
- 可在扬声器播放后依然保留
- 用于版权追踪与内容溯源
这意味着每一首由音乐大模型Lyria 3.5生成的歌曲都有一张不可伪造的“身份证”。
安全过滤:阻止侵权请求
音乐大模型Lyria 3.5还内置了安全过滤器,阻止以下类型的请求:
- 请求生成特定艺术家声音的提示词
- 请求生成受版权保护的歌词
这些措施共同构成了音乐大模型Lyria 3.5在版权与合规层面的完整防线。
行业影响:Lyria 3.5如何改变AI音乐格局
谷歌的“清白”入场
AI音乐市场此前主要由Suno和Udio两家公司塑造,而它们一直在多条法律战线上同时作战。这限制了它们能公开做什么,也影响了唱片公司如何与它们打交道。
一个资金充裕的第三方入场者改变了市场格局。谷歌能够吸收初创公司无法承受的法律风险,而且它进入市场时没有背负Suno现在所面临的既有判决和诉讼。对于音乐制作者而言,这意味着AI音乐工具不再是两强争霸——音乐大模型Lyria 3.5的入场,使AI音乐的制作条款将由一家具有更大议价能力的公司来重新谈判。
市场数据:AI音乐的规模
据报告,Deezer平台上超过一半的新上传内容是AI生成的。每天约有9万首完全由AI生成的曲目,占总收听量的1%至3%。AI生成的音乐已经超过了人类创作的新音乐数量。音乐大模型Lyria 3.5以谷歌的规模进入这一市场,无疑将加速这一趋势。
对专业音乐制作的影响
工程师们持续争论AI是否会取代音乐制作人。争论的核心始终是同一个问题:重要的不是输出质量,而是能否说清楚它的来源。音乐大模型Lyria 3.5通过SynthID水印和授权数据训练,试图回答的正是“来源”问题——至少在谷歌的体系内,每一首AI歌曲都可以被追溯。
Lyria 3.5的局限与挑战
质量是宣称的,而非实测的
音乐大模型Lyria 3.5发布时,谷歌并未公布任何基准测试数据——没有听感测试得分,没有效率数据,没有正面交锋对比。质量是宣称出来的,而非实测出来的。在唯一追踪这一领域的独立排行榜——Artificial Analysis Music Arena(真实听众在盲测中投票)中,Lyria 3.5甚至尚未被收录。
专业制作的差距
对于需要分轨混音或多轮局部精细微调的专业音乐制作人来说,音乐大模型Lyria 3.5目前“单轮提示词生成”的架构仍有进化空间。有评测指出,目前最大的问题仍是长篇幅的结构控制,纯靠它直接出成品还需要多次尝试。
训练数据的透明度
尽管谷歌声称音乐大模型Lyria 3.5仅使用授权数据训练,但具体使用了哪些数据并未详细披露。更干净的合法立场并不等同于已披露的立场。在版权问题日益敏感的AI音乐领域,透明度仍是音乐大模型Lyria 3.5需要面对的挑战。
如何体验Lyria 3.5
音乐大模型Lyria 3.5目前可通过以下渠道体验:
- Gemini应用(Web端和移动端):全球用户均可使用,可选择流派、人声或纯音乐模式,使用新模板快速开始创作
- Google Flow Music:面向艺术家和AI创作者的专业创作平台
- Google AI Studio:面向开发者的API接入
- Google Vids:视频制作场景中的音乐生成
在Gemini应用中,用户可生成背景音乐、品牌广告配乐及个性化铃声等。
未来展望:Lyria 3.5之后的音乐大模型
音乐大模型Lyria 3.5的发布标志着谷歌在AI音乐生成领域从“追赶者”转变为“规则制定者”。在五个月内连续推出Lyria 3、Lyria 3 Pro和Lyria 3.5三个版本,谷歌的迭代速度令人瞩目。
然而,真正的竞争才刚刚开始。Suno已经拥有约200万付费订阅用户和约3亿美元年度经常性收入。音乐大模型Lyria 3.5虽然背靠谷歌的生态与资源,但要在用户规模和品牌认知上赶上Suno,仍需时间。
更深远的问题是:当AI生成的音乐已经超过人类创作的数量,当每天有9万首AI歌曲被上传到流媒体平台,音乐产业将如何重新定义“创作”与“版权”的边界?音乐大模型Lyria 3.5给出的答案是:水印、授权与合规。这是否能成为行业标准,取决于整个生态系统的选择。
常见问题(FAQ)
Q1:Lyria 3.5和Lyria 3有什么区别?
Lyria 3于2026年2月发布,支持生成最长30秒的音乐片段。Lyria 3.5于2026年7月发布,支持生成最长3分钟的完整歌曲(含主歌、副歌、桥段),在人声表现、旋律编排和创作控制上均有大幅提升。
Q2:Lyria 3.5是免费的吗?
Lyria 3.5可通过Gemini应用免费使用。在Google Flow Music中,注册时提供500点免费额度(约可生成15至50首歌曲),付费方案为Starter每月6美元起。
Q3:Lyria 3.5生成的音乐有版权问题吗?
谷歌声明Lyria 3.5仅使用授权数据训练。所有生成内容均嵌入SynthID隐形水印,用于版权追踪与内容溯源。模型内置安全过滤器,阻止生成特定艺术家声音或受版权保护的歌词。
Q4:Lyria 3.5支持哪些语言?
Lyria 3.5支持八种语言的歌词生成与演唱。
Q5:Lyria 3.5和Suno哪个更好?
各有优势。Lyria 3.5在音频质量(44.1kHz)、分轨导出、创作控制和版权合规方面领先。Suno在曲目长度(最长约8分钟)和人声基准方面仍有竞争力。独立评测中,Suno为综合最佳,Lyria 3.5为易用性首选。
Q6:Lyria 3.5能生成多长的歌曲?
最长3分钟,用户可在30秒至3分钟之间任意指定时长。
Q7:Lyria 3.5在哪里可以使用?
Gemini应用(Web和移动端)、Google Flow Music、Google AI Studio和Google Vids。
Q8:Lyria 3.5生成的内容有AI水印吗?
有。所有生成内容均嵌入SynthID隐形水印,人耳无法察觉,可抵抗压缩、重采样等常见音频处理。
Q9:Lyria 3.5能导出分轨吗?
能。Lyria 3.5支持导出独立的人声、鼓和贝斯分轨。
Q10:Lyria 3.5的训练数据来源是什么?
谷歌声明Lyria 3.5仅使用授权数据训练——即谷歌和YouTube根据服务条款、合作伙伴协议和适用法律有权使用的素材。具体数据集未完全披露。

