Gemini能创作音乐?用户意外发现多模态AI隐藏能力

一个被忽视的AI能力
近日,一位Reddit用户分享了他的意外发现:谷歌的Gemini不仅能处理文本、图像和代码,竟然还具备创作音乐的能力,而且表现相当出色。这条帖子的标题直白而带着惊讶——"我完全不知道Gemini能创作音乐,更没想到它做得这么好。"
这一发现之所以引起讨论,是因为大多数用户对Gemini的认知仍停留在"聊天助手"或"文本生成工具"的层面。而音乐创作作为一项高度结构化又充满艺术性的任务,长期被认为是AI难以真正胜任的领域之一。音乐不同于自然语言——它同时包含横向的旋律进行(melody)和纵向的和声叠加(harmony),还有节奏(rhythm)、力度(dynamics)、音色(timbre)等多个维度的信息需要协调处理。一段好的音乐不仅要在局部保持和声的合理性,还需要在宏观层面具备起承转合的叙事结构,这使得音乐创作在计算复杂度和美学判断上都对AI提出了极高要求。
更深层来看,音乐创作的困难不仅在于多维信息的协调处理,还在于音乐具有高度的层次化结构。从微观的音符时值和音程关系,到中观的乐句、乐段划分,再到宏观的曲式布局,音乐是一种典型的层次化时序数据。此外,音乐的"正确性"判断远比自然语言更为模糊——同一段旋律在不同的文化语境、历史时期和音乐流派中可能被判定为优美或刺耳。这种评价标准的主观性和文化依赖性使得AI音乐创作缺乏类似BLEU分数(机器翻译评估)或FID分数(图像生成评估)那样被广泛接受的客观评价指标,目前学术界多依赖人类主观评测来衡量AI音乐的质量。

多模态AI的边界正在扩展
从文本到音乐的跨越
Gemini作为谷歌主打的多模态大模型,从设计之初就强调对多种数据类型的理解与生成能力。所谓多模态大模型(Multimodal Large Model),是指能够同时处理和生成文本、图像、音频、视频、代码等多种数据类型的人工智能模型。与早期只能处理单一模态的模型不同,多模态模型通过统一的架构将不同类型的数据映射到共享的表示空间中,使模型能够理解跨模态的关联。这种共享表示空间的概念可以这样理解:模型将一段悲伤的文字描述、一张阴郁的图片和一段小调音乐都编码为向量空间中相近区域的数学表示,从而"理解"它们在语义和情感上的共通性。
Gemini采用的原生多模态架构与此前主流的"拼接式"方案有本质区别。早期如GPT-4V等模型通常是在已训练好的文本大模型基础上,通过适配器(Adapter)或桥接模块将视觉编码器等其他模态组件接入,这种方式虽然有效但各模态间的理解深度存在差异。而Gemini从预训练阶段就将文本、图像、音频等多种模态数据混合输入,使用统一的Transformer架构进行端到端训练,使得模型内部形成了跨模态的深层关联表示。
Transformer架构的核心是自注意力机制(Self-Attention),它允许序列中的每个元素直接关注序列中的所有其他元素,从而捕捉长距离的依赖关系。在音乐场景中,这一特性尤为关键:一首曲子的第48小节可能需要回应第4小节提出的主题动机,传统的循环神经网络在处理这种跨越数百个时间步的依赖关系时往往力不从心,而Transformer的全局注意力机制天然适合捕捉音乐中主题的呈示、发展、再现等宏观结构。此外,Transformer使用的位置编码(Positional Encoding)能够为模型提供时序信息,帮助区分同一音符在不同节拍位置上的功能差异——例如强拍上的主音与弱拍上的经过音在音乐语法中扮演完全不同的角色。
值得注意的是,Transformer处理音乐时面临的一个关键技术挑战是上下文窗口长度的限制。一首4分钟的流行歌曲如果以每拍一个token的粒度表示,大约需要500个token;但如果以更细的粒度(如16分音符级别)表示,token数量可能达到数千甚至上万。近年来,长上下文Transformer(如Gemini 1.5支持的百万级token窗口)在解决这一问题上提供了可能性。Music Transformer(Google Brain, 2018)是将Transformer应用于音乐生成的早期重要工作,它引入了相对位置编码来更好地捕捉音乐中基于相对音程而非绝对音高的模式。
这意味着模型不仅能分别理解各模态,还能理解模态之间的对应关系——例如文字描述的情绪与对应音乐调式之间的映射。Gemini系列从训练阶段就采用了多模态数据的联合训练策略,而非像早期方案那样先训练文本模型再"嫁接"其他模态的能力,这种原生多模态的设计使其在跨模态理解和生成上具备更强的连贯性。
音乐创作实际上涉及多个层面的能力:对音乐理论的理解、对节奏与和声结构的把握、以及将抽象的情感需求转化为具体音符序列的能力。值得注意的是,AI音乐创作并非全新概念。早在2016年谷歌就推出了Magenta项目,探索机器学习在音乐和艺术中的应用;OpenAI的Jukebox(2020年)能生成带歌词的完整歌曲;Meta的MusicGen(2023年)可根据文本描述生成音乐片段。但这些通常是专门训练的音乐生成模型。
从技术路线来看,AI音乐生成经历了从符号化方法到端到端生成的演进。早期方法如Magenta基于循环神经网络(RNN)生成MIDI序列,本质上是在符号层面(音符、节拍、力度)进行创作。MIDI(Musical Instrument Digital Interface,乐器数字接口)是1983年由音乐设备厂商联合制定的一种通信协议和数据格式标准,它不存储实际的声音波形,而是记录"在什么时间、以什么力度、演奏什么音高、持续多长时间"等指令信息。一个MIDI文件可能只有几十KB,但包含的音乐结构信息足以驱动任何兼容的合成器或虚拟乐器进行演奏。正因为MIDI的这种符号化特性——它本质上是一种与乐谱等价的离散化表示——使其成为AI音乐研究的理想起点:模型可以像处理文本中的词语token一样处理MIDI中的音符事件,将音乐创作转化为序列预测问题。
后来的方法如OpenAI的Jukebox直接在原始音频波形层面生成,能产出更自然的声音但计算成本极高。2023年后的主流方案如MusicGen和Stable Audio采用了音频编解码器(如EnCodec)将音频压缩为离散token序列,再用类似语言模型的方式进行自回归生成,实现了质量与效率的平衡。EnCodec是Meta于2022年推出的神经网络音频编解码器,其核心技术是残差向量量化(Residual Vector Quantization, RVQ)。它首先通过编码器网络将原始音频波形压缩为低维连续表示,然后通过多层级的向量量化将其离散化为一系列codebook索引(类似于文本中的token ID)。每一层量化器负责捕捉上一层未能精确表示的残差信息,层数越多,重建音频的保真度越高。通过这种方式,一段数秒的高质量音频可以被压缩为仅数百个离散token,使得原本需要处理每秒44100个采样点的音频生成问题,被简化为处理每秒仅约50个token的序列生成问题,计算量降低了近三个数量级。
EnCodec所代表的神经网络音频编解码器技术不仅改变了AI音乐生成的技术路线,还对音频传输、存储和流媒体行业产生了深远影响。传统音频编解码器如MP3、AAC基于心理声学模型进行有损压缩,而神经网络编解码器通过学习音频数据的统计规律来实现更高效的压缩。在极低比特率(如1.5kbps)下,EnCodec的音质显著优于传统编解码器。Google的SoundStream和微软的模型也采用了类似架构。这种将连续信号离散化为token的思路已成为音频、视频等多种模态与大语言模型对接的标准范式。
Gemini的音乐能力具体采用哪种技术路线尚未公开,但其通用多模态架构意味着它可能同时具备符号层面(生成乐谱、和弦标记)和描述层面(用文字解释音乐结构)的能力。
Gemini的不同之处在于,它作为一个通用大模型,在音乐创作上也展现出能力,这意味着其训练数据中可能包含了大量音乐理论、乐谱、MIDI数据等音乐相关信息,模型在预训练过程中"习得"了音乐结构的规律。互联网上存在大量结构化的音乐知识资源——从音乐理论教材、和声学课程、乐器教程到海量的吉他谱和钢琴谱网站(如Ultimate Guitar、MuseScore社区),以及学术论文中对音乐结构的形式化分析。这些数据使得足够大的语言模型有可能在预训练过程中隐式地建立起对调式体系、和弦功能、曲式结构等音乐基本原理的"理解",即使模型从未被明确教导过"属七和弦应当解决到主和弦"这样的规则。
从用户反馈来看,Gemini在处理音乐相关任务时,不仅能生成乐谱、和弦进行,还能根据用户描述的风格与情绪进行创作。这种"cook"(俚语,意为表现惊艳、发挥出色)的评价,反映出模型在音乐创作这一垂直场景下的实际表现超出了用户预期。
为什么用户此前不知道Gemini能作曲?
你可能没注意到,这类能力往往并未被厂商大力宣传。大模型的能力边界通常远超其官方文档描述的范围,很多功能是用户在实际使用中"意外挖掘"出来的。
这涉及到大语言模型研究中一个重要概念——"涌现能力"(Emergent Abilities)。它指的是模型在规模达到一定阈值后,突然表现出训练阶段未被明确设计的能力。这种现象最早由Google Research团队在2022年的论文《Emergent Abilities of Large Language Models》中系统性地描述,研究者发现在算术、多语言翻译、逻辑推理等数十项任务上,模型性能会在参数量突破特定规模后出现急剧提升。由于模型参数规模巨大、训练数据涵盖极其广泛,其能力边界往往连开发者也无法完全预测。
涌现能力的理论解释目前仍无定论。一种主流假说认为,大模型在训练过程中形成了分层的内部表示:底层编码表面模式(如音乐中的音程关系),中层编码抽象规则(如和声进行规律),高层编码跨领域的结构性知识(如叙事张力的构建方式)。当模型规模不足以支撑完整的分层表示时,高层能力无法展现;一旦规模突破阈值,这些高层抽象能力便"涌现"出来。这种解释类似于物理学中的相变现象——水在99°C和100°C之间看似只有1度之差,却经历了从液态到气态的质变。
值得一提的是,涌现能力这一概念虽被广泛讨论,但在学术界存在争议。2023年斯坦福大学的研究者Rylan Schaeffer等人发表论文《Are Emergent Abilities of Large Language Models a Mirage?》指出,所谓的涌现现象可能部分是评估指标选择的产物——当使用非线性或阈值型评估指标(如精确匹配准确率)时,模型性能看起来像是突然跃升,但如果换用连续性更好的指标(如Brier分数或对数概率),能力提升往往是渐进的。这场学术争论的实质是:大模型的能力增长究竟是量变到质变的"相变"现象,还是平滑增长在特定观测方式下的视觉错觉?
尽管如此,大模型确实存在大量未被系统测试和记录的能力,这些能力的发现高度依赖用户的创造性探索。这也引出了AI安全领域的一个重要议题:如果模型的能力边界无法被完全预测,那么如何确保其不会产生意外的有害输出?
因此,社区用户通过各种提示词实验来"探测"模型能力就成为了一种重要的知识生产方式。Reddit、Twitter等平台上涌现的大量使用技巧分享,本质上就是一种分布式的模型能力审计。这种社区驱动的审计方式与AI公司内部进行的红队测试(Red Teaming)形成了互补。红队测试是指由专门团队系统性地尝试突破模型的安全限制或发现其意外行为,而社区审计则具有更大的规模和更强的创造性——数百万用户在各自不同的使用场景中自然而然地探索模型边界,这种"众包式"的能力发现效率远超任何内部测试团队。OpenAI、Anthropic等公司已开始建立正式的社区反馈渠道和Bug Bounty计划,将用户发现的意外能力和安全问题纳入模型迭代的参考依据。
这也是当前生成式AI的一个有趣特征:模型的潜在能力常常需要社区去探索和验证。
这对普通用户意味什么
AI降低音乐创作门槛
如果Gemini能够辅助音乐创作,那么对于没有专业音乐背景的普通人来说,这无疑降低了表达创意的门槛。用户可以通过自然语言描述想要的旋律风格、情绪基调,让AI给出初步的创作方案,再进行调整和完善。
这与AI在绘画、写作等领域的应用逻辑一致——AI并非取代创作者,而是作为一个强大的协作工具,帮助人们更快地将脑海中的想法落地。正如Photoshop的出现并未消灭画家,而是创造了数字艺术这一全新品类,AI音乐工具也可能催生新的音乐创作范式,让更多人参与到音乐表达中来。历史上,每一次音乐技术革命都伴随着创作民主化的浪潮:1980年代MIDI和电子合成器的普及催生了电子音乐这一全新流派;2000年代数字音频工作站(DAW)如Ableton Live和FL Studio使卧室音乐人成为可能,直接推动了独立音乐和Lo-Fi等文化运动的兴起;如今AI音乐工具正在开启下一轮变革,将创作的技术门槛进一步降至"用自然语言描述"的水平。
当前AI音乐创作领域已形成多层次的产品生态。专业级工具如Suno和Udio可以根据文本提示生成完整歌曲(含人声和乐器),月活用户已达数百万;辅助创作工具如AIVA和Amper Music面向影视配乐和游戏音效等B端市场;而Gemini这类通用大模型则代表了第三种路径——将音乐能力作为通用智能的一部分自然具备。这三种路径各有侧重:专业音乐生成工具在音频质量和音乐完整性上更具优势,但使用场景较为单一;B端辅助工具强调与现有工作流的整合和定制化;通用大模型则胜在灵活性和可交互性——用户可以与Gemini就音乐创作进行多轮对话,逐步细化需求,这种交互模式更接近人类与音乐制作人之间的沟通方式。
AI音乐创作的商业化路径正在快速分化。2024年,Suno完成了1.25亿美元的B轮融资,估值达到5亿美元,其商业模式以C端订阅为主(月费8-48美元不等)。AIVA则走B端授权路线,为企业提供免版税的AI配乐服务。另一种新兴模式是"AI辅助版税分成"——平台如Boomy允许用户用AI生成音乐并上传至流媒体平台分享收入,截至2024年已有超过1500万首AI辅助创作的歌曲通过该平台发布。这种模式虽然引发了关于音乐价值稀释的争议,但也确实让更多非专业人士获得了音乐发行的机会。
据Goldman Sachs 2023年的报告估算,生成式AI可能影响音乐产业约600亿美元的市场规模。Spotify等流媒体平台已开始制定针对AI生成音乐的政策,部分平台对纯AI生成内容进行标记或限制其参与版税分配。2024年初,Spotify移除了数万首被认定为AI生成的"功能性音乐"曲目(如白噪音、冥想音乐),原因是这些低成本批量生成的内容稀释了真实音乐人的流量和收入。这场关于AI音乐在流媒体生态中定位的博弈,折射出技术进步与既有商业模式之间的深层张力。
需要理性看待AI音乐的局限
当然,也需要对这类惊喜发现保持理性。单一用户的体验分享难以代表模型的稳定表现,AI生成的音乐在原创性、复杂度和艺术价值上仍存在争议。目前这类能力更适合作为创意起点或辅助工具,而非完整的专业级创作方案。
从技术层面看,当前AI音乐生成仍面临几个核心挑战:一是长期结构的连贯性——AI往往擅长生成听起来悦耳的短片段,但在构建完整的曲式结构(如奏鸣曲的呈示-展开-再现)时仍显不足;二是风格的精确可控性——用户很难精确指定"介于爵士蓝调和bossa nova之间、带有少许电子元素"这样的细粒度风格需求;三是音乐的情感深度——AI可以模仿悲伤或欢快的音乐模式,但能否创造出真正触动人心、具有艺术突破性的作品,仍是一个开放性问题。这些局限与AI在其他创意领域面临的挑战相似:模型擅长模式的识别和重组,但在需要真正理解和创新的任务上仍有差距。
此外,AI音乐创作还牵涉版权、训练数据来源等一系列尚未完全厘清的问题。这些争议主要集中在两个层面:一是训练数据的合法性——AI模型是否有权使用受版权保护的音乐作品进行训练;二是生成作品的权利归属——AI创作的音乐是否享有版权保护,如果享有,版权归用户、AI开发商还是训练数据的原始创作者。2023年,美国版权局明确表示纯AI生成的作品不受版权保护,但人类与AI协作创作的作品中人类贡献的部分可以获得保护——这一裁定首次出现在漫画《Zarya of the Dawn》的版权案中,并逐步延伸至音乐领域。
环球音乐集团等主要唱片公司已对多家AI公司提起诉讼,指控其未经授权使用版权音乐进行训练。2024年,环球、索尼和华纳三大唱片公司联合对Suno和Udio提起大规模诉讼,索赔金额高达数十亿美元。与此同时,全球各地的法律框架对此问题的态度差异显著:日本在2018年修订的《著作权法》中为AI训练提供了极为宽松的例外条款,允许以非享受目的使用受版权保护的作品进行训练;欧盟的《人工智能法案》和《数字单一市场版权指令》则采取了更为审慎的态度,要求AI公司披露训练数据来源,并允许权利人通过"选择退出"机制阻止其作品被用于AI训练;中国的《生成式人工智能服务管理暂行办法》要求训练数据来源合法且尊重知识产权,但具体的执行标准仍在探索中。这些都是行业需要持续面对的课题。
结语
Gemini能创作音乐这一发现,再次提醒我们:当下的多模态大模型能力远比大多数人想象的更广泛。多模态AI正在不断打破"文本-图像-音频"之间的界限,向着更通用的方向演进。
对于用户而言,与其等待厂商公布所有功能,不如主动探索和尝试——你可能会像这位Reddit用户一样,发现AI"隐藏"的惊喜能力。而对于整个行业来说,这种由社区驱动的能力发现,也正是生成式AI生态活力的重要来源。
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
