Stable Audio 3.0 概览
Stable Audio 是 Stability AI 推出的生成式音频产品,用于生成音乐和音效。据官网介绍,Stable Audio 3.0 是一个在完全授权数据上训练的模型系列,旨在成为音频社区后续构建的基础。该系列包含多个模型,其中三个为开放权重,可免费下载和构建。
模型家族
Stable Audio 3.0 提供多种模型以适应不同用例:
- Stable Audio 3.0 Large:最新音频模型,面向企业级声音制作。
- Stable Audio 3.0 Medium:支持完整歌曲创作,开放权重。
- Stable Audio 3.0 Small 与 Small SFX:针对移动设备优化,开放权重。
主要特性
据官网介绍,Stable Audio 3.0 模型可生成具有复杂动态音乐结构的完整曲目,时长可达六分钟,并具备领先的推理速度。模型支持音效(SFX)到音乐创作等多种用途。官网强调“生成是过程的开始,而非结束”,模型设计注重艺术家优先的可控性,支持编辑选项以修改曲目片段、重做部分歌曲或扩展作品,并具有强大的提示词遵循能力,确保输出符合正确的流派和风格。
部署与使用方式
Stable Audio 可通过多种渠道使用:
- Stable Audio App:网页应用,可立即开始生成音乐。
- Stability AI API:访问最新模型,用于托管和集成到应用中。
- 开源下载:可下载 Stable Audio 3.0 Small 和 Medium 的权重。
- 企业许可:可在自有基础设施上部署,并提供定制和支持选项。
此外,Stable Audio 还提供 DAW 插件(macOS AU 和 VST3,兼容 Logic Pro 和 Ableton Live 等主流 DAW),并支持通过 fal、Replicate 和 ComfyUI 等合作伙伴平台使用。
许可与商业化
据官网介绍,Stable Audio 3.0 模型在完全授权的数据集上训练,商业上安全。根据 Stability AI 社区许可,用户拥有其输出,并可自由分发和商业化。年收入超过 100 万美元的组织需使用企业许可,该许可包含法律赔偿和定制支持。
技术背景
根据 Stability AI 的研究,Stable Audio 3 是一系列快速潜在扩散模型,基于新颖的语义-声学自编码器(SAME)构建,将音频投影到紧凑的潜在空间,并通过对抗性后训练减少推理步骤,同时提高保真度和提示词遵循能力。据称,模型可在 H200 GPU 上于两秒内生成音乐和声音,在 MacBook Pro M4 上仅需几秒。
Stable Audio 的早期版本包括 1.0(2023 年 9 月推出,据称是首个商业可行的 AI 音乐生成工具)和 2.0(2024 年 4 月推出,可生成最长三分钟的完整曲目,并支持音频到音频生成和风格迁移)。Stable Audio 2.5 被定位为面向企业级声音制作的模型,增加了更快的推理速度和音频修复功能。
相关导航
数据评估
关于Stable Audio特别声明
本站深度导航提供的Stable Audio都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。



