开放 API 能做什么:音乐生成、精调与语音合成的接口版图
除了面向创作者的产品界面,这个平台还提供面向企业与开发者的 API,把音乐大模型的能力接进第三方产品。以下按官方 API 平台文档口径整理。
标准音乐生成接口
官方文档列出的四大标准能力:
- 歌曲生成(Song Generation):传入歌词与风格描述,异步生成完整歌曲任务;
- 伴奏生成(Instrumental Generation):纯音乐编曲输出;
- 歌词生成(Lyrics Generation):按主题产出歌词文本;
- 歌曲续写(Song Extension):对已有音频做结构扩展。
此外还包括:单轨生成(为已有音频补人声、伴奏或指定乐器轨)、分轨下载(拆分独立轨道)、以及图片视频配乐(解析画面场景、情绪与节奏生成匹配音乐)。
模型精调
拥有大批量风格一致曲目的团队可以走精调(Fine-tuning)路线:按官方文档,提供约 200 首特征一致的曲目,即可让模型稳定产出该风格的歌曲,适合需要批量生产同风格音乐的业务。
语音合成套件
- 文本转语音(TTS):多种预置说话人音色,官方技术报告称其在横向评测中与一线厂商处于同一梯队,接口细节见语音合成与播客 API;
- AI 语音播客:输入双人对谈台词,直接生成完整连续的长音频对谈节目;
- 精品说话人:面向客服、有声书等场景的预置音色库。
计费与接入
API 按生成时长与模型计费,TTS 与播客接口按小时计价;具体价格、并发限制与模型版本以官方 API 平台的定价页实时显示为准。注册、密钥与首个请求的完整步骤见第一个生成请求怎么发。
接口范围与能力边界可能随版本调整,生产接入前以官方开发者文档为准。