语音合成与双人对谈播客 API:从文本到长音频
除音乐生成外,平台还提供一套语音合成(TTS)接口,覆盖从单条语音到整期播客节目的生产需求。
文本转语音接口
按官方接口文档,核心规格如下:
- 输入文本:单次请求最大 500 字符,长文本需分段调用再拼接;
- 说话人选择:通过预置音色参数指定说话人(官方文档列举了多个英文音色名),音色参数与其他细粒度控制参数互斥——选了其一就不能同时选另一组;
- 调用方式:与其他生成接口一致,走密钥认证与任务化流程,见第一个生成请求怎么发。
双人对谈播客接口
输入双人对谈的台词脚本,直接生成完整连续的长音频对谈节目——不需要分别合成再剪辑拼接。适合:
- 新闻与评论类播客的自动化生产;
- 有声内容的对话体改编;
- 客服与培训场景的多人对话素材。
计费口径
官方定价页按生成时长计价:TTS 与播客接口分别对应不同的小时单价,并发能力随档位配置。当前具体价格以官方 API 平台定价页实时显示为准。
与创作端的关系
- 网页版也有语音入口:创作端的语音合成走订阅体系,订阅档位包含每月语音合成时长额度(不同档位额度不同,以订阅页为准),见免费版、Pro 与 Premier 对比;
- API 走独立计费:开发者接入不占用创作端订阅额度,两套体系分开核算;
- 官方技术报告中将 TTS 与播客列为平台级能力,并提及与多家一线厂商的横向评测表现,细节以其技术报告页为准。
接口参数、音色清单与并发限制可能随版本更新,生产接入前以官方开发者文档为准。