创建异步语音合成任务
OpenAPI Specification
异步语音合成:提交文本或文本文件与音色等参数,立即返回任务 ID;任务完成后可凭返回的文件 ID 调用文件检索接口下载音频。
请求方式:POST
接口地址
text
https://api.allyang.cn/minimax/v1/t2a_async_v2
请求头
Content-Type(必填):请求体类型,按本页标注填写。(示例:application/json)Authorization(可选):鉴权头,使用控制台创建的令牌,格式为 Bearer + 令牌。(示例:Bearer {{YOUR_API_KEY}})
请求参数(application/json)
model(string,必填):模型版本,可选 speech-2.6-hd、speech-2.6-turbo、speech-02-hd、speech-02-turbo、speech-01-hd、speech-01-turbo。text(string,必填):待合成的文本,最长 5 万字符;与 text_file_id 二选一必填。language_boost(string,可选):是否增强指定小语种/方言的识别,缺省 null;可设为 auto 由模型自行判断。可选:Chinese、Chinese,Yue、English、Arabic、Russian、Spanish、French、Portuguese、German、Turkish、Dutch、Ukrainian、Vietnamese、Indonesian、Japanese、Italian、Korean、Thai、Polish、Romanian、Greek、Czech、Finnish、Hindi、Bulgarian、Danish、Hebrew、Malay、Persian、Slovak、Swedish、Croatian、Filipino、Hungarian、Norwegian、Slovenian、Catalan、Nynorsk、Tamil、Afrikaans、auto。voice_setting(object,必填)voice_id(string,必填):合成所用音色编号。speed(number,可选):语速,取值越大语速越快,范围 [0.5,2],缺省 1.0。vol(number,可选):音量,取值越大音量越高,范围 (0,10],缺省 1.0。pitch(integer,可选):语调,范围 [-12,12],缺省 0(即原音色输出)。
pronunciation_dict(object,可选)tone(array,可选):特殊发音替换规则,可为指定文字/符号标注注音。中文声调用数字表示:一声 1、二声 2、三声 3、四声 4、轻声 5。示例:["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]。
audio_setting(object,可选)audio_sample_rate(integer,可选):采样率,可选 8000、16000、22050、24000、32000、44100,缺省 32000。bitrate(integer,可选):比特率,可选 32000、64000、128000、256000,缺省 128000;仅对 mp3 格式生效。format(string,可选):输出格式,可选 mp3、pcm、flac,缺省 mp3。channel(integer,可选):声道数,可选 1(单声道)或 2(双声道),缺省 1。
voice_modify(object,可选):音效处理器参数集合。pitch(integer,可选):音高调整(低沉/明亮),范围 [-100,100];越接近 -100 越低沉,越接近 100 越明亮。intensity(integer,可选):强度调整(刚劲/轻柔),范围 [-100,100];越接近 -100 越刚劲,越接近 100 越轻柔。timbre(integer,可选):音色调整(浑厚/清脆),范围 [-100,100];越接近 -100 越浑厚,越接近 100 越清脆。sound_effects(string,可选):音效设置,单次仅可选一种:spacious_echo(空旷回音)、auditorium_echo(礼堂广播)、lofi_telephone(电话失真)、robotic(电音)。
text_file_id(integer,必填):待合成的文本文件,与 text 二选一必填。文件长度 <10 万字符,支持 txt、zip。txt 可用 <#x#> 标记停顿,x 为停顿时长(秒),范围 [0.01,99.99],最多两位小数,且需置于两个可发音文本之间、不可连续使用。zip 内需为同一格式的 txt 或 json;json 支持 [title, content, extra] 三个字段,三者齐全时产出 3 组共 9 个文件并存于同一目录,字段缺失或为空则不产出对应结果。aigc_watermark(boolean,可选):是否在合成音频末尾添加节奏标识,缺省 False;仅对非流式合成生效。
请求示例
json
{
"model": "speech-2.6-hd",
"text": "真正的危险不是计算机开始像人一样思考,而是人开始像计算机一样思考。计算机只是可以帮我们处理一些简单事务。",
"language_boost": "auto",
"voice_setting": {
"voice_id": "audiobook_male_1",
"speed": 1,
"vol": 1,
"pitch": 1
},
"pronunciation_dict": {
"tone": [
"危险/dangerous"
]
},
"audio_setting": {
"audio_sample_rate": 32000,
"bitrate": 128000,
"format": "mp3",
"channel": 2
},
"voice_modify": {
"pitch": 0,
"intensity": 0,
"timbre": 0,
"sound_effects": "spacious_echo"
}
}
返回字段
task_id(integer,可选):当前任务的 ID。task_token(string,可选):本次任务使用的密钥信息。file_id(integer,可选):任务创建成功时返回的音频文件 ID;任务完成后可凭 file_id 调用文件检索接口下载,请求出错时不返回该字段。注意:下载 URL 自生成起 9 小时(32,400 秒)内有效,过期即失效,请及时下载。usage_characters(integer,可选):计费字符数。base_resp(object,可选):本次请求的状态码及详情。status_code(integer,必填):状态码:0 正常;1002 限流;1004 鉴权失败;1039 触发 TPM 限流;1042 非法字符超 10%;2013 参数错误。status_msg(string,必填):状态详情。
使用提示:text 与 text_file_id 二选一必填;下载 URL 自生成起 9 小时内有效,请及时下载。