众扬汇 AI 开放平台 API 文档

创建异步语音合成任务

OpenAPI Specification

异步语音合成:提交文本或文本文件与音色等参数,立即返回任务 ID;任务完成后可凭返回的文件 ID 调用文件检索接口下载音频。

请求方式:POST

接口地址

text
https://api.allyang.cn/minimax/v1/t2a_async_v2

请求头

  • Content-Type(必填):请求体类型,按本页标注填写。(示例:application/json)
  • Authorization(可选):鉴权头,使用控制台创建的令牌,格式为 Bearer + 令牌。(示例:Bearer {{YOUR_API_KEY}})

请求参数(application/json)

  • model(string,必填):模型版本,可选 speech-2.6-hd、speech-2.6-turbo、speech-02-hd、speech-02-turbo、speech-01-hd、speech-01-turbo。
  • text(string,必填):待合成的文本,最长 5 万字符;与 text_file_id 二选一必填。
  • language_boost(string,可选):是否增强指定小语种/方言的识别,缺省 null;可设为 auto 由模型自行判断。可选:Chinese、Chinese,Yue、English、Arabic、Russian、Spanish、French、Portuguese、German、Turkish、Dutch、Ukrainian、Vietnamese、Indonesian、Japanese、Italian、Korean、Thai、Polish、Romanian、Greek、Czech、Finnish、Hindi、Bulgarian、Danish、Hebrew、Malay、Persian、Slovak、Swedish、Croatian、Filipino、Hungarian、Norwegian、Slovenian、Catalan、Nynorsk、Tamil、Afrikaans、auto。
  • voice_setting(object,必填)
    • voice_id(string,必填):合成所用音色编号。
    • speed(number,可选):语速,取值越大语速越快,范围 [0.5,2],缺省 1.0。
    • vol(number,可选):音量,取值越大音量越高,范围 (0,10],缺省 1.0。
    • pitch(integer,可选):语调,范围 [-12,12],缺省 0(即原音色输出)。
  • pronunciation_dict(object,可选)
    • tone(array,可选):特殊发音替换规则,可为指定文字/符号标注注音。中文声调用数字表示:一声 1、二声 2、三声 3、四声 4、轻声 5。示例:["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]。
  • audio_setting(object,可选)
    • audio_sample_rate(integer,可选):采样率,可选 8000、16000、22050、24000、32000、44100,缺省 32000。
    • bitrate(integer,可选):比特率,可选 32000、64000、128000、256000,缺省 128000;仅对 mp3 格式生效。
    • format(string,可选):输出格式,可选 mp3、pcm、flac,缺省 mp3。
    • channel(integer,可选):声道数,可选 1(单声道)或 2(双声道),缺省 1。
  • voice_modify(object,可选):音效处理器参数集合。
    • pitch(integer,可选):音高调整(低沉/明亮),范围 [-100,100];越接近 -100 越低沉,越接近 100 越明亮。
    • intensity(integer,可选):强度调整(刚劲/轻柔),范围 [-100,100];越接近 -100 越刚劲,越接近 100 越轻柔。
    • timbre(integer,可选):音色调整(浑厚/清脆),范围 [-100,100];越接近 -100 越浑厚,越接近 100 越清脆。
    • sound_effects(string,可选):音效设置,单次仅可选一种:spacious_echo(空旷回音)、auditorium_echo(礼堂广播)、lofi_telephone(电话失真)、robotic(电音)。
  • text_file_id(integer,必填):待合成的文本文件,与 text 二选一必填。文件长度 <10 万字符,支持 txt、zip。txt 可用 <#x#> 标记停顿,x 为停顿时长(秒),范围 [0.01,99.99],最多两位小数,且需置于两个可发音文本之间、不可连续使用。zip 内需为同一格式的 txt 或 json;json 支持 [title, content, extra] 三个字段,三者齐全时产出 3 组共 9 个文件并存于同一目录,字段缺失或为空则不产出对应结果。
  • aigc_watermark(boolean,可选):是否在合成音频末尾添加节奏标识,缺省 False;仅对非流式合成生效。

请求示例

json
{
  "model": "speech-2.6-hd",
  "text": "真正的危险不是计算机开始像人一样思考,而是人开始像计算机一样思考。计算机只是可以帮我们处理一些简单事务。",
  "language_boost": "auto",
  "voice_setting": {
    "voice_id": "audiobook_male_1",
    "speed": 1,
    "vol": 1,
    "pitch": 1
  },
  "pronunciation_dict": {
    "tone": [
      "危险/dangerous"
    ]
  },
  "audio_setting": {
    "audio_sample_rate": 32000,
    "bitrate": 128000,
    "format": "mp3",
    "channel": 2
  },
  "voice_modify": {
    "pitch": 0,
    "intensity": 0,
    "timbre": 0,
    "sound_effects": "spacious_echo"
  }
}

返回字段

  • task_id(integer,可选):当前任务的 ID。
  • task_token(string,可选):本次任务使用的密钥信息。
  • file_id(integer,可选):任务创建成功时返回的音频文件 ID;任务完成后可凭 file_id 调用文件检索接口下载,请求出错时不返回该字段。注意:下载 URL 自生成起 9 小时(32,400 秒)内有效,过期即失效,请及时下载。
  • usage_characters(integer,可选):计费字符数。
  • base_resp(object,可选):本次请求的状态码及详情。
    • status_code(integer,必填):状态码:0 正常;1002 限流;1004 鉴权失败;1039 触发 TPM 限流;1042 非法字符超 10%;2013 参数错误。
    • status_msg(string,必填):状态详情。

使用提示:text 与 text_file_id 二选一必填;下载 URL 自生成起 9 小时内有效,请及时下载。