众扬汇 AI 开放平台 API 文档

EMO 视频生成 API

OpenAPI Specification

接口:POST /qwen/api/v1/services/aigc/image2video/video-synthesis

用途:把人物肖像图与人声音频合成一段人脸动态视频。

请求头

  • X-DashScope-Async:必填,string,取值示例 enable(契约字段,名称保留原文写法)。
  • Content-Type:必填,固定 application/json。
  • Authorization:请求头 Bearer {{YOUR_API_KEY}}。

请求体参数(application/json)

  • model:必填,string,模型名,示例 emo-v1。
  • input:必填,object:
    • image_url:必填,string,人物图片地址。输出画幅由裁剪区域决定:ext_bbox 为 1:1 时生成 512×512 头像视频,为 3:4 时生成 512×704 半身像视频。图片最小边 ≥ 400 像素、最大边 ≤ 7000 像素,支持 jpg、jpeg、png、bmp、webp;仅接受 HTTP/HTTPS 链接。
    • audio_url:必填,string,驱动用音频地址。需为清晰人声,尽量无环境噪音与背景音乐;文件 ≤ 15 MB、时长 ≤ 60 秒,支持 wav、mp3;仅接受 HTTP/HTTPS 链接。
    • face_bbox:必填,integer 数组,人脸区域像素坐标,取 EMO 图像检测接口返回的同名字段,格式 [x1,y1,x2,y2](左上、右下两点;图像左上角为原点,x 向右、y 向下)。
    • ext_bbox:必填,integer 数组,动态区域像素坐标,同样取图像检测接口的同名字段,格式 [x1,y1,x2,y2];该区域宽高比需为 1:1 或 3:4。
  • parameters:object,可选:
    • style_level:string,动作风格强度,取 normal、calm、active(分别为适中、平静、活泼),默认 normal。

请求示例

@json { "model": "emo-v1", "input": { "image_url": "https://example.com/portrait.png", "audio_url": "https://example.com/voice.mp3", "face_bbox": [302, 286, 610, 593], "ext_bbox": [71, 9, 840, 778] }, "parameters": { "style_level": "normal" } } @

响应

  • 200:成功,返回 JSON 对象;响应字段原文未给出,待补。

使用提示:本平台 Base URL 为 https://api.allyang.cn,OpenAI 兼容接口路径以 /v1 开头;示例里的 {{YOUR_API_KEY}} 请替换为控制台创建的令牌。