EMO 视频生成 API
OpenAPI Specification
接口:POST /qwen/api/v1/services/aigc/image2video/video-synthesis
用途:把人物肖像图与人声音频合成一段人脸动态视频。
请求头
X-DashScope-Async:必填,string,取值示例enable(契约字段,名称保留原文写法)。Content-Type:必填,固定application/json。Authorization:请求头Bearer {{YOUR_API_KEY}}。
请求体参数(application/json)
model:必填,string,模型名,示例emo-v1。input:必填,object:image_url:必填,string,人物图片地址。输出画幅由裁剪区域决定:ext_bbox为 1:1 时生成 512×512 头像视频,为 3:4 时生成 512×704 半身像视频。图片最小边 ≥ 400 像素、最大边 ≤ 7000 像素,支持 jpg、jpeg、png、bmp、webp;仅接受 HTTP/HTTPS 链接。audio_url:必填,string,驱动用音频地址。需为清晰人声,尽量无环境噪音与背景音乐;文件 ≤ 15 MB、时长 ≤ 60 秒,支持 wav、mp3;仅接受 HTTP/HTTPS 链接。face_bbox:必填,integer 数组,人脸区域像素坐标,取 EMO 图像检测接口返回的同名字段,格式[x1,y1,x2,y2](左上、右下两点;图像左上角为原点,x 向右、y 向下)。ext_bbox:必填,integer 数组,动态区域像素坐标,同样取图像检测接口的同名字段,格式[x1,y1,x2,y2];该区域宽高比需为 1:1 或 3:4。
parameters:object,可选:style_level:string,动作风格强度,取normal、calm、active(分别为适中、平静、活泼),默认normal。
请求示例
@json { "model": "emo-v1", "input": { "image_url": "https://example.com/portrait.png", "audio_url": "https://example.com/voice.mp3", "face_bbox": [302, 286, 610, 593], "ext_bbox": [71, 9, 840, 778] }, "parameters": { "style_level": "normal" } } @
响应
200:成功,返回 JSON 对象;响应字段原文未给出,待补。
使用提示:本平台 Base URL 为
https://api.allyang.cn,OpenAI 兼容接口路径以/v1开头;示例里的{{YOUR_API_KEY}}请替换为控制台创建的令牌。