众扬汇 AI 开放平台 API 文档

视觉语言模型介绍

使用场景

视觉语言模型(VLM)能同时接收图像与文本两类输入。把图片和文本一起交给模型后,它可以结合图像内容与上下文理解指令并作答,典型用途包括:

  • 视觉内容解读:描述图片中的事物、文字、空间关系、颜色与氛围;
  • 图文多轮对话:把图像作为上下文的一部分继续追问;
  • 在部分场景下替代 OCR 等传统机器视觉方案;
  • 随模型能力演进,还可用于视觉智能体、机器人等方向。

使用方式

调用 /chat/completions 时,把 message 的 content 构造成同时包含图片与文本的数组即可。图片既可以用 URL 传入,也可以用 base64 数据传入;图像处理细节由 detail 参数控制。

2.1 关于图片细节控制参数说明

detail 支持 low、high、auto 三种取值。对目前支持的模型:不指定或指定 high 时按高分辨率模式处理,指定 low 或 auto 时按低分辨率模式处理。

2.2 包含图像的 message 消息格式示例

使用图片 url 形式:

json
{
    "role": "user",
    "content": [
        {
            "type": "image_url",
            "image_url": {
                "url": "https://<图片地址>/demo.png",
                "detail": "high"
            }
        },
        { "type": "text", "text": "text-prompt here" }
    ]
}

使用 base64 形式:

json
{
    "role": "user",
    "content": [
        {
            "type": "image_url",
            "image_url": {
                "url": "data:image/jpeg;base64,<base64_image>",
                "detail": "low"
            }
        },
        { "type": "text", "text": "text-prompt here" }
    ]
}

2.3 多图形式

一个 message 中可以放入多张图片,每张可分别使用上述两种形式之一。注意:DeepseekVL2 系列适合短上下文,建议最多传入 2 张图片;超过 2 张时模型会把图片统一调整为 384*384,此时指定的 detail 参数不再生效。

json
{
    "role": "user",
    "content": [
        { "type": "image_url", "image_url": { "url": "https://<图片地址>/a.png" } },
        { "type": "image_url", "image_url": { "url": "data:image/jpeg;base64,<base64_image>" } },
        { "type": "text", "text": "text-prompt here" }
    ]
}

视觉输入内容计费方式

图片会被模型换算成 token,与文本一起计入上下文,因此同样参与计费;不同模型的换算方式不同,请以各模型自身的说明为准。

待补:本平台各视觉模型的图片 token 换算规则(原文档引用的 85/170 代币系数与 512px 切块公式来自第三方,未经我方实测,不直接采用)。

限制

即使视觉能力较强,使用前仍需了解已知边界:

  • 医学影像:不适用于解读 CT 等专业医学图像,不得用于医疗建议;
  • 非拉丁文字:处理日文、韩文等文字的图像时效果可能下降;
  • 小字号文本:可放大图像提高可读性,但不要裁掉关键细节;
  • 旋转与颠倒:可能误读旋转或倒置的文字与图像;
  • 视觉元素:难以区分颜色、线型(实线/虚线/点线)等图形差异;
  • 空间推理:需要精确定位的任务(例如判断棋盘落子)表现不佳;
  • 准确性:个别情况下会给出不正确的描述或标题;
  • 图像形态:全景图、鱼眼图处理困难;
  • 元数据与缩放:不读取原始文件名或元数据,分析前会先缩放,原始尺寸信息会丢失;
  • 计数:只能给出图中物体的近似数量;
  • 验证码:出于安全考虑,平台会拦截验证码类图片的提交。

常问问题

  • 可以用来生成图片吗? 不能。生成图片请使用图像生成模型;图片理解请使用具备视觉能力的对话模型。
  • 我可以上传什么类型的文件? PNG(.png)、JPEG(.jpeg 与 .jpg)、WEBP(.webp)以及非动画 GIF(.gif)。
  • 图片大小有限制吗? 单张图片限制 20MB。
  • 上传的图片会被保留吗? 不会,模型处理完成后平台会自动删除。
  • 在哪里可以了解视觉能力的更多信息? 相关评测与系统卡说明见对应模型的官方资料(外部链接已按合规要求移除)。
  • 视觉请求如何计入限流? 图片按 token 计入用量,因此也占用每分钟 token 限额;具体换算见上一节。
  • 模型能读取图像元数据吗? 不能。
  • 如果图片不清晰会怎样? 模型会尽力解读,但结果可能不准。实用判断标准:低/高分辨率下人都看不清的信息,模型同样看不出来。