众扬汇 AI 开放平台 API 文档

聊天完成块对象

开启 stream=true 后,服务端以 Server-Sent Events 逐块推送 chat.completion.chunk 对象。

字段一览:

  • id(string):本次对话完成的唯一标识,同一次推送的各块保持一致;
  • choices(array):候选回复列表,n 大于 1 时包含多项;
  • created(integer):生成时间的 Unix 时间戳(秒),各块相同;
  • model(string):实际完成本次请求的模型;
  • system_fingerprint(string):后端配置指纹,便于比对版本差异;
  • object(string):固定取值 chat.completion.chunk。

推送过程中,delta 承载本块新增内容;结束块的 delta 为空对象,finish_reason 给出结束原因。

推送示例(截取):

JSON
{"object":"chat.completion.chunk","id":"chatcmpl-9f2c1a","created":1730000000,"model":"<模型名>","system_fingerprint":"fp_9c31b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}

{"object":"chat.completion.chunk","id":"chatcmpl-9f2c1a","created":1730000000,"model":"<模型名>","system_fingerprint":"fp_9c31b","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}

使用提示(通用建议,具体以实测为准):流式响应按行给出带 data: 前缀的 JSON 片段,客户端应逐块拼接 delta.content;若中途断连,已生成的部分仍会计费。finish_reason 为 length 表示输出被长度上限截断,可调大 max_tokens 后重试;为 content_filter 时表示内容被安全策略拦截。只有把 stream 设为 true 才会走流式,默认返回完整对象。