---
title: v1/chat接口
description: "- 运行环境的transformers版本不可低于4.34.1，低版本tokenizer不支持\"chat_template\"方法。"
url: https://www.hiascend.com/document/detail/zh/mindie/latest/mindiellm/llmdev/mindie_llm0027.html
sourcePath: /source/zh/mindie/310/mindiellm/llmdev/mindie_llm0027.html
indexId: d8dc8e28cbf6475764f8000bcb339c0713943179e1544120a445b67ca2b8ab7858
---
# v1/chat接口

- 运行环境的transformers版本不可低于4.34.1，低版本tokenizer不支持"chat_template"方法。
- 推理模型权重路径下的tokenizer_config.json需要包含"chat_template"字段及其实现。
- Function Call功能的相关参数tool_call_id、tool_calls、tools和tool_choice当前仅支持部分模型，使用其他模型可能会报错。目前支持的模型有ChatGLM3-6B和Qwen2.5系列。


#### 接口功能

提供文本/流式推理处理功能。


#### 接口格式

操作类型：POST

URL：https://{ip}:{port}/v1/chat/completions

- {ip}和{port}请使用业务面的IP地址和端口号，即“ipAddress”和“port”。
- 该URL与推理接口中的URL一致，需要使用config.json配置文件中的“openAiSupport”参数的取值进行区分：

  - 取值为"vllm"或者配置字段缺失时，使用该接口。
  - 取值为其他字符时，使用原生OpenAI接口。
详情请参见《MindIE LLM开发指南》中的“核心概念与配置 > 配置参数说明（服务化）”章节中的ServerConfig参数说明。


#### 请求参数

| 参数 | 参数 | 参数 | 参数 | 是否必选 | 说明 | 取值要求 |
| --- | --- | --- | --- | --- | --- | --- |
| model | model | model | model | 必选 | 基础模型名称或指定的LoRA权重。 | 基础模型名称：Server配置文件中"ModelConfig"字段下的"modelName"参数的值。 LoRA权重：即LoRA ID，Server配置文件中"LoraModules"字段下"name"参数的值。 |
| messages | messages | messages | messages | 必选 | 推理请求消息结构。 | list类型，0KB<messages内容包含的字符数<=4MB，支持中英文。prompt经过tokenizer之后的token数量小于或等于maxInputTokenLen、maxSeqLen\-1、max\_position\_embeddings和1MB之间的最小值。其中，max\_position\_embeddings从权重文件config.json中获取，其他相关参数从配置文件中获取。 |
| \- | role | role | role | 必选 | 推理请求消息角色。 | 字符串类型，可取角色有： system：系统角色 user：用户角色 assistant：助手角色 tool：工具角色。使用该角色时，必须要传入tool\_call\_id。 除上述角色以外，支持加载chat\_template（模型权重目录下tokenizer\_config.json文件中的参数）中的自定义角色。 |
| \- | content | content | content | 必选 | 推理请求内容。单模态文本模型为string类型，多模态模型为list类型。 | string： 当role为assistant，且tool\_calls非空时，content可以不传，其余角色非空。 其余情况content非空。 list：请参见使用样例中多模态请求样例。 |
| \- | \- | type | type | 可选 | 推理请求内容类型。 | text：文本 image\_url：图片 video\_url：视频 audio\_url：音频 多媒体文件使用说明： HTTP/HTTPS 访问方式：请先配置白名单环境变量ALLOWED\_MEDIA\_DOMAINS\_ENV。示例如下（示例中的xxx.xxx.xxx.xxx需替换为资源加载的实际IP）： export ALLOWED\_MEDIA\_DOMAINS\_ENV="upload.xxxmedia.org,cxxx.xxx.com,xxx.xxx.xxx.xxx" 本地文件方式：请将多媒体文件放置在以下目录： /data/multimodal\_inputs/ 说明： 安全风险提示： 在使用前，请务必确保传入的多媒体文件来源可信、内容安全，避免潜在风险。 避免解析至本地IP、内网IP，同时避免使用nip.io、sslip.io等可解析至任意IP的域名。 在使用前，请确保磁盘空间足够以支持多媒体文件的下载。建议预留空间计算公式如下： 单请求最大文件大小 × 最大并发数 × 1.5(预留系数) 例如：若单请求最大文件大小为 512MB，最大并发数为 1000，则应确保磁盘剩余空间大于750G。 |
| \- | \- | text | text | 可选 | 推理请求内容为文本。 | 非空，支持中英文。 |
| \- | \- | image\_url | image\_url | 可选 | 推理请求内容为图片。 | 支持服务器本地路径的图片传入，图片类型支持jpg、png、jpeg和base64编码的jpg图片，支持URL图片传入，支持HTTP和HTTPS协议。当前支持传入的图片最大为40MB。 |
| \- | \- | video\_url | video\_url | 可选 | 推理请求内容为视频。 | 支持服务器本地路径的视频传入，视频类型支持MP4、AVI、WMV，支持URL视频传入，支持HTTP和HTTPS协议。当前支持传入的视频最大512MB。 |
| \- | \- | audio\_url | audio\_url | 可选 | 推理请求内容为音频。 | 支持服务器本地路径的音频传入，音频类型支持MP3、WAV、FLAC，支持URL音频传入，支持HTTP和HTTPS协议。当前支持传入的音频最大40MB。 |
| \- | \- | input\_audio | input\_audio | 可选 | 推理请求内容为音频。 | 支持base64编码的MP3、WAV、FLAC音频，当前支持传入的音频最大20MB。 |
| \- | \- | \- | data | 必选 | 音频的base64编码数据。 | 支持base64编码的MP3、WAV、FLAC音频，当前支持传入的音频最大20MB。 |
| \- | \- | \- | format | 必选 | 音频源格式：MP3、WAV、FLAC。 | 支持base64编码的MP3、WAV、FLAC音频，当前支持传入的音频最大20MB。 |
| \- | tool\_calls | tool\_calls | tool\_calls | 可选 | 模型生成的工具调用。 | 类型为List[dict]，当role为assistant时，表示模型对工具的调用。 |
| \- | \- | function | function | 必选 | 表示模型调用的工具。 | dict类型。 arguments，必选，使用JSON格式的字符串，表示调用函数的参数。 name，必选，字符串，调用的函数名。 |
| \- | \- | id | id | 必选 | 表示模型某次工具调用的ID。 | 字符串。 |
| \- | \- | type | type | 必选 | 调用的工具类型。 | 字符串，仅支持"function"。 |
| \- | tool\_call\_id | tool\_call\_id | tool\_call\_id | 当role为tool时必选，否则可选 | 关联模型某次调用工具时的ID。 | 字符串。 |
| stream | stream | stream | stream | 可选 | 指定返回结果是文本推理还是流式推理。 | bool类型参数，可以为null，默认值false。 true：流式推理。 false：文本推理。 |
| presence\_penalty | presence\_penalty | presence\_penalty | presence\_penalty | 可选 | 存在惩罚介于\-2.0和2.0之间，它影响模型如何根据到目前为止是否出现在文本中来惩罚新token。正值将通过惩罚已经使用的词，增加模型谈论新主题的可能性。 不建议同时修改该值与repetition\_penalty或frequency\_penalty。 | float类型，取值范围[\-2.0, 2.0]，默认值0.0，可以为null。 |
| frequency\_penalty | frequency\_penalty | frequency\_penalty | frequency\_penalty | 可选 | 频率惩罚介于\-2.0和2.0之间，它影响模型如何根据文本中词汇的现有频率惩罚新词汇。正值将通过惩罚已经频繁使用的词来降低模型一行中重复用词的可能性。 不建议同时修改该值与repetition\_penalty或presence\_penalty。 | float类型，取值范围[\-2.0, 2.0]，默认值0.0，可以为null。 |
| repetition\_penalty | repetition\_penalty | repetition\_penalty | repetition\_penalty | 可选 | 重复惩罚用于减少在文本生成过程中出现重复片段的概率。它对之前已经生成的文本进行惩罚，使得模型更倾向于选择新的、不重复的内容。 不建议同时修改该值与presence\_penalty或frequency\_penalty。 | float类型，取值范围(0.0, 2.0]，默认值1.0，可以为null。 |
| temperature | temperature | temperature | temperature | 可选 | 控制生成的随机性，较高的值会产生更多样化的输出。 不建议同时修改该值与top\_p。 | float类型，取值范围大于或等于0.0，默认值1.0，可以为null。 取值越大，结果的随机性越大，可能无法触发Function Call功能。推荐使用大于或等于0.001的值，小于0.001可能会导致文本质量不佳。 |
| top\_p | top\_p | top\_p | top\_p | 可选 | 控制模型生成过程中考虑的词汇范围，使用累计概率选择候选词，直到累积概率超过给定的阈值。该参数也可以控制生成结果的多样性，它基于累积概率选择候选词，直到累积概率超过给定的阈值为止。 不建议同时修改该值与temperature。 | float类型，取值范围(1e\-6, 1.0]，默认值1.0，可以为null。 |
| top\_k | top\_k | top\_k | top\_k | 可选 | 控制模型生成过程中考虑的词汇范围，只从概率最高的k个候选词中选择。 | uint32\_t类型，取值范围\-1或（0, 2147483647]，可以为null。 字段未设置时，默认值由后端模型确定： atb（ATB Models）：配置文件为generation\_config.json文件与config.json文件，其中generation\_config.json的优先级更高。若用户与模型权重均未指定“top\_k”参数，为平衡性能与推理效果，“top\_k”参数将会被设定为1000。 ms（MindSpore）：配置文件为“.yaml”结尾的文件。若用户与模型权重均未指定“top\_k”参数，“top\_k”参数将会被设定为0。 字段设置为\-1时，\-1会变为0传递给MindIE LLM后端，MindIE LLM后端会当做词表大小来处理。 字段设置的取值大于或等于vocabSize时，默认值为vocabSize。vocabSize是从modelWeightPath路径下的config.json文件中读取的vocab\_size或者padded\_vocab\_size的值，若不存在则vocabSize取默认值0。建议用户在config.json文件中添加vocab\_size或者padded\_vocab\_size参数，否则可能导致推理失败。 |
| seed | seed | seed | seed | 可选 | 用于指定推理过程的随机种子，相同的seed值可以确保推理结果的可重现性，不同的seed值会提升推理结果的随机性。 | uint64\_t类型，取值范围[0, 18446744073709551615]，可以为null。不传递该参数，系统会产生一个随机seed值。 当seed取到临近最大值时，会有WARNING，但并不会影响使用。若想去掉WARNING，可以减小seed取值。 |
| stop | stop | stop | stop | 可选 | 停止推理的文本。输出结果默认不包含停止词列表文本。 | List[string]类型或者string类型，默认值null。 List[string]：每个元素字符长度大于或等于1，列表元素总字符长度不超过32768（32\*1024）。列表为空时相当于null。 string：字符长度范围为1~32768。 该参数不支持与Function Call特性叠加使用，且不支持思维链内容解析。 |
| stop\_token\_ids | stop\_token\_ids | stop\_token\_ids | stop\_token\_ids | 可选 | 停止推理的token id列表。输出结果不包含停止推理列表中的token id。 | List[int32]类型，默认值null。若该字段值非null，列表中元素不能为null，超出int32的元素将会被忽略。 参数不支持与Function Call特性叠加使用。 |
| include\_stop\_str\_in\_output | include\_stop\_str\_in\_output | include\_stop\_str\_in\_output | include\_stop\_str\_in\_output | 可选 | 决定是否在生成的推理文本中包含停止字符串。 | bool类型，可以为null，默认值false。 true：包含停止字符串。 false：不包含停止字符串。 不传入stop或stop\_token\_ids时，此字段会被忽略。 该参数不支持与Function Call特性叠加使用，且不支持思维链内容解析。 |
| skip\_special\_tokens | skip\_special\_tokens | skip\_special\_tokens | skip\_special\_tokens | 可选 | 指定在推理生成的文本中是否跳过特殊tokens。 | bool类型，可以为null，默认值true。 true：跳过特殊tokens。 false：保留特殊tokens。 |
| ignore\_eos | ignore\_eos | ignore\_eos | ignore\_eos | 可选 | 指定在推理文本生成过程中是否忽略eos\_token结束符。 | bool类型，可以为null，默认值false。 true：忽略eos\_token结束符。 false：不忽略eos\_token结束符。 |
| max\_tokens | max\_tokens | max\_tokens | max\_tokens | 可选 | 允许推理生成的最大token个数。实际产生的token数量同时受到配置文件maxIterTimes参数影响，推理token个数小于或等于min(maxIterTimes, max\_tokens)。 | 整型，取值范围(0，2147483647]，可以为null，默认值为Server配置文件中的maxIterTimes。 |
| use\_beam\_search | use\_beam\_search | use\_beam\_search | use\_beam\_search | 可选 | 是否启用beam search搜索方式。 | bool类型，默认false；该参数不支持与stop、stop\_token\_ids参数叠加使用。 非流式： 返回参数n个序列，当n为null时，则返回一条回答。 流式： 假流式，将结果一次性返回，多出来的序列会增加data数量。 返回参数n个序列，当n为null时，则返回一条回答。 该参数不支持与MTP、Function Call、并行解码、PD分离等特性叠加使用。 该参数不支持DeepSeek系列模型。 |
| best\_of | best\_of | best\_of | best\_of | 可选 | 不开启beam search时，返回best\_of个序列 | 该参数后续版本即将下线。 int类型，取值范围为[1, 128]或null，默认值为1。当设置best\_of>1时，temperature的值必须设置为大于0。 当use\_beam\_search参数取值为false、null或不设置时： 非流式推理场景下，best\_of和n同时设置时，best\_of的取值必须大于等于n； 流式推理场景下，best\_of和n必须相等且不可单独设置best\_of。 当use\_beam\_search参数取值为true时，将不会对best\_of的取值进行校验。 该参数不支持与MTP、Function Call、并行解码、PD分离等特性叠加使用。 该参数不支持DeepSeek系列模型。 |
| n | n | n | n | 可选 | 当best\_of配置为null或者不设置，或开启beam search时，返回n个序列。 | int类型，取值范围为[1, 8192]或null，默认值为1。当设置n>1时，temperature的值必须设置为大于0。 当use\_beam\_search参数取值为false、null或不设置时： 非流式推理场景下，n和best\_of同时设置时，best\_of的取值必须大于等于n； 流式推理场景下，n和best\_of必须相等且不可单独设置best\_of。 当use\_beam\_search参数取值为true时，将不会对best\_of的取值进行校验。 该参数不支持与MTP、Function Call、并行解码、PD分离等特性叠加使用。 该参数不支持DeepSeek系列模型。 |
| logprobs | logprobs | logprobs | logprobs | 可选 | 推理结果是否包含logprobs信息。 | bool类型，默认值为false。 该参数不支持与Function Call、SplitFuse、Prefix Cache、并行解码、PD分离等特性叠加使用。 |
| top\_logprobs | top\_logprobs | top\_logprobs | top\_logprobs | 可选 | 推理结果中每个token携带的logprobs的数量。 | int类型，取值范围为[0, 20]，默认为0。 当top\_logprobs被用户有效赋值而logprobs未被赋值时，logprobs被设为true。 该参数不支持与Function Call、SplitFuse、Prefix Cache、并行解码、PD分离等特性叠加使用。 |
| chat\_template\_kwargs | chat\_template\_kwargs | chat\_template\_kwargs | chat\_template\_kwargs | 可选 | chat模板参数。 | dict类型。 |
| \- | enable\_thinking | enable\_thinking | enable\_thinking | 可选 | 是否开启模型思维链功能。 | bool类型。当前仅有qwen3系列模型支持该开关。默认按照权重文件的配置。 |
| tools | tools | tools | tools | 可选 | 可能会使用的工具列表。 | List[dict]类型，默认值null。 |
| \- | type | type | type | 必选 | 说明工具类型。 | 仅支持字符串"function"。 |
| \- | function | function | function | 必选 | 函数描述。 | dict类型。 |
| \- | \- | name | name | 必选 | 函数名称。 | 字符串。 |
| \- | \- | strict | strict | 可选 | 表示生成tool calls是否严格遵循schema格式。 | bool类型，默认false。 |
| \- | \- | description | description | 可选 | 描述函数功能和使用。 | 字符串。 |
| \- | \- | parameters | parameters | 可选 | 表示函数接受的参数。 | JSON schema格式。 |
| \- | \- | \- | type | 可选 | 表示函数参数属性的类型。 | 字符串。 |
| \- | \- | \- | properties | 可选 | 函数参数的属性。每一个key表示一个参数名，由用户自定义。value为dict类型，表示参数描述，包含type和description两个参数。 | dict类型。 |
| \- | \- | \- | required | 可选 | 表示函数必填参数列表。 | List[string]类型。 |
| \- | \- | \- | additionalProperties | 可选 | 是否允许使用未提及的额外参数。 | bool类型，默认值false。 true：允许使用未提及的额外参数。 false：不允许使用未提及的额外参数。 |
| tool\_choice | tool\_choice | tool\_choice | tool\_choice | 可选 | 控制模型调用工具。 | string类型或者dict类型，可以为null，默认值"auto"。 "none"：表示模型不会调用任何工具，而是生成一条消息。 "auto"：表示模型可以生成消息或调用一个或多个工具。 |
| chat\_template | chat\_template | chat\_template | chat\_template | 可选 | 针对该请求指定的chat\_template模板。 | string类型，可以设置为chat\_template模板字符串或模板文件在服务器本地的绝对地址路径。 字符串：符合jinja语法，针对该请求会采用该字符串进行tokenize。 地址：对应地址存放合法的jinja文件，针对该请求会采用对应的jinja文件进行tokenize。 |


#### 使用样例

请求样例：

```
POST https://
{ip}:{port}
/v1/chat/completions
```

请求消息体：- 单轮对话：

  - 单模态流式推理：

```
{
"model": "llama3-70b",
"messages": [
{
"role": "user",
"content": "You are a helpful assistant."
}
],
"stream": true,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": 1,
"seed": 1,
"max_tokens": 5,
"n": 2,
"best_of": 2
}
```


  - 单模态文本推理：

```
{
"model": "llama3-70b",
"messages": [
{
"role": "user",
"content": "You are a helpful assistant."
}
],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": 1,
"seed": 1,
"max_tokens": 5,
"n": 2,
"best_of": 2
}
```


- 多轮对话：

  - 第一轮请求样例：

```
{
"model": "Qwen3-30B-A3B",
"messages": [
{"role": "system", "content": "You are a helpful customer support assistant."},
{"role": "user", "content": "Hi, can you tell me what is the best city in China? Just tell me the answer."}
],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": 1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 200,
"chat_template_kwargs": {"enable_thinking": false}
}
```


  - 第二轮请求样例：

```
{
"model": "Qwen3-30B-A3B",
"messages": [
{"role": "system", "content": "You are a helpful customer support assistant."},
{"role": "user", "content": "Hi, can you tell me what is the best city in China? Just tell me the answer."},
{"role": "assistant", "content": "Shanghai"},
{"role": "user", "content": "What is the best thing in this city?"}
],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": 1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"chat_template_kwargs": {"enable_thinking": false}
}
```


  - 多模态请求样例：
对多模态推理支持以下几种格式，相关参数请参考请求参数。base64编码后的数据字符长度可能超出系统终端限制，导致请求被截断，因此建议使用Python脚本发送base64编码的请求。
"image_url"参数的取值请根据实际情况进行修改。


    - 图片

      1. 格式一：{"type": "image_url", "image_url": image_url}，此类格式的“image_url”支持服务器的本地路径、jpg图片的base64编码、HTTP和HTTPS协议URL。

```
{
"model": "Qwen2-VL",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{"type": "image_url", "image_url": "demo.png"}
]
}],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": -1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"n": null,
"logprobs": false,
"top_logprobs":null
}
```


      2. 格式二：{"type": "image_url", "image_url": {"url": {image_url}}}，此类格式的“image_url”支持服务器的本地路径、jpg图片的base64编码、HTTP和HTTPS协议URL。

```
{
"model": "Qwen2-VL",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{"type": "image_url", "image_url": {"url": "demo.png"}}
]
}],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": -1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"n": null,
"logprobs": false,
"top_logprobs":null
}
```


      3. 格式三：{"type": "image_url", "image_url": {"url": f"file://{local_path}"}，此类格式仅支持服务器的本地路径。

```
{
"model": "Qwen2-VL",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{"type": "image_url", "image_url": {"url": "file://demo.png"}}
]
}],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": -1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"n": null,
"logprobs": false,
"top_logprobs":null
}
```


      4. 格式四：{"type": "image_url", "image_url": {"url": f"data:{content/type};base64,{base64_data}"}}，此类格式仅支持base64编码，源格式可以为jpg、jpeg、png，对应的MIME类型如        表1
所示。

```
{
"model": "Qwen2-VL",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,{image_base64}"}}
]
}],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": -1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"n": null,
"logprobs": false,
"top_logprobs":null
}
```


**表1 图片源格式的MIME类型**

| 源格式 | content/type |
| --- | --- |
| jpg | image/jpeg |
| jpeg | image/jpeg |
| png | image/png |


    - 视频

      1. 格式一：{"type": "video_url", "video_url": video_url}，此类格式的“video_url”支持服务器的本地路径、HTTP和HTTPS协议URL。
      2. 格式二：{"type": "video_url", "video_url": {"url": {video_url}}}，此类格式的“video_url”支持服务器的本地路径、HTTP和HTTPS协议URL。
      3. 格式三：{"type": "video_url", "video_url": {"url": f"file://{local_path}"}，此类格式仅支持服务器的本地路径。
      4. 格式四：{"type": "video_url", "video_url": {"url": f"data:{content/type};base64,{base64_data}"}}，此类格式仅支持base64编码，源格式可以为MP4、AVI、WMV，对应的MIME类型如        表2
所示。
        由于视频编码后的长度可能超出“messages”字符长度的最大上限，因此不建议使用base64编码格式传输视频。


**表2 视频源格式对应的MIME类型**

| 源格式 | content/type |
| --- | --- |
| MP4 | video/mp4 |
| AVI | video/x\-msvideo |
| WMV | video/x\-ms\-wmv |


视频格式一~格式四的使用方法可分别参考图片的格式一~格式四。
    - 音频

      1. 格式一：{"type": "audio_url", "audio_url": audio_url}，此类格式的“audio_url”支持服务器的本地路径、HTTP和HTTPS协议URL。
      2. 格式二：{"type": "audio_url", "audio_url": {"url": {audio_url}}}，此类格式的“audio_url”支持服务器的本地路径、HTTP和HTTPS协议URL。
      3. 格式三：{"type": "audio_url", "audio_url": {"url": f"file://{local_path}"}，此类格式仅支持服务器的本地路径。
      4. 格式四：{"type": "audio_url", "audio_url": {"url": f"data:{content/type};base64,{base64_data}"}}，此类格式仅支持base64编码，源格式可以为MP3、WAV、FLAC，对应的MIME如        表3
所示。
**表3 音频源格式对应的MIME类型**

| 源格式 | content/type |
| --- | --- |
| MP3 | audio/mpeg |
| WAV | audio/x\-wav |
| FLAC | audio/flac |


        音频格式一~格式四的使用方法可分别参考图片的格式一~格式四。

      5. 格式五：{"type": "input_audio", "input_audio": {"data": f"{base64_data}", "format": f"{format}"}}，当“type”为“input_audio”时，仅支持base64编码格式，源格式支持MP3、WAV、FLAC，同时，必须通过“format”字段明确源格式类型。

```
{
"model": "Qwen2-Audio",
"messages": [{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "{audio_base64_data}",
"format": "wav"
}
},
{"type": "text", "text": "What is in this audio?assistant"}
]
}],
"stream": false,
"presence_penalty": 1.03,
"frequency_penalty": 1.0,
"repetition_penalty": 1.0,
"temperature": 0.5,
"top_p": 0.95,
"top_k": -1,
"seed": null,
"stop": ["stop1", "stop2"],
"stop_token_ids": [2, 13],
"include_stop_str_in_output": false,
"skip_special_tokens": true,
"ignore_eos": false,
"max_tokens": 20,
"best_of": null,
"n": null,
"logprobs": false,
"top_logprobs":null
}
```


响应样例：- 文本推理（“stream”=false）：

  - 单轮对话：

```
{
"id": "llama3-70b",
"object": "chat.completion",
"created": 1677652288,
"model": "gpt-3.5-turbo-0613",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "\n\nHello there, how may I assist you today?"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 9,
"prompt_tokens_details": {"cached_tokens": 0},
"completion_tokens": 12,
"total_tokens": 21,
"batch_size": [1,1,1,1,1,1,1,1,1,1,1,1],
"queue_wait_time": [5149,60,39,213,28,30,38,68,430,61,48,39]
},
"prefill_time": 200,
"decode_time_arr": [56, 28, 28, 28, 32, 28, 28, 41, 28, 25, 28]
}
```


  - 多轮对话：

    - 第一轮响应样例：

```
{
"id": "endpoint_common_0",
"object": "chat.completion",
"created": 1768210927,
"model": "Qwen3-30B-A3B",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "Shanghai",
"tool_calls": []
},
"logprobs": null,
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 45,
"prompt_tokens_details": {"cached_tokens": 0},
"completion_tokens": 3,
"total_tokens": 48,
"batch_size": [1,1,1],
"queue_wait_time": [5556,928,1070]
},
"prefill_time": 615,
"decode_time_arr": [61,26]
}
```


    - 第二轮响应样例：

```
{
"id": "endpoint_common_1",
"object": "chat.completion",
"created": 1768211028,
"model": "Qwen3-30B-A3B",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "The best thing in Shanghai is its vibrant mix of modern skyscrapers, historic architecture, and rich",
"tool_calls": []
},
"logprobs": null,
"finish_reason": "length"
}
],
"usage": {
"prompt_tokens": 66,
"prompt_tokens_details": {"cached_tokens": 0},
"completion_tokens": 20,
"total_tokens": 86,
"batch_size": [1,1,1,1,1,1,1,1,1,1,1,1,1,1,1,1,1,1,1,1],
"queue_wait_time": [5513,483,137,503,139,1108,203,323,553,389,357,351,237,814,877,819,300,281,130,190]},
"prefill_time": 122,
"decode_time_arr": [47,22,20,22,23,19,20,20,20,20,21,21,22,22,20,20,20,20,22]
}
```


- 流式推理：

  - 流式推理1（单模态，“stream”=true）：

```
{
"id":"endpoint_common_11","object":"chat.completion","created":1744038561,"model":"llama3-70b","choices":[{"index":0,"message":{"role":"assistant","content":"You are a helpful assistant","tool_calls":null},"logprobs":null,"finish_reason":"length"},{"index":1,"message":{"role":"assistant","content":"You are a helpful assistant","tool_calls":null},"logprobs":null,"finish_reason":"length"}],"usage":{"prompt_tokens":24,"prompt_tokens_details": {"cached_tokens": 0},"completion_tokens":10,"total_tokens":34,"batch_size":[1,1,1,1,1,1,1,1,1,1],"queue_wait_time":[5318,117,82,72,196,64,60,55,53,54]},"prefill_time":38,"decode_time_arr":[30,27,27,27]}
```


  - 流式推理2（带n和best_of参数）

```
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"You"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":1,"delta":{"role":"assistant","content":"You"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":" are"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":1,"delta":{"role":"assistant","content":" are"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":" a"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":1,"delta":{"role":"assistant","content":" a"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":" helpful"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","choices":[{"index":1,"delta":{"role":"assistant","content":" helpful"},"logprobs":null,"finish_reason":null}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","usage":{"prompt_tokens":24,"completion_tokens":5,"total_tokens":29,"batch_size":[1,1,1,1,1],"queue_wait_time":[5318,117,82,72,196]},"choices":[{"index":0,"delta":{"role":"assistant","content":" assistant"},"logprobs":null,"finish_reason":"length"}]}
data: {"id":"endpoint_common_10","object":"chat.completion.chunk","created":1744038509,"model":"llama3-70b","usage":{"prompt_tokens":24,"prompt_tokens_details": {"cached_tokens": 0},"completion_tokens":5,"total_tokens":29,"batch_size":[1,1,1,1,1],"queue_wait_time":[5318,117,82,72,196]},"choices":[{"index":1,"delta":{"role":"assistant","content":" assistant"},"logprobs":null,"finish_reason":"length"}]}
data: [DONE]
```


  - 流式推理3（不带n和best_of参数，“stream”=true，使用sse格式返回）：

```
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}
data: {"id":"endpoint_common_7","object":"chat.completion.chunk","created":1729614349,"model":"llama3-70b","usage":{"prompt_tokens":54,"prompt_tokens_details": {"cached_tokens": 0},"completion_tokens":13,"total_tokens":67,"batch_size":[1,1,1,1,1,1,1,1,1,1,1,1,1],"queue_wait_time":[5318,117,82,72,196,64,60,55,53,54,56,67,61]},"choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":"stop"}]}
data: [DONE]
```


  - 流式推理4（“stream”=true，配置项“fullTextEnabled”=true，使用sse格式返回）：

```
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello!"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I assist"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I assist you"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I assist you today"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I assist you today?"},"finish_reason":null}]}
data: {"id":"endpoint_common_11","object":"chat.completion.chunk","created":1730184192,"model":"llama3-70b","full_text":"Hello! How can I assist you today?","usage":{"prompt_tokens":31,"prompt_tokens_details": {"cached_tokens": 0},"completion_tokens":10,"total_tokens":41,"batch_size":[1,1,1,1,1,1,1,1,1,1],"queue_wait_time":[5318,117,82,72,196,64,60,55,53,54]},"choices":[{"index":0,"delta":{"role":"assistant","content":"Hello! How can I assist you today?"},"finish_reason":"length"}]}
data: [DONE]
```


#### 输出说明


**表4 文本推理结果说明**

| 参数名 | 参数名 | 参数名 | 参数名 | 参数名 | 类型 | 说明 |
| --- | --- | --- | --- | --- | --- | --- |
| id | id | id | id | id | string | 请求ID。 |
| object | object | object | object | object | string | 返回结果类型目前都返回"chat.completion"。 |
| created | created | created | created | created | integer | 推理请求时间戳，精确到秒。 |
| model | model | model | model | model | string | 使用的推理模型。 |
| choices | choices | choices | choices | choices | list | 推理结果列表。 |
| \- | index | index | index | index | integer | choices消息index，当前只能为0。 |
| \- | message | message | message | message | object | 推理消息。 |
| \- | \- | role | role | role | string | 角色，目前都返回"assistant"。 |
| \- | \- | content | content | content | string | 推理文本结果。 |
| \- | \- | reasoning\_content | reasoning\_content | reasoning\_content | string | 思维链内容。 当该参数匹配到stop参数中携带的停用词时，请求参数include\_stop\_str\_in\_output将不生效，会在reasoning\_content参数值中输出匹配到的stop停用词。 |
| \- | \- | tool\_calls | tool\_calls | tool\_calls | list | 模型工具调用输出。 |
| \- | \- | \- | function | function | dict | 函数调用说明。 |
| \- | \- | \- | \- | arguments | string | 调用函数的参数，JSON格式的字符串。 |
| \- | \- | \- | \- | name | string | 调用的函数名。 |
| \- | \- | \- | id | id | string | 模型调用工具的ID。 |
| \- | \- | \- | type | type | string | 工具的类型，目前仅支持function。 |
| \- | logprobs | logprobs | logprobs | logprobs | object | logprobs信息。 |
| \- | \- | content | content | content | list | 概率较高的logprobs信息。 |
| \- | \- | \- | token | token | string | 选中token对应的词。 |
| \- | \- | \- | logprob | logprob | float | 选中token的logprob。 |
| \- | \- | \- | bytes | bytes | list | 选中token对应词的utf8编码。 |
| \- | \- | \- | top\_logprobs | top\_logprobs | list | 候选token的logprobs信息。 |
| \- | \- | \- | \- | token | string | 候选token对应的词。 |
| \- | \- | \- | \- | logprob | float | 候选token的logprob。 |
| \- | \- | \- | \- | bytes | list | 候选token对应词的utf8编码。 |
| \- | finish\_reason | finish\_reason | finish\_reason | finish\_reason | string | 结束原因。 stop： 请求被CANCEL或STOP，用户不感知，丢弃响应。 请求执行中出错，响应输出为空，err\_msg非空。 请求输入校验异常，响应输出为空，err\_msg非空。 请求遇eos结束符正常结束。 length： 请求因达到最大序列长度而结束，响应为最后一轮迭代输出。 请求因达到最大输出长度（包括请求参数max\_tokens；模型相关参数maxIterTimes、maxSeqLen和max\_position\_embeddings）而结束，响应为最后一轮迭代输出。 tool\_calls：表示模型调用了工具。 |
| usage | usage | usage | usage | usage | object | 推理结果统计数据。 |
| \- | prompt\_tokens | prompt\_tokens | prompt\_tokens | prompt\_tokens | int | 用户输入的prompt文本对应的token长度。 |
| \- | prompt\_tokens\_details | prompt\_tokens\_details | prompt\_tokens\_details | prompt\_tokens\_details | object | 用户输入的prompt文本对应的token细节信息。 |
| \- | \- | cached\_tokens | cached\_tokens | cached\_tokens | int | 用户输入的prompt文本在推理过程中命中的缓存token长度。 如果启用了Prefix Cache特性，该字段将显示实际值；未启用时则显示默认值0。 |
| \- | completion\_tokens | completion\_tokens | completion\_tokens | completion\_tokens | int | 推理token数量。PD场景下统计P和D推理结果的总token数量。当一个请求的推理长度上限取maxIterTimes的值时，D节点响应中completion\_tokens数量为maxIterTimes+1，即增加了P推理结果的首token数量。当生成多个序列时，为所有序列生成的token数量总和。 |
| \- | completion\_tokens\_details | completion\_tokens\_details | completion\_tokens\_details | completion\_tokens\_details | object | 推理的token细节信息。 |
| \- | \- | reasoning\_tokens | reasoning\_tokens | reasoning\_tokens | int | 思维链内容对应的token长度。 仅在调用支持深度思考的模型时有值； 不支持深度思考时，不输出该字段。 |
| \- | total\_tokens | total\_tokens | total\_tokens | total\_tokens | int | 请求和推理的总token数。 当生成多个序列时，为prompt\_tokens加上所有序列生成的token数量总和。 |
| \- | batch\_size | batch\_size | batch\_size | batch\_size | list | 推理生成每个token时的batch size，数组长度为生成序列的token数量。 当同时生成多个序列的情况下，为所有序列共同的batch size，数组长度为最长序列的token数量。（每个batch size为当前轮次所有序列的batch size） |
| \- | queue\_wait\_time | queue\_wait\_time | queue\_wait\_time | queue\_wait\_time | list | 推理生成每个token时的队列等待时间，单位：us。数组长度为生成序列的token数量。 当同时生成多个序列的情况下，为所有序列共同的队列等待时延，数组长度为最长序列的token数量。（每个队列等待时间为当前轮次所有序列的队列等待时间） |
| prefill\_time | prefill\_time | prefill\_time | prefill\_time | prefill\_time | float | 推理首token时延。 当生成多个序列的情况时，为所有序列的首token时延。 |
| decode\_time\_arr | decode\_time\_arr | decode\_time\_arr | decode\_time\_arr | decode\_time\_arr | list | 推理Decode时延数组。 当生成多个序列的情况时，为所有序列共同的Decode时延，时延数组长度为最长序列的Decode token数量。 |


**表5 流式推理结果说明**

| 参数名 | 参数名 | 参数名 | 参数名 | 参数名 | 参数名 | 类型 | 说明 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| data | data | data | data | data | data | object | 一次推理返回的结果。 |
| \- | id | id | id | id | id | string | 请求ID。 |
| \- | object | object | object | object | object | string | 目前都返回"chat.completion.chunk"。 |
| \- | created | created | created | created | created | integer | 推理请求时间戳，精确到秒。 |
| \- | model | model | model | model | model | string | 使用的推理模型。 |
| \- | full\_text | full\_text | full\_text | full\_text | full\_text | string | 全量文本结果，配置项“fullTextEnabled”=true时才有此返回值。 |
| \- | usage | usage | usage | usage | usage | object | 推理结果统计数据。 |
| \- | \- | prompt\_tokens | prompt\_tokens | prompt\_tokens | prompt\_tokens | int | 用户输入的prompt文本对应的token长度。 |
| \- | \- | prompt\_tokens\_details | prompt\_tokens\_details | prompt\_tokens\_details | prompt\_tokens\_details | object | 用户输入的prompt文本对应的token细节信息。 |
| \- | \- | \- | cached\_tokens | cached\_tokens | cached\_tokens | int | 用户输入的prompt文本在推理过程中命中的缓存token长度。 如果启用了Prefix Cache特性，该字段将显示实际值；未启用时则显示默认值0。 |
| \- | \- | completion\_tokens | completion\_tokens | completion\_tokens | completion\_tokens | int | 推理token数量。PD场景下统计P和D推理结果的总token数量。当一个请求的推理长度上限取maxIterTimes的值时，D节点响应中completion\_tokens数量为maxIterTimes+1，即增加了P推理结果的首token数量。 |
| \- | \- | completion\_tokens\_details | completion\_tokens\_details | completion\_tokens\_details | completion\_tokens\_details | object | 推理的token细节信息。 |
| \- | \- | \- | reasoning\_tokens | reasoning\_tokens | reasoning\_tokens | int | 思维链内容对应的token长度。 仅在调用支持深度思考的模型时生成该字段，支持的模型请参见《MindIE LLM开发指南》中的“特性介绍 > 交互特性 > 思考解析”章节中的“限制与约束”。 |
| \- | \- | total\_tokens | total\_tokens | total\_tokens | total\_tokens | int | 请求和推理的总token数。 |
| \- | \- | batch\_size | batch\_size | batch\_size | batch\_size | list | 推理生成每个token时的batch size，数组长度为生成序列的token数量。 当同时生成多个序列的情况下，为所有序列共同的batch size，数组长度为最长序列的token数量。（每个batch size为当前轮次所有序列的batch size） |
| \- | \- | queue\_wait\_time | queue\_wait\_time | queue\_wait\_time | queue\_wait\_time | list | 推理生成每个token时的队列等待时间，单位：us。数组长度为生成序列的token数量。 当同时生成多个序列的情况下，为所有序列共同的队列等待时延，数组长度为最长序列的token数量。（每个队列等待时间为当前轮次所有序列的队列等待时间） |
| \- | choices | choices | choices | choices | choices | list | 流式推理结果。 |
| \- | \- | index | index | index | index | integer | choices消息index，当前只能为0。 |
| \- | \- | delta | delta | delta | delta | object | 推理返回结果。 |
| \- | \- | \- | role | role | role | string | 角色，目前都返回"assistant"。 |
| \- | \- | \- | content | content | content | string | 推理文本结果。 |
| \- | \- | \- | reasoning\_content | reasoning\_content | reasoning\_content | string | 思维链内容。 当该参数匹配到stop参数中携带的停用词时，请求参数include\_stop\_str\_in\_output将不生效，会在reasoning\_content参数值中输出匹配到的stop停用词。 |
| \- | \- | \- | tool\_calls | tool\_calls | tool\_calls | list | 模型工具调用输出。 |
| \- | \- | \- | \- | function | function | dict | 函数调用说明。 |
| \- | \- | \- | \- | \- | arguments | string | 调用函数的参数，JSON格式的字符串。 |
| \- | \- | \- | \- | \- | name | string | 调用的函数名。 |
| \- | \- | \- | \- | id | id | string | 模型调用工具的ID。 |
| \- | \- | \- | \- | type | type | string | 工具的类型，目前仅支持function。 |
| \- | \- | logprobs | logprobs | logprobs | logprobs | object | logprobs信息。 |
| \- | \- | \- | content | content | content | list | 概率较高的logprobs信息。 |
| \- | \- | \- | \- | token | token | string | 选中token对应的词。 |
| \- | \- | \- | \- | logprob | logprob | float | 选中token的logprob。 |
| \- | \- | \- | \- | bytes | bytes | list | 选中token对应词的utf8编码。 |
| \- | \- | \- | \- | top\_logprobs | top\_logprobs | list | 候选token的logprobs信息。 |
| \- | \- | \- | \- | \- | token | string | 候选token对应的词。 |
| \- | \- | \- | \- | \- | logprob | float | 候选token的logprob。 |
| \- | \- | \- | \- | \- | bytes | list | 候选token对应词的utf8编码。 |
| \- | \- | finish\_reason | finish\_reason | finish\_reason | finish\_reason | string | 结束原因，只在最后一次推理结果返回。 stop： 请求被CANCEL或STOP，用户不感知，丢弃响应。 请求执行中出错，响应输出为空，err\_msg非空。 请求输入校验异常，响应输出为空，err\_msg非空。 请求遇eos结束符正常结束。 length： 请求因达到最大序列长度而结束，响应为最后一轮迭代输出。 请求因达到最大输出长度（包括请求参数max\_tokens；模型相关参数maxIterTimes、maxSeqLen和max\_position\_embeddings）而结束，响应为最后一轮迭代输出。 |
