在 mindie:1.0.RC3-800I-A2-arm64 容器内,从 modelscope 下载的 Qwen-VL 模型。进行了权重文件的转换,bin --> safetensors。
用容器内的 requirements 安装依赖,并安装了 transformers 4.34,用 run_pa.sh 验证模型,可进行图片的解析。
对 tokenization_qwen.py 做了如下改动:
- 把 self.IMAGE_ST 部分提前到了 super 语句之前
对 conf/config.json 做了如下改动:
- disable HTTPS
- 改了模型名到'qwen_vl'
- 配置了模型路径
- 配置了服务的端口号
此时 daemon 可以成功启动。
但是,当使用服务端口进行推理时,服务返回错误:
实际 messages 长度是 Messages length: 460607。 检查log,发现 log 里有错误信息:
如果把 transformers 降到 4.32,可以不用改上面的 tokenization 就可以启动 service,但是解析的时候 token 数量还是报错超长,log 里又提示要升到 4.34。
请问各位大佬该怎样解决?
在 mindie:1.0.RC3-800I-A2-arm64 容器内,从 modelscope 下载的 Qwen-VL 模型。进行了权重文件的转换,bin --> safetensors。
用容器内的 requirements 安装依赖,并安装了 transformers 4.34,用 run_pa.sh 验证模型,可进行图片的解析。
对 tokenization_qwen.py 做了如下改动:
对 conf/config.json 做了如下改动:
此时 daemon 可以成功启动。
但是,当使用服务端口进行推理时,服务返回错误:
422, {'error': 'messages token length must be in(0, 1048576]', 'error_type': 'validation'}实际 messages 长度是 Messages length: 460607。 检查log,发现 log 里有错误信息:
如果把 transformers 降到 4.32,可以不用改上面的 tokenization 就可以启动 service,但是解析的时候 token 数量还是报错超长,log 里又提示要升到 4.34。
请问各位大佬该怎样解决?