请求返回信息: {"error":"Failed to get engine response.","error_type":"Incomplete Generation"} 服务端无报错信息,log如下:
[2025-04-27 11:44:31,716] [40837] [281450433147232] [llm] [INFO] [logging.py-331] : <<<<<<< ori k_caches[0].shape=torch.Size([1, 128, 32, 128])
[2025-04-27 11:44:31,718] [40837] [281450433147232] [llm] [INFO] [logging.py-331] : >>>>>>id of kcache is 281456372711504 id of vcache is 281456372711600
Daemon start success!
/usr/local/Ascend/atb-models/atb_llm/models/qwen2_audio/router_qwen2_audio.py:190: UserWarning: To copy construct from a tensor, it is recommended to use sourceTensor.clone().detach() or sourceTensor.clone().detach().requires_grad_(True), rather than torch.tensor(sourceTensor).
new_inputs.feature_attention_mask = torch.tensor(new_inputs.feature_attention_mask, dtype=torch.int64)
/usr/local/Ascend/atb-models/atb_llm/models/qwen2_audio/flash_causal_qwen2_audio.py:233: UserWarning: To copy construct from a tensor, it is recommended to use sourceTensor.clone().detach() or sourceTensor.clone().detach().requires_grad_(True), rather than torch.tensor(sourceTensor).
feature_attention_mask = torch.tensor(feature_attention_mask, dtype=torch.int32)
[2025-04-27 11:47:32,156] [40837] [281450433147232] [llm] [INFO] [logging.py-331] : <<<<<<< ori k_caches[0].shape=torch.Size([119, 128, 32, 128])
[2025-04-27 11:47:32,157] [40837] [281450433147232] [llm] [INFO] [logging.py-331] : >>>>>>id of kcache is 281456372717264 id of vcache is 281456372717360
镜像:mindie-2.0.T3.1
显卡:910B4(32GB)
模型:Qwen2-Audio-7B-Instruct
启动config.json参数
{'Version': '1.0.0', 'LogConfig': {'logLevel': 'Info', 'logFileSize': 20, 'logFileNum': 20, 'logPath': 'logs/mindie-server.log'}, 'ServerConfig': {'ipAddress': '172.17.120.231', 'managementIpAddress': '172.17.120.231', 'port': 8000, 'managementPort': 8001, 'metricsPort': 8002, 'allowAllZeroIpListening': False, 'maxLinkNum': 1000, 'httpsEnabled': False, 'fullTextEnabled': False, 'tlsCaPath': 'security/ca/', 'tlsCaFile': ['ca.pem'], 'tlsCert': 'security/certs/server.pem', 'tlsPk': 'security/keys/server.key.pem', 'tlsPkPwd': 'security/pass/key_pwd.txt', 'tlsCrlPath': 'security/certs/', 'tlsCrlFiles': ['server_crl.pem'], 'managementTlsCaFile': ['management_ca.pem'], 'managementTlsCert': 'security/certs/management/server.pem', 'managementTlsPk': 'security/keys/management/server.key.pem', 'managementTlsPkPwd': 'security/pass/management/key_pwd.txt', 'managementTlsCrlPath': 'security/management/certs/', 'managementTlsCrlFiles': ['server_crl.pem'], 'kmcKsfMaster': 'tools/pmt/master/ksfa', 'kmcKsfStandby': 'tools/pmt/standby/ksfb', 'inferMode': 'standard', 'interCommTLSEnabled': True, 'interCommPort': 1121, 'interCommTlsCaPath': 'security/grpc/ca/', 'interCommTlsCaFiles': ['ca.pem'], 'interCommTlsCert': 'security/grpc/certs/server.pem', 'interCommPk': 'security/grpc/keys/server.key.pem', 'interCommPkPwd': 'security/grpc/pass/key_pwd.txt', 'interCommTlsCrlPath': 'security/grpc/certs/', 'interCommTlsCrlFiles': ['server_crl.pem'], 'openAiSupport': 'vllm'}, 'BackendConfig': {'backendName': 'mindieservice_llm_engine', 'modelInstanceNumber': 1, 'npuDeviceIds': [[0]], 'tokenizerProcessNumber': 8, 'multiNodesInferEnabled': False, 'multiNodesInferPort': 1120, 'interNodeTLSEnabled': True, 'interNodeTlsCaPath': 'security/grpc/ca/', 'interNodeTlsCaFiles': ['ca.pem'], 'interNodeTlsCert': 'security/grpc/certs/server.pem', 'interNodeTlsPk': 'security/grpc/keys/server.key.pem', 'interNodeTlsPkPwd': 'security/grpc/pass/mindie_server_key_pwd.txt', 'interNodeTlsCrlPath': 'security/grpc/certs/', 'interNodeTlsCrlFiles': ['server_crl.pem'], 'interNodeKmcKsfMaster': 'tools/pmt/master/ksfa', 'interNodeKmcKsfStandby': 'tools/pmt/standby/ksfb', 'ModelDeployConfig': {'maxSeqLen': 16384, 'maxInputTokenLen': 16382, 'truncation': False, 'ModelConfig': [{'modelInstanceType': 'Standard', 'modelName': 'atom', 'modelWeightPath': '/tmp/models', 'worldSize': 1, 'cpuMemSize': 5, 'npuMemSize': -1, 'backendType': 'atb', 'trustRemoteCode': False}]}, 'ScheduleConfig': {'templateType': 'Standard', 'templateName': 'Standard_LLM', 'cacheBlockSize': 128, 'maxPrefillBatchSize': 50, 'maxPrefillTokens': 16384, 'prefillTimeMsPerReq': 150, 'prefillPolicyType': 0, 'decodeTimeMsPerReq': 50, 'decodePolicyType': 0, 'maxBatchSize': 200, 'maxIterTimes': 16382, 'maxPreemptCount': 0, 'supportSelectBatch': False, 'maxQueueDelayMicroseconds': 5000}}}请求curl:
curl http://${ip}:8000/v1/chat/completions -H "Content-Type: application/json" -d '{ "model": "atom", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "audio content" }, { "type": "audio_url", "audio_url": "/models/16k.wav" } ] } ], "stream": false}'请求返回信息:
{"error":"Failed to get engine response.","error_type":"Incomplete Generation"}
服务端无报错信息,log如下: