mindie 部署推理 qwen2.5-vl-7b 莫名变慢(910b3、910b4)
收藏回复举报
mindie 部署推理 qwen2.5-vl-7b 莫名变慢(910b3、910b4)
t('forum.solved') 已解决
新人帖
发表于2025-11-24 15:57:11
0 查看

- 使用镜像 swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-800I-A2-py311-openeuler24.03-lts

- 部署推理 qwen2.5-vl-7b 模型,启动和使用正常

问题:部署完成后,刚开始使用的前几天速度正常,在使用一段时间后,不清楚为什么推理速度突然莫名奇妙的变慢,推理进程没动过,显存占用也未见异常,测试时使用的是完全相同的图片和prompt,速度正常时耗时 3~5s,速度慢时耗时 15~20s

在 64G 显存的 910B3 和 32G 显存的 910B4 两台不同服务器上都遇到该问题

下面是使用的配置 ./conf/config.json 完整内容:

{
    "Version": "1.0.0",
    "ServerConfig": {
        "ipAddress": "0.0.0.0",
        "managementIpAddress": "127.0.0.99",
        "port": 19300,
        "managementPort": 14710,
        "metricsPort": 14720,
        "allowAllZeroIpListening": true,
        "maxLinkNum": 1000,
        "httpsEnabled": false,
        "fullTextEnabled": false,
        "tlsCaPath": "security/ca/",
        "tlsCaFile": [
            "ca.pem"
        ],
        "tlsCert": "security/certs/server.pem",
        "tlsPk": "security/keys/server.key.pem",
        "tlsPkPwd": "security/pass/key_pwd.txt",
        "tlsCrlPath": "security/certs/",
        "tlsCrlFiles": [
            "server_crl.pem"
        ],
        "managementTlsCaFile": [
            "management_ca.pem"
        ],
        "managementTlsCert": "security/certs/management/server.pem",
        "managementTlsPk": "security/keys/management/server.key.pem",
        "managementTlsPkPwd": "security/pass/management/key_pwd.txt",
        "managementTlsCrlPath": "security/management/certs/",
        "managementTlsCrlFiles": [
            "server_crl.pem"
        ],
        "kmcKsfMaster": "tools/pmt/master/ksfa",
        "kmcKsfStandby": "tools/pmt/standby/ksfb",
        "inferMode": "standard",
        "interCommTLSEnabled": true,
        "interCommPort": 1121,
        "interCommTlsCaPath": "security/grpc/ca/",
        "interCommTlsCaFiles": [
            "ca.pem"
        ],
        "interCommTlsCert": "security/grpc/certs/server.pem",
        "interCommPk": "security/grpc/keys/server.key.pem",
        "interCommPkPwd": "security/grpc/pass/key_pwd.txt",
        "interCommTlsCrlPath": "security/grpc/certs/",
        "interCommTlsCrlFiles": [
            "server_crl.pem"
        ],
        "openAiSupport": "vllm",
        "tokenTimeout": 600,
        "e2eTimeout": 600,
        "distDPServerEnabled": false
    },
    "BackendConfig": {
        "backendName": "mindieservice_llm_engine",
        "modelInstanceNumber": 1,
        "npuDeviceIds": [
            [
                0,
                1
            ]
        ],
        "tokenizerProcessNumber": 8,
        "multiNodesInferEnabled": false,
        "multiNodesInferPort": 1120,
        "interNodeTLSEnabled": true,
        "interNodeTlsCaPath": "security/grpc/ca/",
        "interNodeTlsCaFiles": [
            "ca.pem"
        ],
        "interNodeTlsCert": "security/grpc/certs/server.pem",
        "interNodeTlsPk": "security/grpc/keys/server.key.pem",
        "interNodeTlsPkPwd": "security/grpc/pass/mindie_server_key_pwd.txt",
        "interNodeTlsCrlPath": "security/grpc/certs/",
        "interNodeTlsCrlFiles": [
            "server_crl.pem"
        ],
        "interNodeKmcKsfMaster": "tools/pmt/master/ksfa",
        "interNodeKmcKsfStandby": "tools/pmt/standby/ksfb",
        "ModelDeployConfig": {
            "maxSeqLen": 20000,
            "maxInputTokenLen": 15000,
            "truncation": false,
            "ModelConfig": [
                {
                    "modelInstanceType": "Standard",
                    "modelName": "qwen2.5-vl-7b",
                    "modelWeightPath": "/root/data/models/Qwen2.5-VL-7B-Instruct",
                    "worldSize": 2,
                    "cpuMemSize": 5,
                    "npuMemSize": 16,
                    "backendType": "atb",
                    "trustRemoteCode": false,
                    "async_scheduler_wait_time": 120,
                    "kv_trans_timeout": 10,
                    "kv_link_timeout": 1080
                }
            ]
        },
        "ScheduleConfig": {
            "templateType": "Standard",
            "templateName": "Standard_LLM",
            "cacheBlockSize": 128,
            "maxPrefillBatchSize": 50,
            "maxPrefillTokens": 20000,
            "prefillTimeMsPerReq": 150,
            "prefillPolicyType": 0,
            "decodeTimeMsPerReq": 50,
            "decodePolicyType": 0,
            "maxBatchSize": 100,
            "maxIterTimes": 4096,
            "maxPreemptCount": 0,
            "supportSelectBatch": false,
            "maxQueueDelayMicroseconds": 5000
        }
    }
}

下面是镜像启动 docker-compose.yaml 文件:

services:
  mindie-test:
    container_name: mindie-test
    image: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-800I-A2-py311-openeuler24.03-lts
    privileged: true
    shm_size: '1gb'
    network_mode: host
    ipc: host
    stdin_open: true
    tty: true
    volumes:
      # 驱动等服务
      - /usr/local/Ascend/driver:/usr/local/Ascend/driver
      - /usr/local/sbin:/usr/local/sbin
      # 模型权重等
      - /root/data/models:/root/data/models
    command: /bin/bash

我要发帖子