各位 Deepseek 社区的大佬好~
最近部署 Deepseek-V2-7B 模型做长文本推理时卡了壳,想请教下问题原因:
- 环境:云服务器(16 核 CPU+32GB 内存,无 GPU),用官方 Python SDK 调用推理接口
- 现象:生成 100token 内的短文本完全正常,但生成 500+token 的长文本时,80% 概率会报 “token generation timeout” 错误,重试后偶尔能成功
- 已尝试操作:把 SDK 的 timeout 参数调至 300s、降低 max_new_tokens 到 200、检查服务器带宽(稳定 10Mbps),但问题没解决
想问问大家:这是 CPU 推理长文本性能不足导致的吗?还是有什么框架配置细节没注意到?麻烦给点排查思路~
各位 Deepseek 社区的大佬好~
最近部署 Deepseek-V2-7B 模型做长文本推理时卡了壳,想请教下问题原因:
想问问大家:这是 CPU 推理长文本性能不足导致的吗?还是有什么框架配置细节没注意到?麻烦给点排查思路~