华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
现在是这情况:
部署: DeepSeek-R1-Distill-Qwen-14B 推理模型
当输出内容比较多的时候总是被截断,调整 maxSeqLen 、 maxInputTokenLen 参数也没有起作用
最大输出toen = maxSeqLen - maxInputTokenLen 吗? 还是调整其他参数,请指教!
我要发帖子
现在是这情况:
部署: DeepSeek-R1-Distill-Qwen-14B 推理模型
当输出内容比较多的时候总是被截断,调整 maxSeqLen 、 maxInputTokenLen 参数也没有起作用
最大输出toen = maxSeqLen - maxInputTokenLen 吗? 还是调整其他参数,请指教!