我正在评估在 Atlas 300I Pro 推理卡上部署大语言模型推理服务,现有以下技术咨询:
- 框架使用咨询 目前考虑使用以下框架:
- ONNX Runtime
- llama.cpp(计划启用 CANN 后端支持)
具体想了解:
- 这些框架是否完全兼容 Atlas 300I Pro
- 是否有其他更推荐的框架方案
- 各框架在 Atlas 300I Pro 上的性能对比数据(如有)
- 环境要求咨询 希望了解对于上述框架:
- 支持的 CANN 版本要求
- 芯片算力特性要求(如算子支持情况、内存带宽等)
- 是否需要特定的驱动或固件版本
- 最佳实践建议
- 针对大模型推理场景,官方推荐的技术栈是什么
- 是否有相关的性能优化指南
- 是否提供开发者支持(如示例代码、调优工具等)
补充信息:
- 目标模型:LLaMA 系列(支持 GGUF、ONNX 格式)
- 性能目标:低延迟推理服务
- 部署环境:EulerOS
谢谢!
我正在评估在 Atlas 300I Pro 推理卡上部署大语言模型推理服务,现有以下技术咨询:
具体想了解:
补充信息:
谢谢!