1. 市场适配性差。目前昇腾芯片主要面向政企市场,通用云市场渗透率低,难以满足初创企业、科研机构的灵活部署需求;
2. 昇腾卡间通信耗时比较长。多卡分布式训练方面卡间通讯耗时比较多;
3. HCCS 带宽与 NVLink 相比不足,模型切分后通信成为瓶颈;
4. 自动驾驶、感知算法生态暂未完善。缺少像Tesla自动驾驶、ChatGPT等依赖英伟达生态的技术,无人驾驶感知算法发面生态为完善支持度低;
5. 人才培养体系生态不完善。高校课程覆盖少、开发者难以系统学习昇腾平台,难以形成从学习到落地的闭环人才通道;
6. 推理精度不稳定。MindSpore或CANN在float16下常出现模型精度波动、异常下降,原因包括数值累积误差与转精度操作不一致;
7. 量化工具链成熟度低。缺乏完善的量化感知训练(QAT)、后量化(PTQ)工具链,INT8 推理性能与精度均不稳定,难以部署轻量模型;
8. 模型迁移成本高。TensorFlow/PyTorch模型需手动修改大量层与参数,工具链不够智能,迁移大型模型如BERT/GPT系列时尤其困难。
9. AI Core与CPU/Host之间带宽受限。昇腾架构中AI Core与CPU之间的访问需要通过HCCS/HBM/DDR,带宽瓶颈限制了小Batch任务或频繁交互场景的效率;
10.文档和SDK更新滞后。昇腾芯片软件文档更新慢,许多关键接口文档不全或未对外公开,SDK依赖关系混乱,初学者和企业都难以上手
11. MindSpore生态不成熟。虽然是华为自研框架,但其社区活跃度、文档完整性、开源依赖度低,开发者很难找到社区支持与插件资源。
12. 集群部署难度大。昇腾集群部署流程繁琐,配置复杂,依赖多(如CANN、MindX、D-driver等多个组件),相比CUDA更难实现快速部署与弹性扩展。
13. 算子库不全面。官方算子库缺少稀疏计算、图神经网络(GNN)、多模态感知等领域支持,限制多样模型的适配能力。
14. 硬件架构与通信。主要瓶颈在带宽、能效、互联结构与透明度方面不够完善,现在都还有比较大的改进空间。
15. 集群资源监控能力差。缺乏类似的集群资源占用监控工具,运维成本高。
16. 提升昇腾硬件的开放性与兼容性文档支持 。建议华为提供更详尽的硬件兼容性矩阵,帮助用户在部署前快速判断硬件适配情况,减少集成过程中的不确定性。
17. 建议针对MindIE推理引擎优化 prefill 阶段的显存占用(目前 128K 上下文模型的显存占用比起 NVIDIA 多了十几 G)。
18. 建立统一的昇腾开发者门户与问题追踪系统。目前文档、代码仓库、社区论坛分散在不同平台。建议整合为一站式开发者门户,集成文档检索、示例代码、常见问题库、Bug上报与进度追踪功能,提升问题解决效率。
19. 构建官方认证的模型 zoo 与迁移指南库。建议在Gitee/GitHub上维护一个权威的“昇腾适配模型库”,对主流模型(如BERT、YOLO、ResNet、LLaMA等)提供已验证的迁移脚本、性能数据和调优参数,并附带详细的迁移操作指南。
20. 优化社区响应机制,设立企业用户专属支持通道 。对于企业级用户,建议开通优先响应通道或技术支持工单系统,针对关键问题提供SLA保障(如24小时内初步响应),并定期组织线上答疑会或技术沙龙,增强用户粘性。
21. 提供更细粒度的性能剖析工具链(Profiler + Trace可视化) 。当前性能分析工具对新手门槛较高。建议推出轻量级性能探针工具,支持一键生成执行轨迹图、内存生命周期分析和算子调度时序图,帮助开发者直观理解模型运行瓶颈。
22. 增强社区问题响应闭环。在代码仓库(如gitee/ascend)中增设问题追踪看板,公开Bug修复进度,并对高频问题(如动态shape适配、自定义算子编译失败)提供标准化解决方案模板。
23. 开放Notebook环境持久化API。针对Notebook环境重启后配置丢失问题,除镜像保存功能外,提供环境变量与依赖包的一键导出/导入API,支持依赖版本冲突自动解决。
24. 完善NPU资源实时监控机制。当前训练任务中无法实时查看CPU/NPU使用率,建议在控制台增加多维度资源监控面板(如算力利用率、显存占用、温度曲线),支持历史数据回溯与瓶颈分析,帮助用户快速定位性能瓶颈。
25. 强化硬件兼容性自动化测试。针对第三方硬件(如新型PCIe设备、存储模块)与昇腾芯片的兼容性问题,提供标准化兼容性测试工具包,支持自动生成测试报告并推荐驱动适配方案,减少手动调试成本。
26. 社区和仓库对老旧型号的设备缺乏使用说明和示例
27. 社区和仓库针对推理卡的操作文档和demo较少,比如atlas300v,atlas300I pro等
28. mindie推理框架对比vllm设置比较复杂,config文件里面需要设置参数较多
29. 昇腾社区缺乏对910A硬件的支撑文档和对应mindie镜像
30. gitee仓库问题回复较慢。
附其他客户产研提交的实际问题:
1.文档与示例不足,官方示例覆盖不足,适配过程中发现文档缺少Atlas 300推理卡相关内容描述,Atlas 300卡对UOS产品适配滞后,且未在文档注明。
2.文档碎片化,例如:装 MindIE 需 ATB models,文档仅给链接却找不到包,只能等 3-5 天下载完整容器再手动抽取。
3.文档内容滞后,部分文档UOS版本依然是写的1050版本。
4.目前已经适配的vLLM引擎性能较MindIE偏弱,且vLLM版本适配的Pytorch与vLLM-Ascend使用的Pytorch版本不一致,目前社区方案是否已经确定?
5.CANN架构对6.6内核支持进度如何?
2. 昇腾卡间通信耗时比较长。多卡分布式训练方面卡间通讯耗时比较多;
3. HCCS 带宽与 NVLink 相比不足,模型切分后通信成为瓶颈;
4. 自动驾驶、感知算法生态暂未完善。缺少像Tesla自动驾驶、ChatGPT等依赖英伟达生态的技术,无人驾驶感知算法发面生态为完善支持度低;
5. 人才培养体系生态不完善。高校课程覆盖少、开发者难以系统学习昇腾平台,难以形成从学习到落地的闭环人才通道;
6. 推理精度不稳定。MindSpore或CANN在float16下常出现模型精度波动、异常下降,原因包括数值累积误差与转精度操作不一致;
7. 量化工具链成熟度低。缺乏完善的量化感知训练(QAT)、后量化(PTQ)工具链,INT8 推理性能与精度均不稳定,难以部署轻量模型;
8. 模型迁移成本高。TensorFlow/PyTorch模型需手动修改大量层与参数,工具链不够智能,迁移大型模型如BERT/GPT系列时尤其困难。
9. AI Core与CPU/Host之间带宽受限。昇腾架构中AI Core与CPU之间的访问需要通过HCCS/HBM/DDR,带宽瓶颈限制了小Batch任务或频繁交互场景的效率;
10.文档和SDK更新滞后。昇腾芯片软件文档更新慢,许多关键接口文档不全或未对外公开,SDK依赖关系混乱,初学者和企业都难以上手
11. MindSpore生态不成熟。虽然是华为自研框架,但其社区活跃度、文档完整性、开源依赖度低,开发者很难找到社区支持与插件资源。
12. 集群部署难度大。昇腾集群部署流程繁琐,配置复杂,依赖多(如CANN、MindX、D-driver等多个组件),相比CUDA更难实现快速部署与弹性扩展。
13. 算子库不全面。官方算子库缺少稀疏计算、图神经网络(GNN)、多模态感知等领域支持,限制多样模型的适配能力。
14. 硬件架构与通信。主要瓶颈在带宽、能效、互联结构与透明度方面不够完善,现在都还有比较大的改进空间。
15. 集群资源监控能力差。缺乏类似的集群资源占用监控工具,运维成本高。
16. 提升昇腾硬件的开放性与兼容性文档支持 。建议华为提供更详尽的硬件兼容性矩阵,帮助用户在部署前快速判断硬件适配情况,减少集成过程中的不确定性。
17. 建议针对MindIE推理引擎优化 prefill 阶段的显存占用(目前 128K 上下文模型的显存占用比起 NVIDIA 多了十几 G)。
18. 建立统一的昇腾开发者门户与问题追踪系统。目前文档、代码仓库、社区论坛分散在不同平台。建议整合为一站式开发者门户,集成文档检索、示例代码、常见问题库、Bug上报与进度追踪功能,提升问题解决效率。
19. 构建官方认证的模型 zoo 与迁移指南库。建议在Gitee/GitHub上维护一个权威的“昇腾适配模型库”,对主流模型(如BERT、YOLO、ResNet、LLaMA等)提供已验证的迁移脚本、性能数据和调优参数,并附带详细的迁移操作指南。
20. 优化社区响应机制,设立企业用户专属支持通道 。对于企业级用户,建议开通优先响应通道或技术支持工单系统,针对关键问题提供SLA保障(如24小时内初步响应),并定期组织线上答疑会或技术沙龙,增强用户粘性。
21. 提供更细粒度的性能剖析工具链(Profiler + Trace可视化) 。当前性能分析工具对新手门槛较高。建议推出轻量级性能探针工具,支持一键生成执行轨迹图、内存生命周期分析和算子调度时序图,帮助开发者直观理解模型运行瓶颈。
22. 增强社区问题响应闭环。在代码仓库(如gitee/ascend)中增设问题追踪看板,公开Bug修复进度,并对高频问题(如动态shape适配、自定义算子编译失败)提供标准化解决方案模板。
23. 开放Notebook环境持久化API。针对Notebook环境重启后配置丢失问题,除镜像保存功能外,提供环境变量与依赖包的一键导出/导入API,支持依赖版本冲突自动解决。
24. 完善NPU资源实时监控机制。当前训练任务中无法实时查看CPU/NPU使用率,建议在控制台增加多维度资源监控面板(如算力利用率、显存占用、温度曲线),支持历史数据回溯与瓶颈分析,帮助用户快速定位性能瓶颈。
25. 强化硬件兼容性自动化测试。针对第三方硬件(如新型PCIe设备、存储模块)与昇腾芯片的兼容性问题,提供标准化兼容性测试工具包,支持自动生成测试报告并推荐驱动适配方案,减少手动调试成本。
26. 社区和仓库对老旧型号的设备缺乏使用说明和示例
27. 社区和仓库针对推理卡的操作文档和demo较少,比如atlas300v,atlas300I pro等
28. mindie推理框架对比vllm设置比较复杂,config文件里面需要设置参数较多
29. 昇腾社区缺乏对910A硬件的支撑文档和对应mindie镜像
30. gitee仓库问题回复较慢。
附其他客户产研提交的实际问题:
1.文档与示例不足,官方示例覆盖不足,适配过程中发现文档缺少Atlas 300推理卡相关内容描述,Atlas 300卡对UOS产品适配滞后,且未在文档注明。
2.文档碎片化,例如:装 MindIE 需 ATB models,文档仅给链接却找不到包,只能等 3-5 天下载完整容器再手动抽取。
3.文档内容滞后,部分文档UOS版本依然是写的1050版本。
4.目前已经适配的vLLM引擎性能较MindIE偏弱,且vLLM版本适配的Pytorch与vLLM-Ascend使用的Pytorch版本不一致,目前社区方案是否已经确定?
5.CANN架构对6.6内核支持进度如何?