【实验环境】
操作系统:Ubuntu 18.04
硬件信息:Ascend NPU 910 + CPU
版本信息:Mindspore 1.10 + CANN 6.0.1.alpha001 + GCC 7.5.0
(Mindspore 2.0.0-alpha + CANN 6.0.RC1 + GCC 7.5.0)
训练模型:Wide_and_Deep网络(Mindspore官网提供的代码)
【报错信息】
使用Mindspore官网提供的Wide_and_Deep代码(演示Mindspore Parameter Server异构模式的教程)
使用mindspore 1.10和2.0版本均在单机多卡的实验环境配置(4卡),报错信息如下:
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:170] Join] Task: DataQueueOp(ID:0) Thread ID 140386936792832 is not responding. Interrupt it again.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:178] Join] Wait 31 seconds, the task: DataQueueOp(ID:0) will be destroyed by TdtHostDestory.
[INFO] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:181] Join] Destroy tdt channel success.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:189] Join] Task: DataQueueOp(ID:0) Thread ID 140386936792832 is not responding. Maybe it has been destroyed. Stop the task.
[INFO] MD [mindspore/ccsrc/minddata/dataset/engine/python_runtime_context.cc:22] Terminate] Terminating a Dataset PythonRuntime.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/engine/datasetops/data_queue_op.cc:93] ~DataQueueOp] preprocess_batch: 0; batch_queue: 0, 2; push_start_time: 2023-05-05-18:01:32.208.476; push_end_time: .
[INFO] PS [mindspore/ccsrc/ps/ps_cache/ps_data/ps_data_prefetch.cc:89] PrefetchData] Waiting for ps data process, channel name:cf8134f6-eb2b-11ed-a26c-5c546d6b6dae...(39 / 40)
[ERROR] PS [mindspore/ccsrc/ps/ps_cache/ps_data/ps_data_prefetch.cc:93] PrefetchData] Ps cache data process timeout, suggest to enlarge the cache size.
[ERROR] DEVICE [mindspore/ccsrc/plugin/device/ascend/hal/device/ascend_data_queue.cc:248] Push] PrefetchData failed in when pre-processing sending data.
根据报错信息尝试:
1. 增大vocab_cache_size
2. 降低batch size
报错信息同上
【问题求助】
1. Mindspore的Parameter Server异构模式在Ascend NPU单机多卡场景时的PS处理数据超时问题。
2. Mindspore的Parameter Server异构模式的Cache如何手动配置开启关闭和大小,以及是否等价于EmbeddingLookup算子的vocab_cache_size。
3. Mindspore在Ascend NPU卡上训练推理,Parameter Server异构模式稳定的配套版本,如Mindspore和CANN。
【实验环境】
操作系统:Ubuntu 18.04
硬件信息:Ascend NPU 910 + CPU
版本信息:Mindspore 1.10 + CANN 6.0.1.alpha001 + GCC 7.5.0
(Mindspore 2.0.0-alpha + CANN 6.0.RC1 + GCC 7.5.0)
训练模型:Wide_and_Deep网络(Mindspore官网提供的代码)
【报错信息】
使用Mindspore官网提供的Wide_and_Deep代码(演示Mindspore Parameter Server异构模式的教程)
使用mindspore 1.10和2.0版本均在单机多卡的实验环境配置(4卡),报错信息如下:
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:170] Join] Task: DataQueueOp(ID:0) Thread ID 140386936792832 is not responding. Interrupt it again.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:178] Join] Wait 31 seconds, the task: DataQueueOp(ID:0) will be destroyed by TdtHostDestory.
[INFO] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:181] Join] Destroy tdt channel success.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/util/task.cc:189] Join] Task: DataQueueOp(ID:0) Thread ID 140386936792832 is not responding. Maybe it has been destroyed. Stop the task.
[INFO] MD [mindspore/ccsrc/minddata/dataset/engine/python_runtime_context.cc:22] Terminate] Terminating a Dataset PythonRuntime.
[WARNING] MD [mindspore/ccsrc/minddata/dataset/engine/datasetops/data_queue_op.cc:93] ~DataQueueOp] preprocess_batch: 0; batch_queue: 0, 2; push_start_time: 2023-05-05-18:01:32.208.476; push_end_time: .
[INFO] PS [mindspore/ccsrc/ps/ps_cache/ps_data/ps_data_prefetch.cc:89] PrefetchData] Waiting for ps data process, channel name:cf8134f6-eb2b-11ed-a26c-5c546d6b6dae...(39 / 40)
[ERROR] PS [mindspore/ccsrc/ps/ps_cache/ps_data/ps_data_prefetch.cc:93] PrefetchData] Ps cache data process timeout, suggest to enlarge the cache size.
[ERROR] DEVICE [mindspore/ccsrc/plugin/device/ascend/hal/device/ascend_data_queue.cc:248] Push] PrefetchData failed in when pre-processing sending data.
根据报错信息尝试:
1. 增大vocab_cache_size
2. 降低batch size
报错信息同上
【问题求助】
1. Mindspore的Parameter Server异构模式在Ascend NPU单机多卡场景时的PS处理数据超时问题。
2. Mindspore的Parameter Server异构模式的Cache如何手动配置开启关闭和大小,以及是否等价于EmbeddingLookup算子的vocab_cache_size。
3. Mindspore在Ascend NPU卡上训练推理,Parameter Server异构模式稳定的配套版本,如Mindspore和CANN。