目前用batch size = 1,2,3,4,5分别转出了五个OM模型。又用--dynamic_batch_size="1,2,3,4,5"转出了一个动态batch的。
benchmark的时候,发现了很奇怪的现象,如图:

1. 动态batch似乎是按照最大batch来分配内存的?
2. 右边的延迟,耗时是batch size的一次函数。这是为什么呢?难道底下的实现是batch=1串行吗...没有体现出batch parallelism,很奇怪
这两个问题,不知道是我设置的问题,还是设计就是这样的...
感谢!
目前用batch size = 1,2,3,4,5分别转出了五个OM模型。又用--dynamic_batch_size="1,2,3,4,5"转出了一个动态batch的。
benchmark的时候,发现了很奇怪的现象,如图:
1. 动态batch似乎是按照最大batch来分配内存的?
2. 右边的延迟,耗时是batch size的一次函数。这是为什么呢?难道底下的实现是batch=1串行吗...没有体现出batch parallelism,很奇怪
这两个问题,不知道是我设置的问题,还是设计就是这样的...
感谢!