由于没有使用profiler,仅仅通过简单的传输函数测试,如下测试了10000个点,1000000个点,100000000个点的速度:
均按时钟周期来计时,通过MAX调整数据
int main(){ clock_t start,finish; int *d_data,*h_data; h_data = (int *)calloc(MAX, sizeof(int)); memset(h_data,0,MAX*sizeof(int)); cudaMalloc((void **) &d_data,MAX*sizeof(int)); start = clock(); cudaMemcpy(d_data,h_data,MAX*sizeof(int),cudaMemcpyHostToDevice); cudaMemcpy(h_data,d_data,MAX*sizeof(int),cudaMemcpyDeviceToHost); finish = clock(); cudaFree(d_data); free(h_data); cout<<"time is "<<finish-start<<endl; getchar(); return 0; }
测试结果
测试结果 | 10,000个节点 | 1,000,000个节点 | 100,000,000个节点 |
第一次测试 | 0 | 7 | 822 |
第二次测试 | 0 | 8 | 715 |
第三次测试 | 1 | 7 | 696 |
测试图表如下:
所以在小批量数组的情况下,完全可以在cpu中完成数据操作,然后device上面做简单的加和或者乘积运算。