关于cuda拷贝的速度测试

由于没有使用profiler,仅仅通过简单的传输函数测试，如下测试了10000个点，1000000个点，100000000个点的速度：

均按时钟周期来计时，通过MAX调整数据

int main(){
    clock_t start,finish;

    int *d_data,*h_data;
    h_data = (int *)calloc(MAX, sizeof(int));
    memset(h_data,0,MAX*sizeof(int));
    cudaMalloc((void **) &d_data,MAX*sizeof(int));


    start = clock();
    cudaMemcpy(d_data,h_data,MAX*sizeof(int),cudaMemcpyHostToDevice);
    cudaMemcpy(h_data,d_data,MAX*sizeof(int),cudaMemcpyDeviceToHost);
    finish = clock();


    cudaFree(d_data);
    free(h_data);
    cout<<"time is "<<finish-start<<endl;
    getchar();
return 0;
}

测试结果

测试结果	10,000个节点	1,000,000个节点	100,000,000个节点
第一次测试	0	7	822
第二次测试	0	8	715
第三次测试	1	7	696

测试图表如下：

所以在小批量数组的情况下，完全可以在cpu中完成数据操作，然后device上面做简单的加和或者乘积运算。

相关阅读:
抽象类与接口【转载】
linux网卡驱动程序架构
linux回环网卡驱动设计
命令行启动appium服务
Java+Maven的工程运行Sonar的方式
使用Fabric在tomcat中部署应用的问题总结
Fabric的使用总结
利用xcode Build生成模拟器运行包
Jenkins配置git/github 插件的ssh key
Jenkins插件--通知Notification

原文地址：https://www.cnblogs.com/xing901022/p/3397227.html