频道导航

c – 调用cuda内核时的性能损失

2019-06-06 C&C++ 前端之家

前端之家收集整理的这篇文章主要介绍了c – 调用cuda内核时的性能损失，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

我想知道执行cuda内核调用的开销在C/C++中,如下所示：

somekernel1<<<blocks,threads>>>(args);
somekernel2<<<blocks,threads>>>(args);
somekernel3<<<blocks,threads>>>(args);

我问这个问题的原因是因为我正在构建的应用程序重复调用几个内核(没有内存被重新读取/写入到设备之间的调用),我想知道是否将这些内核调用包装到单个内核调用(使用somekernel1-3成为设备功能)将在性能上产生任何有意义的差异.

解决方法

在非WDDM Windows平台上,启动运行时API的内核的主机端开销只有15-30微秒.在WDDM平台(我不使用)上,我明白,它可以要高得多,加上在驱动程序中有一些批处理机制,通过在单个驱动程序端操作中执行多个操作来尝试平摊成本.

通常,“融合”多个数据操作的性能将会提高,否则这些数据操作将在单独的内核中进行单个内核,而算法允许它们. GPU具有比峰值存储器带宽更高的算术峰值性能,因此每个存储器事务(以及每个内核“设置代码”)可以执行的FLOP越多,内核的性能就越好.另一方面,试图写出一个“瑞士军刀”风格的内核,试图将完全不同的操作压缩成一个单独的代码,从来不是一个特别好的主意,因为它增加了寄存器压力并降低了像L1,不断的记忆和纹理缓存.

你选择哪一种方式应该是由代码/算法的本质来指导的.我不相信这个问题有一个单一的“正确的”答案可以在所有情况下应用.

上一篇：c中有1U和1之间有区别吗？下一篇：为什么在C中复制文件比C快得多？

猜你在找的C&C++相关文章

C++11新特性的一些用法举例②

/** C+⬑ * 默认成员函数原来C++类中，有6个默认成员函数：构造函数析...

作者：HJfjfK 时间：2024-09-28

C++特殊类的设计与单例模式

#pragma once // 1. 设计一个不能被拷贝的类/* 解析:拷贝只会放生在两个场景中：拷贝构造函...

作者：HJfjfK 时间：2024-09-28

C++11的类型转换

C类型转换 C语言:显式和隐式类型转换隐式类型转化：编译器在编译阶段自动进行，能转就转，...

作者：HJfjfK 时间：2024-09-28

C++异常的基本概念与用法

//异常的概念/*抛出异常后必须要捕获,否则终止程序(到最外层后会交给main管理,main的行为就...

作者：HJfjfK 时间：2024-09-28

C++的智能指针

#pragma once /*Smart pointer 智能指针;灵巧指针智能指针三大件//1.RAII//2.像指针一样使...

作者：HJfjfK 时间：2024-09-28

C++11标准库原子变量 <atomic> 梳理

目录<atomic>原子操作的概念CAS实现原理CAS操作的伪代码：使用CAS完成变量的...

作者：HJfjfK 时间：2024-09-28

C++11新特性的一些用法举例①

//字符串字面量/*常用:1.原始字符串字面量括号内保持原样输出没有转义字符,如n不再是换行...

作者：HJfjfK 时间：2024-09-28

C++11标准库条件变量 <condition_variable> 梳理

目录<condition_variable>condition_variable类类方法生产者消费者模型 -- ...

作者：HJfjfK 时间：2024-09-28

C++11智能指针 unique_ptr、shared_ptr/weak_ptr、make_shared、循环引用、定制删除器 (万字长文)

目录智能指针场景引入 - 为什么需要智能指针？内存泄漏什么是内存泄漏内存泄漏的危害内存泄...

作者：HJfjfK 时间：2024-09-28

/** 多态/动态调用 * * * 1.虚函数/虚拟函数 * 语法:在函数前面加上virtual * * 1.1虚函数...

作者：HJfjfK 时间：2024-09-28

编程分类

PHP Java Java SE Python C#C&C++Ruby VB asp.Net Go Perl netty Django Delphi Jsp .NET Core Spring Flask Springboot SpringMVC Lua Laravel Mybatis Asp Groovy ThinkPHP Yii swoole

最新文章