小编use*_*002的帖子

块中的线程和warp(32个线程)之间有什么区别?

我已经为字符串匹配测试编写了一个程序,以测试性能与cpu的关系.

我只是调用内核<<<1,1>>>,一个包含一个线程的块,执行时间是430ms,然后我用一个块两个线程<<<1,2>>>来调用内核,执行时间是303ms,最后我调用内核<<<2,1><<,两个块和每个一个线程,时间只有430毫秒的一半(即215毫秒).

块中的线程和warp之间有什么区别?是什么让一个包含两个线程的块比两个块慢一个块?

cuda

2
推荐指数
1
解决办法
2283
查看次数

标签 统计

cuda ×1