我已经为字符串匹配测试编写了一个程序,以测试性能与cpu的关系.
我只是调用内核<<<1,1>>>,一个包含一个线程的块,执行时间是430ms,然后我用一个块两个线程<<<1,2>>>来调用内核,执行时间是303ms,最后我调用内核<<<2,1><<,两个块和每个一个线程,时间只有430毫秒的一半(即215毫秒).
<<<1,1>>>
<<<1,2>>>
<<<2,1><<
块中的线程和warp之间有什么区别?是什么让一个包含两个线程的块比两个块慢一个块?
cuda
cuda ×1