我读到可以使用内核启动来同步不同的块,即,如果我希望所有块在继续操作2之前完成操作1,我应该将操作1放在一个内核中,将操作2放在另一个内核中.这样,我就可以实现块之间的全局同步.但是,cuda c编程指南提到内核调用是异步的,即.CPU不会等待第一个内核调用完成,因此,CPU也可以在第一个内核完成之前调用第二个内核.但是,如果这是真的,那么我们就不能使用内核启动来同步块.请让我知道我哪里出错了
cuda nvidia
cuda ×1
nvidia ×1