Joh*_*Kay 14 c cuda gpu-programming gpu-shared-memory gpu-local-memory
我只发现本地内存比寄存器内存慢,每个线程两种类型.
共享内存应该很快,但它比[线程]的本地内存更快?
我想要做的是一种中值滤波器,但具有给定的百分位数而不是中位数.因此,我需要获取列表的块,对它们进行排序,然后选择一个合适的列表.但我无法开始对共享内存列表进行排序或出现问题.只要复制到本地内存,我会失去很多性能吗?
| 归档时间: |
|
| 查看次数: |
5651 次 |
| 最近记录: |