标签: gpu

如何在Nvidia GPU上调试OpenCL?

有没有办法在Nvidia GPU上调试OpenCL内核,即设置断点和检查变量?我的理解是,Nvidia的工具不允许OpenCL调试,AMDIntel只允许在自己的设备上使用它.

gpu gpgpu nvidia opencl amd-processor

9
推荐指数
1
解决办法
4055
查看次数

张量流代码优化策略

请原谅这个问题的广泛性.也许一旦我知道更多,也许我可以更具体地问.

我有性能敏感的tensorflow代码.从对gpu编程知之甚少的人的角度来看,我想知道哪些指南或策略是优化我的代码的"好开始".(单个gpu)

或许甚至可以读出每个张量流操作花了多长时间...

我有一个模糊的理解

  • 当分配给cpu而不是gpu时,某些操作会更快,但是不清楚哪个操作
  • 我在一篇
    论文中读到了一篇名为"EEG"的谷歌软件,可能有一天会被开源.

可能还有其他常见因素在起作用,我不知道..

cpu performance gpu tensorflow

9
推荐指数
1
解决办法
4480
查看次数

Tensorflow:如何实时监控模型培训期间的GPU性能?

我是Ubuntu和GPU的新手,最近在我们的实验室中使用了带有Ubuntu 16.04和4个NVIDIA 1080ti GPU的新PC.该机器还配备了i7 16核心处理器.

我有一些基本问题:

  1. 为GPU安装了Tensorflow.那么我认为它会自动优先考虑GPU的使用情况?如果是这样,它是否一起使用全部4或者是否使用1然后在需要时再招募另一个?

  2. 我可以在模型训练期间实时监控GPU使用/活动吗?

我完全理解这是基本的硬件,但对这些具体问题的明确答案将是很好的.

编辑:

根据这个输出 - 这真的说我的每个GPU上的几乎所有内存都被使用了吗?

在此输入图像描述

performance gpu tensorflow

9
推荐指数
3
解决办法
1万
查看次数

如何使用关键字在nvidia-smi中使用PID杀死GPU上的进程?

如何终止终端中特定程序(例如python)在GPU上正在运行的进程?例如,两个进程在顶部图片中使用python运行,并杀死它们以在nvidia-smi中看到底部图片

例如,两个进程在顶部图片中使用python运行,并杀死它们以在nvidia-smi中看到底部图片

python gpu pid nvidia keyword

9
推荐指数
5
解决办法
1万
查看次数

ipad/3gs(SGX显卡)的最大纹理'计数'是多少?我们可以"专门"使用纹理数据多少内存?

究竟什么是与PowerVR SGX卡中的纹理内存相关的"共享内存".没有与此相关的正确文档.

通常对于iPhone上的应用程序(假设3​​gs/ipad PowerVR SGX卡),它限制为使用24MB.即使我加载了大约64mb的纹理,它也会加载.然后它为什么称为共享内存!对此真的很困惑.指向整个建筑的指针也很受欢迎.谢谢.

iphone graphics gpu opengl-es ios

8
推荐指数
1
解决办法
2062
查看次数

AMD设备上的物理内存:本地与私有

我正在OpenCL中编写一个算法,我需要每个工作单元记住一部分数据,比如每个内核的a long[70]和a long[200]左右.

最近的AMD设备具有32 KiB __local内存,这是(对于每个内核的给定数据量)足以存储20-58个工作单元的信息.但是,根据我从架构中理解的内容(特别是从该图中),每个着色器核心还具有专用的私有内存量.然而,我找不到它的大小.

任何人都可以告诉我如何找出每个内核有多少私有内存?

我对HD7970特别好奇,因为我打算很快购买其中的一些.

编辑:问题解决了,答案是这里的附录D.

architecture gpu gpgpu opencl amd-processor

8
推荐指数
1
解决办法
3175
查看次数

在像素着色器中可以实现什么样的模糊?

高斯,框,径向,方向,运动模糊,变焦模糊等

我读到高斯模糊可以在可以在像素着色器中实现的通道中分解,但是找不到任何样本.

假设任何与自身以外的像素有关的效果都无法在像素着色器中实现,这是正确的吗?

shader gpu glsl hlsl pixel-shader

8
推荐指数
2
解决办法
7458
查看次数

仅在GPU上求解小对称正定Ax = b

我正在尝试在实时3D建模中优化应用程序.应用程序的计算部分几乎完全在CUDA中的GPU上运行.该应用需要小(6x6)双精度对称正定线性系统的解决方案Ax = b每秒500+次.目前,这是正在使用基于乔莱斯基线性代数库的高效CPU完成,但必要数据从CPU复制 - GPU和回GPU每秒数百和内核的开销次,每次启动等.

如何在GPU上计算线性系统的解决方案,而无需将数据全部输入CPU?我已经阅读了一些关于MAGMA库的内容,但它似乎使用混合算法而不是仅GPU算法.

我已经准备好了,GPU上的单个线性系统的解决方案将比现有的基于CPU的库慢得多,但我想看看是否可以通过删除之间的数据通信来弥补这一点.主机和设备以及内核启动的开销等每秒数百次.如果没有GPU只有类似LAPACK的替代方案,我将如何在GPU上实现一些解决这个特定的6x6案例?如果没有GPU BLAS库的大量时间投资,可以做到吗?

algorithm cuda gpu linear-algebra solver

8
推荐指数
1
解决办法
1624
查看次数

OpenCL和CUDA中的持久线程

我已经阅读了一些关于GPGPU的"持久线程"的论文,但我并不是真的理解它.任何人都可以给我一个例子或向我展示这种编程方式的用途吗?

在阅读和搜索"持久线程"之后,我在脑海中留下了什么:

Presistent Threads它只不过是一个while循环,它可以保持线程运行并计算大量的工作.

它是否正确?提前致谢

参考:http ://www.idav.ucdavis.edu/publications/print_pub?pub_id = 1089 http://developer.download.nvidia.com/GTC/PDF/GTC2012/PresentationPDF/S0157-GTC2012-Persistent-Threads-Computing .PDF

cuda gpu gpgpu opencl

8
推荐指数
1
解决办法
3550
查看次数

在执行Tensorflow或Theano代码期间GPU丢失

当训练两个不同神经网络中的一个时,一个用Tensorflow,另一个用Theano,有时候经过一段随机的时间(可能是几个小时或几分钟,大多数几个小时),执行冻结,我得到这个消息运行"nvidia-smi":

"无法确定GPU 0000:02:00.0的设备句柄:GPU丢失.重新启动系统以恢复此GPU"

我尝试监控GPU性能,执行13个小时,一切看起来都很稳定: 在此输入图像描述

我正在与:

  • Ubuntu 14.04.5 LTS
  • GPU是Nvidia Titan Xp(这种行为在同一台机器上的另一个GPU上重复)
  • CUDA 8.0
  • CuDNN 5.1
  • Tensorflow 1.3
  • Theano 0.8.2

我不确定如何处理这个问题,有人可以提出一些可能导致这种情况以及如何诊断/解决此问题的建议吗?

gpu nvidia cudnn theano-cuda tensorflow-gpu

8
推荐指数
1
解决办法
1302
查看次数