标签: gpu

有没有办法迫使Bazel连续运行测试

默认情况下,Bazel以并行方式运行测试以加快速度.但是,由于GPU内存限制,我有一个无法处理并行作业的资源(GPU).有没有办法强制Bazel以串行方式运行测试,即非并行方式?

谢谢.

gpu bazel tensorflow

10
推荐指数
2
解决办法
1891
查看次数

用于机器学习的外部GPU

我拥有MacBook Pro 15'2014年中期,我正在考虑购买Titan X GPU来加速我的神经网络的训练.Titan将通过Thunderbolt 2作为外部GPU连接.

我可以从这种设置中获得什么样的性能 - 它是否与连接到主板相同?霹雳是否会限制GPU的速度?

macos gpu

10
推荐指数
2
解决办法
5127
查看次数

在哪里可以找到从gpusGenerateCrashLog调用堆栈创建的日志?

在我的OpenGL渲染引擎中,当我按下一个开始发出一些新的OpenGL调用的键后,我正在崩溃1帧.

以下是崩溃的调用堆栈,它是一个CVDisplayLink线程.

0   libsystem_kernel.dylib          0x00007fff94d89f06 __pthread_kill + 10
1   libsystem_pthread.dylib         0x00007fff88d3e4ec pthread_kill + 90
2   libsystem_c.dylib               0x00007fff980246e7 abort + 129
3   libGPUSupportMercury.dylib      0x00007fff983a3e5c gpusGenerateCrashLog + 158
4   com.apple.driver.AppleIntelHD5000GraphicsGLDriver   0x000000010f750d4b gpusKillClientExt + 9
5   libGPUSupportMercury.dylib      0x00007fff983a5204 gpusSubmitDataBuffers + 162
6   com.apple.driver.AppleIntelHD5000GraphicsGLDriver   0x000000010f2ac3f2 IntelCommandBuffer::getNew(GLDContextRec*) + 48
7   com.apple.driver.AppleIntelHD5000GraphicsGLDriver   0x000000010f399849 intelSubmitCommands + 171
8   com.apple.driver.AppleIntelHD5000GraphicsGLDriver   0x000000010f3996c2 gldPresentFramebufferData + 142
9   GLEngine                        0x000000010f0ddc81 glSwap_Exec + 97
10  com.apple.GLEngineProfiler      0x000000010d759265 0x10d60b000 + 1368677
11  com.apple.opengl                0x00007fff8ed15ffe CGLFlushDrawable + 66
12  com.apple.AppKit                0x00007fff8846509f -[NSOpenGLContext flushBuffer] + …
Run Code Online (Sandbox Code Playgroud)

opengl macos gpu driver osx-elcapitan

10
推荐指数
1
解决办法
395
查看次数

使用Ubuntu在AWS GPU实例上运行OpenGL

我正在尝试使用Ubuntu Ubuntu Server 16.04让opengl在亚马逊p2实例上进行无头屏幕渲染.

实例创建后,我根据这篇亚马逊文章安装了相应的nvidia驱动程序,它们似乎按预期工作:

$ lsmod | grep nvidia
nvidia_drm             53248  0
nvidia_modeset        790528  1 nvidia_drm
nvidia              11911168  1 nvidia_modeset
drm_kms_helper        155648  3 cirrus,nouveau,nvidia_drm
drm                   364544  7 ttm,drm_kms_helper,cirrus,nouveau,nvidia_drm

$ nvidia-smi -q | head
==============NVSMI LOG==============

Timestamp                           : Thu Jan 19 11:22:38 2017
Driver Version                      : 375.20

Attached GPUs                       : 1
GPU 0000:00:1E.0
Product Name                    : Tesla K80
Product Brand                   : Tesla
Run Code Online (Sandbox Code Playgroud)

我正在尝试这个相关问题的步骤:

sudo apt-get install xserver-xorg libglu1-mesa-dev freeglut3-dev mesa-common-dev libxmu-dev libxi-dev
sudo nvidia-xconfig -a --use-display-device=None …
Run Code Online (Sandbox Code Playgroud)

opengl ubuntu gpu headless amazon-ec2

10
推荐指数
2
解决办法
2156
查看次数

从托管代码执行CPU/GPU指令

考虑执行禁用位,从高级托管环境(如VB.NET 2008或C#)对本机处理器执行指令的推荐方法是什么.另外有没有人在对图形处理器执行GPU指令时取得了类似的成果?

.net gpu

9
推荐指数
1
解决办法
1515
查看次数

为什么我们需要cudaDeviceSynchronize(); 在内核中使用device-printf?

__global__ void helloCUDA(float f)
{
    printf("Hello thread %d, f=%f\n", threadIdx.x, f);
}

int main()
{
    helloCUDA<<<1, 5>>>(1.2345f);
    cudaDeviceSynchronize();
    return 0;
}
Run Code Online (Sandbox Code Playgroud)

为什么是cudaDeviceSynchronize(); 在很多地方例如这里 在内核调用后不需要它?

c cuda gpu nvidia

9
推荐指数
1
解决办法
9769
查看次数

将数据上传到共享内存中以用于卷积内核

我在参考评论中理解批量加载时遇到一些困难.为了计算像素中的卷积,大小为5的掩模必须以该特定像素为中心.图像被分为图块.应用卷积掩模后的这些图块是尺寸为的最终输出图块TILE_WIDTH*TILE_WIDTH.对于属于输出图块边框的像素,当此图块属于图像的边框时,图像必须从相邻图块借用一些像素.否则,这些借来的值被赋值为零.这两个步骤描述于

if (srcY >= 0 && srcY < height && srcX >= 0 && srcX < width)
    N_ds[destY][destX] = I[src];
else
    N_ds[destY][destX] = 0;
Run Code Online (Sandbox Code Playgroud)

因此,共享存储器阵列的TILE_WIDTH + Mask_width - 1每一侧都有尺寸.我不清楚代码的以下部分.

  1. destYdestX指数.将输出索引除以输入切片宽度意味着什么?
  2. srcY添加srcX索引.为什么destYdestX索引参与srcY添加srcX索引?

    srcY = blockIdx.y * TILE_WIDTH + destY - Mask_radius;

    srcX = blockIdx.x * TILE_WIDTH + destX - Mask_radius;

  3. 为什么在第二次加载时我们使用偏移TILE_WIDTH * TILE_WIDTH
  4. 一般来说,有两次加载的直观解释是什么?
  5. 所有这些问题都可以根据下面的图像进行直观的示例吗?
  6. 谢谢!

编辑:图片添加.在绿色中有输出瓦片,在红色中我们有掩模以114索引为中心.很明显,面具借用了不同瓷砖的元素.最后,该图像指的是一个通道.

示例: …

cuda gpu

9
推荐指数
1
解决办法
5918
查看次数

Clojure上的GPU编程?

我想知道如果Clojure有任何GPU集成库会怎么样?

我已经看过这个涉及手动滚动OpenCL代码的例子,但我特别是我正在寻找类似于Anacoda的东西,它将Numpy Python表达式相对无缝地转换为CUDA代码.

我对OpenCL或Cuda方法持开放态度.

cuda gpu clojure opencl

9
推荐指数
1
解决办法
2844
查看次数

用于(转)神经网络计算的CPU与GPU

我是AI的学生,今年他将与pylearn和Theano(我也可能尝试火炬和咖啡)合作实施神经网络,我即将为此买一台笔记本电脑.我希望根据您对此事的经验给予您帮助.

我没有很大的预算,所以我负担不起.我有两三个简单的问题:

哪个最适合图书馆,如theano,torch,caffe:ATINVIDIA?有没有人尝试过Geforce 740M 820M 840M上的GPU计算?它比CPU更好吗?或者如果我买不起巨大的GPU,那么购买带有i7的笔记本电脑比用这些(廉价)卡更好吗?

感谢您的时间,

cpu gpu machine-learning computer-vision neural-network

9
推荐指数
1
解决办法
1万
查看次数

使用OpenCL的GPU线程同步多核CPU线程

我一直在与使用OpenCL的多核CPU线程进行GPU线程同步.我确实看到了一些CUDA示例,但是,如果有人能够在OpenCL方面给我一些关于同步部分的提示,我会更清楚这个概念.提前感谢您对此事的任何帮助.

multithreading gpu opencl

9
推荐指数
1
解决办法
508
查看次数