我快速浏览了论坛,但我认为尚未有人问过这个问题。
我目前正在使用别人在博士期间编写的MPI / CUDA混合代码。每个CPU都有自己的GPU。我的任务是通过运行(已经工作的)代码来收集数据,并实现其他功能。目前暂时无法将此代码转换为一个CPU / Multi-GPU。
我想利用性能分析工具来分析整个过程。
现在的想法是让每个CPU为其自己的GPU启动nvvp并收集数据,而另一个性能分析工具将处理常规的CPU / MPI部分(我打算像往常一样使用TAU)。
问题是,同时启动nvvp的界面8次(如果与8个CPU / GPU一起运行)非常烦人。我想避免通过该界面,而是获得一个直接将数据写入文件的命令行,以便以后可以将其提供给nvvc的界面并进行分析。
我想获得一个命令行,该命令行将由每个CPU执行,并将为每个CPU生成一个文件,以提供有关其自身GPU的数据。8(GPU / CPU)= 8个文件。然后,我计划分别使用nvcc逐个添加和分析这些文件,并手动比较数据。
任何的想法 ?
谢谢 !