为什么英特尔编译器会忽略英特尔MIC的非时间预取pragma指令?

Dan*_*ica 8 c++ intel pragma prefetch xeon-phi

英特尔编译器在循环内生成以下预取指令,以通过a_ptr指针访问数组:

400e93:       62 d1 78 08 18 4c 24    vprefetch0 [r12+0x80]
Run Code Online (Sandbox Code Playgroud)

如果我手动更改(通过十六进制编辑可执行文件)这到非临时预取:

400e93:       62 d1 78 08 18 44 24    vprefetchnta [r12+0x80]
Run Code Online (Sandbox Code Playgroud)

循环运行快了近1.5倍(!!!).但是,我更喜欢编译器为我生成非时间预取.我以为

#pragma prefetch a_ptr:_MM_HINT_NTA
Run Code Online (Sandbox Code Playgroud)

在循环之前应该做的伎俩,但它实际上没有; 它生成的指令与不完整的pragma完全相同.为什么icpc忽略这个pragma?我怎么强迫它生成非时间预取?

选择.据我所知,报告没有说任何有用的内容:

LOOP BEGIN at test-mic.cpp(56,5)
   remark #15344: loop was not vectorized: vector dependence prevents vectorization
   remark #15346: vector dependence: assumed ANTI dependence between b_ptr line 64 and b_ptr line 65
   remark #15346: vector dependence: assumed FLOW dependence between b_ptr line 65 and b_ptr line 64
   remark #25018: Total number of lines prefetched=2
   remark #25019: Number of spatial prefetches=2, dist=29
   remark #25021: Number of initial-value prefetches=2
   remark #25139: Using second-level distance 2 for prefetching spatial memory reference   [ test-mic.cpp(61,50) ]
   remark #25015: Estimate of max trip count of loop=1048576
LOOP END
Run Code Online (Sandbox Code Playgroud)

K. *_*vis 4

这是一个已知问题 - BKM 在预取指令/编译指示中对提示(t0、t1、t2、nta)使用显式值 0、1、2、3(并且不使用 MM_HINT 枚举)。

这是因为头文件中的 MM_HINT 枚举映射不同:

/* constants to use with _mm_prefetch  (extracted from *mmintrin.h) */
#define _MM_HINT_T0 1
#define _MM_HINT_T1 2
#define _MM_HINT_T2 3
#define _MM_HINT_NTA    0    <--maps here
#define _MM_HINT_ENTA   4
#define _MM_HINT_ET0    5
#define _MM_HINT_ET1    6
#define _MM_HINT_ET2    7
Run Code Online (Sandbox Code Playgroud)

另外,Intel 标头和 gcc 标头使用不同的枚举值 - 这也很麻烦。因此提示 --enums 仅用于 _mm_prefetch 内在函数,而不用于预取指令。

对于此示例,您应该能够使用:#pragma prefetch a_ptr:3

然而,由于编译器当前无法将循环内的 a_ptr 加载内存引用与预取指令中的表达式正确连接的缺陷,该建议语法当前不可用;因此,临时解决方案是使用以下语法:

#pragma 预取 *:3

注意:星号表示该指令将应用于循环内的“ALL”内存引用。在此循环中,b_ptr 无论如何都无法被编译器预取 - 因为它不是线性地址表达式。因此,“*”在这里仅适用于 a_ptr - 并导致 vprefetchnta (在 KNC 和 KNL 上)。

该缺陷将在未来版本中修复。