我想问一个关于SIMD的问题.我没有得到AVX512我的CPU,但想要一个_mm256_max_epu64.
我们如何实现这个功能AVX2?
在这里,我试着让我的琐碎.也许我们可以让它成为讨论并改进它.
#define SIMD_INLINE inline __attribute__ ((always_inline))
SIMD_INLINE __m256i __my_mm256_max_epu64_(__m256i a, __m256i b) {
uint64_t *val_a = (uint64_t*) &a;
uint64_t *val_b = (uint64_t*) &b;
uint64_t e[4];
for (size_t i = 0; i < 4; ++i) e[i] = (*(val_a + i) > *(val_b + i)) ? *(val_a + i) : *(val_b + i);
return _mm256_set_epi64x(e[3], e[2], e[1], e[0]);
}
Run Code Online (Sandbox Code Playgroud)
编辑作为摘要:
我们讨论了__mm256 无符号比较.我只是按照这个非常基本的概念给出了我的琐碎实现:单个__m256i只等于4 uint64_t或4 float,它们也组成256位.
然后我们得到了@chtz的答案,从AVX调用更多位编程函数更有意义 …