Luo*_*gao 4 c++ simd avx2 avx512
我想问一个关于SIMD的问题.我没有得到AVX512我的CPU,但想要一个_mm256_max_epu64.
我们如何实现这个功能AVX2?
在这里,我试着让我的琐碎.也许我们可以让它成为讨论并改进它.
#define SIMD_INLINE inline __attribute__ ((always_inline))
SIMD_INLINE __m256i __my_mm256_max_epu64_(__m256i a, __m256i b) {
uint64_t *val_a = (uint64_t*) &a;
uint64_t *val_b = (uint64_t*) &b;
uint64_t e[4];
for (size_t i = 0; i < 4; ++i) e[i] = (*(val_a + i) > *(val_b + i)) ? *(val_a + i) : *(val_b + i);
return _mm256_set_epi64x(e[3], e[2], e[1], e[0]);
}
Run Code Online (Sandbox Code Playgroud)
编辑作为摘要:
我们讨论了__mm256 无符号比较.我只是按照这个非常基本的概念给出了我的琐碎实现:单个__m256i只等于4 uint64_t或4 float,它们也组成256位.
然后我们得到了@chtz的答案,从AVX调用更多位编程函数更有意义AVX.
最后,由于结果,这两个实现结果在同一个程序集中CLang.编译器资源管理器的汇编示例
另外_mm256_min_epu64_补充道.它只是反映了_mm256_max_epu64_上述情况.使搜索更容易将来使用.
SIMD_INLINE __m256i __my_mm256_min_epu64_(__m256i a, __m256i b) {
uint64_t *val_a = (uint64_t*) &a;
uint64_t *val_b = (uint64_t*) &b;
uint64_t e[4];
for (size_t i = 0; i < 4; ++i) e[i] = (*(val_a + i) < *(val_b + i)) ? *(val_a + i) : *(val_b + i);
return _mm256_set_epi64x(e[3], e[2], e[1], e[0]);
}
Run Code Online (Sandbox Code Playgroud)
最简单的解决方案_mm256_cmpgt_epi64是混合物的组合.但是,如果您想要无符号最大值,则需要1<<63先从每个元素中减去(在比较之前,而不是在混合之前).没有_mm256_blendv_epu64指令,但可以使用,_mm256_blendv_epi8因为掩码将设置在相关元素的每一位.另请注意,减去最高位可以稍快一些xor:
__m256i pmax_epu64(__m256i a, __m256i b)
{
__m256i signbit = _mm256_set1_epi64x(0x8000'0000'0000'0000);
__m256i mask = _mm256_cmpgt_epi64(_mm256_xor_si256(a,signbit),_mm256_xor_si256(b,signbit));
return _mm256_blendv_epi8(b,a,mask);
}
Run Code Online (Sandbox Code Playgroud)
其实,铛几乎设法从你的代码相同的指令:https://godbolt.org/z/afhdOa
它只使用vblendvpd替代vpblendvb,这可能会引入延迟(详见@PeterCordes评论).
通过一些bit-twiddeling,您实际上可以保存为signbit设置寄存器.如果两个操作数的符号匹配,则无符号比较给出相同的结果,如果它们不匹配则给出相反的结果,即
unsigned_greater_than(signed a, signed b) == (a<0) ^ (b<0) ^ (a>b)
Run Code Online (Sandbox Code Playgroud)
如果您使用_mm256_blendv_pd带有某些转换作为_mm256_blendv_epi64(因为现在只有最高位有效),则可以使用此方法:
__m256i _mm256_blendv_epi64(__m256i a, __m256i b, __m256i mask)
{
return _mm256_castpd_si256(_mm256_blendv_pd(
_mm256_castsi256_pd(a),_mm256_castsi256_pd(b),_mm256_castsi256_pd(mask)));
}
__m256i pmax_epu64_b(__m256i a, __m256i b)
{
__m256i opposite_sign = _mm256_xor_si256(a,b);
__m256i mask = _mm256_cmpgt_epi64(a,b);
return _mm256_blendv_epi64(b,a,_mm256_xor_si256(mask, opposite_sign));
}
Run Code Online (Sandbox Code Playgroud)
仅供参考,签名的最大值当然只是:
__m256i pmax_epi64(__m256i a, __m256i b)
{
__m256i mask = _mm256_cmpgt_epi64(a,b);
return _mm256_blendv_epi8(b,a,mask);
}
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
338 次 |
| 最近记录: |