小编ste*_*ola的帖子

AVX2由8个__m256i寄存器表示的矩阵的转置

我试图找出如何转置(在AVX2内部函数中)矩形矩阵,该矩形矩阵由8行__m256i寄存器组成,每行包含32x 8位(字符)。

__m256i matrix[8]; //32x8bit integers
Run Code Online (Sandbox Code Playgroud)

转置的矩阵就像32行的8x 8位整数,但我也可以用相同的方式表示它:8行的__m256i,每行包含4行的64位。

我知道_mm256_shuffle_epi8适用于此类问题,但是我不知道如何在矩形矩阵的这种特殊情况下使用它。

c x86 transpose simd avx2

4
推荐指数
1
解决办法
151
查看次数

标签 统计

avx2 ×1

c ×1

simd ×1

transpose ×1

x86 ×1