相关疑难解决方法(0)

为什么一个线程比调用函数更快,mingw

当我调用函数执行时间是6.8秒.从线程时间调用它是3.4秒,当使用2线程1.8秒时.无论我使用什么优化口粮保持相同.

在Visual Studio中,时间与预期的3.1,3和1.7秒相同.

#include<math.h>
#include<stdio.h>
#include<windows.h>
#include <time.h>

using namespace std;

#define N 400

float a[N][N];

struct b{
    int begin;
    int end;
};

DWORD WINAPI thread(LPVOID p)
{
    b b_t = *(b*)p;

    for(int i=0;i<N;i++)
        for(int j=b_t.begin;j<b_t.end;j++)
        {
            a[i][j] = 0;
            for(int k=0;k<i;k++)
                a[i][j]+=k*sin(j)-j*cos(k);
        }

    return (0);
}

int main()
{
    clock_t t;
    HANDLE hn[2];

    b b_t[3];

    b_t[0].begin = 0;
    b_t[0].end = N;

    b_t[1].begin = 0;
    b_t[1].end = N/2;

    b_t[2].begin = N/2;
    b_t[2].end = N;

    t = clock();
    thread(&b_t[0]);
    printf("0 - …
Run Code Online (Sandbox Code Playgroud)

c++ performance multithreading mingw function

6
推荐指数
1
解决办法
599
查看次数

使用Xeon Phi Knights Landing获得密集矩阵乘法的最大FLOPS

我最近开始使用Xeon Phi Knights Landing(KNL)7250计算机(http://ark.intel.com/products/94035/Intel-Xeon-Phi-Processor-7250-16GB-1_40-GHz-68-core) .

它有68个核心和AVX 512.基本频率为1.4 GHz,Turbo频率为1.6 GHz.我不知道所有内核的turbo频率是多少,因为通常turbo频率只引用一个内核.

每个Knights Landing核心每个周期可以进行两次8宽双FMA操作.由于每个FMA操作是两个浮点运算,因此每个核每个周期的双浮点运算为32.

因此最大GFLOPS是32*68*1.4 = 3046.4 DP GFLOPS.

对于单核心,峰值FLOPS是32*1.6 = 51.2 DP GLOPS.

密集矩阵乘法是实际上能够接近峰值触发器的少数操作之一.英特尔MKL库提供优化的密集矩阵乘法功能.在Sandy Bridge系统中,我使用DGEMM获得了超过97%的峰值FLOPS.在哈斯威尔,几年前我检查了大约90%的峰值,所以当时用FMA获得峰值显然更加困难.然而,凭借Knights Landing和MKL,我得到的峰值不到50%.

我修改了dgemm_example.cMKL示例目录中的文件以使用2.0*1E-9*n*n*n/time(参见下文)计算GFLOPS .

我也试过了export KMP_AFFINITY=scatter,export OMP_NUM_THREADS=68但这似乎没有什么区别.但是,KMP_AFFINITY=compact速度明显较慢,因此OMP_NUM_THREADS=1默认的线程拓扑似乎是分散的,并且线程正在工作.

我见过的最好的GFLOPS约为1301 GFLOPS,约占峰值的43%.对于一个线程,我看到38 GFLOPS,约占峰值的74%.这告诉我MKL DGEMM针对AVX512进行了优化,否则会看到不到50%.另一方面,对于单个线程,我认为我应该获得90%的峰值.

KNL内存可以在三种模式下运行(缓存,平面和混合),可以通过BIOS设置(http://www.anandtech.com/show/9794/a-few-notes-on-intels-knights-登陆-mcdram-modes-from-sc15).我不知道我的(或者说我的工作)KNL系统是什么模式.这会对DGEMM产生影响吗?

我的问题是为什么DGEMM的FLOPS如此之低,我该怎么做才能改进它?也许我没有最佳配置MKL(我正在使用ICC 17.0).

source /opt/intel/mkl/bin/mklvars.sh  intel64
icc -O3 -mkl dgemm_example.c 
Run Code Online (Sandbox Code Playgroud)

这是代码

#define min(x,y) (((x) < (y)) ? (x) : (y))

#include <stdio.h>
#include <stdlib.h>
#include "mkl.h"
#include …
Run Code Online (Sandbox Code Playgroud)

x86 openmp icc intel-mkl xeon-phi

6
推荐指数
0
解决办法
877
查看次数

标签 统计

c++ ×1

function ×1

icc ×1

intel-mkl ×1

mingw ×1

multithreading ×1

openmp ×1

performance ×1

x86 ×1

xeon-phi ×1