eXX*_*XX2 8 c x86 assembly rdtsc
#include <stdio.h>
static inline unsigned long long tick()
{
unsigned long long d;
__asm__ __volatile__ ("rdtsc" : "=A" (d) );
return d;
}
int main()
{
long long res;
res=tick();
res=tick()-res;
printf("%d",res);
return 0;
}
Run Code Online (Sandbox Code Playgroud)
我用gcc编译了这段代码,并使用了-O0 -O1 -O2 -O3优化.我总是得到2000-2500个周期.任何人都可以解释这个输出的原因吗?如何度过这些周期?
第一个函数"tick"是错误的.这是对的.
另一个版本的功能"滴答"
static __inline__ unsigned long long tick()
{
unsigned hi, lo;
__asm__ __volatile__ ("rdtsc" : "=a"(lo), "=d"(hi));
return ( (unsigned long long)lo)|( ((unsigned long long)hi)<<32 );
}
Run Code Online (Sandbox Code Playgroud)
这是-O3的汇编代码
.file "rdtsc.c"
.section .rodata.str1.1,"aMS",@progbits,1
.LC0:
.string "%d"
.text
.p2align 4,,15
.globl main
.type main, @function
main:
leal 4(%esp), %ecx
andl $-16, %esp
pushl -4(%ecx)
pushl %ebp
movl %esp, %ebp
subl $40, %esp
movl %ecx, -16(%ebp)
movl %ebx, -12(%ebp)
movl %esi, -8(%ebp)
movl %edi, -4(%ebp)
#APP
# 6 "rdtsc.c" 1
rdtsc
# 0 "" 2
#NO_APP
movl %edx, %edi
movl %eax, %esi
#APP
# 6 "rdtsc.c" 1
rdtsc
# 0 "" 2
#NO_APP
movl %eax, %ecx
movl %edx, %ebx
subl %esi, %ecx
sbbl %edi, %ebx
movl %ecx, 4(%esp)
movl %ebx, 8(%esp)
movl $.LC0, (%esp)
call printf
movl -16(%ebp), %ecx
xorl %eax, %eax
movl -12(%ebp), %ebx
movl -8(%ebp), %esi
movl -4(%ebp), %edi
movl %ebp, %esp
popl %ebp
leal -4(%ecx), %esp
ret
.size main, .-main
.ident "GCC: (Debian 4.3.2-1.1) 4.3.2"
.section .note.GNU-stack,"",@progbits
Run Code Online (Sandbox Code Playgroud)
这是CPU
processor : 0
vendor_id : GenuineIntel
cpu family : 15
model : 4
model name : Intel(R) Xeon(TM) CPU 3.00GHz
stepping : 3
cpu MHz : 3000.105
cache size : 2048 KB
fdiv_bug : no
hlt_bug : no
f00f_bug : no
coma_bug : no
fpu : yes
fpu_exception : yes
cpuid level : 5
wp : yes
flags : fpu vme de pse tsc msr pae mce cx8 apic sep mtrr pge mca cmov pat pse36 clflush dts acpi mmx fxsr sse sse2 ss constant_tsc up pebs bts pni
bogomips : 6036.62
clflush size : 64
Run Code Online (Sandbox Code Playgroud)
NPE*_*NPE 10
我已经在几个运行在不同Intel CPU上的Linux发行版上尝试了你的代码(不可否认,它们比你似乎使用的Pentium 4 HT 630更新).在所有这些测试中,我得到的值在25到50个周期之间.
我唯一与所有证据一致的假设是,您在虚拟机内而不是在裸机上运行操作系统,而TSC正在虚拟化.
获得大量数据的原因有很多:
请注意,rdtsc对于没有工作的计时而言,这不是特别可靠,因为
大多数操作系统都具有高精度时钟或定时方法.clock_gettime以Linux为例,特别是单调时钟.(了解挂钟和单调时钟之间的区别:挂钟可以向后移动 - 即使是UTC.)在Windows上,我认为建议是QueryHighPerformanceCounter.通常,这些时钟可为大多数需求提供足够的精度.
另外,看看程序集,看起来你只得到了32位的答案:我看不到之后%edx得到保存rdtsc.
运行你的代码,我得到120-150 ns的clock_gettime使用时间CLOCK_MONOTONIC,rdtsc的时间为70-90(全速约20 ns,但我怀疑处理器是时钟降低的,那真是大约50 ns).(在笔记本电脑桌面上(通过SSH,忘了我在哪台机器上!),CPU占用率大约是20%)确定你的机器没有陷入困境?
看起来您的操作系统禁用了用户空间中 RDTSC 的执行。并且您的应用程序必须切换到内核并返回,这需要大量的周期。
\n\n这来自英特尔软件开发人员\xe2\x80\x99s 手册:
\n\n\n\n\n当处于受保护或虚拟 8086 模式时,寄存器 CR4 中的时间戳禁用 (TSD) 标志将限制 RDTSC 指令的使用,如下所示。当 TSD 标志清零时,RDTSC 指令可以在任何特权级别执行;当该标志被设置时,该指令只能在特权级0下执行。(在实地址模式下,RDTSC指令始终启用。)
\n
编辑:
\n\n在回答 aix 的评论时,我解释了为什么 TSD 很可能是这里的原因。
\n\n我只知道程序执行单个指令的时间比平常长的这些可能性:
\n\n前两个原因通常不能将执行延迟超过几百个周期。对于上下文/内核切换,2000-2500 个周期更为典型。但实际上不可能在同一个地方多次捕获上下文切换。所以应该是内核切换。这意味着程序在调试器下运行,或者在用户模式下不允许 RDTSC。
\n\n操作系统禁用 RDTSC 最可能的原因可能是安全。有人尝试使用 RDTSC 来破解加密程序。
\n