nb_kernel302_ia32_sse2.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,217 行 · 第 1/5 页

S
2,217
字号
	mulpd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC     addpd  xmm5, [esp + nb302_vctot]    movapd [esp + nb302_vctot], xmm5	xorpd  xmm1, xmm1	mulpd  xmm3,  [esp + nb302_tsc]	mulpd  xmm3, xmm0	subpd  xmm1, xmm3	movapd xmm0, xmm1	movapd xmm2, xmm1		movapd xmm3, [esp + nb302_fjxH1]	movapd xmm4, [esp + nb302_fjyH1]	movapd xmm5, [esp + nb302_fjzH1]	mulpd xmm0, [esp + nb302_dxH2H1]	mulpd xmm1, [esp + nb302_dyH2H1]	mulpd xmm2, [esp + nb302_dzH2H1]	subpd xmm3, xmm0	subpd xmm4, xmm1	subpd xmm5, xmm2	addpd xmm0, [esp + nb302_fixH2]	addpd xmm1, [esp + nb302_fiyH2]	addpd xmm2, [esp + nb302_fizH2]	movapd [esp + nb302_fjxH1], xmm3	movapd [esp + nb302_fjyH1], xmm4	movapd [esp + nb302_fjzH1], xmm5	movapd [esp + nb302_fixH2], xmm0	movapd [esp + nb302_fiyH2], xmm1	movapd [esp + nb302_fizH2], xmm2	;# H2-H2 interaction 	movapd xmm0, [esp + nb302_rinvH2H2]	movapd xmm1, xmm0	mulpd  xmm1, [esp + nb302_rsqH2H2] ;# xmm1=r 	mulpd  xmm1, [esp + nb302_tsc]		cvttpd2pi mm6, xmm1	;# mm6 = lu idx 	cvtpi2pd xmm6, mm6	subpd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulpd  xmm2, xmm2	;# xmm2=eps2 		pslld mm6, 2		;# idx *= 4 	mov  esi, [ebp + nb302_VFtab]	movd eax, mm6	psrlq mm6, 32	movd ebx, mm6		;# indices in eax/ebx 	movlpd xmm4, [esi + eax*8]	;# Y1		movlpd xmm3, [esi + ebx*8]	;# Y2	movhpd xmm4, [esi + eax*8 + 8]	;# Y1 F1 		movhpd xmm3, [esi + ebx*8 + 8]	;# Y2 F2 	movapd xmm5, xmm4	unpcklpd xmm4, xmm3	;# Y1 Y2 	unpckhpd xmm5, xmm3	;# F1 F2 	movlpd xmm6, [esi + eax*8 + 16]	;# G1	movlpd xmm3, [esi + ebx*8 + 16]	;# G2	movhpd xmm6, [esi + eax*8 + 24]	;# G1 H1 		movhpd xmm3, [esi + ebx*8 + 24]	;# G2 H2 	movapd xmm7, xmm6	unpcklpd xmm6, xmm3	;# G1 G2 	unpckhpd xmm7, xmm3	;# H1 H2 	;# coulomb table ready, in xmm4-xmm7  			mulpd  xmm6, xmm1	;# xmm6=Geps 	mulpd  xmm7, xmm2	;# xmm7=Heps2 	addpd  xmm5, xmm6	addpd  xmm5, xmm7	;# xmm5=Fp 		mulpd  xmm7, [esp + nb302_two]	;# two*Heps2 	movapd xmm3, [esp + nb302_qqHH]	addpd  xmm7, xmm6	addpd  xmm7, xmm5 ;# xmm7=FF 	mulpd  xmm5, xmm1 ;# xmm5=eps*Fp 	addpd  xmm5, xmm4 ;# xmm5=VV 	mulpd  xmm5, xmm3 ;# vcoul=qq*VV  	mulpd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC 	    addpd  xmm5, [esp + nb302_vctot]    movapd [esp + nb302_vctot], xmm5	xorpd  xmm1, xmm1	mulpd  xmm3,  [esp + nb302_tsc]	mulpd  xmm3, xmm0	subpd  xmm1, xmm3	movapd xmm0, xmm1	movapd xmm2, xmm1		movapd xmm3, [esp + nb302_fjxH2]	movapd xmm4, [esp + nb302_fjyH2]	movapd xmm5, [esp + nb302_fjzH2]	mulpd xmm0, [esp + nb302_dxH2H2]	mulpd xmm1, [esp + nb302_dyH2H2]	mulpd xmm2, [esp + nb302_dzH2H2]	subpd xmm3, xmm0	subpd xmm4, xmm1	subpd xmm5, xmm2	addpd xmm0, [esp + nb302_fixH2]	addpd xmm1, [esp + nb302_fiyH2]	addpd xmm2, [esp + nb302_fizH2]	movapd [esp + nb302_fjxH2], xmm3	movapd [esp + nb302_fjyH2], xmm4	movapd [esp + nb302_fjzH2], xmm5	movapd [esp + nb302_fixH2], xmm0	movapd [esp + nb302_fiyH2], xmm1	movapd [esp + nb302_fizH2], xmm2	mov edi, [ebp + nb302_faction]	movd eax, mm0	movd ebx, mm1		;# Did all interactions - now update j forces 	movlpd xmm0, [edi + eax*8]	movlpd xmm1, [edi + eax*8 + 8]	movlpd xmm2, [edi + eax*8 + 16]	movlpd xmm3, [edi + eax*8 + 24]	movlpd xmm4, [edi + eax*8 + 32]	movlpd xmm5, [edi + eax*8 + 40]	movlpd xmm6, [edi + eax*8 + 48]	movlpd xmm7, [edi + eax*8 + 56]	movhpd xmm0, [edi + ebx*8]	movhpd xmm1, [edi + ebx*8 + 8]	movhpd xmm2, [edi + ebx*8 + 16]	movhpd xmm3, [edi + ebx*8 + 24]	movhpd xmm4, [edi + ebx*8 + 32]	movhpd xmm5, [edi + ebx*8 + 40]	movhpd xmm6, [edi + ebx*8 + 48]	movhpd xmm7, [edi + ebx*8 + 56]	addpd xmm0, [esp + nb302_fjxO]	addpd xmm1, [esp + nb302_fjyO]	addpd xmm2, [esp + nb302_fjzO]	addpd xmm3, [esp + nb302_fjxH1]	addpd xmm4, [esp + nb302_fjyH1]	addpd xmm5, [esp + nb302_fjzH1]	addpd xmm6, [esp + nb302_fjxH2]	addpd xmm7, [esp + nb302_fjyH2]	movlpd [edi + eax*8], xmm0	movlpd [edi + eax*8 + 8], xmm1	movlpd [edi + eax*8 + 16], xmm2	movlpd [edi + eax*8 + 24], xmm3	movlpd [edi + eax*8 + 32], xmm4	movlpd [edi + eax*8 + 40], xmm5	movlpd [edi + eax*8 + 48], xmm6	movlpd [edi + eax*8 + 56], xmm7	movhpd [edi + ebx*8], xmm0	movhpd [edi + ebx*8 + 8], xmm1	movhpd [edi + ebx*8 + 16], xmm2	movhpd [edi + ebx*8 + 24], xmm3	movhpd [edi + ebx*8 + 32], xmm4	movhpd [edi + ebx*8 + 40], xmm5	movhpd [edi + ebx*8 + 48], xmm6	movhpd [edi + ebx*8 + 56], xmm7	movlpd xmm0, [edi + eax*8 + 64]	movhpd xmm0, [edi + ebx*8 + 64]	addpd xmm0, [esp + nb302_fjzH2]	movlpd [edi + eax*8 + 64], xmm0	movhpd [edi + ebx*8 + 64], xmm0		;# should we do one more iteration? 	sub dword ptr [esp + nb302_innerk],  2	jl    .nb302_checksingle	jmp   .nb302_unroll_loop.nb302_checksingle:	mov   edx, [esp + nb302_innerk]	and   edx, 1	jnz   .nb302_dosingle	jmp   .nb302_updateouterdata.nb302_dosingle:	mov   edx, [esp + nb302_innerjjnr]     ;# pointer to jjnr[k] 	mov   eax, [edx]	mov esi, [ebp + nb302_pos]	lea   eax, [eax + eax*2]  	;# fetch j coordinates 	movlpd xmm2, [esi + eax*8]	movlpd xmm3, [esi + eax*8 + 8]	movlpd xmm4, [esi + eax*8 + 16]	movlpd xmm5, [esi + eax*8 + 24]	movlpd xmm6, [esi + eax*8 + 32]	movlpd xmm7, [esi + eax*8 + 40]	movapd 	[esp + nb302_jxO], xmm2	movapd 	[esp + nb302_jyO], xmm3	movapd 	[esp + nb302_jzO], xmm4	movapd 	[esp + nb302_jxH1], xmm5	movapd 	[esp + nb302_jyH1], xmm6	movapd 	[esp + nb302_jzH1], xmm7	movlpd xmm2, [esi + eax*8 + 48]	movlpd xmm3, [esi + eax*8 + 56]	movlpd xmm4, [esi + eax*8 + 64]	movapd 	[esp + nb302_jxH2], xmm2	movapd 	[esp + nb302_jyH2], xmm3	movapd 	[esp + nb302_jzH2], xmm4		movapd xmm0, [esp + nb302_ixO]	movapd xmm1, [esp + nb302_iyO]	movapd xmm2, [esp + nb302_izO]	movapd xmm3, [esp + nb302_ixO]	movapd xmm4, [esp + nb302_iyO]	movapd xmm5, [esp + nb302_izO]	subsd  xmm0, [esp + nb302_jxO]	subsd  xmm1, [esp + nb302_jyO]	subsd  xmm2, [esp + nb302_jzO]	subsd  xmm3, [esp + nb302_jxH1]	subsd  xmm4, [esp + nb302_jyH1]	subsd  xmm5, [esp + nb302_jzH1]	movapd [esp + nb302_dxOO], xmm0	movapd [esp + nb302_dyOO], xmm1	movapd [esp + nb302_dzOO], xmm2	mulsd  xmm0, xmm0	mulsd  xmm1, xmm1	mulsd  xmm2, xmm2	movapd [esp + nb302_dxOH1], xmm3	movapd [esp + nb302_dyOH1], xmm4	movapd [esp + nb302_dzOH1], xmm5	mulsd  xmm3, xmm3	mulsd  xmm4, xmm4	mulsd  xmm5, xmm5	addsd  xmm0, xmm1	addsd  xmm0, xmm2	addsd  xmm3, xmm4	addsd  xmm3, xmm5	movapd [esp + nb302_rsqOO], xmm0	movapd [esp + nb302_rsqOH1], xmm3	movapd xmm0, [esp + nb302_ixO]	movapd xmm1, [esp + nb302_iyO]	movapd xmm2, [esp + nb302_izO]	movapd xmm3, [esp + nb302_ixH1]	movapd xmm4, [esp + nb302_iyH1]	movapd xmm5, [esp + nb302_izH1]	subsd  xmm0, [esp + nb302_jxH2]	subsd  xmm1, [esp + nb302_jyH2]	subsd  xmm2, [esp + nb302_jzH2]	subsd  xmm3, [esp + nb302_jxO]	subsd  xmm4, [esp + nb302_jyO]	subsd  xmm5, [esp + nb302_jzO]	movapd [esp + nb302_dxOH2], xmm0	movapd [esp + nb302_dyOH2], xmm1	movapd [esp + nb302_dzOH2], xmm2	mulsd  xmm0, xmm0	mulsd  xmm1, xmm1	mulsd  xmm2, xmm2	movapd [esp + nb302_dxH1O], xmm3	movapd [esp + nb302_dyH1O], xmm4	movapd [esp + nb302_dzH1O], xmm5	mulsd  xmm3, xmm3	mulsd  xmm4, xmm4	mulsd  xmm5, xmm5	addsd  xmm0, xmm1	addsd  xmm0, xmm2	addsd  xmm3, xmm4	addsd  xmm3, xmm5	movapd [esp + nb302_rsqOH2], xmm0	movapd [esp + nb302_rsqH1O], xmm3	movapd xmm0, [esp + nb302_ixH1]	movapd xmm1, [esp + nb302_iyH1]	movapd xmm2, [esp + nb302_izH1]	movapd xmm3, [esp + nb302_ixH1]	movapd xmm4, [esp + nb302_iyH1]	movapd xmm5, [esp + nb302_izH1]	subsd  xmm0, [esp + nb302_jxH1]	subsd  xmm1, [esp + nb302_jyH1]	subsd  xmm2, [esp + nb302_jzH1]	subsd  xmm3, [esp + nb302_jxH2]	subsd  xmm4, [esp + nb302_jyH2]	subsd  xmm5, [esp + nb302_jzH2]	movapd [esp + nb302_dxH1H1], xmm0	movapd [esp + nb302_dyH1H1], xmm1	movapd [esp + nb302_dzH1H1], xmm2	mulsd  xmm0, xmm0	mulsd  xmm1, xmm1	mulsd  xmm2, xmm2	movapd [esp + nb302_dxH1H2], xmm3	movapd [esp + nb302_dyH1H2], xmm4	movapd [esp + nb302_dzH1H2], xmm5	mulsd  xmm3, xmm3	mulsd  xmm4, xmm4	mulsd  xmm5, xmm5	addsd  xmm0, xmm1	addsd  xmm0, xmm2	addsd  xmm3, xmm4	addsd  xmm3, xmm5	movapd [esp + nb302_rsqH1H1], xmm0	movapd [esp + nb302_rsqH1H2], xmm3	movapd xmm0, [esp + nb302_ixH2]	movapd xmm1, [esp + nb302_iyH2]	movapd xmm2, [esp + nb302_izH2]	movapd xmm3, [esp + nb302_ixH2]	movapd xmm4, [esp + nb302_iyH2]	movapd xmm5, [esp + nb302_izH2]	subsd  xmm0, [esp + nb302_jxO]	subsd  xmm1, [esp + nb302_jyO]	subsd  xmm2, [esp + nb302_jzO]	subsd  xmm3, [esp + nb302_jxH1]	subsd  xmm4, [esp + nb302_jyH1]	subsd  xmm5, [esp + nb302_jzH1]	movapd [esp + nb302_dxH2O], xmm0	movapd [esp + nb302_dyH2O], xmm1	movapd [esp + nb302_dzH2O], xmm2	mulsd  xmm0, xmm0	mulsd  xmm1, xmm1	mulsd  xmm2, xmm2	movapd [esp + nb302_dxH2H1], xmm3	movapd [esp + nb302_dyH2H1], xmm4	movapd [esp + nb302_dzH2H1], xmm5	mulsd  xmm3, xmm3	mulsd  xmm4, xmm4	mulsd  xmm5, xmm5	addsd  xmm0, xmm1	addsd  xmm0, xmm2	addsd  xmm4, xmm3	addsd  xmm4, xmm5	movapd [esp + nb302_rsqH2O], xmm0	movapd [esp + nb302_rsqH2H1], xmm4	movapd xmm0, [esp + nb302_ixH2]	movapd xmm1, [esp + nb302_iyH2]	movapd xmm2, [esp + nb302_izH2]	subsd  xmm0, [esp + nb302_jxH2]	subsd  xmm1, [esp + nb302_jyH2]	subsd  xmm2, [esp + nb302_jzH2]	movapd [esp + nb302_dxH2H2], xmm0	movapd [esp + nb302_dyH2H2], xmm1	movapd [esp + nb302_dzH2H2], xmm2	mulsd xmm0, xmm0	mulsd xmm1, xmm1	mulsd xmm2, xmm2	addsd xmm0, xmm1	addsd xmm0, xmm2	movapd [esp + nb302_rsqH2H2], xmm0			;# start doing invsqrt use rsq values in xmm0, xmm4 	cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb302_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb302_half] ;# iter1 	mulsd   xmm7, [esp + nb302_half] ;# iter1 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb302_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb302_half] ;# rinv 	mulsd   xmm5, [esp + nb302_half] ;# rinv 	movapd [esp + nb302_rinvH2H2], xmm1	movapd [esp + nb302_rinvH2H1], xmm5	movapd xmm0, [esp + nb302_rsqOO]	movapd xmm4, [esp + nb302_rsqOH1]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb302_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb302_half] ;# iter1 of  	mulsd   xmm7, [esp + nb302_half] ;# iter1 of  	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb302_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb302_half] ;# rinv 	mulsd   xmm5, [esp + nb302_half] ;# rinv	movapd [esp + nb302_rinvOO], xmm1	movapd [esp + nb302_rinvOH1], xmm5	movapd xmm0, [esp + nb302_rsqOH2]	movapd xmm4, [esp + nb302_rsqH1O]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb302_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb302_half] ;# iter1 	mulsd   xmm7, [esp + nb302_half] ;# iter1 	movapd  xmm2, xmm3	;# copy of luA 

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?