nb_kernel312_ia32_sse2.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,210 行 · 第 1/5 页

S
2,210
字号
	cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb312_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb312_half] ;# iter1 of  	mulsd   xmm7, [esp + nb312_half] ;# iter1 of  	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb312_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb312_half] ;# rinv 	mulsd   xmm5, [esp + nb312_half] ;# rinv	movapd [esp + nb312_rinvOO], xmm1	movapd [esp + nb312_rinvOH1], xmm5	movapd xmm0, [esp + nb312_rsqOH2]	movapd xmm4, [esp + nb312_rsqH1O]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb312_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb312_half] ;# iter1 	mulsd   xmm7, [esp + nb312_half] ;# iter1 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb312_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb312_half] ;# rinv 	mulsd   xmm5, [esp + nb312_half] ;# rinv 	movapd [esp + nb312_rinvOH2], xmm1	movapd [esp + nb312_rinvH1O], xmm5	movapd xmm0, [esp + nb312_rsqH1H1]	movapd xmm4, [esp + nb312_rsqH1H2]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb312_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb312_half] ;# iter1a 	mulsd   xmm7, [esp + nb312_half] ;# iter1b 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb312_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb312_half] ;# rinv 	mulsd   xmm5, [esp + nb312_half] ;# rinv 	movapd [esp + nb312_rinvH1H1], xmm1	movapd [esp + nb312_rinvH1H2], xmm5	movapd xmm0, [esp + nb312_rsqH2O]	cvtsd2ss xmm1, xmm0		rsqrtss xmm1, xmm1	cvtss2sd xmm1, xmm1		movapd  xmm2, xmm1	;# copy of luA 	mulsd   xmm1, xmm1	;# luA*luA 	movapd  xmm3, [esp + nb312_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm3, [esp + nb312_half] ;# iter1 	movapd  xmm2, xmm3	;# copy of luA 	mulsd   xmm3, xmm3	;# luA*luA 	movapd  xmm1, [esp + nb312_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm1, [esp + nb312_half] ;# rinv 	movapd [esp + nb312_rinvH2O], xmm1		;# start with OO interaction 	movapd xmm0, [esp + nb312_rinvOO]	movapd xmm1, xmm0	mulsd  xmm1, [esp + nb312_rsqOO] ;# xmm1=r 	mulsd  xmm1, [esp + nb312_tsc]	movd mm0, eax		cvttsd2si eax, xmm1	;# mm6 = lu idx 	cvtsi2sd xmm6, eax	subsd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 		shl eax, 2		;# idx *= 4 	mov  esi, [ebp + nb312_VFtab]	movsd xmm4, [esi + eax*8]	;# Y1 		movsd xmm5, [esi + eax*8 + 8]	;# F1 		movsd xmm6, [esi + eax*8 + 16]	;# G1 		movsd xmm7, [esi + eax*8 + 24]	;# H1 		;# coulomb table ready, in xmm4-xmm7  			mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb312_two]	;# two*Heps2 	movapd xmm3, [esp + nb312_qqOO]	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 	mulsd  xmm5, xmm3 ;# vcoul=qq*VV  	mulsd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC     ;# increment vcoul - then we can get rid of mm5     ;# update vctot     addsd  xmm5, [esp + nb312_vctot]	xorpd  xmm2, xmm2    movlpd [esp + nb312_vctot], xmm5	mulsd  xmm3, [esp + nb312_tsc]	;# start doing lj 	movapd xmm2, xmm0	mulsd  xmm2, xmm2	movapd xmm1, xmm2	mulsd  xmm1, xmm2	mulsd  xmm1, xmm2	;# xmm1=rinvsix 	movapd xmm2, xmm1	mulsd  xmm2, xmm2	;# xmm2=rinvtwelve 	mulsd  xmm1, [esp + nb312_c6]	mulsd  xmm2, [esp + nb312_c12]	movapd xmm4, xmm2	subsd  xmm4, xmm1	addsd  xmm4, [esp + nb312_Vvdwtot]	mulsd  xmm1, [esp + nb312_six]	mulsd  xmm2, [esp + nb312_twelve]	movlpd [esp + nb312_Vvdwtot], xmm4	subsd  xmm2, xmm1	mulsd  xmm2, xmm0	subsd  xmm2, xmm3	mulsd  xmm0, xmm2		movapd xmm1, xmm0	movapd xmm2, xmm0			xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulpd xmm0, [esp + nb312_dxOO]	mulpd xmm1, [esp + nb312_dyOO]	mulpd xmm2, [esp + nb312_dzOO]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb312_fixO]	addsd xmm1, [esp + nb312_fiyO]	addsd xmm2, [esp + nb312_fizO]	movlpd [esp + nb312_fjxO], xmm3	movlpd [esp + nb312_fjyO], xmm4	movlpd [esp + nb312_fjzO], xmm5	movlpd [esp + nb312_fixO], xmm0	movlpd [esp + nb312_fiyO], xmm1	movlpd [esp + nb312_fizO], xmm2	;# O-H1 interaction 	movapd xmm0, [esp + nb312_rinvOH1]	movapd xmm1, xmm0	mulsd  xmm1, [esp + nb312_rsqOH1] ;# xmm1=r 	mulsd  xmm1, [esp + nb312_tsc]	cvttsd2si eax, xmm1	;# mm6 = lu idx 	cvtsi2sd xmm6, eax	subsd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 		shl eax, 2		;# idx *= 4 	mov  esi, [ebp + nb312_VFtab]	movsd xmm4, [esi + eax*8]	;# Y1 		movsd xmm5, [esi + eax*8 + 8]	;# F1 		movsd xmm6, [esi + eax*8 + 16]	;# G1 		movsd xmm7, [esi + eax*8 + 24]	;# H1 		;# coulomb table ready, in xmm4-xmm7  			mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb312_two]	;# two*Heps2 	movapd xmm3, [esp + nb312_qqOH]	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 	mulsd  xmm5, xmm3 ;# vcoul=qq*VV  	mulsd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC     addsd  xmm5, [esp + nb312_vctot]    movlpd [esp + nb312_vctot], xmm5	xorpd  xmm1, xmm1	mulsd  xmm3,  [esp + nb312_tsc]	mulsd  xmm3, xmm0	subsd  xmm1, xmm3	movapd xmm0, xmm1	movapd xmm2, xmm1		xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb312_dxOH1]	mulsd xmm1, [esp + nb312_dyOH1]	mulsd xmm2, [esp + nb312_dzOH1]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb312_fixO]	addsd xmm1, [esp + nb312_fiyO]	addsd xmm2, [esp + nb312_fizO]	movlpd [esp + nb312_fjxH1], xmm3	movlpd [esp + nb312_fjyH1], xmm4	movlpd [esp + nb312_fjzH1], xmm5	movlpd [esp + nb312_fixO], xmm0	movlpd [esp + nb312_fiyO], xmm1	movlpd [esp + nb312_fizO], xmm2	;# O-H2 interaction  	movapd xmm0, [esp + nb312_rinvOH2]	movapd xmm1, xmm0	mulsd  xmm1, [esp + nb312_rsqOH2] ;# xmm1=r 	mulsd  xmm1, [esp + nb312_tsc]		cvttsd2si eax, xmm1	;# mm6 = lu idx 	cvtsi2sd xmm6, eax	subsd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 		shl eax, 2		;# idx *= 4 	mov  esi, [ebp + nb312_VFtab]	movsd xmm4, [esi + eax*8]	;# Y1 		movsd xmm5, [esi + eax*8 + 8]	;# F1 		movsd xmm6, [esi + eax*8 + 16]	;# G1 		movsd xmm7, [esi + eax*8 + 24]	;# H1 		;# coulomb table ready, in xmm4-xmm7  			mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb312_two]	;# two*Heps2 	movapd xmm3, [esp + nb312_qqOH]	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 	mulsd  xmm5, xmm3 ;# vcoul=qq*VV  	mulsd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC     addsd  xmm5, [esp + nb312_vctot]    movlpd [esp + nb312_vctot], xmm5	xorpd  xmm1, xmm1	mulsd  xmm3,  [esp + nb312_tsc]	mulsd  xmm3, xmm0	subsd  xmm1, xmm3	movapd xmm0, xmm1	movapd xmm2, xmm1		xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb312_dxOH2]	mulsd xmm1, [esp + nb312_dyOH2]	mulsd xmm2, [esp + nb312_dzOH2]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb312_fixO]	addsd xmm1, [esp + nb312_fiyO]	addsd xmm2, [esp + nb312_fizO]	movlpd [esp + nb312_fjxH2], xmm3	movlpd [esp + nb312_fjyH2], xmm4	movlpd [esp + nb312_fjzH2], xmm5	movlpd [esp + nb312_fixO], xmm0	movlpd [esp + nb312_fiyO], xmm1	movlpd [esp + nb312_fizO], xmm2	;# H1-O interaction 	movapd xmm0, [esp + nb312_rinvH1O]	movapd xmm1, xmm0	mulsd  xmm1, [esp + nb312_rsqH1O] ;# xmm1=r 	mulsd  xmm1, [esp + nb312_tsc]		cvttsd2si eax, xmm1	;# mm6 = lu idx 	cvtsi2sd xmm6, eax	subsd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 		shl eax, 2		;# idx *= 4 	mov  esi, [ebp + nb312_VFtab]	movsd xmm4, [esi + eax*8]	;# Y1 		movsd xmm5, [esi + eax*8 + 8]	;# F1 		movsd xmm6, [esi + eax*8 + 16]	;# G1 		movsd xmm7, [esi + eax*8 + 24]	;# H1 		;# coulomb table ready, in xmm4-xmm7  			mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb312_two]	;# two*Heps2 	movapd xmm3, [esp + nb312_qqOH]	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 	mulsd  xmm5, xmm3 ;# vcoul=qq*VV  	mulsd  xmm3, xmm7 ;# fijC=FF*qq     ;# at this point mm5 contains vcoul and xmm3 fijC     addsd  xmm5, [esp + nb312_vctot]    movlpd [esp + nb312_vctot], xmm5	xorpd  xmm1, xmm1	mulsd  xmm3,  [esp + nb312_tsc]	mulsd  xmm3, xmm0	subsd  xmm1, xmm3	movapd xmm0, xmm1	movapd xmm2, xmm1		movapd xmm3, [esp + nb312_fjxO]	movapd xmm4, [esp + nb312_fjyO]	movapd xmm5, [esp + nb312_fjzO]	mulsd xmm0, [esp + nb312_dxH1O]	mulsd xmm1, [esp + nb312_dyH1O]	mulsd xmm2, [esp + nb312_dzH1O]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb312_fixH1]	addsd xmm1, [esp + nb312_fiyH1]	addsd xmm2, [esp + nb312_fizH1]	movlpd [esp + nb312_fjxO], xmm3	movlpd [esp + nb312_fjyO], xmm4	movlpd [esp + nb312_fjzO], xmm5	movlpd [esp + nb312_fixH1], xmm0	movlpd [esp + nb312_fiyH1], xmm1	movlpd [esp + nb312_fizH1], xmm2	;# H1-H1 interaction 	movapd xmm0, [esp + nb312_rinvH1H1]	movapd xmm1, xmm0	mulsd  xmm1, [esp + nb312_rsqH1H1] ;# xmm1=r 	mulsd  xmm1, [esp + nb312_tsc]		cvttsd2si eax, xmm1	;# mm6 = lu idx 	cvtsi2sd xmm6, eax	subsd xmm1, xmm6	;# xmm1=eps 	movapd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 		shl eax, 2		;# idx *= 4 	mov  esi, [ebp + nb312_VFtab]	movsd xmm4, [esi + eax*8]	;# Y1 		movsd xmm5, [esi + eax*8 + 8]	;# F1 		movsd xmm6, [esi + eax*8 + 16]	;# G1 		movsd xmm7, [esi + eax*8 + 24]	;# H1 		;# coulomb table ready, in xmm4-xmm7  			mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?