nb_kernel234_ia32_sse2.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,167 行 · 第 1/5 页

S
2,167
字号
	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb234_half] ;# iter1 of  	mulsd   xmm7, [esp + nb234_half] ;# iter1 of  	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb234_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb234_half] ;# rinv 	mulsd   xmm5, [esp + nb234_half] ;# rinv	movapd [esp + nb234_rinvOO], xmm1	movapd [esp + nb234_rinvH1H1], xmm5	movapd xmm0, [esp + nb234_rsqH1H2]	movapd xmm4, [esp + nb234_rsqH1M]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb234_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb234_half] ;# iter1 	mulsd   xmm7, [esp + nb234_half] ;# iter1 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb234_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb234_half] ;# rinv 	mulsd   xmm5, [esp + nb234_half] ;# rinv 	movapd [esp + nb234_rinvH1H2], xmm1	movapd [esp + nb234_rinvH1M], xmm5	movapd xmm0, [esp + nb234_rsqH2H1]	movapd xmm4, [esp + nb234_rsqH2H2]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb234_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb234_half] ;# iter1a 	mulsd   xmm7, [esp + nb234_half] ;# iter1b 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb234_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb234_half] ;# rinv 	mulsd   xmm5, [esp + nb234_half] ;# rinv 	movapd [esp + nb234_rinvH2H1], xmm1	movapd [esp + nb234_rinvH2H2], xmm5	movapd xmm0, [esp + nb234_rsqMH1]	movapd xmm4, [esp + nb234_rsqH2M]		cvtsd2ss xmm1, xmm0		cvtsd2ss xmm5, xmm4		rsqrtss xmm1, xmm1	rsqrtss xmm5, xmm5	cvtss2sd xmm1, xmm1	cvtss2sd xmm5, xmm5		movapd  xmm2, xmm1	;# copy of luA 	movapd  xmm6, xmm5	;# copy of luB 	mulsd   xmm1, xmm1	;# luA*luA 	mulsd   xmm5, xmm5	;# luB*luB 	movapd  xmm3, [esp + nb234_three]	mulsd   xmm1, xmm0	;# rsqA*luA*luA 	mulsd   xmm5, xmm4	;# rsqB*luB*luB 		movapd  xmm7, xmm3	subsd   xmm3, xmm1	;# 3-rsqA*luA*luA 	subsd   xmm7, xmm5	;# 3-rsqB*luB*luB 	mulsd   xmm3, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm7, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm3, [esp + nb234_half] ;# iter1a 	mulsd   xmm7, [esp + nb234_half] ;# iter1b 	movapd  xmm2, xmm3	;# copy of luA 	movapd  xmm6, xmm7	;# copy of luB 	mulsd   xmm3, xmm3	;# luA*luA 	mulsd   xmm7, xmm7	;# luB*luB 	movapd  xmm1, [esp + nb234_three]	mulsd   xmm3, xmm0	;# rsqA*luA*luA 	mulsd   xmm7, xmm4	;# rsqB*luB*luB 		movapd  xmm5, xmm1	subsd   xmm1, xmm3	;# 3-rsqA*luA*luA 	subsd   xmm5, xmm7	;# 3-rsqB*luB*luB 	mulsd   xmm1, xmm2	;# luA*(3-rsqA*luA*luA) 	mulsd   xmm5, xmm6	;# luB*(3-rsqB*luB*luB) 	mulsd   xmm1, [esp + nb234_half] ;# rinv 	mulsd   xmm5, [esp + nb234_half] ;# rinv 	movapd [esp + nb234_rinvMH1], xmm1	movapd [esp + nb234_rinvH2M], xmm5	;# start with OO interaction 	movsd xmm0, [esp + nb234_rinvOO] 	movsd xmm4, [esp + nb234_rsqOO]		mulsd xmm4, xmm0	;# xmm4=r 	mulsd xmm4, [esp + nb234_tsc]		cvttsd2si ebx, xmm4	;# mm6 = lu idx 	cvtsi2sd xmm5, ebx	subsd xmm4, xmm5	movsd xmm1, xmm4	;# xmm1=eps 	movsd xmm2, xmm1		mulsd  xmm2, xmm2	;# xmm2=eps2 	shl ebx, 3		mov  esi, [ebp + nb234_VFtab]	;# dispersion 	movlpd xmm4, [esi + ebx*8]	;# Y1 		movhpd xmm4, [esi + ebx*8 + 8]	;# Y1 F1 		movapd xmm5, xmm4	unpcklpd xmm4, xmm3	;# Y1 Y2 	unpckhpd xmm5, xmm3	;# F1 F2 	movlpd xmm6, [esi + ebx*8 + 16]	;# G1	movhpd xmm6, [esi + ebx*8 + 24]	;# G1 H1 		movapd xmm7, xmm6	unpcklpd xmm6, xmm3	;# G1 G2 	unpckhpd xmm7, xmm3	;# H1 H2 	;# dispersion table ready, in xmm4-xmm7 		mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb234_two]	;# two*Heps2 	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 	movsd xmm4, [esp + nb234_c6]	mulsd  xmm7, xmm4	 ;# fijD 	mulsd  xmm5, xmm4	 ;# Vvdw6 	;# put scalar force on stack Update Vvdwtot directly 	addsd  xmm5, [esp + nb234_Vvdwtot]	xorpd  xmm3, xmm3	mulsd  xmm7, [esp + nb234_tsc]	subsd  xmm3, xmm7	movsd [esp + nb234_fstmp], xmm3	movsd [esp + nb234_Vvdwtot], xmm5	;# repulsion 	movlpd xmm4, [esi + ebx*8 + 32]	;# Y1 		movhpd xmm4, [esi + ebx*8 + 40]	;# Y1 F1 		movapd xmm5, xmm4	unpcklpd xmm4, xmm3	;# Y1 Y2 	unpckhpd xmm5, xmm3	;# F1 F2 	movlpd xmm6, [esi + ebx*8 + 48]	;# G1	movhpd xmm6, [esi + ebx*8 + 56]	;# G1 H1 		movapd xmm7, xmm6	unpcklpd xmm6, xmm3	;# G1 G2 	unpckhpd xmm7, xmm3	;# H1 H2 		;# table ready, in xmm4-xmm7 		mulsd  xmm6, xmm1	;# xmm6=Geps 	mulsd  xmm7, xmm2	;# xmm7=Heps2 	addsd  xmm5, xmm6	addsd  xmm5, xmm7	;# xmm5=Fp 		mulsd  xmm7, [esp + nb234_two]	;# two*Heps2 	addsd  xmm7, xmm6	addsd  xmm7, xmm5 ;# xmm7=FF 	mulsd  xmm5, xmm1 ;# xmm5=eps*Fp 	addsd  xmm5, xmm4 ;# xmm5=VV 		movsd xmm4, [esp + nb234_c12]	mulsd  xmm7, xmm4 	mulsd  xmm5, xmm4  		addsd  xmm5, [esp + nb234_Vvdwtot]	movsd xmm3, [esp + nb234_fstmp]	mulsd  xmm7, [esp + nb234_tsc]	subsd  xmm3, xmm7	movsd [esp + nb234_Vvdwtot], xmm5	mulsd  xmm0, xmm3	movsd xmm1, xmm0	movsd xmm2, xmm0	xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb234_dxOO]	mulsd xmm1, [esp + nb234_dyOO]	mulsd xmm2, [esp + nb234_dzOO]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb234_fixO]	addsd xmm1, [esp + nb234_fiyO]	addsd xmm2, [esp + nb234_fizO]	movsd [esp + nb234_fjxO], xmm3	movsd [esp + nb234_fjyO], xmm4	movsd [esp + nb234_fjzO], xmm5	movsd [esp + nb234_fixO], xmm0	movsd [esp + nb234_fiyO], xmm1	movsd [esp + nb234_fizO], xmm2	;# H1-H1 interaction 	movsd xmm0, [esp + nb234_rinvH1H1]	movsd xmm7, xmm0	;# xmm7=rinv 	movsd xmm5, [esp + nb234_krf]	mulsd  xmm0, xmm0	;# xmm0=rinvsq 	mulsd  xmm5, [esp + nb234_rsqH1H1] ;# xmm5=krsq 	movsd xmm6, xmm5	addsd  xmm6, xmm7	;# xmm6=rinv+ krsq 	subsd  xmm6, [esp + nb234_crf]	mulsd  xmm6, [esp + nb234_qqHH] ;# xmm6=voul=qq*(rinv+ krsq-crf) 	mulsd  xmm5, [esp + nb234_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb234_qqHH] ;# xmm7 = coul part of fscal 		addsd  xmm6, [esp + nb234_vctot] ;# local vctot summation variable 	mulsd  xmm0, xmm7	movsd [esp + nb234_vctot], xmm6		movapd xmm1, xmm0	movapd xmm2, xmm0		xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb234_dxH1H1]	mulsd xmm1, [esp + nb234_dyH1H1]	mulsd xmm2, [esp + nb234_dzH1H1]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb234_fixH1]	addsd xmm1, [esp + nb234_fiyH1]	addsd xmm2, [esp + nb234_fizH1]	movsd [esp + nb234_fjxH1], xmm3	movsd [esp + nb234_fjyH1], xmm4	movsd [esp + nb234_fjzH1], xmm5	movsd [esp + nb234_fixH1], xmm0	movsd [esp + nb234_fiyH1], xmm1	movsd [esp + nb234_fizH1], xmm2	;# H1-H2 interaction  	movsd xmm0, [esp + nb234_rinvH1H2]	movsd xmm7, xmm0	;# xmm7=rinv 	movsd xmm5, [esp + nb234_krf]	mulsd  xmm0, xmm0	;# xmm0=rinvsq 	mulsd  xmm5, [esp + nb234_rsqH1H2] ;# xmm5=krsq 	movsd xmm6, xmm5	addsd  xmm6, xmm7	;# xmm6=rinv+ krsq 	subsd  xmm6, [esp + nb234_crf]	mulsd  xmm6, [esp + nb234_qqHH] ;# xmm6=voul=qq*(rinv+ krsq-crf) 	mulsd  xmm5, [esp + nb234_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb234_qqHH] ;# xmm7 = coul part of fscal 		addsd  xmm6, [esp + nb234_vctot] ;# local vctot summation variable 	mulsd  xmm0, xmm7	movsd [esp + nb234_vctot], xmm6		movapd xmm1, xmm0	movapd xmm2, xmm0		xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb234_dxH1H2]	mulsd xmm1, [esp + nb234_dyH1H2]	mulsd xmm2, [esp + nb234_dzH1H2]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb234_fixH1]	addsd xmm1, [esp + nb234_fiyH1]	addsd xmm2, [esp + nb234_fizH1]	movsd [esp + nb234_fjxH2], xmm3	movsd [esp + nb234_fjyH2], xmm4	movsd [esp + nb234_fjzH2], xmm5	movsd [esp + nb234_fixH1], xmm0	movsd [esp + nb234_fiyH1], xmm1	movsd [esp + nb234_fizH1], xmm2	;# H1-M interaction 	movsd xmm0, [esp + nb234_rinvH1M]	movsd xmm7, xmm0	;# xmm7=rinv 	movsd xmm5, [esp + nb234_krf]	mulsd  xmm0, xmm0	;# xmm0=rinvsq 	mulsd  xmm5, [esp + nb234_rsqH1M] ;# xmm5=krsq 	movsd xmm6, xmm5	addsd  xmm6, xmm7	;# xmm6=rinv+ krsq 	subsd  xmm6, [esp + nb234_crf]	mulsd  xmm6, [esp + nb234_qqMH] ;# xmm6=voul=qq*(rinv+ krsq-crf) 	mulsd  xmm5, [esp + nb234_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb234_qqMH] ;# xmm7 = coul part of fscal 		addsd  xmm6, [esp + nb234_vctot] ;# local vctot summation variable 	mulsd  xmm0, xmm7	movsd [esp + nb234_vctot], xmm6	movapd xmm1, xmm0	movapd xmm2, xmm0		xorpd xmm3, xmm3	movapd xmm4, xmm3	movapd xmm5, xmm3	mulsd xmm0, [esp + nb234_dxH1M]	mulsd xmm1, [esp + nb234_dyH1M]	mulsd xmm2, [esp + nb234_dzH1M]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb234_fixH1]	addsd xmm1, [esp + nb234_fiyH1]	addsd xmm2, [esp + nb234_fizH1]	movsd [esp + nb234_fjxM], xmm3	movsd [esp + nb234_fjyM], xmm4	movsd [esp + nb234_fjzM], xmm5	movsd [esp + nb234_fixH1], xmm0	movsd [esp + nb234_fiyH1], xmm1	movsd [esp + nb234_fizH1], xmm2	;# H2-H1 interaction 	movsd xmm0, [esp + nb234_rinvH2H1]	movsd xmm7, xmm0	;# xmm7=rinv 	movsd xmm5, [esp + nb234_krf]	mulsd  xmm0, xmm0	;# xmm0=rinvsq 	mulsd  xmm5, [esp + nb234_rsqH2H1] ;# xmm5=krsq 	movsd xmm6, xmm5	addsd  xmm6, xmm7	;# xmm6=rinv+ krsq 	subsd  xmm6, [esp + nb234_crf]	mulsd  xmm6, [esp + nb234_qqHH] ;# xmm6=voul=qq*(rinv+ krsq-crf) 	mulsd  xmm5, [esp + nb234_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb234_qqHH] ;# xmm7 = coul part of fscal 		addsd  xmm6, [esp + nb234_vctot] ;# local vctot summation variable 	mulsd  xmm0, xmm7	movsd [esp + nb234_vctot], xmm6		movapd xmm1, xmm0	movapd xmm2, xmm0		movapd xmm3, [esp + nb234_fjxH1]	movapd xmm4, [esp + nb234_fjyH1]	movapd xmm5, [esp + nb234_fjzH1]	mulsd xmm0, [esp + nb234_dxH2H1]	mulsd xmm1, [esp + nb234_dyH2H1]	mulsd xmm2, [esp + nb234_dzH2H1]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb234_fixH2]	addsd xmm1, [esp + nb234_fiyH2]	addsd xmm2, [esp + nb234_fizH2]	movsd [esp + nb234_fjxH1], xmm3	movsd [esp + nb234_fjyH1], xmm4	movsd [esp + nb234_fjzH1], xmm5	movsd [esp + nb234_fixH2], xmm0	movsd [esp + nb234_fiyH2], xmm1	movsd [esp + nb234_fizH2], xmm2	;# H2-H2 interaction 	movsd xmm0, [esp + nb234_rinvH2H2]	movsd xmm7, xmm0	;# xmm7=rinv 	movsd xmm5, [esp + nb234_krf]	mulsd  xmm0, xmm0	;# xmm0=rinvsq 	mulsd  xmm5, [esp + nb234_rsqH2H2] ;# xmm5=krsq 	movsd xmm6, xmm5	addsd  xmm6, xmm7	;# xmm6=rinv+ krsq 	subsd  xmm6

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?