nb_kernel303_ia32_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 1,990 行 · 第 1/4 页

S
1,990
字号
	movaps xmm1, xmm7	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2	;# xmm2=eps2 	pslld mm6, 2	pslld mm7, 2			movd mm0, eax   	movd mm1, ebx	movd mm2, ecx	movd mm3, edx    	mov  esi, [ebp + nb303_VFtab]    	movd eax, mm6    	psrlq mm6, 32    	movd ecx, mm7    	psrlq mm7, 32    	movd ebx, mm6    	movd edx, mm7    	movlps xmm5, [esi + eax*4]    	movlps xmm7, [esi + ecx*4]    	movhps xmm5, [esi + ebx*4]    	movhps xmm7, [esi + edx*4] ;# got half coulomb table     	movaps xmm4, xmm5    	shufps xmm4, xmm7, 136  ;# 10001000    	shufps xmm5, xmm7, 221  ;# 11011101    	movlps xmm7, [esi + eax*4 + 8]    	movlps xmm3, [esi + ecx*4 + 8]    	movhps xmm7, [esi + ebx*4 + 8]    	movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table      	movaps xmm6, xmm7    	shufps xmm6, xmm3, 136  ;# 10001000    	shufps xmm7, xmm3, 221  ;# 11011101    	;# coulomb table ready, in xmm4-xmm7              		mulps  xmm6, xmm1   	;# xmm6=Geps 		mulps  xmm7, xmm2   	;# xmm7=Heps2 		addps  xmm5, xmm6		addps  xmm5, xmm7   	;# xmm5=Fp        		mulps  xmm7, [esp + nb303_two]   	;# two*Heps2 		movaps xmm0, [esp + nb303_qqH]		addps  xmm7, xmm6		addps  xmm7, xmm5 ;# xmm7=FF 		mulps  xmm5, xmm1 ;# xmm5=eps*Fp 		addps  xmm5, xmm4 ;# xmm5=VV 		mulps  xmm5, xmm0 ;# vcoul=qq*VV  		mulps  xmm0, xmm7 ;# fijC=FF*qq 		;# at this point mm5 contains vcoul and xmm0 fijC 		;# increment vcoul - then we can get rid of mm5 		addps  xmm5, [esp + nb303_vctot]		movaps [esp + nb303_vctot], xmm5 		xorps  xmm4, xmm4		mulps  xmm0, [esp + nb303_tsc]		mulps  xmm0, [esp + nb303_rinvH1]			subps  xmm4, xmm0		movaps xmm0, [esp + nb303_dxH1]		movaps xmm1, [esp + nb303_dyH1]		movaps xmm2, [esp + nb303_dzH1]		mulps  xmm0, xmm4		mulps  xmm1, xmm4		mulps  xmm2, xmm4	;# tx in xmm0-xmm2 		;# update H1 forces 		movaps xmm3, [esp + nb303_fixH1]		movaps xmm4, [esp + nb303_fiyH1]		movaps xmm7, [esp + nb303_fizH1]		addps  xmm3, xmm0		addps  xmm4, xmm1		addps  xmm7, xmm2		movaps [esp + nb303_fixH1], xmm3		movaps [esp + nb303_fiyH1], xmm4		movaps [esp + nb303_fizH1], xmm7		;# update j forces with water H1 		movaps [esp + nb303_fjx], xmm0		movaps [esp + nb303_fjy], xmm1		movaps [esp + nb303_fjz], xmm2		;# Done with H1 interactions - now H2! 		movaps xmm7, [esp + nb303_rH2]		mulps   xmm7, [esp + nb303_tsc]		movhlps xmm4, xmm7		cvttps2pi mm6, xmm7		cvttps2pi mm7, xmm4	;# mm6/mm7 contain lu indices 			cvtpi2ps xmm3, mm6		cvtpi2ps xmm4, mm7		movlhps xmm3, xmm4				subps xmm7, xmm3		movaps xmm1, xmm7	;# xmm1=eps 		movaps xmm2, xmm1		mulps  xmm2, xmm2	;# xmm2=eps2 		pslld mm6, 2		pslld mm7, 2		    	movd eax, mm6    	psrlq mm6, 32    	movd ecx, mm7    	psrlq mm7, 32    	movd ebx, mm6    	movd edx, mm7		    	movlps xmm5, [esi + eax*4]    	movlps xmm7, [esi + ecx*4]    	movhps xmm5, [esi + ebx*4]    	movhps xmm7, [esi + edx*4] ;# got half coulomb table     	movaps xmm4, xmm5    	shufps xmm4, xmm7, 136  ;# 10001000    	shufps xmm5, xmm7, 221  ;# 11011101    	movlps xmm7, [esi + eax*4 + 8]    	movlps xmm3, [esi + ecx*4 + 8]    	movhps xmm7, [esi + ebx*4 + 8]    	movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table      	movaps xmm6, xmm7    	shufps xmm6, xmm3, 136  ;# 10001000    	shufps xmm7, xmm3, 221  ;# 11011101    	;# coulomb table ready, in xmm4-xmm7              	mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp        	mulps  xmm7, [esp + nb303_two]   	;# two*Heps2 	movaps xmm0, [esp + nb303_qqH]	addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm0 ;# vcoul=qq*VV  	mulps  xmm7, xmm0 ;# fijC=FF*qq 	;# at this point mm5 contains vcoul and xmm7 fijC 	;# increment vcoul 	xorps  xmm4, xmm4	addps  xmm5, [esp + nb303_vctot]	mulps  xmm7, [esp + nb303_rinvH2]	movaps [esp + nb303_vctot], xmm5 	mulps  xmm7, [esp + nb303_tsc]	subps xmm4, xmm7	movaps xmm0, [esp + nb303_dxH2]	movaps xmm1, [esp + nb303_dyH2]	movaps xmm2, [esp + nb303_dzH2]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4	;# update H2 forces 	movaps xmm3, [esp + nb303_fixH2]	movaps xmm4, [esp + nb303_fiyH2]	movaps xmm7, [esp + nb303_fizH2]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm7, xmm2	movaps [esp + nb303_fixH2], xmm3	movaps [esp + nb303_fiyH2], xmm4	movaps [esp + nb303_fizH2], xmm7	;# update j forces with water H2 	addps  xmm0, [esp + nb303_fjx]	addps  xmm1, [esp + nb303_fjy]	addps  xmm2, [esp + nb303_fjz]	movaps [esp + nb303_fjx], xmm0	movaps [esp + nb303_fjy], xmm1	movaps [esp + nb303_fjz], xmm2	;# Done with H2, finally we do M interactions 	movaps xmm7, [esp + nb303_rM]	mulps   xmm7, [esp + nb303_tsc]	movhlps xmm4, xmm7	cvttps2pi mm6, xmm7	cvttps2pi mm7, xmm4	;# mm6/mm7 contain lu indices 		cvtpi2ps xmm3, mm6	cvtpi2ps xmm4, mm7	movlhps xmm3, xmm4		subps xmm7, xmm3	movaps xmm1, xmm7	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2	;# xmm2=eps2 	pslld mm6, 2	pslld mm7, 2		    	movd eax, mm6    	psrlq mm6, 32    	movd ecx, mm7    	psrlq mm7, 32    	movd ebx, mm6    	movd edx, mm7	    	movlps xmm5, [esi + eax*4]    	movlps xmm7, [esi + ecx*4]    	movhps xmm5, [esi + ebx*4]    	movhps xmm7, [esi + edx*4] ;# got half coulomb table     	movaps xmm4, xmm5    	shufps xmm4, xmm7, 136  ;# 10001000    	shufps xmm5, xmm7, 221  ;# 11011101    	movlps xmm7, [esi + eax*4 + 8]    	movlps xmm3, [esi + ecx*4 + 8]    	movhps xmm7, [esi + ebx*4 + 8]    	movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table      	movaps xmm6, xmm7    	shufps xmm6, xmm3, 136  ;# 10001000    	shufps xmm7, xmm3, 221  ;# 11011101    	;# coulomb table ready, in xmm4-xmm7              	mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp        	mulps  xmm7, [esp + nb303_two]   	;# two*Heps2 	movaps xmm0, [esp + nb303_qqM]	addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm0 ;# vcoul=qq*VV  	mulps  xmm7, xmm0 ;# fijC=FF*qq 	;# at this point mm5 contains vcoul and xmm0 fijC 	;# increment vcoul 	xorps  xmm4, xmm4	addps  xmm5, [esp + nb303_vctot]	mulps  xmm7, [esp + nb303_rinvM]	movaps [esp + nb303_vctot], xmm5 	mulps  xmm7, [esp + nb303_tsc]	subps  xmm4, xmm7	movaps xmm0, [esp + nb303_dxM]	movaps xmm1, [esp + nb303_dyM]	movaps xmm2, [esp + nb303_dzM]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4	movd eax, mm0   	movd ebx, mm1	movd ecx, mm2	movd edx, mm3		;# update M forces 	movaps xmm3, [esp + nb303_fixM]	movaps xmm4, [esp + nb303_fiyM]	movaps xmm7, [esp + nb303_fizM]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm7, xmm2	movaps [esp + nb303_fixM], xmm3	movaps [esp + nb303_fiyM], xmm4	movaps [esp + nb303_fizM], xmm7	mov edi, [ebp + nb303_faction]	;# update j forces 	addps xmm0, [esp + nb303_fjx]	addps xmm1, [esp + nb303_fjy]	addps xmm2, [esp + nb303_fjz]	movlps xmm4, [edi + eax*4]	movlps xmm7, [edi + ecx*4]	movhps xmm4, [edi + ebx*4]	movhps xmm7, [edi + edx*4]		movaps xmm3, xmm4	shufps xmm3, xmm7, 136  ;# 10001000	shufps xmm4, xmm7, 221  ;# 11011101			      	;# xmm3 has fjx, xmm4 has fjy 	subps xmm3, xmm0	subps xmm4, xmm1	;# unpack them back for storing 	movaps xmm7, xmm3	unpcklps xmm7, xmm4	unpckhps xmm3, xmm4		movlps [edi + eax*4], xmm7	movlps [edi + ecx*4], xmm3	movhps [edi + ebx*4], xmm7	movhps [edi + edx*4], xmm3	;# finally z forces 	movss  xmm0, [edi + eax*4 + 8]	movss  xmm1, [edi + ebx*4 + 8]	movss  xmm3, [edi + ecx*4 + 8]	movss  xmm4, [edi + edx*4 + 8]	subss  xmm0, xmm2	shufps xmm2, xmm2, 229  ;# 11100101	subss  xmm1, xmm2	shufps xmm2, xmm2, 234  ;# 11101010	subss  xmm3, xmm2	shufps xmm2, xmm2, 255  ;# 11111111	subss  xmm4, xmm2	movss  [edi + eax*4 + 8], xmm0	movss  [edi + ebx*4 + 8], xmm1	movss  [edi + ecx*4 + 8], xmm3	movss  [edi + edx*4 + 8], xmm4		;# should we do one more iteration? 	sub dword ptr [esp + nb303_innerk],  4	jl    .nb303_odd_inner	jmp   .nb303_unroll_loop.nb303_odd_inner:		add dword ptr [esp + nb303_innerk],  4	jnz   .nb303_odd_loop	jmp   .nb303_updateouterdata.nb303_odd_loop:	mov   edx, [esp + nb303_innerjjnr] 	;# pointer to jjnr[k] 	mov   eax, [edx]		add dword ptr [esp + nb303_innerjjnr],  4	 	xorps xmm4, xmm4	movss xmm4, [esp + nb303_iqM]	mov esi, [ebp + nb303_charge] 	movhps xmm4, [esp + nb303_iqH]     	movss xmm3, [esi + eax*4]	;# charge in xmm3 	shufps xmm3, xmm3, 0	mulps xmm3, xmm4	movaps [esp + nb303_qqM], xmm3	;# use dummy qq for storage 	mov esi, [ebp + nb303_pos]	lea   eax, [eax + eax*2]  		;# move j coords to xmm0-xmm2 	movss xmm0, [esi + eax*4]	movss xmm1, [esi + eax*4 + 4]	movss xmm2, [esi + eax*4 + 8]	shufps xmm0, xmm0, 0	shufps xmm1, xmm1, 0	shufps xmm2, xmm2, 0		movss xmm3, [esp + nb303_ixM]	movss xmm4, [esp + nb303_iyM]	movss xmm5, [esp + nb303_izM]			movlps xmm6, [esp + nb303_ixH1]	movlps xmm7, [esp + nb303_ixH2]	unpcklps xmm6, xmm7	movlhps xmm3, xmm6	movlps xmm6, [esp + nb303_iyH1]	movlps xmm7, [esp + nb303_iyH2]	unpcklps xmm6, xmm7	movlhps xmm4, xmm6	movlps xmm6, [esp + nb303_izH1]	movlps xmm7, [esp + nb303_izH2]	unpcklps xmm6, xmm7	movlhps xmm5, xmm6	subps xmm3, xmm0	subps xmm4, xmm1	subps xmm5, xmm2		;# use dummy dx for storage	movaps [esp + nb303_dxM], xmm3	movaps [esp + nb303_dyM], xmm4	movaps [esp + nb303_dzM], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	addps  xmm4, xmm3	addps  xmm4, xmm5	;# rsq in xmm4 	rsqrtps xmm5, xmm4	;# lookup seed in xmm5 	movaps xmm2, xmm5	mulps xmm5, xmm5	movaps xmm1, [esp + nb303_three]	mulps xmm5, xmm4	;# rsq*lu*lu 				movaps xmm0, [esp + nb303_half]	subps xmm1, xmm5	;# 30-rsq*lu*lu 	mulps xmm1, xmm2		mulps xmm0, xmm1	;# xmm0=rinv 	;# a little trick to avoid NaNs: 	;# positions 0,2,and 3 are valid, but not 1. 	;# If it contains NaN it doesnt help to mult by 0, 	;# So we shuffle it and copy pos 0 to pos1! 	shufps xmm0, xmm0, 224 ;# 11100000			mulps xmm4, xmm0	;# xmm4=r 	movaps [esp + nb303_rinvM], xmm0		mulps xmm4, [esp + nb303_tsc]	movhlps xmm7, xmm4	cvttps2pi mm6, xmm4	cvttps2pi mm7, xmm7	;# mm6/mm7 contain lu indices 	cvtpi2ps xmm3, mm6	cvtpi2ps xmm7, mm7	movlhps xmm3, xmm7	subps   xmm4, xmm3		movaps xmm1, xmm4	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2	;# xmm2=eps2 	pslld mm6, 2	pslld mm7, 2		movd mm0, eax   	movd mm1, ecx	movd mm2, edx	mov  esi, [ebp + nb303_VFtab]	movd eax, mm6	movd ecx, mm7	psrlq mm7, 32	movd edx, mm7	movlps xmm5, [esi + eax*4]	movlps xmm7, [esi + ecx*4]	movhps xmm7, [esi + edx*4] ;# got half coulomb table 	movaps xmm4, xmm5	shufps xmm4, xmm7, 136  ;# 10001000	shufps xmm5, xmm7, 221  ;# 11011101	movlps xmm7, [esi + eax*4 + 8]	movlps xmm3, [esi + ecx*4 + 8]	movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table  	movaps xmm6, xmm7	shufps xmm6, xmm3, 136  ;# 10001000	shufps xmm7, xmm3, 221  ;# 11011101	;# coulomb table ready, in xmm4-xmm7      	mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp        	mulps  xmm7, [esp + nb303_two]   	;# two*Heps2 	movaps xmm0, [esp + nb303_qqM]	addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm0 ;# vcoul=qq*VV  	mulps  xmm0, xmm7 ;# fijC=FF*qq 	;# at this point mm5 contains vcoul and xmm0 fijC 	;# increment vcoul - then we can get rid of mm5 	addps  xmm5, [esp + nb303_vctot]	movaps [esp + nb303_vctot], xmm5	xorps xmm4, xmm4	mulps  xmm0, [esp + nb303_tsc]	mulps  xmm0, [esp + nb303_rinvM]		subps  xmm4, xmm0			movd eax, mm0   	movd ecx, mm1	movd edx, mm2				movaps xmm0, [esp + nb303_dxM]	movaps xmm1, [esp + nb303_dyM]	movaps xmm2, [esp + nb303_dzM]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4 ;# xmm0-xmm2 now contains tx-tz (partial force) 	movss  xmm3, [esp + nb303_fixM]		movss  xmm4, [esp + nb303_fiyM]		movss  xmm5, [esp + nb303_fizM]		addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss  [esp + nb303_fixM], xmm3		movss  [esp + nb303_fiyM], xmm4		movss  [esp + nb303_fizM], xmm5	;# updated the M force now do the H's 	movaps xmm3, xmm0	movaps xmm4, xmm1	movaps xmm5, xmm2	shufps xmm3, xmm3, 230 ;# 11100110	;# shift right 	shufps xmm4, xmm4, 230 ;# 11100110	shufps xmm5, xmm5, 230 ;# 11100110	addss  xmm3, [esp + nb303_fixH1]	addss  xmm4, [esp + nb303_fiyH1]	addss  xmm5, [esp + nb303_fizH1]	movss  [esp + nb303_fixH1], xmm3		movss  [esp + nb303_fiyH1], xmm4		movss  [esp + nb303_fizH1], xmm5	;# updated the H1 force 	mov edi, [ebp + nb303_faction]	shufps xmm3, xmm3, 231 ;# 11100111	;# shift right 	shufps xmm4, xmm4, 231 ;# 11100111	shufps xmm5, xmm5, 231 ;# 11100111	addss  xmm3, [esp + nb303_fixH2]	addss  xmm4, [esp + nb303_fiyH2]	addss  xmm5, [esp + nb303_fizH2]	movss  [esp + nb303_fixH2], xmm3		movss  [esp + nb303_fiyH2], xmm4		movss  [esp + nb303_fizH2], xmm5	;# updated the H2 force 	;# the fj's - start by accumulating the tx/ty/tz force in xmm0, xmm1 	xorps  xmm5, xmm5	movaps xmm3, xmm0

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?