nb_kernel430_ia32_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,411 行 · 第 1/5 页

S
2,411
字号
	;# put scalar force on stack Update Vvdwtot directly 	addps  xmm5, [esp + nb430_Vvdwtot]	movaps [esp + nb430_fscal], xmm7	movaps [esp + nb430_Vvdwtot], xmm5	;# repulsion 	movaps xmm4, [esi + ecx*4 + 16]	movaps xmm7, [esi + edx*4 + 16]	;# transpose, using xmm3 for scratch	movaps xmm6, xmm4	unpcklps xmm4, xmm7  	;# Y1 Y2 F1 F2 	unpckhps xmm6, xmm7     ;# G1 G2 H1 H2	movhlps  xmm5, xmm4    	;# F1 F2 	movhlps  xmm7, xmm6     ;# H1 H2	;# table ready, in xmm4-xmm7 		mulps  xmm6, xmm1	;# xmm6=Geps 	mulps  xmm7, xmm2	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7	;# xmm5=Fp 		mulps  xmm7, [esp + nb430_two]	;# two*Heps2 	addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV  		movaps xmm4, [esp + nb430_c12]	mulps  xmm7, xmm4 ;# fijR 	mulps  xmm5, xmm4 ;# Vvdw12 	mulps  xmm7, [esp + nb430_tsc]	addps  xmm7, [esp + nb430_fscal] 		addps  xmm5, [esp + nb430_Vvdwtot]	movaps [esp + nb430_Vvdwtot], xmm5	xorps  xmm4, xmm4	mulps xmm7, xmm0	subps  xmm4, xmm7	movaps xmm0, [esp + nb430_dx]	movaps xmm1, [esp + nb430_dy]	movaps xmm2, [esp + nb430_dz]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4	;# xmm0-xmm2 contains tx-tz (partial force) 	;# now update f_i 	movaps xmm3, [esp + nb430_fix]	movaps xmm4, [esp + nb430_fiy]	movaps xmm5, [esp + nb430_fiz]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm5, xmm2	movaps [esp + nb430_fix], xmm3	movaps [esp + nb430_fiy], xmm4	movaps [esp + nb430_fiz], xmm5	;# update the fj's 	movss   xmm3, [edi + eax*4]	movss   xmm4, [edi + eax*4 + 4]	movss   xmm5, [edi + eax*4 + 8]	subss   xmm3, xmm0	subss   xmm4, xmm1	subss   xmm5, xmm2		movss   [edi + eax*4], xmm3	movss   [edi + eax*4 + 4], xmm4	movss   [edi + eax*4 + 8], xmm5		shufps  xmm0, xmm0, 225  ;# constant 11100001	shufps  xmm1, xmm1, 225  ;# constant 11100001	shufps  xmm2, xmm2, 225  ;# constant 11100001	movss   xmm3, [edi + ebx*4]	movss   xmm4, [edi + ebx*4 + 4]	movss   xmm5, [edi + ebx*4 + 8]	subss   xmm3, xmm0	subss   xmm4, xmm1	subss   xmm5, xmm2		movss   [edi + ebx*4], xmm3	movss   [edi + ebx*4 + 4], xmm4	movss   [edi + ebx*4 + 8], xmm5	.nb430_checksingle:					mov   edx, [esp + nb430_innerk]	and   edx, 1	jnz    .nb430_dosingle	jmp    .nb430_updateouterdata.nb430_dosingle:	mov esi, [ebp + nb430_charge]	mov edx, [ebp + nb430_invsqrta]	mov edi, [ebp + nb430_pos]	mov   ecx, [esp + nb430_innerjjnr]	mov   eax, [ecx]		xorps  xmm2, xmm2	movaps xmm6, xmm2	movss xmm2, [edx + eax*4]	;# isaj	mulss xmm2, [esp + nb430_isai]	movss [esp + nb430_isaprod], xmm2		movss xmm1, xmm2	mulss xmm1, [esp + nb430_gbtsc]	movss [esp + nb430_gbscale], xmm1			mulss  xmm2, [esp + nb430_iq]	movss xmm6, [esi + eax*4]	;# xmm6(0) has the charge 		mulss  xmm6, xmm2	movss [esp + nb430_qq], xmm6			mov esi, [ebp + nb430_type]	mov ecx, eax	mov ecx, [esi + ecx*4]		mov esi, [ebp + nb430_vdwparam]	shl ecx, 1	add ecx, [esp + nb430_ntia]	movlps xmm6, [esi + ecx*4]	movaps xmm4, xmm6	shufps xmm4, xmm4, 252  ;# constant 11111100		shufps xmm6, xmm6, 253  ;# constant 11111101					movss [esp + nb430_c6], xmm4	movss [esp + nb430_c12], xmm6		movd  mm0, eax	lea   eax, [eax + eax*2]		;# move coordinates to xmm0-xmm2 	movss xmm0, [edi + eax*4]		movss xmm1, [edi + eax*4 + 4]		movss xmm2, [edi + eax*4 + 8]	 		movss xmm4, [esp + nb430_ix]	movss xmm5, [esp + nb430_iy]	movss xmm6, [esp + nb430_iz]	;# calc dr 	subss xmm4, xmm0	subss xmm5, xmm1	subss xmm6, xmm2	;# store dr 	movaps [esp + nb430_dx], xmm4	movaps [esp + nb430_dy], xmm5	movaps [esp + nb430_dz], xmm6	;# square it 	mulss xmm4,xmm4	mulss xmm5,xmm5	mulss xmm6,xmm6	addss xmm4, xmm5	addss xmm4, xmm6	;# rsq in xmm4 	rsqrtss xmm5, xmm4	;# lookup seed in xmm5 	movaps xmm2, xmm5	mulss xmm5, xmm5	movss xmm1, [esp + nb430_three]	mulss xmm5, xmm4	;# rsq*lu*lu 				movss xmm0, [esp + nb430_half]	subss xmm1, xmm5	;# constant 30-rsq*lu*lu 	mulss xmm1, xmm2		mulss xmm0, xmm1	;# xmm0=rinv 	mulss xmm4, xmm0	;# xmm4=r 	movss [esp + nb430_r], xmm4	mulss xmm4, [esp + nb430_gbscale]	cvttss2si ebx, xmm4     ;# mm6 contain lu indices 	cvtsi2ss xmm6, ebx	subss xmm4, xmm6		movaps xmm1, xmm4	;# xmm1=eps 	movaps xmm2, xmm1		mulss  xmm2, xmm2	;# xmm2=eps2 	shl ebx, 2	mov  esi, [ebp + nb430_GBtab]							movaps xmm4, [esi + ebx*4]		movhlps xmm6, xmm4	movaps xmm5, xmm4	movaps xmm7, xmm6	shufps xmm5, xmm5, 1	shufps xmm7, xmm7, 1	;# table ready in xmm4-xmm7 	mulss  xmm6, xmm1	;# xmm6=Geps 	mulss  xmm7, xmm2	;# xmm7=Heps2 	addss  xmm5, xmm6	addss  xmm5, xmm7	;# xmm5=Fp 		mulss  xmm7, [esp + nb430_two]	;# two*Heps2 	movss xmm3, [esp + nb430_qq]	addss  xmm7, xmm6	addss  xmm7, xmm5 ;# xmm7=FF 	mulss  xmm5, xmm1 ;# xmm5=eps*Fp 	addss  xmm5, xmm4 ;# xmm5=VV 	mulss  xmm5, xmm3 ;# vcoul=qq*VV  	mulss  xmm3, xmm7 ;# fijC=FF*qq 	movd ebx, mm0	mov esi, [ebp + nb430_dvda]		;# Calculate dVda	xorps xmm7, xmm7	mulss xmm3, [esp + nb430_gbscale]	movaps xmm6, xmm3	mulss  xmm6, [esp + nb430_r]	addss  xmm6, xmm5	addss  xmm5, [esp + nb430_vctot]	movss [esp + nb430_vctot], xmm5 		;# xmm6=(vcoul+fijC*r)	subss  xmm7, xmm6	movaps xmm6, xmm7		;# update dvdasum	addss  xmm7, [esp + nb430_dvdasum]	movaps [esp + nb430_dvdasum], xmm7 	;# update j atoms dvdaj	addss  xmm6, [esi + ebx*4]	movss  [esi + ebx*4], xmm6		;# put scalar force on stack temporarily 	movss [esp + nb430_fscal], xmm3	movss xmm4, [esp + nb430_r]	mulps xmm4, [esp + nb430_tsc]		cvttss2si ebx, xmm4	cvtsi2ss xmm6, ebx	subss xmm4, xmm6		movss xmm1, xmm4	;# xmm1=eps 	movss xmm2, xmm1		mulss  xmm2, xmm2	;# xmm2=eps2 	shl ebx, 3	mov  esi, [ebp + nb430_VFtab]				;# dispersion 	movaps xmm4, [esi + ebx*4]		movhlps xmm6, xmm4	movaps xmm5, xmm4	movaps xmm7, xmm6	shufps xmm5, xmm5, 1	shufps xmm7, xmm7, 1	;# table ready in xmm4-xmm7 	mulss  xmm6, xmm1	;# xmm6=Geps 	mulss  xmm7, xmm2	;# xmm7=Heps2 	addss  xmm5, xmm6	addss  xmm5, xmm7	;# xmm5=Fp 		mulss  xmm7, [esp + nb430_two]	;# two*Heps2 	addss  xmm7, xmm6	addss  xmm7, xmm5 ;# xmm7=FF 	mulss  xmm5, xmm1 ;# xmm5=eps*Fp 	addss  xmm5, xmm4 ;# xmm5=VV 	movss xmm4, [esp + nb430_c6]	mulss  xmm7, xmm4	 ;# fijD 	mulss  xmm5, xmm4	 ;# Vvdw6	mulps  xmm7, [esp + nb430_tsc]	addss  xmm7, [esp + nb430_fscal] ;# add to fscal 	;# put scalar force on stack Update Vvdwtot directly 	addss  xmm5, [esp + nb430_Vvdwtot]	movss [esp + nb430_fscal], xmm7	movss [esp + nb430_Vvdwtot], xmm5	;# repulsion 	movaps xmm4, [esi + ebx*4 + 16]		movhlps xmm6, xmm4	movaps xmm5, xmm4	movaps xmm7, xmm6	shufps xmm5, xmm5, 1	shufps xmm7, xmm7, 1	;# table ready in xmm4-xmm7 		mulss  xmm6, xmm1	;# xmm6=Geps 	mulss  xmm7, xmm2	;# xmm7=Heps2 	addss  xmm5, xmm6	addss  xmm5, xmm7	;# xmm5=Fp 		mulss  xmm7, [esp + nb430_two]	;# two*Heps2 	addss  xmm7, xmm6	addss  xmm7, xmm5 ;# xmm7=FF 	mulss  xmm5, xmm1 ;# xmm5=eps*Fp 	addss  xmm5, xmm4 ;# xmm5=VV  		movss xmm4, [esp + nb430_c12]	mulss  xmm7, xmm4 ;# fijR 	mulss  xmm5, xmm4 ;# Vvdw12 	mulps  xmm7, [esp + nb430_tsc]	addss  xmm7, [esp + nb430_fscal] 		addss  xmm5, [esp + nb430_Vvdwtot]	movss [esp + nb430_Vvdwtot], xmm5	xorps  xmm4, xmm4	mulss xmm7, xmm0	subss  xmm4, xmm7	mov    edi, [ebp + nb430_faction]	movss xmm0, [esp + nb430_dx]	movss xmm1, [esp + nb430_dy]	movss xmm2, [esp + nb430_dz]	mulss  xmm0, xmm4	mulss  xmm1, xmm4	mulss  xmm2, xmm4	;# xmm0-xmm2 contains tx-tz (partial force) 	;# now update f_i 	movss xmm3, [esp + nb430_fix]	movss xmm4, [esp + nb430_fiy]	movss xmm5, [esp + nb430_fiz]	addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss [esp + nb430_fix], xmm3	movss [esp + nb430_fiy], xmm4	movss [esp + nb430_fiz], xmm5	;# update fj 		movss   xmm3, [edi + eax*4]	movss   xmm4, [edi + eax*4 + 4]	movss   xmm5, [edi + eax*4 + 8]	subss   xmm3, xmm0	subss   xmm4, xmm1	subss   xmm5, xmm2		movss   [edi + eax*4], xmm3	movss   [edi + eax*4 + 4], xmm4	movss   [edi + eax*4 + 8], xmm5	.nb430_updateouterdata:	mov   ecx, [esp + nb430_ii3]	mov   edi, [ebp + nb430_faction]	mov   esi, [ebp + nb430_fshift]	mov   edx, [esp + nb430_is3]	;# accumulate i forces in xmm0, xmm1, xmm2 	movaps xmm0, [esp + nb430_fix]	movaps xmm1, [esp + nb430_fiy]	movaps xmm2, [esp + nb430_fiz]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addps  xmm0, xmm3	addps  xmm1, xmm4	addps  xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 	movaps xmm3, xmm0		movaps xmm4, xmm1		movaps xmm5, xmm2		shufps xmm3, xmm3, 1	shufps xmm4, xmm4, 1	shufps xmm5, xmm5, 1	addss  xmm0, xmm3	addss  xmm1, xmm4	addss  xmm2, xmm5	;# xmm0-xmm2 has single force in pos0 	;# increment i force 	movss  xmm3, [edi + ecx*4]	movss  xmm4, [edi + ecx*4 + 4]	movss  xmm5, [edi + ecx*4 + 8]	addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss  [edi + ecx*4],     xmm3	movss  [edi + ecx*4 + 4], xmm4	movss  [edi + ecx*4 + 8], xmm5	;# increment fshift force  	movss  xmm3, [esi + edx*4]	movss  xmm4, [esi + edx*4 + 4]	movss  xmm5, [esi + edx*4 + 8]	addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss  [esi + edx*4],     xmm3	movss  [esi + edx*4 + 4], xmm4	movss  [esi + edx*4 + 8], xmm5	;# get n from stack	mov esi, [esp + nb430_n]        ;# get group index for i particle         mov   edx, [ebp + nb430_gid]      	;# base of gid[]        mov   edx, [edx + esi*4]		;# ggid=gid[n]	;# accumulate total potential energy and update it 	movaps xmm7, [esp + nb430_vctot]	;# accumulate 	movhlps xmm6, xmm7	addps  xmm7, xmm6	;# pos 0-1 in xmm7 have the sum now 	movaps xmm6, xmm7	shufps xmm6, xmm6, 1	addss  xmm7, xmm6			;# add earlier value from mem 	mov   eax, [ebp + nb430_Vc]	addss xmm7, [eax + edx*4] 	;# move back to mem 	movss [eax + edx*4], xmm7 		;# accumulate total lj energy and update it 	movaps xmm7, [esp + nb430_Vvdwtot]	;# accumulate 	movhlps xmm6, xmm7	addps  xmm7, xmm6	;# pos 0-1 in xmm7 have the sum now 	movaps xmm6, xmm7	shufps xmm6, xmm6, 1	addss  xmm7, xmm6			;# add earlier value from mem 	mov   eax, [ebp + nb430_Vvdw]	addss xmm7, [eax + edx*4] 	;# move back to mem 	movss [eax + edx*4], xmm7 		;# accumulate dVda and update it 	movaps xmm7, [esp + nb430_dvdasum]	;# accumulate 	movhlps xmm6, xmm7	addps  xmm7, xmm6	;# pos 0-1 in xmm7 have the sum now 	movaps xmm6, xmm7	shufps xmm6, xmm6, 1	addss  xmm7, xmm6				mov edx, [esp + nb430_ii]	mov eax, [ebp + nb430_dvda]	addss xmm7, [eax + edx*4]	movss [eax + edx*4], xmm7	        ;# finish if last         mov ecx, [esp + nb430_nn1]	;# esi already loaded with n	inc esi        sub ecx, esi        jecxz .nb430_outerend        ;# not last, iterate outer loop once more!          mov [esp + nb430_n], esi        jmp .nb430_outer.nb430_outerend:        ;# check if more outer neighborlists remain        mov   ecx, [esp + nb430_nri]	;# esi already loaded with n above        sub   ecx, esi        jecxz .nb430_end        ;# non-zero, do one more workunit        jmp   .nb430_threadloop.nb430_end:	emms	mov eax, [esp + nb430_nouter]	mov ebx, [esp + nb430_ninner]	mov ecx, [ebp + nb430_outeriter]	mov edx, [ebp + nb430_inneriter]	mov [ecx], eax	mov [edx], ebx	mov eax, [esp + nb430_salign]	add esp, eax	add esp, 488	pop edi	pop esi    	pop edx    	pop ecx    	pop ebx    	pop eax	leave	ret	.globl nb_kernel430nf_ia32_sse.globl _nb_kernel430nf_ia32_ssenb_kernel430nf_ia32_sse:	_nb_kernel430nf_ia32_sse:	.equiv          nb430nf_p_nri,          8.equiv          nb430nf_iinr,           12

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?