nb_kernel314_x86_64_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,319 行 · 第 1/5 页

S
2,319
字号
	addss   xmm1, [rsp + nb314_fiyO]	addss   xmm2, [rsp + nb314_fizO]	movss  [rsp + nb314_fixO], xmm0	movss  [rsp + nb314_fiyO], xmm1	movss  [rsp + nb314_fizO], xmm2	;# do  H1 coulomb interaction	movaps xmm0, [rsp + nb314_rinvH1H1] ;# rinv 	movaps xmm1, xmm0	mulps  xmm1, [rsp + nb314_rsqH1H1] 	;# r	mulps xmm1, [rsp + nb314_tsc]		movhlps xmm2, xmm1		cvttps2pi mm6, xmm1	cvttps2pi mm7, xmm2 	;# mm6/mm7 contain lu indices 	cvtpi2ps xmm3, mm6	cvtpi2ps xmm2, mm7	movlhps  xmm3, xmm2	subps    xmm1, xmm3	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2   	;# xmm2=eps2 	pslld   mm6, 2	pslld   mm7, 2		psrlq mm6, 32	movd ebx, mm6	movd ecx, mm7	psrlq mm7, 32	movd edx, mm7		;# table indices in ebx,ecx,edx 	mov rsi, [rbp + nb314_VFtab]	movlps xmm4, [rsi + rbx*4]	movlps xmm3, [rsi + rcx*4]	movlps xmm7, [rsi + rdx*4]	movhps xmm4, [rsi + rbx*4 + 8]	movhps xmm3, [rsi + rcx*4 + 8]	movhps xmm7, [rsi + rdx*4 + 8]	movaps xmm6, xmm3	unpcklps xmm6, xmm7	unpckhps xmm3, xmm7	movaps xmm5, xmm4	movaps xmm7, xmm4	shufps xmm4, xmm6, 0x40	shufps xmm5, xmm6, 0xE4	movaps xmm6, xmm7	shufps xmm6, xmm3, 0x48	shufps xmm7, xmm3, 0xEC	;# coulomb table ready, in xmm4-xmm7		mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp 	addps  xmm7, xmm7  	;# two*Heps2 	;# fetch charges to xmm3 (temporary) 	xorps  xmm3, xmm3	movss   xmm3, [rsp + nb314_qqHH]	movhps  xmm3, [rsp + nb314_qqMH]	shufps  xmm3, xmm3, 193 ;# 11000001 	addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm3 ;# vcoul=qq*VV  	mulps  xmm3, xmm7 ;# fijC=FF*qq 	;# at this point xmm5 contains vcoul and xmm3 fijC 		addps  xmm5, [rsp + nb314_vctot]	movaps [rsp + nb314_vctot], xmm5	mulps  xmm3, [rsp + nb314_tsc]	xorps  xmm2, xmm2	subps  xmm2, xmm3	mulps  xmm0, xmm2	movaps xmm1, xmm0	movaps xmm2, xmm0				mulps   xmm0, [rsp + nb314_dxH1H1]	mulps   xmm1, [rsp + nb314_dyH1H1]	mulps   xmm2, [rsp + nb314_dzH1H1]	;# update forces H1 - j water 	movaps  xmm3, [rsp + nb314_fjxO]	movaps  xmm4, [rsp + nb314_fjyO]	movaps  xmm5, [rsp + nb314_fjzO]	addps   xmm3, xmm0	addps   xmm4, xmm1	addps   xmm5, xmm2	movaps  [rsp + nb314_fjxO], xmm3	movaps  [rsp + nb314_fjyO], xmm4	movaps  [rsp + nb314_fjzO], xmm5	addps   xmm0, [rsp + nb314_fixH1]	addps   xmm1, [rsp + nb314_fiyH1]	addps   xmm2, [rsp + nb314_fizH1]	movaps  [rsp + nb314_fixH1], xmm0	movaps  [rsp + nb314_fiyH1], xmm1	movaps  [rsp + nb314_fizH1], xmm2			;# i H2 & M simultaneously first get i particle coords:     movaps  xmm0, [rsp + nb314_jxO]    movaps  xmm1, [rsp + nb314_jyO]    movaps  xmm2, [rsp + nb314_jzO]    movaps  xmm3, xmm0    movaps  xmm4, xmm1    movaps  xmm5, xmm2	subps   xmm0, [rsp + nb314_ixH2]	subps   xmm1, [rsp + nb314_iyH2]	subps   xmm2, [rsp + nb314_izH2]	subps   xmm3, [rsp + nb314_ixM] 	subps   xmm4, [rsp + nb314_iyM] 	subps   xmm5, [rsp + nb314_izM] 	movaps [rsp + nb314_dxH2H2], xmm0	movaps [rsp + nb314_dyH2H2], xmm1	movaps [rsp + nb314_dzH2H2], xmm2	movaps [rsp + nb314_dxMM], xmm3	movaps [rsp + nb314_dyMM], xmm4	movaps [rsp + nb314_dzMM], xmm5	mulps xmm0, xmm0	mulps xmm1, xmm1	mulps xmm2, xmm2	mulps xmm3, xmm3	mulps xmm4, xmm4	mulps xmm5, xmm5	addps xmm0, xmm1	addps xmm4, xmm3	addps xmm0, xmm2	;# have rsqH2 in xmm0 	addps xmm4, xmm5	;# have rsqM in xmm4 	;# start with H2, save data 	movaps [rsp + nb314_rsqH2H2], xmm0	movaps [rsp + nb314_rsqMM], xmm4		;# do invsqrt 	rsqrtps xmm1, xmm0	rsqrtps xmm5, xmm4	movaps  xmm2, xmm1	movaps  xmm6, xmm5	mulps   xmm1, xmm1	mulps   xmm5, xmm5	movaps  xmm3, [rsp + nb314_three]	movaps  xmm7, xmm3	mulps   xmm1, xmm0	mulps   xmm5, xmm4	subps   xmm3, xmm1	subps   xmm7, xmm5	mulps   xmm3, xmm2	mulps   xmm7, xmm6	mulps   xmm3, [rsp + nb314_half] ;# rinv H2 - j water 	mulps   xmm7, [rsp + nb314_half] ;# rinv M - j water  	movaps [rsp + nb314_rinvH2H2], xmm3	movaps [rsp + nb314_rinvMM], xmm7	movaps xmm1, xmm3	mulps  xmm1, [rsp + nb314_rsqH2H2]	;# xmm1=r 	movaps xmm0, xmm3	;# xmm0=rinv 	mulps  xmm1, [rsp + nb314_tsc]		movhlps xmm2, xmm1		cvttps2pi mm6, xmm1	cvttps2pi mm7, xmm2 	;# mm6/mm7 contain lu indices 	cvtpi2ps xmm3, mm6	cvtpi2ps xmm2, mm7	movlhps  xmm3, xmm2	subps    xmm1, xmm3	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2   	;# xmm2=eps2 	pslld   mm6, 2	pslld   mm7, 2	psrlq mm6, 32	movd ebx, mm6	movd ecx, mm7	psrlq mm7, 32	movd edx, mm7		;# table indices in ebx,ecx,edx 	movlps xmm4, [rsi + rbx*4]	movlps xmm3, [rsi + rcx*4]	movlps xmm7, [rsi + rdx*4]	movhps xmm4, [rsi + rbx*4 + 8]	movhps xmm3, [rsi + rcx*4 + 8]	movhps xmm7, [rsi + rdx*4 + 8]	movaps xmm6, xmm3	unpcklps xmm6, xmm7	unpckhps xmm3, xmm7	movaps xmm5, xmm4	movaps xmm7, xmm4	shufps xmm4, xmm6, 0x40	shufps xmm5, xmm6, 0xE4	movaps xmm6, xmm7	shufps xmm6, xmm3, 0x48	shufps xmm7, xmm3, 0xEC	;# coulomb table ready, in xmm4-xmm7	mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp 	mulps  xmm7, [rsp + nb314_two]   	;# two*Heps2 	xorps  xmm3, xmm3		;# fetch charges to xmm3 (temporary) 	movss   xmm3, [rsp + nb314_qqHH]	movhps  xmm3, [rsp + nb314_qqMH]	shufps  xmm3, xmm3, 193 ;# 11000001		addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm3 ;# vcoul=qq*VV  	mulps  xmm3, xmm7 ;# fijC=FF*qq 	;# at this point xmm5 contains vcoul and xmm3 fijC 	addps  xmm5, [rsp + nb314_vctot]	movaps [rsp + nb314_vctot], xmm5		xorps  xmm1, xmm1	mulps xmm3, [rsp + nb314_tsc]	mulps xmm3, xmm0	subps  xmm1, xmm3		movaps  xmm0, xmm1	movaps  xmm2, xmm1	mulps   xmm0, [rsp + nb314_dxH2H2]	mulps   xmm1, [rsp + nb314_dyH2H2]	mulps   xmm2, [rsp + nb314_dzH2H2]	;# update forces H1 - j water 	movaps  xmm3, [rsp + nb314_fjxO]	movaps  xmm4, [rsp + nb314_fjyO]	movaps  xmm5, [rsp + nb314_fjzO]	addps   xmm3, xmm0	addps   xmm4, xmm1	addps   xmm5, xmm2	movaps  [rsp + nb314_fjxO], xmm3	movaps  [rsp + nb314_fjyO], xmm4	movaps  [rsp + nb314_fjzO], xmm5	addps   xmm0, [rsp + nb314_fixH2]	addps   xmm1, [rsp + nb314_fiyH2]	addps   xmm2, [rsp + nb314_fizH2]	movaps  [rsp + nb314_fixH2], xmm0	movaps  [rsp + nb314_fiyH2], xmm1	movaps  [rsp + nb314_fizH2], xmm2		;# do table for i M - j water interaction 	movaps xmm0, [rsp + nb314_rinvMM]	movaps xmm1, xmm0	mulps  xmm1, [rsp + nb314_rsqMM]	;# xmm0=rinv, xmm1=r 	mulps  xmm1, [rsp + nb314_tsc]		movhlps xmm2, xmm1		cvttps2pi mm6, xmm1	cvttps2pi mm7, xmm2 	;# mm6/mm7 contain lu indices 	cvtpi2ps xmm3, mm6	cvtpi2ps xmm2, mm7	movlhps  xmm3, xmm2	subps    xmm1, xmm3	;# xmm1=eps 	movaps xmm2, xmm1	mulps  xmm2, xmm2   	;# xmm2=eps2 	pslld   mm6, 2	pslld   mm7, 2 	psrlq mm6, 32	movd ebx, mm6	movd ecx, mm7	psrlq mm7, 32	movd edx, mm7		;# table indices in ebx,ecx,edx 	movlps xmm4, [rsi + rbx*4]	movlps xmm3, [rsi + rcx*4]	movlps xmm7, [rsi + rdx*4]	movhps xmm4, [rsi + rbx*4 + 8]	movhps xmm3, [rsi + rcx*4 + 8]	movhps xmm7, [rsi + rdx*4 + 8]	movaps xmm6, xmm3	unpcklps xmm6, xmm7	unpckhps xmm3, xmm7	movaps xmm5, xmm4	movaps xmm7, xmm4	shufps xmm4, xmm6, 0x40	shufps xmm5, xmm6, 0xE4	movaps xmm6, xmm7	shufps xmm6, xmm3, 0x48	shufps xmm7, xmm3, 0xEC	;# coulomb table ready, in xmm4-xmm7	mulps  xmm6, xmm1   	;# xmm6=Geps 	mulps  xmm7, xmm2   	;# xmm7=Heps2 	addps  xmm5, xmm6	addps  xmm5, xmm7   	;# xmm5=Fp 	mulps  xmm7, [rsp + nb314_two]   	;# two*Heps2 	xorps  xmm3, xmm3	;# fetch charges to xmm3 (temporary) 	movss   xmm3, [rsp + nb314_qqMH]	movhps  xmm3, [rsp + nb314_qqMM]	shufps  xmm3, xmm3, 193 ;# 11000001		addps  xmm7, xmm6	addps  xmm7, xmm5 ;# xmm7=FF 	mulps  xmm5, xmm1 ;# xmm5=eps*Fp 	addps  xmm5, xmm4 ;# xmm5=VV 	mulps  xmm5, xmm3 ;# vcoul=qq*VV  	mulps  xmm3, xmm7 ;# fijC=FF*qq 	;# at this point xmm5 contains vcoul and xmm3 fijC 	addps  xmm5, [rsp + nb314_vctot]	movaps [rsp + nb314_vctot], xmm5		xorps  xmm1, xmm1	mulps xmm3, [rsp + nb314_tsc]	mulps xmm3, xmm0	subps  xmm1, xmm3		movaps  xmm0, xmm1	movaps  xmm2, xmm1		mulps   xmm0, [rsp + nb314_dxMM]	mulps   xmm1, [rsp + nb314_dyMM]	mulps   xmm2, [rsp + nb314_dzMM]	movaps  xmm3, [rsp + nb314_fjxO]	movaps  xmm4, [rsp + nb314_fjyO]	movaps  xmm5, [rsp + nb314_fjzO]	addps   xmm3, xmm0	addps   xmm4, xmm1	addps   xmm5, xmm2	mov     rsi, [rbp + nb314_faction]	movaps  [rsp + nb314_fjxO], xmm3	movaps  [rsp + nb314_fjyO], xmm4	movaps  [rsp + nb314_fjzO], xmm5	addps   xmm0, [rsp + nb314_fixM]	addps   xmm1, [rsp + nb314_fiyM]	addps   xmm2, [rsp + nb314_fizM]	movaps  [rsp + nb314_fixM], xmm0	movaps  [rsp + nb314_fiyM], xmm1	movaps  [rsp + nb314_fizM], xmm2	;# update j water forces from local variables.	;# transpose back first	movaps  xmm0, [rsp + nb314_fjxO] ;# Ox H1x H2x Mx 	movaps  xmm1, [rsp + nb314_fjyO] ;# Oy H1y H2y My	movaps  xmm2, [rsp + nb314_fjzO] ;# Oz H1z H2z Mz	 	movaps  xmm3, xmm0	movaps  xmm4, xmm0	unpcklps xmm3, xmm1       	;# Ox Oy - -	shufps  xmm4, xmm2, 0x1	  	;# h1x - Oz -	movaps  xmm5, xmm1	movaps  xmm6, xmm0	unpcklps xmm5, xmm2 	  	;# - - H1y H1z	unpckhps xmm6, xmm1	  	;# h2x h2y - - 	unpckhps xmm1, xmm2	  	;# - - My Mz		shufps   xmm2, xmm0, 0x32  ;# (00110010) h2z - Mx -	shufps   xmm3, xmm4, 36  ;# 00100100 ;# Ox Oy Oz H1x 	shufps   xmm5, xmm6, 78  ;# 01001110 ;# h1y h1z h2x h2y	shufps   xmm2, xmm1, 232  ;# 11101000 ;# h2z mx my mz	movlps  xmm0, [rsi + rax*4]	movlps  xmm1, [rsi + rax*4 + 16]	movlps  xmm4, [rsi + rax*4 + 32]	movhps  xmm0, [rsi + rax*4 + 8]	movhps  xmm1, [rsi + rax*4 + 24]	movhps  xmm4, [rsi + rax*4 + 40]	addps   xmm0, xmm3	addps   xmm1, xmm5	addps   xmm4, xmm2	movlps   [rsi + rax*4], xmm0	movlps   [rsi + rax*4 + 16], xmm1	movlps   [rsi + rax*4 + 32], xmm4	movhps   [rsi + rax*4 + 8], xmm0	movhps   [rsi + rax*4 + 24], xmm1	movhps   [rsi + rax*4 + 40], xmm4		dec dword ptr [rsp + nb314_innerk]	jz    .nb314_updateouterdata	jmp   .nb314_single_loop.nb314_updateouterdata:	mov   ecx, [rsp + nb314_ii3]	mov   rdi, [rbp + nb314_faction]	mov   rsi, [rbp + nb314_fshift]	mov   edx, [rsp + nb314_is3]	;# accumulate  Oi forces in xmm0, xmm1, xmm2 	movaps xmm0, [rsp + nb314_fixO]	movaps xmm1, [rsp + nb314_fiyO] 	movaps xmm2, [rsp + nb314_fizO]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addps  xmm0, xmm3	addps  xmm1, xmm4	addps  xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 	movaps xmm3, xmm0		movaps xmm4, xmm1		movaps xmm5, xmm2		shufps xmm3, xmm3, 1	shufps xmm4, xmm4, 1	shufps xmm5, xmm5, 1	addss  xmm0, xmm3	addss  xmm1, xmm4	addss  xmm2, xmm5	;# xmm0-xmm2 has single force in pos0 	;# increment i force 	movss  xmm3, [rdi + rcx*4]	movss  xmm4, [rdi + rcx*4 + 4]	movss  xmm5, [rdi + rcx*4 + 8]	subss  xmm3, xmm0	subss  xmm4, xmm1	subss  xmm5, xmm2	movss  [rdi + rcx*4],     xmm3	movss  [rdi + rcx*4 + 4], xmm4	movss  [rdi + rcx*4 + 8], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	movaps xmm6, xmm0	movss xmm7, xmm2	movlhps xmm6, xmm1	shufps  xmm6, xmm6, 8 ;# 00001000		;# accumulate H1i forces in xmm0, xmm1, xmm2 	movaps xmm0, [rsp + nb314_fixH1]	movaps xmm1, [rsp + nb314_fiyH1]	movaps xmm2, [rsp + nb314_fizH1]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addps  xmm0, xmm3	addps  xmm1, xmm4	addps  xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 	movaps xmm3, xmm0		movaps xmm4, xmm1		movaps xmm5, xmm2		shufps xmm3, xmm3, 1	shufps xmm4, xmm4, 1	shufps xmm5, xmm5, 1	addss  xmm0, xmm3	addss  xmm1, xmm4	addss  xmm2, xmm5	;# xmm0-xmm2 has single force in pos0 	;# increment i force 	movss  xmm3, [rdi + rcx*4 + 12]	movss  xmm4, [rdi + rcx*4 + 16]	movss  xmm5, [rdi + rcx*4 + 20]	subss  xmm3, xmm0	subss  xmm4, xmm1	subss  xmm5, xmm2	movss  [rdi + rcx*4 + 12], xmm3	movss  [rdi + rcx*4 + 16], xmm4	movss  [rdi + rcx*4 + 20], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addss xmm7, xmm2	movlhps xmm0, xmm1	shufps  xmm0, xmm0, 8 ;# 00001000		addps   xmm6, xmm0

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?