nb_kernel213_ia32_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 1,984 行 · 第 1/4 页

S
1,984
字号
	;# store dr 	movaps [esp + nb213_dxH1], xmm4	movaps [esp + nb213_dyH1], xmm5	movaps [esp + nb213_dzH1], xmm6	;# square it 	mulps xmm4,xmm4	mulps xmm5,xmm5	mulps xmm6,xmm6	addps xmm6, xmm5	addps xmm6, xmm4	;# rsqH1 in xmm6 			;# move ixH2-izH2 to xmm3-xmm5  	movaps xmm3, [esp + nb213_ixH2]	movaps xmm4, [esp + nb213_iyH2]	movaps xmm5, [esp + nb213_izH2]	;# calc dr 	subps xmm3, xmm0	subps xmm4, xmm1	subps xmm5, xmm2	;# store dr 	movaps [esp + nb213_dxH2], xmm3	movaps [esp + nb213_dyH2], xmm4	movaps [esp + nb213_dzH2], xmm5	;# square it 	mulps xmm3,xmm3	mulps xmm4,xmm4	mulps xmm5,xmm5	addps xmm5, xmm4	addps xmm5, xmm3		;# move ixM-izM to xmm2-xmm4  	movaps xmm3, [esp + nb213_iyM]	movaps xmm4, [esp + nb213_izM]	subps  xmm3, xmm1	subps  xmm4, xmm2	movaps xmm2, [esp + nb213_ixM]	subps  xmm2, xmm0		;# store dr 	movaps [esp + nb213_dxM], xmm2	movaps [esp + nb213_dyM], xmm3	movaps [esp + nb213_dzM], xmm4	;# square it 	mulps xmm2,xmm2	mulps xmm3,xmm3	mulps xmm4,xmm4	addps xmm4, xmm3	addps xmm4, xmm2		;# rsqM in xmm4, rsqH2 in xmm5, rsqH1 in xmm6, rsqO in xmm7 	movaps xmm0, xmm4	movaps xmm1, xmm5	movaps xmm2, xmm6	mulps  xmm0, [esp + nb213_krf]		mulps  xmm1, [esp + nb213_krf]		mulps  xmm2, [esp + nb213_krf]		movaps [esp + nb213_krsqM], xmm0	movaps [esp + nb213_krsqH2], xmm1	movaps [esp + nb213_krsqH1], xmm2	;# rsqH1 - seed in xmm2 	rsqrtps xmm2, xmm6	movaps  xmm3, xmm2	mulps   xmm2, xmm2	movaps  xmm0, [esp + nb213_three]	mulps   xmm2, xmm6	;# rsq*lu*lu 	subps   xmm0, xmm2	;# constant 30-rsq*lu*lu 	mulps   xmm0, xmm3	;# lu*(3-rsq*lu*lu) 	mulps   xmm0, [esp + nb213_half]	movaps  [esp + nb213_rinvH1], xmm0	;# rinvH1 	;# rsqH2 - seed to xmm2 	rsqrtps xmm2, xmm5	movaps  xmm3, xmm2	mulps   xmm2, xmm2	movaps  xmm0, [esp + nb213_three]	mulps   xmm2, xmm5	;# rsq*lu*lu 	subps   xmm0, xmm2	;# constant 30-rsq*lu*lu 	mulps   xmm0, xmm3	;# lu*(3-rsq*lu*lu) 	mulps   xmm0, [esp + nb213_half]	movaps  [esp + nb213_rinvH2], xmm0	;# rinvH2 	;# rsqM - seed to xmm2 	rsqrtps xmm2, xmm4	movaps  xmm3, xmm2	mulps   xmm2, xmm2	movaps  xmm0, [esp + nb213_three]	mulps   xmm2, xmm4	;# rsq*lu*lu 	subps   xmm0, xmm2	;# constant 30-rsq*lu*lu 	mulps   xmm0, xmm3	;# lu*(3-rsq*lu*lu) 	mulps   xmm0, [esp + nb213_half]	movaps  [esp + nb213_rinvM], xmm0		;# Do the O LJ-only interaction directly.		rcpps   xmm2, xmm7	movaps  xmm1, [esp + nb213_two]	mulps   xmm7, xmm2	subps   xmm1, xmm7	mulps   xmm2, xmm1 ;# rinvsq 	movaps  xmm0, xmm2	mulps   xmm0, xmm2  	;# r4	mulps   xmm0, xmm2 	;# r6	movaps  xmm1, xmm0	mulps   xmm1, xmm1  	;# r12	mulps   xmm0, [esp + nb213_c6]	mulps   xmm1, [esp + nb213_c12]	movaps  xmm3, xmm1	subps   xmm3, xmm0  	;# Vvdw12-Vvdw6	addps   xmm3, [esp + nb213_Vvdwtot]	movaps  [esp + nb213_Vvdwtot], xmm3	mulps   xmm0, [esp + nb213_six]	mulps   xmm1, [esp + nb213_twelve]	subps   xmm1, xmm0	mulps   xmm1, xmm2 	;# fscal	movaps xmm3, [esp + nb213_dxO]	movaps xmm4, [esp + nb213_dyO]	movaps xmm5, [esp + nb213_dzO]	mulps  xmm3, xmm1	mulps  xmm4, xmm1	mulps  xmm5, xmm1	;# tx in xmm3-xmm5	;# update O forces 	movaps xmm0, [esp + nb213_fixO]	movaps xmm1, [esp + nb213_fiyO]	movaps xmm2, [esp + nb213_fizO]	addps  xmm0, xmm3	addps  xmm1, xmm4	addps  xmm2, xmm5	movaps [esp + nb213_fixO], xmm0	movaps [esp + nb213_fiyO], xmm1	movaps [esp + nb213_fizO], xmm2	;# update j forces with water O 	movaps [esp + nb213_fjx], xmm3	movaps [esp + nb213_fjy], xmm4	movaps [esp + nb213_fjz], xmm5	;# Do H1 interaction	movaps  xmm7, [esp + nb213_rinvH1]	movaps  xmm4, xmm7		mulps   xmm4, xmm4	;# xmm7=rinv, xmm4=rinvsq	movaps xmm0, xmm7	movaps xmm1, [esp + nb213_krsqH1]	addps  xmm0, xmm1	subps  xmm0, [esp + nb213_crf] ;# xmm0=rinv+ krsq-crf 	mulps  xmm1, [esp + nb213_two]	subps  xmm7, xmm1	mulps  xmm0, [esp + nb213_qqH]	mulps  xmm7, [esp + nb213_qqH]	mulps  xmm4, xmm7	;# total fs H1 in xmm4 	addps  xmm0, [esp + nb213_vctot]		movaps [esp + nb213_vctot], xmm0	movaps xmm0, [esp + nb213_dxH1]	movaps xmm1, [esp + nb213_dyH1]	movaps xmm2, [esp + nb213_dzH1]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4	;# update H1 forces 	movaps xmm3, [esp + nb213_fixH1]	movaps xmm4, [esp + nb213_fiyH1]	movaps xmm7, [esp + nb213_fizH1]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm7, xmm2	movaps [esp + nb213_fixH1], xmm3	movaps [esp + nb213_fiyH1], xmm4	movaps [esp + nb213_fizH1], xmm7	;# update j forces with water H1 	addps  xmm0, [esp + nb213_fjx]	addps  xmm1, [esp + nb213_fjy]	addps  xmm2, [esp + nb213_fjz]	movaps [esp + nb213_fjx], xmm0	movaps [esp + nb213_fjy], xmm1	movaps [esp + nb213_fjz], xmm2	;# Done with H1, do H2 interactions	movaps  xmm7, [esp + nb213_rinvH2]	movaps  xmm4, xmm7		mulps   xmm4, xmm4	;# xmm7=rinv, xmm4=rinvsq	movaps xmm0, xmm7	movaps xmm1, [esp + nb213_krsqH2]	addps  xmm0, xmm1	subps  xmm0, [esp + nb213_crf] ;# xmm0=rinv+ krsq-crf 	mulps  xmm1, [esp + nb213_two]	subps  xmm7, xmm1	mulps  xmm0, [esp + nb213_qqH]	mulps  xmm7, [esp + nb213_qqH]	mulps  xmm4, xmm7	;# total fs H2 in xmm4 	addps  xmm0, [esp + nb213_vctot]		movaps [esp + nb213_vctot], xmm0	movaps xmm0, [esp + nb213_dxH2]	movaps xmm1, [esp + nb213_dyH2]	movaps xmm2, [esp + nb213_dzH2]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4	;# update H2 forces 	movaps xmm3, [esp + nb213_fixH2]	movaps xmm4, [esp + nb213_fiyH2]	movaps xmm7, [esp + nb213_fizH2]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm7, xmm2	movaps [esp + nb213_fixH2], xmm3	movaps [esp + nb213_fiyH2], xmm4	movaps [esp + nb213_fizH2], xmm7	addps xmm0, [esp + nb213_fjx]        addps xmm1, [esp + nb213_fjy]        addps xmm2, [esp + nb213_fjz]	movaps [esp + nb213_fjx], xmm0	movaps [esp + nb213_fjy], xmm1	movaps [esp + nb213_fjz], xmm2	;# Done with H2, do M interactions	movaps  xmm7, [esp + nb213_rinvM]	movaps  xmm4, xmm7		mulps   xmm4, xmm4	;# xmm7=rinv, xmm4=rinvsq	movaps xmm0, xmm7	movaps xmm1, [esp + nb213_krsqM]	addps  xmm0, xmm1	subps  xmm0, [esp + nb213_crf] ;# xmm0=rinv+ krsq-crf 	mulps  xmm1, [esp + nb213_two]	subps  xmm7, xmm1	mulps  xmm0, [esp + nb213_qqM]	mulps  xmm7, [esp + nb213_qqM]	mulps  xmm4, xmm7	;# total fs M in xmm4 	addps  xmm0, [esp + nb213_vctot]		movaps [esp + nb213_vctot], xmm0	movaps xmm0, [esp + nb213_dxM]	movaps xmm1, [esp + nb213_dyM]	movaps xmm2, [esp + nb213_dzM]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4		;# update M forces 	movaps xmm3, [esp + nb213_fixM]	movaps xmm4, [esp + nb213_fiyM]	movaps xmm7, [esp + nb213_fizM]	addps  xmm3, xmm0	addps  xmm4, xmm1	addps  xmm7, xmm2	movaps [esp + nb213_fixM], xmm3	movaps [esp + nb213_fiyM], xmm4	movaps [esp + nb213_fizM], xmm7	mov edi, [ebp + nb213_faction]	;# update j forces from stored values	addps xmm0, [esp + nb213_fjx]	addps xmm1, [esp + nb213_fjy]	addps xmm2, [esp + nb213_fjz]	movlps xmm4, [edi + eax*4]	movlps xmm7, [edi + ecx*4]	movhps xmm4, [edi + ebx*4]	movhps xmm7, [edi + edx*4]	movaps xmm3, xmm4	shufps xmm3, xmm7, 136  ;# constant 10001000	shufps xmm4, xmm7, 221  ;# constant 11011101		;# xmm3 has fjx, xmm4 has fjy 	subps xmm3, xmm0	subps xmm4, xmm1	;# unpack them back for storing 	movaps xmm7, xmm3	unpcklps xmm7, xmm4	unpckhps xmm3, xmm4		movlps [edi + eax*4], xmm7	movlps [edi + ecx*4], xmm3	movhps [edi + ebx*4], xmm7	movhps [edi + edx*4], xmm3	;# finally z forces 	movss  xmm0, [edi + eax*4 + 8]	movss  xmm1, [edi + ebx*4 + 8]	movss  xmm3, [edi + ecx*4 + 8]	movss  xmm4, [edi + edx*4 + 8]	subss  xmm0, xmm2	shufps xmm2, xmm2, 229  ;# constant 11100101	subss  xmm1, xmm2	shufps xmm2, xmm2, 234  ;# constant 11101010	subss  xmm3, xmm2	shufps xmm2, xmm2, 255  ;# constant 11111111	subss  xmm4, xmm2	movss  [edi + eax*4 + 8], xmm0	movss  [edi + ebx*4 + 8], xmm1	movss  [edi + ecx*4 + 8], xmm3	movss  [edi + edx*4 + 8], xmm4		;# should we do one more iteration? 	sub dword ptr [esp + nb213_innerk],  4	jl    .nb213_odd_inner	jmp   .nb213_unroll_loop.nb213_odd_inner:		add dword ptr [esp + nb213_innerk],  4	jnz   .nb213_odd_loop	jmp   .nb213_updateouterdata.nb213_odd_loop:	mov   edx, [esp + nb213_innerjjnr] 	;# pointer to jjnr[k] 	mov   eax, [edx]		add dword ptr [esp + nb213_innerjjnr],  4	 	xorps xmm4, xmm4  	;# clear reg.	movss xmm4, [esp + nb213_iqM]	mov esi, [ebp + nb213_charge] 	movhps xmm4, [esp + nb213_iqH]  ;# [qM  0  qH  qH] 	shufps xmm4, xmm4, 41	;# [0 qH qH qM]	movss xmm3, [esi + eax*4]	;# charge in xmm3 	shufps xmm3, xmm3, 0	mulps xmm3, xmm4	movaps [esp + nb213_qqM], xmm3	;# use dummy qq for storage 		xorps xmm6, xmm6	mov esi, [ebp + nb213_type]	mov ebx, [esi + eax*4]	mov esi, [ebp + nb213_vdwparam]	shl ebx, 1		add ebx, [esp + nb213_ntia]	movlps xmm6, [esi + ebx*4]	movaps xmm7, xmm6	shufps xmm6, xmm6, 252  ;# constant 11111100	shufps xmm7, xmm7, 253  ;# constant 11111101	movaps [esp + nb213_c6], xmm6	movaps [esp + nb213_c12], xmm7		mov esi, [ebp + nb213_pos]	lea eax, [eax + eax*2]  	movss xmm3, [esp + nb213_ixO]	movss xmm4, [esp + nb213_iyO]	movss xmm5, [esp + nb213_izO]	movss xmm0, [esp + nb213_ixH1]	movss xmm1, [esp + nb213_iyH1]	movss xmm2, [esp + nb213_izH1]	unpcklps xmm3, [esp + nb213_ixH2] 	;# ixO ixH2 - -	unpcklps xmm4, [esp + nb213_iyH2]  	;# iyO iyH2 - -	unpcklps xmm5, [esp + nb213_izH2]	;# izO izH2 - -	unpcklps xmm0, [esp + nb213_ixM] 	;# ixH1 ixM - -	unpcklps xmm1, [esp + nb213_iyM]  	;# iyH1 iyM - -	unpcklps xmm2, [esp + nb213_izM]	;# izH1 izM - -	unpcklps xmm3, xmm0  	;# ixO ixH1 ixH2 ixM	unpcklps xmm4, xmm1 	;# same for y	unpcklps xmm5, xmm2 	;# same for z		;# move j coords to xmm0-xmm2 	movss xmm0, [esi + eax*4]	movss xmm1, [esi + eax*4 + 4]	movss xmm2, [esi + eax*4 + 8]	shufps xmm0, xmm0, 0	shufps xmm1, xmm1, 0	shufps xmm2, xmm2, 0		subps xmm3, xmm0	subps xmm4, xmm1	subps xmm5, xmm2	;# use O distances for storage	movaps [esp + nb213_dxO], xmm3	movaps [esp + nb213_dyO], xmm4	movaps [esp + nb213_dzO], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	addps  xmm4, xmm3	addps  xmm4, xmm5	;# rsq in xmm4 	movaps xmm0, xmm4	mulps xmm0, [esp + nb213_krf]	movaps [esp + nb213_krsqM], xmm0			rsqrtps xmm5, xmm4	;# lookup seed in xmm5 	movaps xmm2, xmm5	mulps xmm5, xmm5	movaps xmm1, [esp + nb213_three]	mulps xmm5, xmm4	;# rsq*lu*lu 				movaps xmm0, [esp + nb213_half]	subps xmm1, xmm5	;# constant 30-rsq*lu*lu 	mulps xmm1, xmm2		mulps xmm0, xmm1	;# xmm0=rinv			movaps xmm4, xmm0	movaps xmm1, xmm0	movaps xmm5, xmm0	mulps  xmm4, xmm4	;# xmm1=rinv, xmm4=rinvsq	movaps xmm3, [esp + nb213_krsqM]	addps  xmm5, xmm3	;# xmm0=rinv+ krsq 	subps  xmm5, [esp + nb213_crf] ;# xmm0=rinv+ krsq-crf 	mulps  xmm3, [esp + nb213_two]	subps  xmm1, xmm3	;# xmm1=rinv-2*krsq	movaps xmm7, xmm5	mulps  xmm7, [esp + nb213_qqM]	;# xmm0=vcoul 	mulps  xmm1, [esp + nb213_qqM] 	;# xmm1=coul part of fs 	movaps xmm6, xmm1		addps  xmm7, [esp + nb213_vctot]		movaps [esp + nb213_vctot], xmm7	movaps xmm1, xmm0	mulps  xmm1, xmm1	movaps xmm2, xmm1	mulss  xmm1, xmm1	mulss  xmm1, xmm2	;# xmm1=rinvsix	xorps  xmm4, xmm4	movss  xmm4, xmm1	mulss  xmm4, xmm4	;# xmm4=rinvtwelve 	mulss  xmm1, [esp + nb213_c6]	mulss  xmm4, [esp + nb213_c12]	movaps xmm3, xmm4	subss  xmm3, xmm1	;# xmm3=Vvdw12-Vvdw6 	mulss  xmm1, [esp + nb213_six]	mulss  xmm4, [esp + nb213_twelve]	subss  xmm4, xmm1	addss  xmm3, [esp + nb213_Vvdwtot]	movss  [esp + nb213_Vvdwtot], xmm3	addps  xmm4, xmm6	mulps  xmm4, xmm0	mulps  xmm4, xmm0  	;# fscal			movaps xmm0, [esp + nb213_dxO]	movaps xmm1, [esp + nb213_dyO]	movaps xmm2, [esp + nb213_dzO]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4 ;# xmm0-xmm2 now contains tx-tz (partial force)		movss  xmm3, [esp + nb213_fixO]		movss  xmm4, [esp + nb213_fiyO]		movss  xmm5, [esp + nb213_fizO]		addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss  [esp + nb213_fixO], xmm3		movss  [esp + nb213_fiyO], xmm4		movss  [esp + nb213_fizO], xmm5	;# updated the O force now do the H's		movaps xmm3, xmm0	movaps xmm4, xmm1	movaps xmm5, xmm2      	shufps xmm3, xmm3, 0x39	;# shift right 	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [esp + nb213_fixH1]	addss  xmm4, [esp + nb213_fiyH1]	addss  xmm5, [esp + nb213_fizH1]	movss  [esp + nb213_fixH1], xmm3		movss  [esp + nb213_fiyH1], xmm4		movss  [esp + nb213_fizH1], xmm5	;# updated the H1 force 	shufps xmm3, xmm3, 0x39	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [esp + nb213_fixH2]	addss  xmm4, [esp + nb213_fiyH2]	addss  xmm5, [esp + nb213_fizH2]	movss  [esp + nb213_fixH2], xmm3		movss  [esp + nb213_fiyH2], xmm4		movss  [esp + nb213_fizH2], xmm5	;# updated the H2 force 	mov edi, [ebp + nb213_faction]	shufps xmm3, xmm3, 0x39	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [esp + nb213_fixM]	addss  xmm4, [esp + nb213_fiyM]	addss  xmm5, [esp + nb213_fizM]	movss  [esp + nb213_fixM], xmm3		movss  [esp + nb213_fiyM], xmm4		movss  [esp + nb213_fizM], xmm5	;# updated the M force 	;# the fj's - move in from mem start by acc. tx/ty/tz in xmm0, xmm1	movlps xmm6, [edi + eax*4]	movss  xmm7, [edi + eax*4 + 8]		movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?