nb_kernel113_x86_64_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 1,845 行 · 第 1/4 页

S
1,845
字号
    movaps xmm14, xmm4    movaps xmm15, xmm5    	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	addps  xmm3, xmm4	addps  xmm3, xmm5    ;# calc 1/rsq    rcpps xmm5, xmm3    movaps xmm4, [rsp + nb113_two]    mulps xmm3, xmm5    subps xmm4, xmm3    mulps xmm4, xmm5        ;# xmm4=rinvsq    movaps xmm3, xmm4       ;# rinvsq    mulps  xmm4, xmm4       ;# rinv4    mulps  xmm4, xmm3       ;# rinv6    movaps xmm5, xmm4         mulps  xmm5, xmm5       ;# rinv12    mulps  xmm4, [rsp + nb113_c6]    mulps  xmm5, [rsp + nb113_c12]    movaps xmm6, xmm5    subps  xmm6, xmm4  ;# Vvdw=vvdw12-vvdw6    mulps  xmm4, [rsp + nb113_six]    mulps  xmm5, [rsp + nb113_twelve]    subps  xmm5, xmm4    mulps  xmm3, xmm5   ;# fscal        addps  xmm6, [rsp + nb113_Vvdwtot]    movaps [rsp + nb113_Vvdwtot], xmm6        mulps  xmm13, xmm3 ;# fx    mulps  xmm14, xmm3 ;# fy    mulps  xmm15, xmm3 ;# fz    ;# save j force temporarily    movaps [rsp + nb113_fjx], xmm13    movaps [rsp + nb113_fjy], xmm14    movaps [rsp + nb113_fjz], xmm15        ;# increment i O force    addps xmm13, [rsp + nb113_fixO]    addps xmm14, [rsp + nb113_fiyO]    addps xmm15, [rsp + nb113_fizO]    movaps [rsp + nb113_fixO], xmm13    movaps [rsp + nb113_fiyO], xmm14    movaps [rsp + nb113_fizO], xmm15        ;# finished O LJ interaction.    ;# do H1, H2, and M interactions in parallel.    ;# xmm0-xmm2 still contain j coordinates.    movaps xmm3, xmm0    movaps xmm4, xmm1    movaps xmm5, xmm2    movaps xmm6, xmm0    movaps xmm7, xmm1    movaps xmm8, xmm2            subps xmm0, [rsp + nb113_ixH1]    subps xmm1, [rsp + nb113_iyH1]    subps xmm2, [rsp + nb113_izH1]    subps xmm3, [rsp + nb113_ixH2]    subps xmm4, [rsp + nb113_iyH2]    subps xmm5, [rsp + nb113_izH2]    subps xmm6, [rsp + nb113_ixM]    subps xmm7, [rsp + nb113_iyM]    subps xmm8, [rsp + nb113_izM]    	movaps [rsp + nb113_dxH1], xmm0	movaps [rsp + nb113_dyH1], xmm1	movaps [rsp + nb113_dzH1], xmm2	mulps  xmm0, xmm0	mulps  xmm1, xmm1	mulps  xmm2, xmm2	movaps [rsp + nb113_dxH2], xmm3	movaps [rsp + nb113_dyH2], xmm4	movaps [rsp + nb113_dzH2], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	movaps [rsp + nb113_dxM], xmm6	movaps [rsp + nb113_dyM], xmm7	movaps [rsp + nb113_dzM], xmm8	mulps  xmm6, xmm6	mulps  xmm7, xmm7	mulps  xmm8, xmm8	addps  xmm0, xmm1	addps  xmm0, xmm2	addps  xmm3, xmm4	addps  xmm3, xmm5    addps  xmm6, xmm7    addps  xmm6, xmm8	;# start doing invsqrt for j atoms	rsqrtps xmm1, xmm0	rsqrtps xmm4, xmm3    rsqrtps xmm7, xmm6		movaps  xmm2, xmm1	movaps  xmm5, xmm4    movaps  xmm8, xmm7    	mulps   xmm1, xmm1 ;# lu*lu	mulps   xmm4, xmm4 ;# lu*lu    mulps   xmm7, xmm7 ;# lu*lu			movaps  xmm9, [rsp + nb113_three]	movaps  xmm10, xmm9    movaps  xmm11, xmm9	mulps   xmm1, xmm0 ;# rsq*lu*lu	mulps   xmm4, xmm3 ;# rsq*lu*lu     mulps   xmm7, xmm6 ;# rsq*lu*lu		subps   xmm9, xmm1	subps   xmm10, xmm4    subps   xmm11, xmm7 ;# 3-rsq*lu*lu	mulps   xmm9, xmm2	mulps   xmm10, xmm5    mulps   xmm11, xmm8 ;# lu*(3-rsq*lu*lu)	movaps  xmm0, [rsp + nb113_half]	mulps   xmm9, xmm0  ;# rinvH1	mulps   xmm10, xmm0 ;# rinvH2    mulps   xmm11, xmm0 ;# rinvM		;# interactions     movaps xmm0, xmm9    movaps xmm1, xmm10    movaps xmm2, xmm11    mulps  xmm9, xmm9    mulps  xmm10, xmm10    mulps  xmm11, xmm11    mulps  xmm0, [rsp + nb113_qqH]     mulps  xmm1, [rsp + nb113_qqH]     mulps  xmm2, [rsp + nb113_qqM]     mulps  xmm9, xmm0    mulps  xmm10, xmm1    mulps  xmm11, xmm2        addps xmm0, [rsp + nb113_vctot]     addps xmm1, xmm2    addps xmm0, xmm1    movaps [rsp + nb113_vctot], xmm0    	mov   rdi, [rbp + nb113_faction]		;# move j forces to local temp variables     movlps xmm0, [rdi + rax*4] ;# jxa jya  -   -    movlps xmm1, [rdi + rcx*4] ;# jxc jyc  -   -    movhps xmm0, [rdi + rbx*4] ;# jxa jya jxb jyb     movhps xmm1, [rdi + rdx*4] ;# jxc jyc jxd jyd     movss  xmm2, [rdi + rax*4 + 8] ;# jza  -  -  -    movss  xmm3, [rdi + rcx*4 + 8] ;# jzc  -  -  -    movss  xmm4, [rdi + rbx*4 + 8] ;# jzb    movss  xmm5, [rdi + rdx*4 + 8] ;# jzd    movlhps xmm2, xmm4 ;# jza  -  jzb  -    movlhps xmm3, xmm5 ;# jzc  -  jzd -    shufps xmm2, xmm3,  136  ;# 10001000 => jza jzb jzc jzd    ;# xmm0: jxa jya jxb jyb     ;# xmm1: jxc jyc jxd jyd    ;# xmm2: jza jzb jzc jzd    movaps xmm7, xmm9    movaps xmm8, xmm9    movaps xmm13, xmm11    movaps xmm14, xmm11    movaps xmm15, xmm11    movaps xmm11, xmm10    movaps xmm12, xmm10	mulps xmm7, [rsp + nb113_dxH1]	mulps xmm8, [rsp + nb113_dyH1]	mulps xmm9, [rsp + nb113_dzH1]	mulps xmm10, [rsp + nb113_dxH2]	mulps xmm11, [rsp + nb113_dyH2]	mulps xmm12, [rsp + nb113_dzH2]	mulps xmm13, [rsp + nb113_dxM]	mulps xmm14, [rsp + nb113_dyM]	mulps xmm15, [rsp + nb113_dzM]    ;# fetch forces from O interaction    movaps xmm3, [rsp + nb113_fjx]    movaps xmm4, [rsp + nb113_fjy]    addps  xmm2, [rsp + nb113_fjz]    addps xmm3, xmm7    addps xmm4, xmm8    addps xmm2, xmm9    addps xmm7, [rsp + nb113_fixH1]    addps xmm8, [rsp + nb113_fiyH1]    addps xmm9, [rsp + nb113_fizH1]    addps xmm3, xmm10    addps xmm4, xmm11    addps xmm2, xmm12    addps xmm10, [rsp + nb113_fixH2]    addps xmm11, [rsp + nb113_fiyH2]    addps xmm12, [rsp + nb113_fizH2]    addps xmm3, xmm13    addps xmm4, xmm14    addps xmm2, xmm15    addps xmm13, [rsp + nb113_fixM]    addps xmm14, [rsp + nb113_fiyM]    addps xmm15, [rsp + nb113_fizM]    movaps [rsp + nb113_fixH1], xmm7    movaps [rsp + nb113_fiyH1], xmm8    movaps [rsp + nb113_fizH1], xmm9    movaps [rsp + nb113_fixH2], xmm10    movaps [rsp + nb113_fiyH2], xmm11    movaps [rsp + nb113_fizH2], xmm12    movaps [rsp + nb113_fixM], xmm13    movaps [rsp + nb113_fiyM], xmm14    movaps [rsp + nb113_fizM], xmm15        ;# xmm3 = fjx , xmm4 = fjy    movaps xmm5, xmm3    unpcklps xmm3, xmm4    unpckhps xmm5, xmm4        addps xmm0, xmm3    addps xmm1, xmm5    movhlps  xmm3, xmm2 ;# fjzc fjzd        movlps [rdi + rax*4], xmm0    movhps [rdi + rbx*4], xmm0    movlps [rdi + rcx*4], xmm1    movhps [rdi + rdx*4], xmm1    movss  [rdi + rax*4 + 8], xmm2    movss  [rdi + rcx*4 + 8], xmm3    shufps xmm2, xmm2, 1    shufps xmm3, xmm3, 1    movss  [rdi + rbx*4 + 8], xmm2    movss  [rdi + rdx*4 + 8], xmm3	;# should we do one more iteration? 	sub dword ptr [rsp + nb113_innerk],  4	jl    .nb113_odd_inner	jmp   .nb113_unroll_loop.nb113_odd_inner:		add dword ptr [rsp + nb113_innerk],  4	jnz   .nb113_odd_loop	jmp   .nb113_updateouterdata.nb113_odd_loop:	mov   rdx, [rsp + nb113_innerjjnr] 	;# pointer to jjnr[k] 	mov   eax, [rdx]		add qword ptr [rsp + nb113_innerjjnr],  4	 	xorps xmm4, xmm4  	;# clear reg.	movss xmm4, [rsp + nb113_iqM]	mov rsi, [rbp + nb113_charge] 	movhps xmm4, [rsp + nb113_iqH]  ;# [qM  0  qH  qH] 	shufps xmm4, xmm4, 41	;# [0 qH qH qM]	movss xmm3, [rsi + rax*4]	;# charge in xmm3 	shufps xmm3, xmm3, 0	mulps xmm3, xmm4	movaps [rsp + nb113_qqM], xmm3	;# use dummy qq for storage 		xorps xmm6, xmm6	mov rsi, [rbp + nb113_type]	mov ebx, [rsi + rax*4]	mov rsi, [rbp + nb113_vdwparam]	shl ebx, 1		add ebx, [rsp + nb113_ntia]	movlps xmm6, [rsi + rbx*4]	movaps xmm7, xmm6	shufps xmm6, xmm6, 252  ;# 11111100	shufps xmm7, xmm7, 253  ;# 11111101	movaps [rsp + nb113_c6], xmm6	movaps [rsp + nb113_c12], xmm7		mov rsi, [rbp + nb113_pos]	lea	rax, [rax + rax*2]  	movss xmm0, [rsp + nb113_ixO]	movss xmm1, [rsp + nb113_iyO]	movss xmm2, [rsp + nb113_izO]	movss xmm3, [rsp + nb113_ixH1]	movss xmm4, [rsp + nb113_iyH1]	movss xmm5, [rsp + nb113_izH1]	unpcklps xmm0, [rsp + nb113_ixH2] 	;# ixO ixH2 - -	unpcklps xmm1, [rsp + nb113_iyH2]  	;# iyO iyH2 - -	unpcklps xmm2, [rsp + nb113_izH2]	;# izO izH2 - -	unpcklps xmm3, [rsp + nb113_ixM] 	;# ixH1 ixM - -	unpcklps xmm4, [rsp + nb113_iyM]  	;# iyH1 iyM - -	unpcklps xmm5, [rsp + nb113_izM]	;# izH1 izM - -	unpcklps xmm0, xmm3  	;# ixO ixH1 ixH2 ixM	unpcklps xmm1, xmm4 	;# same for y	unpcklps xmm2, xmm5 	;# same for z		;# move j coords to xmm0-xmm2 	movss xmm3, [rsi + rax*4]	movss xmm4, [rsi + rax*4 + 4]	movss xmm5, [rsi + rax*4 + 8]	shufps xmm3, xmm3, 0	shufps xmm4, xmm4, 0	shufps xmm5, xmm5, 0		subps xmm3, xmm0	subps xmm4, xmm1	subps xmm5, xmm2	;# use O distances for storage	movaps [rsp + nb113_dxO], xmm3	movaps [rsp + nb113_dyO], xmm4	movaps [rsp + nb113_dzO], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	addps  xmm4, xmm3	addps  xmm4, xmm5	;# rsq in xmm4 	rsqrtps xmm5, xmm4	;# lookup seed in xmm5 	movaps xmm2, xmm5	mulps xmm5, xmm5	movaps xmm1, [rsp + nb113_three]	mulps xmm5, xmm4	;# rsq*lu*lu 				movaps xmm0, [rsp + nb113_half]	subps xmm1, xmm5	;# 30-rsq*lu*lu 	mulps xmm1, xmm2		mulps xmm0, xmm1	;# xmm0=rinv		movaps xmm1, xmm0 	mulps xmm1, xmm1	;# rinvsq 	movaps xmm7, xmm0	mulps  xmm7, [rsp + nb113_qqM] ;# vcoul	movaps xmm6, xmm7		addps  xmm7, [rsp + nb113_vctot]		movaps [rsp + nb113_vctot], xmm7	movaps xmm2, xmm1	mulss  xmm1, xmm1	mulss  xmm1, xmm2	;# xmm1=rinvsix	xorps  xmm4, xmm4	movss  xmm4, xmm1	mulss  xmm4, xmm4	;# xmm4=rinvtwelve 	mulss  xmm1, [rsp + nb113_c6]	mulss  xmm4, [rsp + nb113_c12]	movaps xmm3, xmm4	subss  xmm3, xmm1	;# xmm3=Vvdw12-Vvdw6 	mulss  xmm1, [rsp + nb113_six]	mulss  xmm4, [rsp + nb113_twelve]	subss  xmm4, xmm1	addss  xmm3, [rsp + nb113_Vvdwtot]	movss  [rsp + nb113_Vvdwtot], xmm3	addps  xmm4, xmm6	mulps  xmm4, xmm0	mulps  xmm4, xmm0  	;# fscal		movaps xmm0, [rsp + nb113_dxO]	movaps xmm1, [rsp + nb113_dyO]	movaps xmm2, [rsp + nb113_dzO]	mulps  xmm0, xmm4	mulps  xmm1, xmm4	mulps  xmm2, xmm4 ;# xmm0-xmm2 now contains tx-tz (partial force)		movss  xmm3, [rsp + nb113_fixO]		movss  xmm4, [rsp + nb113_fiyO]		movss  xmm5, [rsp + nb113_fizO]		addss  xmm3, xmm0	addss  xmm4, xmm1	addss  xmm5, xmm2	movss  [rsp + nb113_fixO], xmm3		movss  [rsp + nb113_fiyO], xmm4		movss  [rsp + nb113_fizO], xmm5	;# updated the O force now do the H's		movaps xmm3, xmm0	movaps xmm4, xmm1	movaps xmm5, xmm2      	shufps xmm3, xmm3, 0x39	;# shift right 	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [rsp + nb113_fixH1]	addss  xmm4, [rsp + nb113_fiyH1]	addss  xmm5, [rsp + nb113_fizH1]	movss  [rsp + nb113_fixH1], xmm3		movss  [rsp + nb113_fiyH1], xmm4		movss  [rsp + nb113_fizH1], xmm5	;# updated the H1 force 	shufps xmm3, xmm3, 0x39	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [rsp + nb113_fixH2]	addss  xmm4, [rsp + nb113_fiyH2]	addss  xmm5, [rsp + nb113_fizH2]	movss  [rsp + nb113_fixH2], xmm3		movss  [rsp + nb113_fiyH2], xmm4		movss  [rsp + nb113_fizH2], xmm5	;# updated the H2 force 	mov rdi, [rbp + nb113_faction]	shufps xmm3, xmm3, 0x39	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm3, [rsp + nb113_fixM]	addss  xmm4, [rsp + nb113_fiyM]	addss  xmm5, [rsp + nb113_fizM]	movss  [rsp + nb113_fixM], xmm3		movss  [rsp + nb113_fiyM], xmm4		movss  [rsp + nb113_fizM], xmm5	;# updated the M force 	;# the fj's - move in from mem start by acc. tx/ty/tz in xmm0, xmm1	movlps xmm6, [rdi + rax*4]	movss  xmm7, [rdi + rax*4 + 8]		movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addps   xmm3, xmm0	addps   xmm4, xmm1	addps   xmm5, xmm2	movaps  xmm0, xmm3	movaps  xmm1, xmm4	movaps  xmm2, xmm5		shufps xmm3, xmm3, 0x39	;# shift right 	shufps xmm4, xmm4, 0x39	shufps xmm5, xmm5, 0x39	addss  xmm0, xmm3	addss  xmm1, xmm4	addss  xmm2, xmm5	unpcklps xmm0, xmm1 	;# x,y sum in xmm0, z sum in xmm2		addps    xmm6, xmm0	addss    xmm7, xmm2		movlps [rdi + rax*4],     xmm6	movss  [rdi + rax*4 + 8], xmm7	dec dword ptr [rsp + nb113_innerk]	jz    .nb113_updateouterdata	jmp   .nb113_odd_loop.nb113_updateouterdata:	mov   ecx, [rsp + nb113_ii3]	mov   rdi, [rbp + nb113_faction]	mov   rsi, [rbp + nb113_fshift]	mov   edx, [rsp + nb113_is3]	;# accumulate  Oi forces in xmm0, xmm1, xmm2 	movaps xmm0, [rsp + nb113_fixO]	movaps xmm1, [rsp + nb113_fiyO]	movaps xmm2, [rsp + nb113_fizO]	movhlps xmm3, xmm0	movhlps xmm4, xmm1

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?