nb_kernel333_x86_64_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,385 行 · 第 1/5 页

S
2,385
字号
        ;# calculate rinv=1/sqrt(rsq)	rsqrtps xmm5, xmm3	movaps xmm15, xmm5	mulps xmm5, xmm5	movaps xmm4, [rsp + nb333_three]	mulps xmm5, xmm3	;# rsq*lu*lu 	    subps xmm4, xmm5	;# 30-rsq*lu*lu 	mulps xmm4, xmm15		mulps xmm4, [rsp + nb333_half]		movaps xmm15, xmm4	mulps  xmm3, xmm4	    ;# xmm15=rinv    ;# xmm3=r    mulps xmm3, [rsp + nb333_tsc] ;# rtab    ;# truncate and convert to integers    cvttps2dq xmm5, xmm3        ;# convert back to float    cvtdq2ps  xmm4, xmm5        ;# multiply by 4    pslld   xmm5, 2    ;# multiply by three (copy, mult. by two, add back)    movaps  xmm10, xmm5    pslld   xmm10, 1    paddd   xmm5, xmm10        ;# calculate eps    subps     xmm3, xmm4    ;# xmm3=eps        ;# move to integer registers    movhlps xmm6, xmm5    movd    r8d, xmm5    movd    r10d, xmm6    pshufd  xmm5, xmm5, 1    pshufd  xmm6, xmm6, 1    movd    r9d, xmm5    movd    r11d, xmm6    ;# xmm3=eps    ;# xmm15=rinv	mov rsi, [rbp + nb333_VFtab]    ;# calculate LJ table    movlps xmm5, [rsi + r8*4 + 16]   	movlps xmm9, [rsi + r8*4 + 32]	movlps xmm7,  [rsi + r10*4 + 16]	movlps xmm11, [rsi + r10*4 + 32]	movhps xmm5, [rsi + r9*4 + 16]	movhps xmm9, [rsi + r9*4 + 32]	movhps xmm7,  [rsi + r11*4 + 16]	movhps xmm11, [rsi + r11*4 + 32]    movaps xmm4, xmm5    movaps xmm8, xmm9	shufps xmm4, xmm7, 136  ;# 10001000	shufps xmm8, xmm11, 136  ;# 10001000	shufps xmm5, xmm7, 221  ;# 11011101	shufps xmm9, xmm11, 221  ;# 11011101	movlps xmm7,  [rsi + r8*4 + 24]	movlps xmm11, [rsi + r8*4 + 40]    	movlps xmm13, [rsi + r10*4 + 24]	movlps xmm14, [rsi + r10*4 + 40]	movhps xmm7,  [rsi + r9*4 + 24]	movhps xmm11, [rsi + r9*4 + 40]    	movhps xmm13, [rsi + r11*4 + 24]	movhps xmm14, [rsi + r11*4 + 40]    movaps xmm6, xmm7    movaps xmm10, xmm11    	shufps xmm6, xmm13, 136  ;# 10001000	shufps xmm10, xmm14, 136  ;# 10001000	shufps xmm7, xmm13, 221  ;# 11011101	shufps xmm11, xmm14, 221  ;# 11011101    ;# dispersion table in xmm4-xmm7, repulsion table in xmm8-xmm11        mulps  xmm7, xmm3    ;# Heps    mulps  xmm11, xmm3     mulps  xmm6, xmm3   ;# Geps    mulps  xmm10, xmm3     mulps  xmm7, xmm3   ;# Heps2    mulps  xmm11, xmm3     addps  xmm5, xmm6  ;# F+Geps    addps  xmm9, xmm10     addps  xmm5, xmm7   ;# F+Geps+Heps2 = Fp    addps  xmm9, xmm11     addps  xmm7, xmm7    ;# 2*Heps2    addps  xmm11, xmm11    addps  xmm7, xmm6   ;# 2*Heps2+Geps    addps  xmm11, xmm10        addps  xmm7, xmm5  ;# FF = Fp + 2*Heps2 + Geps    addps  xmm11, xmm9    mulps  xmm5, xmm3  ;# eps*Fp    mulps  xmm9, xmm3    movaps xmm12, [rsp + nb333_c6]    movaps xmm13, [rsp + nb333_c12]    addps  xmm5, xmm4 ;# VV    addps  xmm9, xmm8    mulps  xmm5, xmm12  ;# VV*c6 = vnb6    mulps  xmm9, xmm13  ;# VV*c12 = vnb12    addps  xmm5, xmm9    addps  xmm5, [rsp + nb333_Vvdwtot]    movaps [rsp + nb333_Vvdwtot], xmm5            mulps  xmm7, xmm12   ;# FF*c6 = fnb6    mulps  xmm11, xmm13   ;# FF*c12  = fnb12    addps  xmm7, xmm11        mulps  xmm7, [rsp + nb333_tsc]    mulps  xmm7, xmm15   ;# -fscal    xorps  xmm9, xmm9        subps  xmm9, xmm7     ;# fscal    movaps xmm10, xmm9    movaps xmm11, xmm9    mulps  xmm9,  [rsp + nb333_dxO] ;# fx/fy/fz    mulps  xmm10, [rsp + nb333_dyO]    mulps  xmm11, [rsp + nb333_dzO]    ;# save j force temporarily    movaps [rsp + nb333_fjx], xmm9    movaps [rsp + nb333_fjy], xmm10    movaps [rsp + nb333_fjz], xmm11        ;# increment i O force    addps xmm9, [rsp + nb333_fixO]    addps xmm10, [rsp + nb333_fiyO]    addps xmm11, [rsp + nb333_fizO]    movaps [rsp + nb333_fixO], xmm9    movaps [rsp + nb333_fiyO], xmm10    movaps [rsp + nb333_fizO], xmm11    ;# finished O LJ interaction.    ;# do H1, H2, and M interactions in parallel.    ;# xmm0-xmm2 still contain j coordinates.                    movaps xmm3, xmm0    movaps xmm4, xmm1    movaps xmm5, xmm2    movaps xmm6, xmm0    movaps xmm7, xmm1    movaps xmm8, xmm2        subps xmm0, [rsp + nb333_ixH1]    subps xmm1, [rsp + nb333_iyH1]    subps xmm2, [rsp + nb333_izH1]    subps xmm3, [rsp + nb333_ixH2]    subps xmm4, [rsp + nb333_iyH2]    subps xmm5, [rsp + nb333_izH2]    subps xmm6, [rsp + nb333_ixM]    subps xmm7, [rsp + nb333_iyM]    subps xmm8, [rsp + nb333_izM]    	movd  mm0, eax		;# use mmx registers as temp storage 	movd  mm1, ebx	movd  mm2, ecx	movd  mm3, edx	movaps [rsp + nb333_dxH1], xmm0	movaps [rsp + nb333_dyH1], xmm1	movaps [rsp + nb333_dzH1], xmm2	mulps  xmm0, xmm0	mulps  xmm1, xmm1	mulps  xmm2, xmm2	movaps [rsp + nb333_dxH2], xmm3	movaps [rsp + nb333_dyH2], xmm4	movaps [rsp + nb333_dzH2], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	movaps [rsp + nb333_dxM], xmm6	movaps [rsp + nb333_dyM], xmm7	movaps [rsp + nb333_dzM], xmm8	mulps  xmm6, xmm6	mulps  xmm7, xmm7	mulps  xmm8, xmm8	addps  xmm0, xmm1	addps  xmm0, xmm2	addps  xmm3, xmm4	addps  xmm3, xmm5    addps  xmm6, xmm7    addps  xmm6, xmm8	;# start doing invsqrt for j atoms	rsqrtps xmm1, xmm0	rsqrtps xmm4, xmm3    rsqrtps xmm7, xmm6		movaps  xmm2, xmm1	movaps  xmm5, xmm4    movaps  xmm8, xmm7    	mulps   xmm1, xmm1 ;# lu*lu	mulps   xmm4, xmm4 ;# lu*lu    mulps   xmm7, xmm7 ;# lu*lu			movaps  xmm9, [rsp + nb333_three]	movaps  xmm10, xmm9    movaps  xmm11, xmm9	mulps   xmm1, xmm0 ;# rsq*lu*lu	mulps   xmm4, xmm3 ;# rsq*lu*lu     mulps   xmm7, xmm6 ;# rsq*lu*lu		subps   xmm9, xmm1	subps   xmm10, xmm4    subps   xmm11, xmm7 ;# 3-rsq*lu*lu	mulps   xmm9, xmm2	mulps   xmm10, xmm5    mulps   xmm11, xmm8 ;# lu*(3-rsq*lu*lu)	movaps  xmm4, [rsp + nb333_half]	mulps   xmm9, xmm4  ;# rinvH1 	mulps   xmm10, xmm4 ;# rinvH2    mulps   xmm11, xmm4 ;# rinvM	movaps  [rsp + nb333_rinvH1], xmm9	movaps  [rsp + nb333_rinvH2], xmm10	movaps  [rsp + nb333_rinvM], xmm11		;# interactions     ;# rsq in xmm0,xmm3,xmm6      ;# rinv in xmm9, xmm10, xmm11    movaps xmm1, [rsp + nb333_tsc]    mulps  xmm0, xmm9  ;# r    mulps  xmm3, xmm10    mulps  xmm6, xmm11    mulps  xmm0, xmm1 ;# rtab    mulps  xmm3, xmm1    mulps  xmm6, xmm1        ;# truncate and convert to integers    cvttps2dq xmm1, xmm0    cvttps2dq xmm4, xmm3    cvttps2dq xmm7, xmm6            ;# convert back to float    cvtdq2ps  xmm2, xmm1    cvtdq2ps  xmm5, xmm4    cvtdq2ps  xmm8, xmm7        ;# multiply by 4    pslld   xmm1, 2    pslld   xmm4, 2    pslld   xmm7, 2        ;# multiply by three (copy, mult. by two, add back)    movaps  xmm10, xmm1    movaps  xmm11, xmm4    movaps  xmm12, xmm7    pslld   xmm1, 1    pslld   xmm4, 1    pslld   xmm7, 1        paddd   xmm1, xmm10    paddd   xmm4, xmm11    paddd   xmm7, xmm12            ;# move to integer registers    movhlps xmm13, xmm1    movhlps xmm14, xmm4    movhlps xmm15, xmm7    movd    eax, xmm1    movd    r8d, xmm4    movd    r12d, xmm7    movd    ecx, xmm13    movd    r10d, xmm14    movd    r14d, xmm15    pshufd  xmm1, xmm1, 1    pshufd  xmm4, xmm4, 1    pshufd  xmm7, xmm7, 1    pshufd  xmm13, xmm13, 1    pshufd  xmm14, xmm14, 1    pshufd  xmm15, xmm15, 1    movd    ebx, xmm1    movd    r9d, xmm4    movd    r13d, xmm7        movd    edx, xmm13    movd    r11d, xmm14    movd    r15d, xmm15               mov  rsi, [rbp + nb333_VFtab]    ;# calculate eps    subps     xmm0, xmm2    subps     xmm3, xmm5    subps     xmm6, xmm8    movaps    [rsp + nb333_epsH1], xmm0    movaps    [rsp + nb333_epsH2], xmm3    movaps    [rsp + nb333_epsM], xmm6    ;# Load LOTS of table data   	movlps xmm1, [rsi + rax*4]   	movlps xmm5, [rsi + r8*4]   	movlps xmm9, [rsi + r12*4]	movlps xmm3, [rsi + rcx*4]	movlps xmm7, [rsi + r10*4]	movlps xmm11, [rsi + r14*4]	movhps xmm1, [rsi + rbx*4]	movhps xmm5, [rsi + r9*4]	movhps xmm9, [rsi + r13*4]	movhps xmm3, [rsi + rdx*4]	movhps xmm7, [rsi + r11*4]	movhps xmm11, [rsi + r15*4]    movaps xmm0, xmm1    movaps xmm4, xmm5    movaps xmm8, xmm9	shufps xmm0, xmm3, 136  ;# 10001000	shufps xmm4, xmm7, 136  ;# 10001000	shufps xmm8, xmm11, 136  ;# 10001000	shufps xmm1, xmm3, 221  ;# 11011101	shufps xmm5, xmm7, 221  ;# 11011101	shufps xmm9, xmm11, 221  ;# 11011101    	movlps xmm3, [rsi + rax*4 + 8]	movlps xmm7, [rsi + r8*4 + 8]	movlps xmm11, [rsi + r12*4 + 8]    	movlps xmm12, [rsi + rcx*4 + 8]	movlps xmm13, [rsi + r10*4 + 8]	movlps xmm14, [rsi + r14*4 + 8]	movhps xmm3, [rsi + rbx*4 + 8]	movhps xmm7, [rsi + r9*4 + 8]	movhps xmm11, [rsi + r13*4 + 8]    	movhps xmm12, [rsi + rdx*4 + 8]	movhps xmm13, [rsi + r11*4 + 8]	movhps xmm14, [rsi + r15*4 + 8]    movaps xmm2, xmm3    movaps xmm6, xmm7    movaps xmm10, xmm11    	shufps xmm2, xmm12, 136  ;# 10001000	shufps xmm6, xmm13, 136  ;# 10001000	shufps xmm10, xmm14, 136  ;# 10001000	shufps xmm3, xmm12, 221  ;# 11011101	shufps xmm7, xmm13, 221  ;# 11011101	shufps xmm11, xmm14, 221  ;# 11011101    ;# table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11        movaps xmm12, [rsp + nb333_epsH1]    movaps xmm13, [rsp + nb333_epsH2]    movaps xmm14, [rsp + nb333_epsM]        mulps  xmm3, xmm12   ;# Heps    mulps  xmm7, xmm13    mulps  xmm11, xmm14     mulps  xmm2, xmm12   ;# Geps    mulps  xmm6, xmm13    mulps  xmm10, xmm14     mulps  xmm3, xmm12   ;# Heps2    mulps  xmm7, xmm13    mulps  xmm11, xmm14     addps  xmm1, xmm2   ;# F+Geps    addps  xmm5, xmm6    addps  xmm9, xmm10     addps  xmm1, xmm3   ;# F+Geps+Heps2 = Fp    addps  xmm5, xmm7    addps  xmm9, xmm11     addps  xmm3, xmm3    ;# 2*Heps2    addps  xmm7, xmm7    addps  xmm11, xmm11    addps  xmm3, xmm2    ;# 2*Heps2+Geps    addps  xmm7, xmm6      addps  xmm11, xmm10    addps  xmm3, xmm1   ;# FF = Fp + 2*Heps2 + Geps    addps  xmm7, xmm5    addps  xmm11, xmm9    mulps  xmm1, xmm12   ;# eps*Fp    mulps  xmm5, xmm13    mulps  xmm9, xmm14    movaps xmm12, [rsp + nb333_qqH]    movaps xmm13, [rsp + nb333_qqM]    addps  xmm1, xmm0     ;# VV    addps  xmm5, xmm4    addps  xmm9, xmm8    mulps  xmm1, xmm12   ;# VV*qq = vcoul    mulps  xmm5, xmm12    mulps  xmm9, xmm13    mulps  xmm3, xmm12    ;# FF*qq = fij    mulps  xmm7, xmm12    mulps  xmm11, xmm13        ;# accumulate vctot    addps  xmm1, [rsp + nb333_vctot]    addps  xmm5, xmm9    addps  xmm1, xmm5    movaps [rsp + nb333_vctot], xmm1        movaps xmm10, [rsp + nb333_tsc]    mulps  xmm3, xmm10  ;# fscal    mulps  xmm7, xmm10    mulps  xmm10, xmm11        movd eax, mm0    movd ebx, mm1    movd ecx, mm2    movd edx, mm3	;# move j forces to local temp variables     mov rdi, [rbp + nb333_faction]    movlps xmm11, [rdi + rax*4] ;# jxa jya  -   -    movlps xmm12, [rdi + rcx*4] ;# jxc jyc  -   -    movhps xmm11, [rdi + rbx*4] ;# jxa jya jxb jyb     movhps xmm12, [rdi + rdx*4] ;# jxc jyc jxd jyd     movss  xmm13, [rdi + rax*4 + 8] ;# jza  -  -  -    movss  xmm14, [rdi + rcx*4 + 8] ;# jzc  -  -  -    movss  xmm2,  [rdi + rbx*4 + 8] ;# jzb    movss  xmm5,  [rdi + rdx*4 + 8] ;# jzd    movlhps xmm13, xmm2 ;# jza  -  jzb  -    movlhps xmm14, xmm5 ;# jzc  -  jzd -        shufps xmm13, xmm14,  136  ;# 10001000 => jza jzb jzc jzd    ;# xmm11: jxa jya jxb jyb     ;# xmm12: jxc jyc jxd jyd    ;# xmm13: jza jzb jzc jzd    xorps  xmm0, xmm0    xorps  xmm4, xmm4    xorps  xmm8, xmm8    mulps  xmm3, [rsp + nb333_rinvH1]    mulps  xmm7, [rsp + nb333_rinvH2]    mulps  xmm10, [rsp + nb333_rinvM]        subps  xmm0, xmm3    subps  xmm4, xmm7    subps  xmm8, xmm10        movaps xmm1, xmm0    movaps xmm2, xmm0    movaps xmm3, xmm4    movaps xmm5, xmm4    movaps xmm6, xmm8    movaps xmm7, xmm8	mulps xmm0, [rsp + nb333_dxH1]	mulps xmm1, [rsp + nb333_dyH1]	mulps xmm2, [rsp + nb333_dzH1]	mulps xmm3, [rsp + nb333_dxH2]	mulps xmm4, [rsp + nb333_dyH2]	mulps xmm5, [rsp + nb333_dzH2]	mulps xmm6, [rsp + nb333_dxM]	mulps xmm7, [rsp + nb333_dyM]	mulps xmm8, [rsp + nb333_dzM]    ;# fetch forces from O interaction    movaps xmm14, [rsp + nb333_fjx]    movaps xmm15, [rsp + nb333_fjy]    addps  xmm13, [rsp + nb333_fjz]    addps xmm14, xmm0

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?