nb_kernel332_x86_64_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,234 行 · 第 1/5 页

S
2,234
字号
        movss  28(%rsi,%rbx,4),%xmm7    ## dispersion table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb332_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV         xorps  %xmm4,%xmm4    movss  nb332_c6(%rsp),%xmm4    mulps  %xmm4,%xmm7   ## fijD     mulps  %xmm4,%xmm5   ## Vvdw6     addps  nb332_fstmp(%rsp),%xmm7   ## add to fscal     ## put scalar force on stack Update Vvdwtot directly     addps  nb332_Vvdwtot(%rsp),%xmm5    movaps %xmm7,nb332_fstmp(%rsp)    movaps %xmm5,nb332_Vvdwtot(%rsp)    ## repulsion         movss  32(%rsi,%rbx,4),%xmm4        movss  36(%rsi,%rbx,4),%xmm5        movss  40(%rsi,%rbx,4),%xmm6        movss  44(%rsi,%rbx,4),%xmm7    ## table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb332_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV         xorps  %xmm4,%xmm4    movss  nb332_c12(%rsp),%xmm4    mulps  %xmm4,%xmm7 ## fijR     mulps  %xmm4,%xmm5 ## Vvdw12     addps  nb332_fstmp(%rsp),%xmm7    addps  nb332_Vvdwtot(%rsp),%xmm5    movaps %xmm5,nb332_Vvdwtot(%rsp)    xorps  %xmm1,%xmm1    mulps nb332_tsc(%rsp),%xmm7    mulps %xmm0,%xmm7    subps  %xmm7,%xmm1        movaps %xmm1,%xmm0        movaps %xmm1,%xmm2        mulps   nb332_dxOO(%rsp),%xmm0        mulps   nb332_dyOO(%rsp),%xmm1        mulps   nb332_dzOO(%rsp),%xmm2        ## initial update for j forces         xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb332_fjxO(%rsp)        movaps  %xmm4,nb332_fjyO(%rsp)        movaps  %xmm5,nb332_fjzO(%rsp)        addps   nb332_fixO(%rsp),%xmm0        addps   nb332_fiyO(%rsp),%xmm1        addps   nb332_fizO(%rsp),%xmm2        movaps  %xmm0,nb332_fixO(%rsp)        movaps  %xmm1,nb332_fiyO(%rsp)        movaps  %xmm2,nb332_fizO(%rsp)        ## done with i O Now do i H1 & H2 simultaneously first get i particle coords:     movaps  nb332_jxO(%rsp),%xmm0    movaps  nb332_jyO(%rsp),%xmm1    movaps  nb332_jzO(%rsp),%xmm2    movaps  %xmm0,%xmm3    movaps  %xmm1,%xmm4    movaps  %xmm2,%xmm5        subps  nb332_ixH1(%rsp),%xmm0        subps  nb332_iyH1(%rsp),%xmm1        subps  nb332_izH1(%rsp),%xmm2        subps  nb332_ixH2(%rsp),%xmm3        subps  nb332_iyH2(%rsp),%xmm4        subps  nb332_izH2(%rsp),%xmm5    movaps %xmm0,nb332_dxH1O(%rsp)        movaps %xmm1,nb332_dyH1O(%rsp)        movaps %xmm2,nb332_dzH1O(%rsp)        movaps %xmm3,nb332_dxH2O(%rsp)        movaps %xmm4,nb332_dyH2O(%rsp)        movaps %xmm5,nb332_dzH2O(%rsp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm1,%xmm0        addps %xmm3,%xmm4        addps %xmm2,%xmm0       ## have rsqH1 in xmm0         addps %xmm5,%xmm4       ## have rsqH2 in xmm4         ## start with H1, save H2 data         movaps %xmm4,nb332_rsqH2O(%rsp)        ## do invsqrt         rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb332_three(%rsp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb332_half(%rsp),%xmm3   ## rinv H1 - j water         mulps   nb332_half(%rsp),%xmm7   ## rinv H2 - j water          ## start with H1, save H2 data         movaps %xmm7,nb332_rinvH2O(%rsp)        movaps %xmm3,%xmm1        mulps  %xmm0,%xmm1      ## xmm1=r         movaps %xmm3,%xmm0      ## xmm0=rinv         mulps  nb332_tsc(%rsp),%xmm1        movhlps %xmm1,%xmm2    cvttps2pi %xmm1,%mm6    cvttps2pi %xmm2,%mm7    ## mm6/mm7 contain lu indices     cvtpi2ps %mm6,%xmm3    cvtpi2ps %mm7,%xmm2        movlhps  %xmm2,%xmm3        subps    %xmm3,%xmm1    ## xmm1=eps     movaps %xmm1,%xmm2    mulps  %xmm2,%xmm2      ## xmm2=eps2     pslld $2,%mm6    pslld $2,%mm7    movd %mm6,%ebx    movd %mm7,%ecx    psrlq $32,%mm7    movd %mm7,%edx              ## table indices in ebx,ecx,edx     lea  (%rbx,%rbx,2),%rbx    lea  (%rcx,%rcx,2),%rcx    lea  (%rdx,%rdx,2),%rdx    movlps (%rsi,%rbx,4),%xmm5    movlps (%rsi,%rcx,4),%xmm7    movhps (%rsi,%rdx,4),%xmm7 ## got half coulomb table     movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## 10001000    shufps $221,%xmm7,%xmm5 ## 11011101    movlps 8(%rsi,%rbx,4),%xmm7    movlps 8(%rsi,%rcx,4),%xmm3    movhps 8(%rsi,%rdx,4),%xmm3    ## other half of coulomb table      movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## 10001000    shufps $221,%xmm3,%xmm7 ## 11011101    ## coulomb table ready, in xmm4-xmm7      mulps  %xmm1,%xmm6      ## xmm6=Geps     mulps  %xmm2,%xmm7      ## xmm7=Heps2     addps  %xmm6,%xmm5    addps  %xmm7,%xmm5      ## xmm5=Fp     mulps  nb332_two(%rsp),%xmm7         ## two*Heps2         xorps  %xmm3,%xmm3        ## fetch charges to xmm3 (temporary)         movss   nb332_qqOH(%rsp),%xmm3        movhps  nb332_qqHH(%rsp),%xmm3    addps  %xmm6,%xmm7    addps  %xmm5,%xmm7 ## xmm7=FF     mulps  %xmm1,%xmm5 ## xmm5=eps*Fp     addps  %xmm4,%xmm5 ## xmm5=VV     mulps  %xmm3,%xmm5 ## vcoul=qq*VV      mulps  %xmm7,%xmm3 ## fijC=FF*qq     ## at this point xmm5 contains vcoul and xmm3 fijC     addps  nb332_vctot(%rsp),%xmm5    movaps %xmm5,nb332_vctot(%rsp)    xorps  %xmm1,%xmm1    mulps nb332_tsc(%rsp),%xmm3    mulps %xmm0,%xmm3    subps  %xmm3,%xmm1        movaps  %xmm1,%xmm0        movaps  %xmm1,%xmm2        mulps   nb332_dxH1O(%rsp),%xmm0        mulps   nb332_dyH1O(%rsp),%xmm1        mulps   nb332_dzH1O(%rsp),%xmm2        ## update forces H1 - j water         movaps  nb332_fjxO(%rsp),%xmm3        movaps  nb332_fjyO(%rsp),%xmm4        movaps  nb332_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb332_fjxO(%rsp)        movaps  %xmm4,nb332_fjyO(%rsp)        movaps  %xmm5,nb332_fjzO(%rsp)        addps   nb332_fixH1(%rsp),%xmm0        addps   nb332_fiyH1(%rsp),%xmm1        addps   nb332_fizH1(%rsp),%xmm2        movaps  %xmm0,nb332_fixH1(%rsp)        movaps  %xmm1,nb332_fiyH1(%rsp)        movaps  %xmm2,nb332_fizH1(%rsp)        ## do table for H2 - j water interaction         movaps nb332_rinvH2O(%rsp),%xmm0        movaps nb332_rsqH2O(%rsp),%xmm1        mulps  %xmm0,%xmm1      ## xmm0=rinv, xmm1=r         mulps  nb332_tsc(%rsp),%xmm1        movhlps %xmm1,%xmm2    cvttps2pi %xmm1,%mm6    cvttps2pi %xmm2,%mm7    ## mm6/mm7 contain lu indices     cvtpi2ps %mm6,%xmm3    cvtpi2ps %mm7,%xmm2        movlhps  %xmm2,%xmm3        subps    %xmm3,%xmm1    ## xmm1=eps     movaps %xmm1,%xmm2    mulps  %xmm2,%xmm2      ## xmm2=eps2     pslld $2,%mm6    pslld $2,%mm7    movd %mm6,%ebx    movd %mm7,%ecx    psrlq $32,%mm7    movd %mm7,%edx              ## table indices in ebx,ecx,edx     lea  (%rbx,%rbx,2),%rbx    lea  (%rcx,%rcx,2),%rcx    lea  (%rdx,%rdx,2),%rdx    movlps (%rsi,%rbx,4),%xmm5    movlps (%rsi,%rcx,4),%xmm7    movhps (%rsi,%rdx,4),%xmm7 ## got half coulomb table     movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## 10001000    shufps $221,%xmm7,%xmm5 ## 11011101    movlps 8(%rsi,%rbx,4),%xmm7    movlps 8(%rsi,%rcx,4),%xmm3    movhps 8(%rsi,%rdx,4),%xmm3    ## other half of coulomb table      movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## 10001000    shufps $221,%xmm3,%xmm7 ## 11011101    ## coulomb table ready, in xmm4-xmm7      mulps  %xmm1,%xmm6      ## xmm6=Geps     mulps  %xmm2,%xmm7      ## xmm7=Heps2     addps  %xmm6,%xmm5    addps  %xmm7,%xmm5      ## xmm5=Fp     mulps  nb332_two(%rsp),%xmm7         ## two*Heps2         xorps  %xmm3,%xmm3        ## fetch charges to xmm3 (temporary)         movss   nb332_qqOH(%rsp),%xmm3        movhps  nb332_qqHH(%rsp),%xmm3    addps  %xmm6,%xmm7    addps  %xmm5,%xmm7 ## xmm7=FF     mulps  %xmm1,%xmm5 ## xmm5=eps*Fp     addps  %xmm4,%xmm5 ## xmm5=VV     mulps  %xmm3,%xmm5 ## vcoul=qq*VV      mulps  %xmm7,%xmm3 ## fijC=FF*qq     ## at this point xmm5 contains vcoul and xmm3 fijC     addps  nb332_vctot(%rsp),%xmm5    movaps %xmm5,nb332_vctot(%rsp)    xorps  %xmm1,%xmm1    mulps nb332_tsc(%rsp),%xmm3    mulps %xmm0,%xmm3    subps  %xmm3,%xmm1        movaps  %xmm1,%xmm0        movaps  %xmm1,%xmm2        mulps   nb332_dxH2O(%rsp),%xmm0        mulps   nb332_dyH2O(%rsp),%xmm1        mulps   nb332_dzH2O(%rsp),%xmm2        movaps  nb332_fjxO(%rsp),%xmm3        movaps  nb332_fjyO(%rsp),%xmm4        movaps  nb332_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movq    nb332_faction(%rbp),%rsi        movaps  %xmm3,nb332_fjxO(%rsp)        movaps  %xmm4,nb332_fjyO(%rsp)        movaps  %xmm5,nb332_fjzO(%rsp)        addps   nb332_fixH2(%rsp),%xmm0        addps   nb332_fiyH2(%rsp),%xmm1        addps   nb332_fizH2(%rsp),%xmm2        movaps  %xmm0,nb332_fixH2(%rsp)        movaps  %xmm1,nb332_fiyH2(%rsp)        movaps  %xmm2,nb332_fizH2(%rsp)        ## update j water forces from local variables         movlps  (%rsi,%rax,4),%xmm0        movlps  12(%rsi,%rax,4),%xmm1        movhps  24(%rsi,%rax,4),%xmm1        movaps  nb332_fjxO(%rsp),%xmm3        movaps  nb332_fjyO(%rsp),%xmm4        movaps  nb332_fjzO(%rsp),%xmm5        movaps  %xmm5,%xmm6        movaps  %xmm5,%xmm7        shufps $2,%xmm6,%xmm6 ## 00000010        shufps $3,%xmm7,%xmm7 ## 00000011        addss   8(%rsi,%rax,4),%xmm5        addss   20(%rsi,%rax,4),%xmm6        addss   32(%rsi,%rax,4),%xmm7        movss   %xmm5,8(%rsi,%rax,4)        movss   %xmm6,20(%rsi,%rax,4)        movss   %xmm7,32(%rsi,%rax,4)        movaps   %xmm3,%xmm5        unpcklps %xmm4,%xmm3        unpckhps %xmm4,%xmm5        addps    %xmm3,%xmm0        addps    %xmm5,%xmm1        movlps  %xmm0,(%rsi,%rax,4)        movlps  %xmm1,12(%rsi,%rax,4)        movhps  %xmm1,24(%rsi,%rax,4)        decl nb332_innerk(%rsp)        jz    _nb_kernel332_x86_64_sse.nb332_updateouterdata        jmp   _nb_kernel332_x86_64_sse.nb332_single_loop_nb_kernel332_x86_64_sse.nb332_updateouterdata:         movl  nb332_ii3(%rsp),%ecx        movq  nb332_faction(%rbp),%rdi        movq  nb332_fshift(%rbp),%rsi        movl  nb332_is3(%rsp),%edx        ## accumulate  Oi forces in xmm0, xmm1, xmm2         movaps nb332_fixO(%rsp),%xmm0        movaps nb332_fiyO(%rsp),%xmm1        movaps nb332_fizO(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  (%rdi,%rcx,4),%xmm3        movss  4(%rdi,%rcx,4),%xmm4        movss  8(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,(%rdi,%rcx,4)        movss  %xmm4,4(%rdi,%rcx,4)        movss  %xmm5,8(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         movaps %xmm0,%xmm6        movss %xmm2,%xmm7        movlhps %xmm1,%xmm6        shufps $8,%xmm6,%xmm6 ## 00001000               ## accumulate H1i forces in xmm0, xmm1, xmm2         movaps nb332_fixH1(%rsp),%xmm0        movaps nb332_fiyH1(%rsp),%xmm1        movaps nb332_fizH1(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  12(%rdi,%rcx,4),%xmm3        movss  16(%rdi,%rcx,4),%xmm4        movss  20(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,12(%rdi,%rcx,4)        movss  %xmm4,16(%rdi,%rcx,4)        movss  %xmm5,20(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## 00001000               addps   %xmm0,%xmm6        ## accumulate H2i forces in xmm0, xmm1, xmm2         movaps nb332_fixH2(%rsp),%xmm0        movaps nb332_fiyH2(%rsp),%xmm1        movaps nb332_fizH2(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 i xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0   

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?