nb_kernel334_ia32_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,029 行 · 第 1/5 页

S
2,029
字号
        movd %mm6,%eax        psrlq $32,%mm6        movd %mm7,%ecx        psrlq $32,%mm7        movd %mm6,%ebx        movd %mm7,%edx        leal  (%eax,%eax,2),%eax        leal  (%ebx,%ebx,2),%ebx        leal  (%ecx,%ecx,2),%ecx        leal  (%edx,%edx,2),%edx        movlps (%esi,%eax,4),%xmm5        movlps (%esi,%ecx,4),%xmm7        movhps (%esi,%ebx,4),%xmm5        movhps (%esi,%edx,4),%xmm7 ## got half coulomb table         movaps %xmm5,%xmm4        shufps $136,%xmm7,%xmm4 ## 10001000        shufps $221,%xmm7,%xmm5 ## 11011101        movlps 8(%esi,%eax,4),%xmm7        movlps 8(%esi,%ecx,4),%xmm3        movhps 8(%esi,%ebx,4),%xmm7        movhps 8(%esi,%edx,4),%xmm3    ## other half of coulomb table          movaps %xmm7,%xmm6        shufps $136,%xmm3,%xmm6 ## 10001000        shufps $221,%xmm3,%xmm7 ## 11011101        ## coulomb table ready, in xmm4-xmm7          mulps  %xmm1,%xmm6      ## xmm6=Geps         mulps  %xmm2,%xmm7      ## xmm7=Heps2         addps  %xmm6,%xmm5        addps  %xmm7,%xmm5      ## xmm5=Fp         mulps  nb334_two(%esp),%xmm7            ## two*Heps2         movaps nb334_qqMM(%esp),%xmm3        addps  %xmm6,%xmm7        addps  %xmm5,%xmm7 ## xmm7=FF         mulps  %xmm1,%xmm5 ## xmm5=eps*Fp         addps  %xmm4,%xmm5 ## xmm5=VV         mulps  %xmm3,%xmm5 ## vcoul=qq*VV          mulps  %xmm7,%xmm3 ## fijC=FF*qq         ## at this point mm5 contains vcoul and mm3 fijC         addps  nb334_vctot(%esp),%xmm5        movaps %xmm5,nb334_vctot(%esp)        xorps  %xmm1,%xmm1        mulps  nb334_tsc(%esp),%xmm3        mulps  %xmm0,%xmm3        subps  %xmm3,%xmm1        movaps %xmm1,%xmm0        movaps %xmm1,%xmm2        movaps nb334_fjxM(%esp),%xmm3        movaps nb334_fjyM(%esp),%xmm4        movaps nb334_fjzM(%esp),%xmm5        mulps nb334_dxMM(%esp),%xmm0        mulps nb334_dyMM(%esp),%xmm1        mulps nb334_dzMM(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb334_fixM(%esp),%xmm0        addps nb334_fiyM(%esp),%xmm1        addps nb334_fizM(%esp),%xmm2        movaps %xmm3,nb334_fjxM(%esp)        movaps %xmm4,nb334_fjyM(%esp)        movaps %xmm5,nb334_fjzM(%esp)        movaps %xmm0,nb334_fixM(%esp)        movaps %xmm1,nb334_fiyM(%esp)        movaps %xmm2,nb334_fizM(%esp)        movl nb334_faction(%ebp),%edi        movd %mm0,%eax        movd %mm1,%ebx        movd %mm2,%ecx        movd %mm3,%edx        ## Did all interactions - now update j forces         ## 4 j waters with four atoms each.        ## step 1 : transpose fjxO, fjyO, fjzO, fjxH1        movaps nb334_fjxO(%esp),%xmm0        movaps nb334_fjyO(%esp),%xmm1        movaps nb334_fjzO(%esp),%xmm2        movaps nb334_fjxH1(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   (%edi,%eax,4),%xmm1        movlps   (%edi,%ebx,4),%xmm5        movlps   (%edi,%ecx,4),%xmm6        movlps   (%edi,%edx,4),%xmm7        movhps   8(%edi,%eax,4),%xmm1        movhps   8(%edi,%ebx,4),%xmm5        movhps   8(%edi,%ecx,4),%xmm6        movhps   8(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,(%edi,%eax,4)        movlps   %xmm5,(%edi,%ebx,4)        movlps   %xmm6,(%edi,%ecx,4)        movlps   %xmm7,(%edi,%edx,4)        movhps   %xmm1,8(%edi,%eax,4)        movhps   %xmm5,8(%edi,%ebx,4)        movhps   %xmm6,8(%edi,%ecx,4)        movhps   %xmm7,8(%edi,%edx,4)        ## step 2 : transpose fjyH1, fjzH1, fjxH2, fjyH2        movaps nb334_fjyH1(%esp),%xmm0        movaps nb334_fjzH1(%esp),%xmm1        movaps nb334_fjxH2(%esp),%xmm2        movaps nb334_fjyH2(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   16(%edi,%eax,4),%xmm1        movlps   16(%edi,%ebx,4),%xmm5        movlps   16(%edi,%ecx,4),%xmm6        movlps   16(%edi,%edx,4),%xmm7        movhps   24(%edi,%eax,4),%xmm1        movhps   24(%edi,%ebx,4),%xmm5        movhps   24(%edi,%ecx,4),%xmm6        movhps   24(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,16(%edi,%eax,4)        movlps   %xmm5,16(%edi,%ebx,4)        movlps   %xmm6,16(%edi,%ecx,4)        movlps   %xmm7,16(%edi,%edx,4)        movhps   %xmm1,24(%edi,%eax,4)        movhps   %xmm5,24(%edi,%ebx,4)        movhps   %xmm6,24(%edi,%ecx,4)        movhps   %xmm7,24(%edi,%edx,4)        ## step 3 : transpose fjzH2, fjxM, fjyM, fjzM        movaps nb334_fjzH2(%esp),%xmm0        movaps nb334_fjxM(%esp),%xmm1        movaps nb334_fjyM(%esp),%xmm2        movaps nb334_fjzM(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   32(%edi,%eax,4),%xmm1        movlps   32(%edi,%ebx,4),%xmm5        movlps   32(%edi,%ecx,4),%xmm6        movlps   32(%edi,%edx,4),%xmm7        movhps   40(%edi,%eax,4),%xmm1        movhps   40(%edi,%ebx,4),%xmm5        movhps   40(%edi,%ecx,4),%xmm6        movhps   40(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,32(%edi,%eax,4)        movlps   %xmm5,32(%edi,%ebx,4)        movlps   %xmm6,32(%edi,%ecx,4)        movlps   %xmm7,32(%edi,%edx,4)        movhps   %xmm1,40(%edi,%eax,4)        movhps   %xmm5,40(%edi,%ebx,4)        movhps   %xmm6,40(%edi,%ecx,4)        movhps   %xmm7,40(%edi,%edx,4)        ## should we do one more iteration?         subl $4,nb334_innerk(%esp)        jl    _nb_kernel334_ia32_sse.nb334_single_check        jmp   _nb_kernel334_ia32_sse.nb334_unroll_loop_nb_kernel334_ia32_sse.nb334_single_check:         addl $4,nb334_innerk(%esp)        jnz   _nb_kernel334_ia32_sse.nb334_single_loop        jmp   _nb_kernel334_ia32_sse.nb334_updateouterdata_nb_kernel334_ia32_sse.nb334_single_loop:         movl  nb334_innerjjnr(%esp),%edx        ## pointer to jjnr[k]         movl  (%edx),%eax        addl $4,nb334_innerjjnr(%esp)        movl nb334_pos(%ebp),%esi        leal  (%eax,%eax,2),%eax        ## fetch j coordinates        movlps (%esi,%eax,4),%xmm3              ##  Ox  Oy          movlps 16(%esi,%eax,4),%xmm4            ## H1y H1z         movlps 32(%esi,%eax,4),%xmm5            ## H2z  Mx         movhps 8(%esi,%eax,4),%xmm3             ##  Ox  Oy  Oz H1x        movhps 24(%esi,%eax,4),%xmm4            ## H1y H1z H2x H2y        movhps 40(%esi,%eax,4),%xmm5            ## H2z  Mx  My  Mz        ## transpose        movaps %xmm4,%xmm0        movaps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm3,%xmm6        shufps $18,%xmm5,%xmm4 ## (00010010)  h2x - Mx  -         shufps $193,%xmm0,%xmm3 ## (11000001)  Oy  - H1y -         shufps $35,%xmm5,%xmm2 ## (00100011) H2y - My  -         shufps $18,%xmm0,%xmm1 ## (00010010)  Oz  - H1z -         ##  xmm6: Ox - - H1x   xmm5: H2z - - Mz         shufps $140,%xmm4,%xmm6 ## (10001100) Ox H1x H2x Mx         shufps $136,%xmm2,%xmm3 ## (10001000) Oy H1y H2y My         shufps $200,%xmm5,%xmm1 ## (11001000) Oz H1z H2z Mz        ## store all j coordinates in jO          movaps %xmm6,nb334_jxO(%esp)        movaps %xmm3,nb334_jyO(%esp)        movaps %xmm1,nb334_jzO(%esp)        ## do O and H1 in parallel        movaps nb334_ixO(%esp),%xmm0        movaps nb334_iyO(%esp),%xmm1        movaps nb334_izO(%esp),%xmm2        movaps nb334_ixH1(%esp),%xmm3        movaps nb334_iyH1(%esp),%xmm4        movaps nb334_izH1(%esp),%xmm5        subps  nb334_jxO(%esp),%xmm0        subps  nb334_jyO(%esp),%xmm1        subps  nb334_jzO(%esp),%xmm2        subps  nb334_jxO(%esp),%xmm3        subps  nb334_jyO(%esp),%xmm4        subps  nb334_jzO(%esp),%xmm5        movaps %xmm0,nb334_dxOO(%esp)        movaps %xmm1,nb334_dyOO(%esp)        movaps %xmm2,nb334_dzOO(%esp)        movaps %xmm3,nb334_dxH1H1(%esp)        movaps %xmm4,nb334_dyH1H1(%esp)        movaps %xmm5,nb334_dzH1H1(%esp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        addps %xmm1,%xmm0        addps %xmm2,%xmm0       ## have rsq in xmm0         mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm3,%xmm4        addps %xmm5,%xmm4       ## have rsq in xmm4        movaps %xmm0,nb334_rsqOO(%esp)        movaps %xmm4,nb334_rsqH1H1(%esp)        ## do 1/sqrt(x) for O and  H1        rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb334_three(%esp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb334_half(%esp),%xmm3   ## rinv O - j water         mulps   nb334_half(%esp),%xmm7   ## rinv H1 - j water          movaps %xmm3,nb334_rinvOO(%esp)        movaps %xmm7,nb334_rinvH1H1(%esp)        movl nb334_VFtab(%ebp),%esi        ## do O table LJ interaction        movaps %xmm3,%xmm0        movaps %xmm0,%xmm1        mulss  nb334_rsqOO(%esp),%xmm1   ## xmm1=r         mulss  nb334_tsc(%esp),%xmm1        cvttps2pi %xmm1,%mm6        cvtpi2ps %mm6,%xmm3        subss    %xmm3,%xmm1    ## xmm1=eps         movaps %xmm1,%xmm2        mulss  %xmm2,%xmm2      ## xmm2=eps2         pslld   $2,%mm6        movd %mm6,%ebx        leal  (%ebx,%ebx,2),%ebx        ## load dispersion table data into xmm4        movlps 16(%esi,%ebx,4),%xmm4        movlps 24(%esi,%ebx,4),%xmm6        movaps %xmm4,%xmm5        movaps %xmm6,%xmm7        shufps $0x1,%xmm5,%xmm5        shufps $0x1,%xmm7,%xmm7        ## dispersion table YFGH ready in xmm4-xmm7        mulss  %xmm1,%xmm6      ## xmm6=Geps         mulss  %xmm2,%xmm7      ## xmm7=Heps2         addss  %xmm6,%xmm5        addss  %xmm7,%xmm5      ## xmm5=Fp         mulss  nb334_two(%esp),%xmm7            ## two*Heps2         addss  %xmm6,%xmm7        addss  %xmm5,%xmm7 ## xmm7=FF         mulss  %xmm1,%xmm5 ## xmm5=eps*Fp         addss  %xmm4,%xmm5 ## xmm5=VV         movaps nb334_c6(%esp),%xmm4        mulss  %xmm4,%xmm7      ## fijD         mulss  %xmm4,%xmm5      ## Vvdw6         ## save scalar force in xmm3. Update Vvdwtot directly         addss  nb334_Vvdwtot(%esp),%xmm5        movaps %xmm7,%xmm3 ## fscal         movss %xmm5,nb334_Vvdwtot(%esp)        ## load repulsion table data into xmm4        movlps 32(%esi,%ebx,4),%xmm4        movlps 40(%esi,%ebx,4),%xmm6        movaps %xmm4,%xmm5        movaps %xmm6,%xmm7        shufps $0x1,%xmm5,%xmm5        shufps $0x1,%xmm7,%xmm7        ## repulsion table YFGH ready in xmm4-xmm7        mulss  %xmm1,%xmm6      ## xmm6=Geps         mulss  %xmm2,%xmm7      ## xmm7=Heps2         addss  %xmm6,%xmm5        addss  %xmm7,%xmm5      ## xmm5=Fp         mulss  nb334_two(%esp),%xmm7            ## two*Heps2         addss  %xmm6,%xmm7        addss  %xmm5,%xmm7 ## xmm7=FF         mulss  %xmm1,%xmm5 ## xmm5=eps*Fp         addss  %xmm4,%xmm5 ## xmm5=VV         movaps nb334_c12(%esp),%xmm4        mulss  %xmm4,%xmm7 ## fijR         mulss  %xmm4,%xmm5 ## Vvdw12         addss  %xmm3,%xmm7        addss  nb334_Vvdwtot(%esp),%xmm5        movss %xmm5,nb334_Vvdwtot(%esp)        xorps  %xmm1,%xmm1        mulss nb334_tsc(%esp),%xmm7        mulss %xmm0,%xmm7        subss  %xmm7,%xmm1        movaps %xmm1,%xmm0        movaps %xmm1,%xmm2        mulss  nb334_dxOO(%esp),%xmm0        mulss  nb334_dyOO(%esp),%xmm1        mulss  nb334_dzOO(%esp),%xmm2        xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        subss   %xmm0,%xmm3        subss   %xmm1,%xmm4        subss   %xmm2,%xmm5        movaps  %xmm3,nb334_fjxO(%esp)        movaps  %xmm4,nb334_fjyO(%esp)        movaps  %xmm5,nb334_fjzO(%esp)        addss   nb334_fixO(%esp),%xmm0        addss   nb334_fiyO(%esp),%xmm1        addss   nb334_fizO(%esp),%xmm2        movss  %xmm0,nb334_fixO(%esp)        mov

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?