nb_kernel214_ia32_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 1,984 行 · 第 1/5 页

S
1,984
字号
        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   16(%edi,%eax,4),%xmm1        movlps   16(%edi,%ebx,4),%xmm5        movlps   16(%edi,%ecx,4),%xmm6        movlps   16(%edi,%edx,4),%xmm7        movhps   24(%edi,%eax,4),%xmm1        movhps   24(%edi,%ebx,4),%xmm5        movhps   24(%edi,%ecx,4),%xmm6        movhps   24(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,16(%edi,%eax,4)        movlps   %xmm5,16(%edi,%ebx,4)        movlps   %xmm6,16(%edi,%ecx,4)        movlps   %xmm7,16(%edi,%edx,4)        movhps   %xmm1,24(%edi,%eax,4)        movhps   %xmm5,24(%edi,%ebx,4)        movhps   %xmm6,24(%edi,%ecx,4)        movhps   %xmm7,24(%edi,%edx,4)        ## step 3 : transpose fjzH2, fjxM, fjyM, fjzM. xmm4 is scratch        movaps nb214_fjzH2(%esp),%xmm0        movaps nb214_fjxM(%esp),%xmm1        movaps nb214_fjyM(%esp),%xmm2        movaps nb214_fjzM(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm0, xmm1, xmm2, xmm3        ## load the corresponding j forces from memory        movlps   32(%edi,%eax,4),%xmm1        movlps   32(%edi,%ebx,4),%xmm5        movlps   32(%edi,%ecx,4),%xmm6        movlps   32(%edi,%edx,4),%xmm7        movhps   40(%edi,%eax,4),%xmm1        movhps   40(%edi,%ebx,4),%xmm5        movhps   40(%edi,%ecx,4),%xmm6        movhps   40(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,32(%edi,%eax,4)        movlps   %xmm5,32(%edi,%ebx,4)        movlps   %xmm6,32(%edi,%ecx,4)        movlps   %xmm7,32(%edi,%edx,4)        movhps   %xmm1,40(%edi,%eax,4)        movhps   %xmm5,40(%edi,%ebx,4)        movhps   %xmm6,40(%edi,%ecx,4)        movhps   %xmm7,40(%edi,%edx,4)        ## should we do one more iteration?         subl $4,nb214_innerk(%esp)        jl    _nb_kernel214_ia32_sse.nb214_single_check        jmp   _nb_kernel214_ia32_sse.nb214_unroll_loop_nb_kernel214_ia32_sse.nb214_single_check:         addl $4,nb214_innerk(%esp)        jnz   _nb_kernel214_ia32_sse.nb214_single_loop        jmp   _nb_kernel214_ia32_sse.nb214_updateouterdata_nb_kernel214_ia32_sse.nb214_single_loop:         movl  nb214_innerjjnr(%esp),%edx        ## pointer to jjnr[k]         movl  (%edx),%eax        addl $4,nb214_innerjjnr(%esp)        movl nb214_pos(%ebp),%esi        leal  (%eax,%eax,2),%eax        ## fetch j coordinates        movlps (%esi,%eax,4),%xmm3              ##  Ox  Oy          movlps 16(%esi,%eax,4),%xmm4            ## H1y H1z         movlps 32(%esi,%eax,4),%xmm5            ## H2z  Mx         movhps 8(%esi,%eax,4),%xmm3             ##  Ox  Oy  Oz H1x        movhps 24(%esi,%eax,4),%xmm4            ## H1y H1z H2x H2y        movhps 40(%esi,%eax,4),%xmm5            ## H2z  Mx  My  Mz        ## transpose        movaps %xmm4,%xmm0        movaps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm3,%xmm6        shufps $18,%xmm5,%xmm4 ## (00010010)  h2x - Mx  -         shufps $193,%xmm0,%xmm3 ## (11000001)  Oy  - H1y -         shufps $35,%xmm5,%xmm2 ## (00100011) H2y - My  -         shufps $18,%xmm0,%xmm1 ## (00010010)  Oz  - H1z -         ##  xmm6: Ox - - H1x   xmm5: H2z - - Mz         shufps $140,%xmm4,%xmm6 ## (10001100) Ox H1x H2x Mx         shufps $136,%xmm2,%xmm3 ## (10001000) Oy H1y H2y My         shufps $200,%xmm5,%xmm1 ## (11001000) Oz H1z H2z Mz        ## store all j coordinates in jO          movaps %xmm6,nb214_jxO(%esp)        movaps %xmm3,nb214_jyO(%esp)        movaps %xmm1,nb214_jzO(%esp)        ## do O and M in parallel        movaps nb214_ixO(%esp),%xmm0        movaps nb214_iyO(%esp),%xmm1        movaps nb214_izO(%esp),%xmm2        movaps nb214_ixM(%esp),%xmm3        movaps nb214_iyM(%esp),%xmm4        movaps nb214_izM(%esp),%xmm5        subps  nb214_jxO(%esp),%xmm0        subps  nb214_jyO(%esp),%xmm1        subps  nb214_jzO(%esp),%xmm2        subps  nb214_jxO(%esp),%xmm3        subps  nb214_jyO(%esp),%xmm4        subps  nb214_jzO(%esp),%xmm5        movaps %xmm0,nb214_dxOO(%esp)        movaps %xmm1,nb214_dyOO(%esp)        movaps %xmm2,nb214_dzOO(%esp)        movaps %xmm3,nb214_dxMM(%esp)        movaps %xmm4,nb214_dyMM(%esp)        movaps %xmm5,nb214_dzMM(%esp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        addps %xmm1,%xmm0        addps %xmm2,%xmm0       ## have rsq in xmm0         mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm3,%xmm4        addps %xmm5,%xmm4       ## have rsq in xmm4        ## Save M data         movaps %xmm4,nb214_rsqMM(%esp)        ## do 1/x for O and 1/sqrt(x) for M        rcpss  %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movss  nb214_two(%esp),%xmm2        movaps  %xmm5,%xmm6        mulss  %xmm1,%xmm0        mulps   %xmm5,%xmm5        subss  %xmm0,%xmm2        movaps  nb214_three(%esp),%xmm7        mulss  %xmm1,%xmm2      ## constant 1/r2        mulps   %xmm4,%xmm5        movss  %xmm2,%xmm0        subps   %xmm5,%xmm7        mulss  %xmm2,%xmm2        mulps   %xmm6,%xmm7        mulss  %xmm0,%xmm2      ## constant 1/r6        mulps   nb214_half(%esp),%xmm7   ## rinv iH1 - j water         movss  %xmm2,%xmm1        movaps %xmm7,nb214_rinvMM(%esp)        mulss  %xmm2,%xmm2      ## constant 1/r12        mulss  nb214_c6(%esp),%xmm1        mulss  nb214_c12(%esp),%xmm2        movss  %xmm2,%xmm3        subss  %xmm1,%xmm3        addss  nb214_Vvdwtot(%esp),%xmm3        movss  %xmm3,nb214_Vvdwtot(%esp)        mulss  nb214_six(%esp),%xmm1        mulss  nb214_twelve(%esp),%xmm2        subss  %xmm1,%xmm2        mulss  %xmm2,%xmm0      ## fscal        movss  %xmm0,%xmm1        movss  %xmm0,%xmm2        mulss  nb214_dxOO(%esp),%xmm0        mulss  nb214_dyOO(%esp),%xmm1        mulss  nb214_dzOO(%esp),%xmm2        xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        subss   %xmm0,%xmm3        subss   %xmm1,%xmm4        subss   %xmm2,%xmm5        movaps  %xmm3,nb214_fjxO(%esp)        movaps  %xmm4,nb214_fjyO(%esp)        movaps  %xmm5,nb214_fjzO(%esp)        addss   nb214_fixO(%esp),%xmm0        addss   nb214_fiyO(%esp),%xmm1        addss   nb214_fizO(%esp),%xmm2        movss  %xmm0,nb214_fixO(%esp)        movss  %xmm1,nb214_fiyO(%esp)        movss  %xmm2,nb214_fizO(%esp)        ## do  M coulomb interaction        movaps nb214_rinvMM(%esp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb214_krf(%esp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb214_qqMH(%esp),%xmm3        movhps  nb214_qqMM(%esp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb214_rsqMM(%esp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb214_crf(%esp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb214_two(%esp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb214_vctot(%esp),%xmm6        movaps %xmm6,nb214_vctot(%esp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb214_dxMM(%esp),%xmm0        mulps   nb214_dyMM(%esp),%xmm1        mulps   nb214_dzMM(%esp),%xmm2        ## update forces M - j water         movaps  nb214_fjxO(%esp),%xmm3        movaps  nb214_fjyO(%esp),%xmm4        movaps  nb214_fjzO(%esp),%xmm5        subps   %xmm0,%xmm3        subps   %xmm1,%xmm4        subps   %xmm2,%xmm5        movaps  %xmm3,nb214_fjxO(%esp)        movaps  %xmm4,nb214_fjyO(%esp)        movaps  %xmm5,nb214_fjzO(%esp)        addps   nb214_fixM(%esp),%xmm0        addps   nb214_fiyM(%esp),%xmm1        addps   nb214_fizM(%esp),%xmm2        movaps  %xmm0,nb214_fixM(%esp)        movaps  %xmm1,nb214_fiyM(%esp)        movaps  %xmm2,nb214_fizM(%esp)        ## i H1 & H2 simultaneously first get i particle coords:         movaps  nb214_ixH1(%esp),%xmm0        movaps  nb214_iyH1(%esp),%xmm1        movaps  nb214_izH1(%esp),%xmm2        movaps  nb214_ixH2(%esp),%xmm3        movaps  nb214_iyH2(%esp),%xmm4        movaps  nb214_izH2(%esp),%xmm5        subps   nb214_jxO(%esp),%xmm0        subps   nb214_jyO(%esp),%xmm1        subps   nb214_jzO(%esp),%xmm2        subps   nb214_jxO(%esp),%xmm3        subps   nb214_jyO(%esp),%xmm4        subps   nb214_jzO(%esp),%xmm5        movaps %xmm0,nb214_dxH1H1(%esp)        movaps %xmm1,nb214_dyH1H1(%esp)        movaps %xmm2,nb214_dzH1H1(%esp)        movaps %xmm3,nb214_dxH2H2(%esp)        movaps %xmm4,nb214_dyH2H2(%esp)        movaps %xmm5,nb214_dzH2H2(%esp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm1,%xmm0        addps %xmm3,%xmm4        addps %xmm2,%xmm0       ## have rsqH1 in xmm0         addps %xmm5,%xmm4       ## have rsqH2 in xmm4         movaps  %xmm0,nb214_rsqH1H1(%esp)        movaps  %xmm4,nb214_rsqH2H2(%esp)        ## start doing invsqrt use rsq values in xmm0, xmm4         rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb214_three(%esp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb214_half(%esp),%xmm3   ## rinvH1H1        mulps   nb214_half(%esp),%xmm7   ## rinvH2H2        movaps  %xmm3,nb214_rinvH1H1(%esp)        movaps  %xmm7,nb214_rinvH2H2(%esp)        ## Do H1 coulomb interaction        movaps nb214_rinvH1H1(%esp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb214_krf(%esp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb214_qqHH(%esp),%xmm3        movhps  nb214_qqMH(%esp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb214_rsqH1H1(%esp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb214_crf(%esp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb214_two(%esp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb214_vctot(%esp),%xmm6        movaps %xmm6,nb214_vctot(%esp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb214_dxH1H1(%esp),%xmm0        mulps   nb214_dyH1H1(%esp),%xmm1        mulps   nb214_dzH1H1(%esp),%xmm2        ## update forces H1 - j water         movaps  nb214_fjxO(%esp),%xmm3        movaps  nb214_fjyO(%esp),%xmm4        movaps  nb214_fjzO(%esp),%xmm5        subps   %xmm0,%xmm3        subps   %xmm1,%xmm4        subps   %xmm2,%xmm5        movaps  %xmm3,nb214_fjxO(%esp)        movaps  %xmm4,nb214_fjyO(%esp)        movaps  %xmm5,nb214_fjzO(%esp)        addps   nb214_fixH1(%esp),%xmm0        addps   nb214_fiyH1(%esp),%xmm1        addps   nb214_fizH1(%esp),%xmm2        movaps  %xmm0,nb214_fixH1(%esp)        movaps  %xmm1,nb214_fiyH1(%esp)        movaps  %xmm2,nb214_fizH1(%esp)        ## H2 Coulomb        movaps nb214_rinvH2H2(%esp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb214_krf(%esp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb214_qqHH(%esp),%xmm3        movhps  nb214_qqMH(%esp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb214_rsqH2H2(%esp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb214_crf(%esp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb214_two(%esp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb214_vctot(%esp),%xmm6   ## local vctot summation variable        movaps %xmm6,nb214_vctot(%esp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb214_dxH2H2(%esp),%xmm0        mulps   nb214_dyH2H2(%esp),%xmm1        mulps   nb214_dzH2H2(%esp),%xmm2        ## update forces H2 - j water         movaps  nb214_fjxO(%esp),%xmm3        movaps  nb214_fjyO(%esp),%xmm4        movaps  nb214_fjzO(%esp),%xmm5        subps   %xmm0,%xmm3        subps   %xmm1,%xmm4        subps   %xmm2,%xmm5        movaps  %xmm3,nb214_fjxO(%esp)        movaps  %xmm4,nb214_fjyO(%esp)        movaps  %xmm5,nb214_fjzO(%esp)

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?