nb_kernel234_x86_64_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,177 行 · 第 1/5 页

S
2,177
字号
    movaps %xmm0,%xmm13    movaps %xmm1,%xmm14    addps %xmm2,%xmm11    addps nb234_fixH1(%rsp),%xmm0    addps nb234_fiyH1(%rsp),%xmm1    addps nb234_fizH1(%rsp),%xmm2    addps %xmm3,%xmm13    addps %xmm4,%xmm14    addps %xmm5,%xmm11    addps nb234_fixH2(%rsp),%xmm3    addps nb234_fiyH2(%rsp),%xmm4    addps nb234_fizH2(%rsp),%xmm5    addps %xmm6,%xmm13    addps %xmm7,%xmm14    addps %xmm8,%xmm11    addps nb234_fixM(%rsp),%xmm6    addps nb234_fiyM(%rsp),%xmm7    addps nb234_fizM(%rsp),%xmm8    movaps %xmm0,nb234_fixH1(%rsp)    movaps %xmm1,nb234_fiyH1(%rsp)    movaps %xmm2,nb234_fizH1(%rsp)    movaps %xmm3,nb234_fixH2(%rsp)    movaps %xmm4,nb234_fiyH2(%rsp)    movaps %xmm5,nb234_fizH2(%rsp)    movaps %xmm6,nb234_fixM(%rsp)    movaps %xmm7,nb234_fiyM(%rsp)    movaps %xmm8,nb234_fizM(%rsp)    ## xmm0 = fMx    ## xmm1 = fMy    ## xmm2 = fMz    movaps %xmm13,%xmm0    unpcklps %xmm14,%xmm13    unpckhps %xmm14,%xmm0    addps %xmm13,%xmm9    addps %xmm0,%xmm10    movhlps  %xmm11,%xmm12 ## fMzc fMzd    movlps %xmm9,36(%rdi,%rax,4)    movhps %xmm9,36(%rdi,%rbx,4)    movlps %xmm10,36(%rdi,%rcx,4)    movhps %xmm10,36(%rdi,%rdx,4)    movss  %xmm11,44(%rdi,%rax,4)    movss  %xmm12,44(%rdi,%rcx,4)    shufps $1,%xmm11,%xmm11    shufps $1,%xmm12,%xmm12    movss  %xmm11,44(%rdi,%rbx,4)    movss  %xmm12,44(%rdi,%rdx,4)        ## should we do one more iteration?         subl $4,nb234_innerk(%rsp)        jl    _nb_kernel234_x86_64_sse.nb234_single_check        jmp   _nb_kernel234_x86_64_sse.nb234_unroll_loop_nb_kernel234_x86_64_sse.nb234_single_check:         addl $4,nb234_innerk(%rsp)        jnz   _nb_kernel234_x86_64_sse.nb234_single_loop        jmp   _nb_kernel234_x86_64_sse.nb234_updateouterdata_nb_kernel234_x86_64_sse.nb234_single_loop:         movq  nb234_innerjjnr(%rsp),%rdx        ## pointer to jjnr[k]         movl  (%rdx),%eax        addq $4,nb234_innerjjnr(%rsp)        movq nb234_pos(%rbp),%rsi        lea  (%rax,%rax,2),%rax        ## fetch j coordinates        movlps (%rsi,%rax,4),%xmm3              ##  Ox  Oy          movlps 16(%rsi,%rax,4),%xmm4            ## H1y H1z         movlps 32(%rsi,%rax,4),%xmm5            ## H2z  Mx         movhps 8(%rsi,%rax,4),%xmm3             ##  Ox  Oy  Oz H1x        movhps 24(%rsi,%rax,4),%xmm4            ## H1y H1z H2x H2y        movhps 40(%rsi,%rax,4),%xmm5            ## H2z  Mx  My  Mz        ## transpose        movaps %xmm4,%xmm0        movaps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm3,%xmm6        shufps $18,%xmm5,%xmm4 ## (00010010)  h2x - Mx  -         shufps $193,%xmm0,%xmm3 ## (11000001)  Oy  - H1y -         shufps $35,%xmm5,%xmm2 ## (00100011) H2y - My  -         shufps $18,%xmm0,%xmm1 ## (00010010)  Oz  - H1z -         ##  xmm6: Ox - - H1x   xmm5: H2z - - Mz         shufps $140,%xmm4,%xmm6 ## (10001100) Ox H1x H2x Mx         shufps $136,%xmm2,%xmm3 ## (10001000) Oy H1y H2y My         shufps $200,%xmm5,%xmm1 ## (11001000) Oz H1z H2z Mz        ## store all j coordinates in jO          movaps %xmm6,nb234_jxO(%rsp)        movaps %xmm3,nb234_jyO(%rsp)        movaps %xmm1,nb234_jzO(%rsp)    movaps %xmm6,%xmm0  ## jxO    movaps %xmm1,%xmm2  ## jzO    movaps %xmm3,%xmm1  ## jyO    movaps %xmm3,%xmm4  ## jyO    movaps %xmm6,%xmm3  ## jxO    movaps %xmm2,%xmm5  ## jzO        ## do O and M in parallel        subps  nb234_ixO(%rsp),%xmm0        subps  nb234_iyO(%rsp),%xmm1        subps  nb234_izO(%rsp),%xmm2        subps  nb234_ixM(%rsp),%xmm3        subps  nb234_iyM(%rsp),%xmm4        subps  nb234_izM(%rsp),%xmm5        movaps %xmm0,nb234_dxOO(%rsp)        movaps %xmm1,nb234_dyOO(%rsp)        movaps %xmm2,nb234_dzOO(%rsp)        movaps %xmm3,nb234_dxMM(%rsp)        movaps %xmm4,nb234_dyMM(%rsp)        movaps %xmm5,nb234_dzMM(%rsp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        addps %xmm1,%xmm0        addps %xmm2,%xmm0       ## have rsq in xmm0         mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm3,%xmm4        addps %xmm5,%xmm4       ## have rsq in xmm4        ## Save data         movaps %xmm0,nb234_rsqOO(%rsp)        movaps %xmm4,nb234_rsqMM(%rsp)        ## do 1/x for O        rsqrtps %xmm0,%xmm1        movaps  %xmm1,%xmm2        mulps   %xmm1,%xmm1        movaps  nb234_three(%rsp),%xmm3        mulps   %xmm0,%xmm1     ## rsq*lu*lu         subps   %xmm1,%xmm3     ## constant 30-rsq*lu*lu         mulps   %xmm2,%xmm3     ## lu*(3-rsq*lu*lu)         mulps   nb234_half(%rsp),%xmm3        movaps  %xmm3,nb234_rinvOO(%rsp)        ## rinvH2         ## 1/sqrt(x) for M        rsqrtps %xmm4,%xmm5        movaps  %xmm5,%xmm6        mulps   %xmm5,%xmm5        movaps  nb234_three(%rsp),%xmm7        mulps   %xmm4,%xmm5        subps   %xmm5,%xmm7        mulps   %xmm6,%xmm7        mulps   nb234_half(%rsp),%xmm7   ## rinv iH1 - j water         movaps %xmm7,nb234_rinvMM(%rsp)        ## LJ table interaction        movaps nb234_rinvOO(%rsp),%xmm0        movss %xmm0,%xmm1        mulss  nb234_rsqOO(%rsp),%xmm1   ## xmm1=r         mulss  nb234_tsc(%rsp),%xmm1    cvttps2pi %xmm1,%mm6    cvtpi2ps %mm6,%xmm3        subss    %xmm3,%xmm1    ## xmm1=eps     movss %xmm1,%xmm2    mulss  %xmm2,%xmm2      ## xmm2=eps2     pslld $3,%mm6    movq nb234_VFtab(%rbp),%rsi    movd %mm6,%r8d    ## dispersion     movlps (%rsi,%r8,4),%xmm5    movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## constant 10001000    shufps $221,%xmm7,%xmm5 ## constant 11011101    movlps 8(%rsi,%r8,4),%xmm7    movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## constant 10001000    shufps $221,%xmm3,%xmm7 ## constant 11011101    ## dispersion table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb234_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV     movss nb234_c6(%rsp),%xmm4    mulss  %xmm4,%xmm7   ## fijD     mulss  %xmm4,%xmm5   ## Vvdw6         xorps  %xmm3,%xmm3        mulps  nb234_tsc(%rsp),%xmm7        subss  %xmm7,%xmm3        movss  %xmm3,nb234_fstmp(%rsp)    addss  nb234_Vvdwtot(%rsp),%xmm5    movss %xmm5,nb234_Vvdwtot(%rsp)    ## repulsion     movlps 16(%rsi,%r8,4),%xmm5    movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## constant 10001000    shufps $221,%xmm7,%xmm5 ## constant 11011101    movlps 24(%rsi,%r8,4),%xmm7    movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## constant 10001000    shufps $221,%xmm3,%xmm7 ## constant 11011101    ## table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb234_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV     movss nb234_c12(%rsp),%xmm4    mulss  %xmm4,%xmm7 ## fijR     mulss  %xmm4,%xmm5 ## Vvdw12         movaps nb234_fstmp(%rsp),%xmm3        mulss  nb234_tsc(%rsp),%xmm7        subss  %xmm7,%xmm3    addss  nb234_Vvdwtot(%rsp),%xmm5    movss %xmm5,nb234_Vvdwtot(%rsp)        mulss %xmm3,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulss  nb234_dxOO(%rsp),%xmm0        mulss  nb234_dyOO(%rsp),%xmm1        mulss  nb234_dzOO(%rsp),%xmm2        xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        addss   %xmm0,%xmm3        addss   %xmm1,%xmm4        addss   %xmm2,%xmm5        movaps  %xmm3,nb234_fjxO(%rsp)        movaps  %xmm4,nb234_fjyO(%rsp)        movaps  %xmm5,nb234_fjzO(%rsp)        addss   nb234_fixO(%rsp),%xmm0        addss   nb234_fiyO(%rsp),%xmm1        addss   nb234_fizO(%rsp),%xmm2        movss  %xmm0,nb234_fixO(%rsp)        movss  %xmm1,nb234_fiyO(%rsp)        movss  %xmm2,nb234_fizO(%rsp)        ## do  M coulomb interaction        movaps nb234_rinvMM(%rsp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb234_krf(%rsp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb234_qqMH(%rsp),%xmm3        movhps  nb234_qqMM(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb234_rsqMM(%rsp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb234_crf(%rsp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb234_two(%rsp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb234_vctot(%rsp),%xmm6        movaps %xmm6,nb234_vctot(%rsp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb234_dxMM(%rsp),%xmm0        mulps   nb234_dyMM(%rsp),%xmm1        mulps   nb234_dzMM(%rsp),%xmm2        ## update forces M - j water         movaps  nb234_fjxO(%rsp),%xmm3        movaps  nb234_fjyO(%rsp),%xmm4        movaps  nb234_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb234_fjxO(%rsp)        movaps  %xmm4,nb234_fjyO(%rsp)        movaps  %xmm5,nb234_fjzO(%rsp)        addps   nb234_fixM(%rsp),%xmm0        addps   nb234_fiyM(%rsp),%xmm1        addps   nb234_fizM(%rsp),%xmm2        movaps  %xmm0,nb234_fixM(%rsp)        movaps  %xmm1,nb234_fiyM(%rsp)        movaps  %xmm2,nb234_fizM(%rsp)        ## i H1 & H2 simultaneously first get i particle coords:     movaps  nb234_jxO(%rsp),%xmm0    movaps  nb234_jyO(%rsp),%xmm1    movaps  nb234_jzO(%rsp),%xmm2    movaps  %xmm0,%xmm3    movaps  %xmm1,%xmm4    movaps  %xmm2,%xmm5        subps   nb234_ixH1(%rsp),%xmm0        subps   nb234_iyH1(%rsp),%xmm1        subps   nb234_izH1(%rsp),%xmm2        subps   nb234_ixH2(%rsp),%xmm3        subps   nb234_iyH2(%rsp),%xmm4        subps   nb234_izH2(%rsp),%xmm5        movaps %xmm0,nb234_dxH1H1(%rsp)        movaps %xmm1,nb234_dyH1H1(%rsp)        movaps %xmm2,nb234_dzH1H1(%rsp)        movaps %xmm3,nb234_dxH2H2(%rsp)        movaps %xmm4,nb234_dyH2H2(%rsp)        movaps %xmm5,nb234_dzH2H2(%rsp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm1,%xmm0        addps %xmm3,%xmm4        addps %xmm2,%xmm0       ## have rsqH1 in xmm0         addps %xmm5,%xmm4       ## have rsqH2 in xmm4         movaps  %xmm0,nb234_rsqH1H1(%rsp)        movaps  %xmm4,nb234_rsqH2H2(%rsp)        ## start doing invsqrt use rsq values in xmm0, xmm4         rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb234_three(%rsp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb234_half(%rsp),%xmm3   ## rinvH1H1        mulps   nb234_half(%rsp),%xmm7   ## rinvH2H2        movaps  %xmm3,nb234_rinvH1H1(%rsp)        movaps  %xmm7,nb234_rinvH2H2(%rsp)        ## Do H1 coulomb interaction        movaps nb234_rinvH1H1(%rsp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb234_krf(%rsp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb234_qqHH(%rsp),%xmm3        movhps  nb234_qqMH(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb234_rsqH1H1(%rsp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb234_crf(%rsp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb234_two(%rsp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb234_vctot(%rsp),%xmm6        movaps %xmm6,nb234_vctot(%rsp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb234_dxH1H1(%rsp),%xmm0        mulps   nb234_dyH1H1(%rsp),%xmm1        mulps   nb234_dzH1H1(%rsp),%xmm2        ## update forces H1 - j water         movaps  nb234_fjxO(%rsp),%xmm3        movaps  nb234_fjyO(%rsp),%xmm4        movaps  nb234_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb234_fjxO(%rsp)        movaps  %xmm4,nb234_fjyO(%rsp)        movaps  %xmm5,nb234_fjzO(%rsp)        addps   nb234_fixH1(%rsp),%xmm0        addps   nb234_fiyH1(%rsp),%xmm1        addps   nb234_fizH1(%rsp),%xmm2        movaps  %xmm0,nb234_fixH1(%rsp)        movaps  %xmm1,nb234_fiyH1(%rsp)        movaps  %xmm2,nb234_fizH1(%rsp)        ## H2 Coulomb        movaps nb234_rinvH2H2(%rsp),%xmm0        movaps %xmm0,%xmm7      ## xmm7=rinv         movaps nb234_krf(%rsp),%xmm5        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb234_qqHH(%rsp),%xmm3        movhps  nb234_qqMH(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## constant 11000001         mulps  nb234_rsqH2H2(%rsp),%xmm5   ## xmm5=krsq         movaps %xmm5,%xmm6        addps  %xmm7,%xmm6      ## xmm6=rinv+ krsq         subps  nb234_crf(%rsp),%xmm6        mulps  %xmm3,%xmm6 ## xmm6=voul=qq*(rinv+ krsq-crf)         mulps nb234_two(%rsp),%xmm5        subps  %xmm5,%xmm7      ## xmm7=rinv-2*krsq         mulps  %xmm3,%xmm7 ## xmm7 = coul part of fscal         addps  nb234_vctot(%rsp),%xmm6   ## local vctot summation variable        movaps %xmm6,nb234_vctot(%rsp)        mulps  %xmm7,%xmm0        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?