nb_kernel232_x86_64_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,138 行 · 第 1/5 页

S
2,138
字号
        ## do invsqrt         rsqrtps %xmm0,%xmm1        mulps   nb232_krf(%rsp),%xmm6   ## xmm6=krsq         movaps  %xmm1,%xmm2        movaps  %xmm6,%xmm7        mulps   %xmm1,%xmm1        movaps  nb232_three(%rsp),%xmm3        mulps   %xmm0,%xmm1        subps   %xmm1,%xmm3        mulps   %xmm2,%xmm3        mulps   nb232_half(%rsp),%xmm3   ## rinv iO - j water in xmm3        movaps  %xmm3,nb232_rinvOO(%rsp)        addps   %xmm3,%xmm6     ## xmm6=rinv+ krsq         mulps   nb232_two(%rsp),%xmm7        subps  nb232_crf(%rsp),%xmm6    ## xmm6=rinv+ krsq-crf         movaps  %xmm3,%xmm0 ## rinv        subps   %xmm7,%xmm3     ## xmm3=rinv-2*krsq         xorps   %xmm4,%xmm4        ## fetch charges to xmm4 (temporary)         movss   nb232_qqOO(%rsp),%xmm4        movhps  nb232_qqOH(%rsp),%xmm4        mulps %xmm4,%xmm6       ## vcoul          mulps %xmm4,%xmm3       ## coul part of fs          mulps %xmm0,%xmm3        movaps %xmm3,nb232_fstmp(%rsp)   ## save it        addps  nb232_vctot(%rsp),%xmm6    movaps %xmm6,nb232_vctot(%rsp)        movaps nb232_rinvOO(%rsp),%xmm0        movss %xmm0,%xmm1        mulss  nb232_rsqOO(%rsp),%xmm1   ## xmm1=r         mulss  nb232_tsc(%rsp),%xmm1    cvttps2pi %xmm1,%mm6    cvtpi2ps %mm6,%xmm3        subss    %xmm3,%xmm1    ## xmm1=eps     movss %xmm1,%xmm2    mulss  %xmm2,%xmm2      ## xmm2=eps2     pslld $3,%mm6    movq nb232_VFtab(%rbp),%rsi    movd %mm6,%r8d    ## dispersion     movlps (%rsi,%r8,4),%xmm5    movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## constant 10001000    shufps $221,%xmm7,%xmm5 ## constant 11011101    movlps 8(%rsi,%r8,4),%xmm7    movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## constant 10001000    shufps $221,%xmm3,%xmm7 ## constant 11011101    ## dispersion table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb232_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV     movss nb232_c6(%rsp),%xmm4    mulss  %xmm4,%xmm7   ## fijD     mulss  %xmm4,%xmm5   ## Vvdw6         movss  nb232_fstmp(%rsp),%xmm3        mulps  nb232_tsc(%rsp),%xmm7        subss  %xmm7,%xmm3        movss  %xmm3,nb232_fstmp(%rsp)    addss  nb232_Vvdwtot(%rsp),%xmm5    movss %xmm5,nb232_Vvdwtot(%rsp)    ## repulsion     movlps 16(%rsi,%r8,4),%xmm5    movaps %xmm5,%xmm4    shufps $136,%xmm7,%xmm4 ## constant 10001000    shufps $221,%xmm7,%xmm5 ## constant 11011101    movlps 24(%rsi,%r8,4),%xmm7    movaps %xmm7,%xmm6    shufps $136,%xmm3,%xmm6 ## constant 10001000    shufps $221,%xmm3,%xmm7 ## constant 11011101    ## table ready, in xmm4-xmm7     mulss  %xmm1,%xmm6      ## xmm6=Geps     mulss  %xmm2,%xmm7      ## xmm7=Heps2     addss  %xmm6,%xmm5    addss  %xmm7,%xmm5      ## xmm5=Fp     mulss  nb232_two(%rsp),%xmm7         ## two*Heps2     addss  %xmm6,%xmm7    addss  %xmm5,%xmm7 ## xmm7=FF     mulss  %xmm1,%xmm5 ## xmm5=eps*Fp     addss  %xmm4,%xmm5 ## xmm5=VV     movss nb232_c12(%rsp),%xmm4    mulss  %xmm4,%xmm7 ## fijR     mulss  %xmm4,%xmm5 ## Vvdw12         movaps nb232_fstmp(%rsp),%xmm3        mulss  nb232_tsc(%rsp),%xmm7        subss  %xmm7,%xmm3    addss  nb232_Vvdwtot(%rsp),%xmm5    movss %xmm5,nb232_Vvdwtot(%rsp)        mulps  %xmm3,%xmm0        movaps  %xmm0,%xmm1        movaps  %xmm0,%xmm2        mulps   nb232_dxOO(%rsp),%xmm0        mulps   nb232_dyOO(%rsp),%xmm1        mulps   nb232_dzOO(%rsp),%xmm2        ## initial update for j forces         xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb232_fjxO(%rsp)        movaps  %xmm4,nb232_fjyO(%rsp)        movaps  %xmm5,nb232_fjzO(%rsp)        addps   nb232_fixO(%rsp),%xmm0        addps   nb232_fiyO(%rsp),%xmm1        addps   nb232_fizO(%rsp),%xmm2        movaps  %xmm0,nb232_fixO(%rsp)        movaps  %xmm1,nb232_fiyO(%rsp)        movaps  %xmm2,nb232_fizO(%rsp)        ## done with i O Now do i H1 & H2 simultaneously first get i particle coords:     movaps  nb232_jxO(%rsp),%xmm0    movaps  nb232_jyO(%rsp),%xmm1    movaps  nb232_jzO(%rsp),%xmm2    movaps  %xmm0,%xmm3    movaps  %xmm1,%xmm4    movaps  %xmm2,%xmm5    subps   nb232_ixH1(%rsp),%xmm0    subps   nb232_iyH1(%rsp),%xmm1    subps   nb232_izH1(%rsp),%xmm2    subps   nb232_ixH2(%rsp),%xmm3    subps   nb232_iyH2(%rsp),%xmm4    subps   nb232_izH2(%rsp),%xmm5        movaps %xmm0,nb232_dxH1O(%rsp)        movaps %xmm1,nb232_dyH1O(%rsp)        movaps %xmm2,nb232_dzH1O(%rsp)        movaps %xmm3,nb232_dxH2O(%rsp)        movaps %xmm4,nb232_dyH2O(%rsp)        movaps %xmm5,nb232_dzH2O(%rsp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm1,%xmm0        addps %xmm3,%xmm4        addps %xmm2,%xmm0       ## have rsqH1 in xmm0         addps %xmm5,%xmm4       ## have rsqH2 in xmm4         ## do invsqrt         rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb232_three(%rsp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb232_half(%rsp),%xmm3   ## rinv H1 - j water         mulps   nb232_half(%rsp),%xmm7   ## rinv H2 - j water          mulps nb232_krf(%rsp),%xmm0   ## krsq         mulps nb232_krf(%rsp),%xmm4   ## krsq          ## assemble charges in xmm6         xorps   %xmm6,%xmm6        movss   nb232_qqOH(%rsp),%xmm6        movhps  nb232_qqHH(%rsp),%xmm6        movaps  %xmm0,%xmm1        movaps  %xmm4,%xmm5        addps   %xmm3,%xmm0     ## krsq+ rinv         addps   %xmm7,%xmm4     ## krsq+ rinv         subps nb232_crf(%rsp),%xmm0        subps nb232_crf(%rsp),%xmm4        mulps   nb232_two(%rsp),%xmm1        mulps   nb232_two(%rsp),%xmm5        mulps   %xmm6,%xmm0     ## vcoul         mulps   %xmm6,%xmm4     ## vcoul         addps   %xmm0,%xmm4        addps   nb232_vctot(%rsp),%xmm4        movaps  %xmm4,nb232_vctot(%rsp)        movaps  %xmm3,%xmm0        movaps  %xmm7,%xmm4        mulps   %xmm3,%xmm3        mulps   %xmm7,%xmm7        subps   %xmm1,%xmm0        subps   %xmm5,%xmm4        mulps   %xmm6,%xmm0        mulps   %xmm6,%xmm4        mulps   %xmm3,%xmm0     ## fscal         mulps   %xmm4,%xmm7     ## fscal         movaps  %xmm0,%xmm1        movaps  %xmm0,%xmm2        mulps   nb232_dxH1O(%rsp),%xmm0        mulps   nb232_dyH1O(%rsp),%xmm1        mulps   nb232_dzH1O(%rsp),%xmm2        ## update forces H1 - j water         movaps  nb232_fjxO(%rsp),%xmm3        movaps  nb232_fjyO(%rsp),%xmm4        movaps  nb232_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb232_fjxO(%rsp)        movaps  %xmm4,nb232_fjyO(%rsp)        movaps  %xmm5,nb232_fjzO(%rsp)        addps   nb232_fixH1(%rsp),%xmm0        addps   nb232_fiyH1(%rsp),%xmm1        addps   nb232_fizH1(%rsp),%xmm2        movaps  %xmm0,nb232_fixH1(%rsp)        movaps  %xmm1,nb232_fiyH1(%rsp)        movaps  %xmm2,nb232_fizH1(%rsp)        ## do forces H2 - j water         movaps %xmm7,%xmm0        movaps %xmm7,%xmm1        movaps %xmm7,%xmm2        mulps   nb232_dxH2O(%rsp),%xmm0        mulps   nb232_dyH2O(%rsp),%xmm1        mulps   nb232_dzH2O(%rsp),%xmm2        movaps  nb232_fjxO(%rsp),%xmm3        movaps  nb232_fjyO(%rsp),%xmm4        movaps  nb232_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movq    nb232_faction(%rbp),%rsi        movaps  %xmm3,nb232_fjxO(%rsp)        movaps  %xmm4,nb232_fjyO(%rsp)        movaps  %xmm5,nb232_fjzO(%rsp)        addps   nb232_fixH2(%rsp),%xmm0        addps   nb232_fiyH2(%rsp),%xmm1        addps   nb232_fizH2(%rsp),%xmm2        movaps  %xmm0,nb232_fixH2(%rsp)        movaps  %xmm1,nb232_fiyH2(%rsp)        movaps  %xmm2,nb232_fizH2(%rsp)        ## update j water forces from local variables         movlps  (%rsi,%rax,4),%xmm0        movlps  12(%rsi,%rax,4),%xmm1        movhps  24(%rsi,%rax,4),%xmm1        movaps  nb232_fjxO(%rsp),%xmm3        movaps  nb232_fjyO(%rsp),%xmm4        movaps  nb232_fjzO(%rsp),%xmm5        movaps  %xmm5,%xmm6        movaps  %xmm5,%xmm7        shufps $2,%xmm6,%xmm6 ## constant 00000010        shufps $3,%xmm7,%xmm7 ## constant 00000011        addss   8(%rsi,%rax,4),%xmm5        addss   20(%rsi,%rax,4),%xmm6        addss   32(%rsi,%rax,4),%xmm7        movss   %xmm5,8(%rsi,%rax,4)        movss   %xmm6,20(%rsi,%rax,4)        movss   %xmm7,32(%rsi,%rax,4)        movaps   %xmm3,%xmm5        unpcklps %xmm4,%xmm3        unpckhps %xmm4,%xmm5        addps    %xmm3,%xmm0        addps    %xmm5,%xmm1        movlps  %xmm0,(%rsi,%rax,4)        movlps  %xmm1,12(%rsi,%rax,4)        movhps  %xmm1,24(%rsi,%rax,4)        decl nb232_innerk(%rsp)        jz    _nb_kernel232_x86_64_sse.nb232_updateouterdata        jmp   _nb_kernel232_x86_64_sse.nb232_single_loop_nb_kernel232_x86_64_sse.nb232_updateouterdata:         movl  nb232_ii3(%rsp),%ecx        movq  nb232_faction(%rbp),%rdi        movq  nb232_fshift(%rbp),%rsi        movl  nb232_is3(%rsp),%edx        ## accumulate  Oi forces in xmm0, xmm1, xmm2         movaps nb232_fixO(%rsp),%xmm0        movaps nb232_fiyO(%rsp),%xmm1        movaps nb232_fizO(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  (%rdi,%rcx,4),%xmm3        movss  4(%rdi,%rcx,4),%xmm4        movss  8(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,(%rdi,%rcx,4)        movss  %xmm4,4(%rdi,%rcx,4)        movss  %xmm5,8(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         movaps %xmm0,%xmm6        movss %xmm2,%xmm7        movlhps %xmm1,%xmm6        shufps $8,%xmm6,%xmm6 ## constant 00001000              ## accumulate H1i forces in xmm0, xmm1, xmm2         movaps nb232_fixH1(%rsp),%xmm0        movaps nb232_fiyH1(%rsp),%xmm1        movaps nb232_fizH1(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  12(%rdi,%rcx,4),%xmm3        movss  16(%rdi,%rcx,4),%xmm4        movss  20(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,12(%rdi,%rcx,4)        movss  %xmm4,16(%rdi,%rcx,4)        movss  %xmm5,20(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## constant 00001000              addps   %xmm0,%xmm6        ## accumulate H2i forces in xmm0, xmm1, xmm2         movaps nb232_fixH2(%rsp),%xmm0        movaps nb232_fiyH2(%rsp),%xmm1        movaps nb232_fizH2(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  24(%rdi,%rcx,4),%xmm3        movss  28(%rdi,%rcx,4),%xmm4        movss  32(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,24(%rdi,%rcx,4)        movss  %xmm4,28(%rdi,%rcx,4)        movss  %xmm5,32(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## constant 00001000              addps   %xmm0,%xmm6        ## increment fshift force          movlps  (%rsi,%rdx,4),%xmm3        movss  8(%rsi,%rdx,4),%xmm4        subps  %xmm6,%xmm3        subss  %xmm7,%xmm4        movlps  %xmm3,(%rsi,%rdx,4)        movss  %xmm4,8(%rsi,%rdx,4)        ## get n from stack        movl nb232_n(%rsp),%esi        ## get group index for i particle         movq  nb232_gid(%rbp),%rdx              ## base of gid[]

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?