nb_kernel114_x86_64_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,123 行 · 第 1/5 页

S
2,123
字号
        mulss  nb114_c6(%rsp),%xmm1        mulss  nb114_c12(%rsp),%xmm2        movss  %xmm2,%xmm3        subss  %xmm1,%xmm3        addss  nb114_Vvdwtot(%rsp),%xmm3        movss  %xmm3,nb114_Vvdwtot(%rsp)        mulss  nb114_six(%rsp),%xmm1        mulss  nb114_twelve(%rsp),%xmm2        subss  %xmm1,%xmm2        mulss  %xmm2,%xmm0      ## fscal        movss  %xmm0,%xmm1        movss  %xmm0,%xmm2        mulss  nb114_dxOO(%rsp),%xmm0        mulss  nb114_dyOO(%rsp),%xmm1        mulss  nb114_dzOO(%rsp),%xmm2        xorps   %xmm3,%xmm3        xorps   %xmm4,%xmm4        xorps   %xmm5,%xmm5        addss   %xmm0,%xmm3        addss   %xmm1,%xmm4        addss   %xmm2,%xmm5        movaps  %xmm3,nb114_fjxO(%rsp)        movaps  %xmm4,nb114_fjyO(%rsp)        movaps  %xmm5,nb114_fjzO(%rsp)        addss   nb114_fixO(%rsp),%xmm0        addss   nb114_fiyO(%rsp),%xmm1        addss   nb114_fizO(%rsp),%xmm2        movss  %xmm0,nb114_fixO(%rsp)        movss  %xmm1,nb114_fiyO(%rsp)        movss  %xmm2,nb114_fizO(%rsp)        ## do  M coulomb interaction        movaps nb114_rinvMM(%rsp),%xmm0        movaps %xmm0,%xmm4      ## xmm4=rinv        mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb114_qqMH(%rsp),%xmm3        movhps  nb114_qqMM(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## 11000001         mulps  %xmm3,%xmm4      ## xmm4=voul            mulps  %xmm4,%xmm0        addps  nb114_vctot(%rsp),%xmm4        movaps %xmm4,nb114_vctot(%rsp)        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb114_dxMM(%rsp),%xmm0        mulps   nb114_dyMM(%rsp),%xmm1        mulps   nb114_dzMM(%rsp),%xmm2        ## update forces M - j water         movaps  nb114_fjxO(%rsp),%xmm3        movaps  nb114_fjyO(%rsp),%xmm4        movaps  nb114_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb114_fjxO(%rsp)        movaps  %xmm4,nb114_fjyO(%rsp)        movaps  %xmm5,nb114_fjzO(%rsp)        addps   nb114_fixM(%rsp),%xmm0        addps   nb114_fiyM(%rsp),%xmm1        addps   nb114_fizM(%rsp),%xmm2        movaps  %xmm0,nb114_fixM(%rsp)        movaps  %xmm1,nb114_fiyM(%rsp)        movaps  %xmm2,nb114_fizM(%rsp)        ## i H1 & H2 simultaneously first get i particle coords:     movaps  nb114_jxO(%rsp),%xmm0    movaps  nb114_jyO(%rsp),%xmm1    movaps  nb114_jzO(%rsp),%xmm2    movaps  %xmm0,%xmm3    movaps  %xmm1,%xmm4    movaps  %xmm2,%xmm5        subps   nb114_ixH1(%rsp),%xmm0        subps   nb114_iyH1(%rsp),%xmm1        subps   nb114_izH1(%rsp),%xmm2        subps   nb114_ixH2(%rsp),%xmm3        subps   nb114_iyH2(%rsp),%xmm4        subps   nb114_izH2(%rsp),%xmm5        movaps %xmm0,nb114_dxH1H1(%rsp)        movaps %xmm1,nb114_dyH1H1(%rsp)        movaps %xmm2,nb114_dzH1H1(%rsp)        movaps %xmm3,nb114_dxH2H2(%rsp)        movaps %xmm4,nb114_dyH2H2(%rsp)        movaps %xmm5,nb114_dzH2H2(%rsp)        mulps %xmm0,%xmm0        mulps %xmm1,%xmm1        mulps %xmm2,%xmm2        mulps %xmm3,%xmm3        mulps %xmm4,%xmm4        mulps %xmm5,%xmm5        addps %xmm1,%xmm0        addps %xmm3,%xmm4        addps %xmm2,%xmm0       ## have rsqH1 in xmm0         addps %xmm5,%xmm4       ## have rsqH2 in xmm4         movaps  %xmm0,nb114_rsqH1H1(%rsp)        movaps  %xmm4,nb114_rsqH2H2(%rsp)        ## start doing invsqrt use rsq values in xmm0, xmm4         rsqrtps %xmm0,%xmm1        rsqrtps %xmm4,%xmm5        movaps  %xmm1,%xmm2        movaps  %xmm5,%xmm6        mulps   %xmm1,%xmm1        mulps   %xmm5,%xmm5        movaps  nb114_three(%rsp),%xmm3        movaps  %xmm3,%xmm7        mulps   %xmm0,%xmm1        mulps   %xmm4,%xmm5        subps   %xmm1,%xmm3        subps   %xmm5,%xmm7        mulps   %xmm2,%xmm3        mulps   %xmm6,%xmm7        mulps   nb114_half(%rsp),%xmm3   ## rinvH1H1        mulps   nb114_half(%rsp),%xmm7   ## rinvH2H2        movaps  %xmm3,nb114_rinvH1H1(%rsp)        movaps  %xmm7,nb114_rinvH2H2(%rsp)        ## Do H1 coulomb interaction        movaps nb114_rinvH1H1(%rsp),%xmm0        movaps %xmm0,%xmm4      ## xmm4=rinv         mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb114_qqHH(%rsp),%xmm3        movhps  nb114_qqMH(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## 11000001         mulps  %xmm3,%xmm4      ## xmm4=voul        mulps  %xmm4,%xmm0        addps  nb114_vctot(%rsp),%xmm4        movaps %xmm4,nb114_vctot(%rsp)        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb114_dxH1H1(%rsp),%xmm0        mulps   nb114_dyH1H1(%rsp),%xmm1        mulps   nb114_dzH1H1(%rsp),%xmm2        ## update forces H1 - j water         movaps  nb114_fjxO(%rsp),%xmm3        movaps  nb114_fjyO(%rsp),%xmm4        movaps  nb114_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb114_fjxO(%rsp)        movaps  %xmm4,nb114_fjyO(%rsp)        movaps  %xmm5,nb114_fjzO(%rsp)        addps   nb114_fixH1(%rsp),%xmm0        addps   nb114_fiyH1(%rsp),%xmm1        addps   nb114_fizH1(%rsp),%xmm2        movaps  %xmm0,nb114_fixH1(%rsp)        movaps  %xmm1,nb114_fiyH1(%rsp)        movaps  %xmm2,nb114_fizH1(%rsp)        ## H2 Coulomb        movaps nb114_rinvH2H2(%rsp),%xmm0        movaps %xmm0,%xmm4      ## xmm4=rinv         mulps  %xmm0,%xmm0      ## xmm0=rinvsq         ## fetch charges to xmm3 (temporary)         xorps  %xmm3,%xmm3        movss   nb114_qqHH(%rsp),%xmm3        movhps  nb114_qqMH(%rsp),%xmm3        shufps $193,%xmm3,%xmm3 ## 11000001         mulps  %xmm3,%xmm4      ## xmm4=voul        mulps  %xmm4,%xmm0        addps  nb114_vctot(%rsp),%xmm4   ## local vctot summation variable        movaps %xmm4,nb114_vctot(%rsp)        movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        mulps   nb114_dxH2H2(%rsp),%xmm0        mulps   nb114_dyH2H2(%rsp),%xmm1        mulps   nb114_dzH2H2(%rsp),%xmm2        ## update forces H2 - j water         movaps  nb114_fjxO(%rsp),%xmm3        movaps  nb114_fjyO(%rsp),%xmm4        movaps  nb114_fjzO(%rsp),%xmm5        addps   %xmm0,%xmm3        addps   %xmm1,%xmm4        addps   %xmm2,%xmm5        movaps  %xmm3,nb114_fjxO(%rsp)        movaps  %xmm4,nb114_fjyO(%rsp)        movaps  %xmm5,nb114_fjzO(%rsp)        addps   nb114_fixH2(%rsp),%xmm0        addps   nb114_fiyH2(%rsp),%xmm1        addps   nb114_fizH2(%rsp),%xmm2        movaps  %xmm0,nb114_fixH2(%rsp)        movaps  %xmm1,nb114_fiyH2(%rsp)        movaps  %xmm2,nb114_fizH2(%rsp)        movq    nb114_faction(%rbp),%rsi        ## update j water forces from local variables.        ## transpose back first        movaps  nb114_fjxO(%rsp),%xmm0   ## Ox H1x H2x Mx         movaps  nb114_fjyO(%rsp),%xmm1   ## Oy H1y H2y My        movaps  nb114_fjzO(%rsp),%xmm2   ## Oz H1z H2z Mz        movaps  %xmm0,%xmm3        movaps  %xmm0,%xmm4        unpcklps %xmm1,%xmm3            ## Ox Oy - -        shufps $0x1,%xmm2,%xmm4        ## h1x - Oz -        movaps  %xmm1,%xmm5        movaps  %xmm0,%xmm6        unpcklps %xmm2,%xmm5            ## - - H1y H1z        unpckhps %xmm1,%xmm6            ## h2x h2y - -         unpckhps %xmm2,%xmm1            ## - - My Mz        shufps  $0x32,%xmm0,%xmm2 ## (00110010) h2z - Mx -        shufps  $36,%xmm4,%xmm3 ## 00100100 ;# Ox Oy Oz H1x         shufps  $78,%xmm6,%xmm5 ## 01001110 ;# h1y h1z h2x h2y        shufps  $232,%xmm1,%xmm2 ## 11101000 ;# h2z mx my mz        movlps  (%rsi,%rax,4),%xmm0        movlps  16(%rsi,%rax,4),%xmm1        movlps  32(%rsi,%rax,4),%xmm4        movhps  8(%rsi,%rax,4),%xmm0        movhps  24(%rsi,%rax,4),%xmm1        movhps  40(%rsi,%rax,4),%xmm4        addps   %xmm3,%xmm0        addps   %xmm5,%xmm1        addps   %xmm2,%xmm4        movlps   %xmm0,(%rsi,%rax,4)        movlps   %xmm1,16(%rsi,%rax,4)        movlps   %xmm4,32(%rsi,%rax,4)        movhps   %xmm0,8(%rsi,%rax,4)        movhps   %xmm1,24(%rsi,%rax,4)        movhps   %xmm4,40(%rsi,%rax,4)        decl nb114_innerk(%rsp)        jz    _nb_kernel114_x86_64_sse.nb114_updateouterdata        jmp   _nb_kernel114_x86_64_sse.nb114_single_loop_nb_kernel114_x86_64_sse.nb114_updateouterdata:         movl  nb114_ii3(%rsp),%ecx        movq  nb114_faction(%rbp),%rdi        movq  nb114_fshift(%rbp),%rsi        movl  nb114_is3(%rsp),%edx        ## accumulate  Oi forces in xmm0, xmm1, xmm2         movaps nb114_fixO(%rsp),%xmm0        movaps nb114_fiyO(%rsp),%xmm1        movaps nb114_fizO(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  (%rdi,%rcx,4),%xmm3        movss  4(%rdi,%rcx,4),%xmm4        movss  8(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,(%rdi,%rcx,4)        movss  %xmm4,4(%rdi,%rcx,4)        movss  %xmm5,8(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         movaps %xmm0,%xmm6        movss %xmm2,%xmm7        movlhps %xmm1,%xmm6        shufps $8,%xmm6,%xmm6 ## 00001000               ## accumulate H1i forces in xmm0, xmm1, xmm2         movaps nb114_fixH1(%rsp),%xmm0        movaps nb114_fiyH1(%rsp),%xmm1        movaps nb114_fizH1(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  12(%rdi,%rcx,4),%xmm3        movss  16(%rdi,%rcx,4),%xmm4        movss  20(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,12(%rdi,%rcx,4)        movss  %xmm4,16(%rdi,%rcx,4)        movss  %xmm5,20(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## 00001000               addps   %xmm0,%xmm6        ## accumulate H2i forces in xmm0, xmm1, xmm2         movaps nb114_fixH2(%rsp),%xmm0        movaps nb114_fiyH2(%rsp),%xmm1        movaps nb114_fizH2(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  24(%rdi,%rcx,4),%xmm3        movss  28(%rdi,%rcx,4),%xmm4        movss  32(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,24(%rdi,%rcx,4)        movss  %xmm4,28(%rdi,%rcx,4)        movss  %xmm5,32(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## 00001000               addps   %xmm0,%xmm6        ## accumulate Mi forces in xmm0, xmm1, xmm2         movaps nb114_fixM(%rsp),%xmm0        movaps nb114_fiyM(%rsp),%xmm1        movaps nb114_fizM(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1        addps  %xmm5,%xmm2 ## sum is in 1/2 in xmm0-xmm2         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $1,%xmm3,%xmm3        shufps $1,%xmm4,%xmm4        shufps $1,%xmm5,%xmm5        addss  %xmm3,%xmm0        addss  %xmm4,%xmm1        addss  %xmm5,%xmm2      ## xmm0-xmm2 has single force in pos0         ## increment i force         movss  36(%rdi,%rcx,4),%xmm3        movss  40(%rdi,%rcx,4),%xmm4        movss  44(%rdi,%rcx,4),%xmm5        subss  %xmm0,%xmm3        subss  %xmm1,%xmm4        subss  %xmm2,%xmm5        movss  %xmm3,36(%rdi,%rcx,4)        movss  %xmm4,40(%rdi,%rcx,4)        movss  %xmm5,44(%rdi,%rcx,4)        ## accumulate force in xmm6/xmm7 for fshift         addss %xmm2,%xmm7        movlhps %xmm1,%xmm0        shufps $8,%xmm0,%xmm0 ## 00001000               addps   %xmm0,%xmm6        ## increment fshift force          movlps  (%rsi,%rdx,4),%xmm3        movss  8(%rsi,%rdx,4),%xmm4        subps  %xmm6,%xmm3        subss  %xmm7,%xmm4        movlps  %xmm3,(%rsi,%rdx,4)        movss  %xmm4,8(%rsi,%rdx,4)        ## get n from stack        movl nb114_n(%rsp),%esi        ## get group index for i particle         movq  nb114_gid(%rbp),%rdx              ## base of gid[]        movl  (%rdx,%rsi,4),%edx                ## ggid=gid[n]        ## accumulate total potential energy and update it         movaps nb114_vctot(%rsp),%xmm7        ## accumulate 

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?