nb_kernel303_x86_64_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 1,919 行 · 第 1/4 页

S
1,919
字号
    movd    %xmm1,%eax    movd    %xmm4,%r8d    movd    %xmm7,%r12d    movd    %xmm13,%ecx    movd    %xmm14,%r10d    movd    %xmm15,%r14d    pshufd $1,%xmm1,%xmm1    pshufd $1,%xmm4,%xmm4    pshufd $1,%xmm7,%xmm7    pshufd $1,%xmm13,%xmm13    pshufd $1,%xmm14,%xmm14    pshufd $1,%xmm15,%xmm15    movd    %xmm1,%ebx    movd    %xmm4,%r9d    movd    %xmm7,%r13d    movd    %xmm13,%edx    movd    %xmm14,%r11d    movd    %xmm15,%r15d    movq nb303_VFtab(%rbp),%rsi    ## calculate eps    subps     %xmm2,%xmm0    subps     %xmm5,%xmm3    subps     %xmm8,%xmm6    movaps    %xmm0,nb303_epsH1(%rsp)    movaps    %xmm3,nb303_epsH2(%rsp)    movaps    %xmm6,nb303_epsM(%rsp)    ## Load LOTS of table data        movlps (%rsi,%rax,4),%xmm1        movlps (%rsi,%r8,4),%xmm5        movlps (%rsi,%r12,4),%xmm9        movlps (%rsi,%rcx,4),%xmm3        movlps (%rsi,%r10,4),%xmm7        movlps (%rsi,%r14,4),%xmm11        movhps (%rsi,%rbx,4),%xmm1        movhps (%rsi,%r9,4),%xmm5        movhps (%rsi,%r13,4),%xmm9        movhps (%rsi,%rdx,4),%xmm3        movhps (%rsi,%r11,4),%xmm7        movhps (%rsi,%r15,4),%xmm11    movaps %xmm1,%xmm0    movaps %xmm5,%xmm4    movaps %xmm9,%xmm8        shufps $136,%xmm3,%xmm0 ## 10001000        shufps $136,%xmm7,%xmm4 ## 10001000        shufps $136,%xmm11,%xmm8 ## 10001000        shufps $221,%xmm3,%xmm1 ## 11011101        shufps $221,%xmm7,%xmm5 ## 11011101        shufps $221,%xmm11,%xmm9 ## 11011101        movlps 8(%rsi,%rax,4),%xmm3        movlps 8(%rsi,%r8,4),%xmm7        movlps 8(%rsi,%r12,4),%xmm11        movlps 8(%rsi,%rcx,4),%xmm12        movlps 8(%rsi,%r10,4),%xmm13        movlps 8(%rsi,%r14,4),%xmm14        movhps 8(%rsi,%rbx,4),%xmm3        movhps 8(%rsi,%r9,4),%xmm7        movhps 8(%rsi,%r13,4),%xmm11        movhps 8(%rsi,%rdx,4),%xmm12        movhps 8(%rsi,%r11,4),%xmm13        movhps 8(%rsi,%r15,4),%xmm14    movaps %xmm3,%xmm2    movaps %xmm7,%xmm6    movaps %xmm11,%xmm10        shufps $136,%xmm12,%xmm2 ## 10001000        shufps $136,%xmm13,%xmm6 ## 10001000        shufps $136,%xmm14,%xmm10 ## 10001000        shufps $221,%xmm12,%xmm3 ## 11011101        shufps $221,%xmm13,%xmm7 ## 11011101        shufps $221,%xmm14,%xmm11 ## 11011101    ## table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11    movaps nb303_epsH1(%rsp),%xmm12    movaps nb303_epsH2(%rsp),%xmm13    movaps nb303_epsM(%rsp),%xmm14    mulps  %xmm12,%xmm3  ## Heps    mulps  %xmm13,%xmm7    mulps  %xmm14,%xmm11    mulps  %xmm12,%xmm2  ## Geps    mulps  %xmm13,%xmm6    mulps  %xmm14,%xmm10    mulps  %xmm12,%xmm3  ## Heps2    mulps  %xmm13,%xmm7    mulps  %xmm14,%xmm11    addps  %xmm2,%xmm1  ## F+Geps    addps  %xmm6,%xmm5    addps  %xmm10,%xmm9    addps  %xmm3,%xmm1  ## F+Geps+Heps2 = Fp    addps  %xmm7,%xmm5    addps  %xmm11,%xmm9    addps  %xmm3,%xmm3   ## 2*Heps2    addps  %xmm7,%xmm7    addps  %xmm11,%xmm11    addps  %xmm2,%xmm3   ## 2*Heps2+Geps    addps  %xmm6,%xmm7    addps  %xmm10,%xmm11    addps  %xmm1,%xmm3  ## FF = Fp + 2*Heps2 + Geps    addps  %xmm5,%xmm7    addps  %xmm9,%xmm11    mulps  %xmm12,%xmm1  ## eps*Fp    mulps  %xmm13,%xmm5    mulps  %xmm14,%xmm9    movaps nb303_qqH(%rsp),%xmm12    movaps nb303_qqM(%rsp),%xmm13    addps  %xmm0,%xmm1    ## VV    addps  %xmm4,%xmm5    addps  %xmm8,%xmm9    mulps  %xmm12,%xmm1  ## VV*qq = vcoul    mulps  %xmm12,%xmm5    mulps  %xmm13,%xmm9    mulps  %xmm12,%xmm3   ## FF*qq = fij    mulps  %xmm12,%xmm7    mulps  %xmm13,%xmm11    ## accumulate vctot    addps  nb303_vctot(%rsp),%xmm1    addps  %xmm9,%xmm5    addps  %xmm5,%xmm1    movaps %xmm1,nb303_vctot(%rsp)    movaps nb303_tsc(%rsp),%xmm10    mulps  %xmm10,%xmm3 ## fscal    mulps  %xmm10,%xmm7    mulps  %xmm11,%xmm10    movd %mm0,%eax    movd %mm1,%ebx    movd %mm2,%ecx    movd %mm3,%edx        ## move j forces to local temp variables     movlps (%rdi,%rax,4),%xmm11 ## jxa jya  -   -    movlps (%rdi,%rcx,4),%xmm12 ## jxc jyc  -   -    movhps (%rdi,%rbx,4),%xmm11 ## jxa jya jxb jyb     movhps (%rdi,%rdx,4),%xmm12 ## jxc jyc jxd jyd     movss  8(%rdi,%rax,4),%xmm13    ## jza  -  -  -    movss  8(%rdi,%rcx,4),%xmm14    ## jzc  -  -  -    movss  8(%rdi,%rbx,4),%xmm2     ## jzb    movss  8(%rdi,%rdx,4),%xmm5     ## jzd    movlhps %xmm2,%xmm13 ## jza  -  jzb  -    movlhps %xmm5,%xmm14 ## jzc  -  jzd -    shufps $136,%xmm14,%xmm13 ## 10001000 => jza jzb jzc jzd    ## xmm11: jxa jya jxb jyb     ## xmm12: jxc jyc jxd jyd    ## xmm13: jza jzb jzc jzd    xorps  %xmm0,%xmm0    xorps  %xmm4,%xmm4    xorps  %xmm8,%xmm8    mulps  nb303_rinvH1(%rsp),%xmm3    mulps  nb303_rinvH2(%rsp),%xmm7    mulps  nb303_rinvM(%rsp),%xmm10    subps  %xmm3,%xmm0    subps  %xmm7,%xmm4    subps  %xmm10,%xmm8    movaps %xmm0,%xmm1    movaps %xmm0,%xmm2    movaps %xmm4,%xmm3    movaps %xmm4,%xmm5    movaps %xmm8,%xmm6    movaps %xmm8,%xmm7        mulps nb303_dxH1(%rsp),%xmm0        mulps nb303_dyH1(%rsp),%xmm1        mulps nb303_dzH1(%rsp),%xmm2        mulps nb303_dxH2(%rsp),%xmm3        mulps nb303_dyH2(%rsp),%xmm4        mulps nb303_dzH2(%rsp),%xmm5        mulps nb303_dxM(%rsp),%xmm6        mulps nb303_dyM(%rsp),%xmm7        mulps nb303_dzM(%rsp),%xmm8    movaps %xmm0,%xmm14    movaps %xmm1,%xmm15    addps %xmm2,%xmm13    addps nb303_fixH1(%rsp),%xmm0    addps nb303_fiyH1(%rsp),%xmm1    addps nb303_fizH1(%rsp),%xmm2    addps %xmm3,%xmm14    addps %xmm4,%xmm15    addps %xmm5,%xmm13    addps nb303_fixH2(%rsp),%xmm3    addps nb303_fiyH2(%rsp),%xmm4    addps nb303_fizH2(%rsp),%xmm5    addps %xmm6,%xmm14    addps %xmm7,%xmm15    addps %xmm8,%xmm13    addps nb303_fixM(%rsp),%xmm6    addps nb303_fiyM(%rsp),%xmm7    addps nb303_fizM(%rsp),%xmm8    movaps %xmm0,nb303_fixH1(%rsp)    movaps %xmm1,nb303_fiyH1(%rsp)    movaps %xmm2,nb303_fizH1(%rsp)    movaps %xmm3,nb303_fixH2(%rsp)    movaps %xmm4,nb303_fiyH2(%rsp)    movaps %xmm5,nb303_fizH2(%rsp)    movaps %xmm6,nb303_fixM(%rsp)    movaps %xmm7,nb303_fiyM(%rsp)    movaps %xmm8,nb303_fizM(%rsp)    ## xmm14 = fjx    ## xmm15 = fjy    ## xmm13 = fjz    movaps %xmm14,%xmm0    unpcklps %xmm15,%xmm14    unpckhps %xmm15,%xmm0    addps  %xmm14,%xmm11    addps  %xmm0,%xmm12    movhlps  %xmm13,%xmm14 ## fjzc fjzd    movlps %xmm11,(%rdi,%rax,4)    movhps %xmm11,(%rdi,%rbx,4)    movlps %xmm12,(%rdi,%rcx,4)    movhps %xmm12,(%rdi,%rdx,4)    movss  %xmm13,8(%rdi,%rax,4)    movss  %xmm14,8(%rdi,%rcx,4)    shufps $1,%xmm13,%xmm13    shufps $1,%xmm14,%xmm14    movss  %xmm13,8(%rdi,%rbx,4)    movss  %xmm14,8(%rdi,%rdx,4)        ## should we do one more iteration?         subl $4,nb303_innerk(%rsp)        jl    _nb_kernel303_x86_64_sse.nb303_odd_inner        jmp   _nb_kernel303_x86_64_sse.nb303_unroll_loop_nb_kernel303_x86_64_sse.nb303_odd_inner:         addl $4,nb303_innerk(%rsp)        jnz   _nb_kernel303_x86_64_sse.nb303_odd_loop        jmp   _nb_kernel303_x86_64_sse.nb303_updateouterdata_nb_kernel303_x86_64_sse.nb303_odd_loop:         movq  nb303_innerjjnr(%rsp),%rdx        ## pointer to jjnr[k]         movl  (%rdx),%eax        addq $4,nb303_innerjjnr(%rsp)        xorps %xmm4,%xmm4        movss nb303_iqM(%rsp),%xmm4        movq nb303_charge(%rbp),%rsi        movhps nb303_iqH(%rsp),%xmm4        movss (%rsi,%rax,4),%xmm3       ## charge in xmm3         shufps $0,%xmm3,%xmm3        mulps %xmm4,%xmm3        movaps %xmm3,nb303_qqM(%rsp)    ## use dummy qq for storage         movq nb303_pos(%rbp),%rsi        lea  (%rax,%rax,2),%rax        ## move j coords to xmm0-xmm2         movss (%rsi,%rax,4),%xmm3        movss 4(%rsi,%rax,4),%xmm4        movss 8(%rsi,%rax,4),%xmm5        shufps $0,%xmm3,%xmm3        shufps $0,%xmm4,%xmm4        shufps $0,%xmm5,%xmm5        movss nb303_ixM(%rsp),%xmm0        movss nb303_iyM(%rsp),%xmm1        movss nb303_izM(%rsp),%xmm2        movlps nb303_ixH1(%rsp),%xmm6        movlps nb303_ixH2(%rsp),%xmm7        unpcklps %xmm7,%xmm6        movlhps %xmm6,%xmm0        movlps nb303_iyH1(%rsp),%xmm6        movlps nb303_iyH2(%rsp),%xmm7        unpcklps %xmm7,%xmm6        movlhps %xmm6,%xmm1        movlps nb303_izH1(%rsp),%xmm6        movlps nb303_izH2(%rsp),%xmm7        unpcklps %xmm7,%xmm6        movlhps %xmm6,%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        ## use dummy dx for storage        movaps %xmm3,nb303_dxM(%rsp)        movaps %xmm4,nb303_dyM(%rsp)        movaps %xmm5,nb303_dzM(%rsp)        mulps  %xmm3,%xmm3        mulps  %xmm4,%xmm4        mulps  %xmm5,%xmm5        addps  %xmm3,%xmm4        addps  %xmm5,%xmm4        ## rsq in xmm4         rsqrtps %xmm4,%xmm5        ## lookup seed in xmm5         movaps %xmm5,%xmm2        mulps %xmm5,%xmm5        movaps nb303_three(%rsp),%xmm1        mulps %xmm4,%xmm5       ## rsq*lu*lu                            movaps nb303_half(%rsp),%xmm0        subps %xmm5,%xmm1       ## 30-rsq*lu*lu         mulps %xmm2,%xmm1        mulps %xmm1,%xmm0       ## xmm0=rinv         ## a little trick to avoid NaNs:         ## positions 0,2,and 3 are valid, but not 1.         ## If it contains NaN it doesnt help to mult by 0,         ## So we shuffle it and copy pos 0 to pos1!         shufps $224,%xmm0,%xmm0 ## 11100000              mulps %xmm0,%xmm4       ## xmm4=r         movaps %xmm0,nb303_rinvM(%rsp)        mulps nb303_tsc(%rsp),%xmm4        movhlps %xmm4,%xmm7        cvttps2pi %xmm4,%mm6        cvttps2pi %xmm7,%mm7    ## mm6/mm7 contain lu indices         cvtpi2ps %mm6,%xmm3        cvtpi2ps %mm7,%xmm7        movlhps %xmm7,%xmm3        subps   %xmm3,%xmm4        movaps %xmm4,%xmm1      ## xmm1=eps         movaps %xmm1,%xmm2        mulps  %xmm2,%xmm2      ## xmm2=eps2         pslld $2,%mm6        pslld $2,%mm7        movd %eax,%mm0        movd %ecx,%mm1        movd %edx,%mm2        movq nb303_VFtab(%rbp),%rsi        movd %mm6,%eax        movd %mm7,%ecx        psrlq $32,%mm7        movd %mm7,%edx        movlps (%rsi,%rax,4),%xmm5        movlps (%rsi,%rcx,4),%xmm7        movhps (%rsi,%rdx,4),%xmm7 ## got half coulomb table         movaps %xmm5,%xmm4        shufps $136,%xmm7,%xmm4 ## 10001000        shufps $221,%xmm7,%xmm5 ## 11011101        movlps 8(%rsi,%rax,4),%xmm7        movlps 8(%rsi,%rcx,4),%xmm3        movhps 8(%rsi,%rdx,4),%xmm3    ## other half of coulomb table          movaps %xmm7,%xmm6        shufps $136,%xmm3,%xmm6 ## 10001000        shufps $221,%xmm3,%xmm7 ## 11011101        ## coulomb table ready, in xmm4-xmm7              mulps  %xmm1,%xmm6      ## xmm6=Geps         mulps  %xmm2,%xmm7      ## xmm7=Heps2         addps  %xmm6,%xmm5        addps  %xmm7,%xmm5      ## xmm5=Fp                mulps  nb303_two(%rsp),%xmm7            ## two*Heps2         movaps nb303_qqM(%rsp),%xmm0        addps  %xmm6,%xmm7        addps  %xmm5,%xmm7 ## xmm7=FF         mulps  %xmm1,%xmm5 ## xmm5=eps*Fp         addps  %xmm4,%xmm5 ## xmm5=VV         mulps  %xmm0,%xmm5 ## vcoul=qq*VV          mulps  %xmm7,%xmm0 ## fijC=FF*qq         ## at this point mm5 contains vcoul and xmm0 fijC         ## increment vcoul - then we can get rid of mm5         addps  nb303_vctot(%rsp),%xmm5        movaps %xmm5,nb303_vctot(%rsp)        xorps %xmm4,%xmm4        mulps  nb303_tsc(%rsp),%xmm0        mulps  nb303_rinvM(%rsp),%xmm0        subps  %xmm0,%xmm4        movd %mm0,%eax        movd %mm1,%ecx        movd %mm2,%edx        movaps nb303_dxM(%rsp),%xmm0        movaps nb303_dyM(%rsp),%xmm1        movaps nb303_dzM(%rsp),%xmm2        mulps  %xmm4,%xmm0        mulps  %xmm4,%xmm1        mulps  %xmm4,%xmm2 ## xmm0-xmm2 now contains tx-tz (partial force)         movss  nb303_fixM(%rsp),%xmm3        movss  nb303_fiyM(%rsp),%xmm4        movss  nb303_fizM(%rsp),%xmm5        addss  %xmm0,%xmm3        addss  %xmm1,%xmm4        addss  %xmm2,%xmm5        movss  %xmm3,nb303_fixM(%rsp)        movss  %xmm4,nb303_fiyM(%rsp)        movss  %xmm5,nb303_fizM(%rsp)   ## updated the O force now do the H's         movaps %xmm0,%xmm3        movaps %xmm1,%xmm4        movaps %xmm2,%xmm5        shufps $230,%xmm3,%xmm3 ## 11100110      ;# shift right         shufps $230,%xmm4,%xmm4 ## 11100110        shufps $230,%xmm5,%xmm5 ## 11100110        addss  nb303_fixH1(%rsp),%xmm3        addss  nb303_fiyH1(%rsp),%xmm4        addss  nb303_fizH1(%rsp),%xmm5        movss  %xmm3,nb303_fixH1(%rsp)        movss  %xmm4,nb303_fiyH1(%rsp)        movss  %xmm5,nb303_fizH1(%rsp)          ## updated the H1 force         movq nb303_faction(%rbp),%rdi        shufps $231,%xmm3,%xmm3 ## 11100111      ;# shift right         shufps $231,%xmm4,%xmm4 ## 11100111        shufps $231,%xmm5,%xmm5 ## 11100111        addss  nb303_fixH2(%rsp),%xmm3        addss  nb303_fiyH2(%rsp),%xmm4        addss  nb303_fizH2(%rsp),%xmm5        movss  %xmm3,nb303_fixH2(%rsp)        movss  %xmm4,nb303_fiyH2(%rsp)        movss  %xmm5,nb303_fizH2(%rsp)          ## updated the H2 force         ## the fj's - start by accumulating the tx/ty/tz force in xmm0, xmm1         xorps  %xmm5,%xmm5        movaps %xmm0,%xmm3        movlps (%rdi,%rax,4),%xmm6        movss  8(%rdi,%rax,4),%xmm7        unpcklps %xmm1,%xmm3        movlhps  %xmm5,%xmm3        unpckhps %xmm1,%xmm0        addps    %xmm3,%xmm0        movhlps  %xmm0,%xmm3        addps    %xmm3,%xmm0    ## x,y sum in xmm0         movhlps  %xmm2,%xmm1        addss    %xmm1,%xmm2        shufps  $1,%xmm1,%xmm1        addss    %xmm1,%xmm2    ## z sum in xmm2         addps    %xmm0,%xmm6        addss    %xmm2,%xmm7        movlps %xmm6,(%rdi,%rax,4)        movss  %xmm7,8(%rdi,%rax,4)        decl nb303_innerk(%rsp)        jz    _nb_kernel303_x86_64_sse.nb303_updateouterdata        jmp   _nb_kernel303_x86_64_sse.nb303_odd_loop_nb_kernel303_x86_64_sse.nb303_updateouterdata:         movl  nb303_ii3(%rsp),%ecx        movq  nb303_faction(%rbp),%rdi        movq  nb303_fshift(%rbp),%rsi        movl  nb303_is3(%rsp),%edx        ## accumulate  H1 i forces in xmm0, xmm1, xmm2         movaps nb303_fixH1(%rsp),%xmm0        movaps nb303_fiyH1(%rsp),%xmm1        movaps nb303_fizH1(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addps  %xmm3,%xmm0        addps  %xmm4,%xmm1

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?