nb_kernel334_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,355 行 · 第 1/5 页

S
2,355
字号
    movapd nb334_tsc(%rsp),%xmm1    mulpd  %xmm9,%xmm0 ## r    mulpd  %xmm10,%xmm3    mulpd  %xmm11,%xmm6    mulpd  %xmm1,%xmm0 ## rtab    mulpd  %xmm1,%xmm3    mulpd  %xmm1,%xmm6    ## truncate and convert to integers    cvttpd2dq %xmm0,%xmm1    cvttpd2dq %xmm3,%xmm4    cvttpd2dq %xmm6,%xmm7    ## convert back to float    cvtdq2pd  %xmm1,%xmm2    cvtdq2pd  %xmm4,%xmm5    cvtdq2pd  %xmm7,%xmm8    ## multiply by 4    pslld   $2,%xmm1    pslld   $2,%xmm4    pslld   $2,%xmm7    ## multiply by three (copy, mult. by two, add back)    movdqa  %xmm1,%xmm10    movdqa  %xmm4,%xmm11    movdqa  %xmm7,%xmm12    pslld   $1,%xmm1    pslld   $1,%xmm4    pslld   $1,%xmm7    paddd   %xmm10,%xmm1    paddd   %xmm11,%xmm4    paddd   %xmm12,%xmm7    ## move to integer registers    pshufd $1,%xmm1,%xmm13    pshufd $1,%xmm4,%xmm14    pshufd $1,%xmm7,%xmm15    movd    %xmm1,%r8d    movd    %xmm4,%r10d    movd    %xmm7,%r12d    movd    %xmm13,%r9d    movd    %xmm14,%r11d    movd    %xmm15,%r13d    movq nb334_VFtab(%rbp),%rsi    ## calculate eps    subpd     %xmm2,%xmm0    subpd     %xmm5,%xmm3    subpd     %xmm8,%xmm6    movapd    %xmm0,%xmm12 ## epsH1    movapd    %xmm3,%xmm13 ## epsH2    movapd    %xmm6,%xmm14 ## epsM    ## Load LOTS of table data    movlpd (%rsi,%r8,8),%xmm0    movlpd 8(%rsi,%r8,8),%xmm1    movlpd 16(%rsi,%r8,8),%xmm2    movlpd 24(%rsi,%r8,8),%xmm3    movlpd (%rsi,%r10,8),%xmm4    movlpd 8(%rsi,%r10,8),%xmm5    movlpd 16(%rsi,%r10,8),%xmm6    movlpd 24(%rsi,%r10,8),%xmm7    movlpd (%rsi,%r12,8),%xmm8    movlpd 8(%rsi,%r12,8),%xmm9    movlpd 16(%rsi,%r12,8),%xmm10    movlpd 24(%rsi,%r12,8),%xmm11    movhpd (%rsi,%r9,8),%xmm0    movhpd 8(%rsi,%r9,8),%xmm1    movhpd 16(%rsi,%r9,8),%xmm2    movhpd 24(%rsi,%r9,8),%xmm3    movhpd (%rsi,%r11,8),%xmm4    movhpd 8(%rsi,%r11,8),%xmm5    movhpd 16(%rsi,%r11,8),%xmm6    movhpd 24(%rsi,%r11,8),%xmm7    movhpd (%rsi,%r13,8),%xmm8    movhpd 8(%rsi,%r13,8),%xmm9    movhpd 16(%rsi,%r13,8),%xmm10    movhpd 24(%rsi,%r13,8),%xmm11    ## table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11    mulpd  %xmm12,%xmm3  ## Heps    mulpd  %xmm13,%xmm7    mulpd  %xmm14,%xmm11    mulpd  %xmm12,%xmm2  ## Geps    mulpd  %xmm13,%xmm6    mulpd  %xmm14,%xmm10    mulpd  %xmm12,%xmm3  ## Heps2    mulpd  %xmm13,%xmm7    mulpd  %xmm14,%xmm11    addpd  %xmm2,%xmm1  ## F+Geps    addpd  %xmm6,%xmm5    addpd  %xmm10,%xmm9    addpd  %xmm3,%xmm1  ## F+Geps+Heps2 = Fp    addpd  %xmm7,%xmm5    addpd  %xmm11,%xmm9    addpd  %xmm3,%xmm3   ## 2*Heps2    addpd  %xmm7,%xmm7    addpd  %xmm11,%xmm11    addpd  %xmm2,%xmm3   ## 2*Heps2+Geps    addpd  %xmm6,%xmm7    addpd  %xmm10,%xmm11    addpd  %xmm1,%xmm3  ## FF = Fp + 2*Heps2 + Geps    addpd  %xmm5,%xmm7    addpd  %xmm9,%xmm11    mulpd  %xmm12,%xmm1  ## eps*Fp    mulpd  %xmm13,%xmm5    mulpd  %xmm14,%xmm9    movapd nb334_qqMH(%rsp),%xmm12    movapd nb334_qqMM(%rsp),%xmm13    addpd  %xmm0,%xmm1    ## VV    addpd  %xmm4,%xmm5    addpd  %xmm8,%xmm9    mulpd  %xmm12,%xmm1  ## VV*qq = vcoul    mulpd  %xmm12,%xmm5    mulpd  %xmm13,%xmm9    mulpd  %xmm12,%xmm3   ## FF*qq = fij    mulpd  %xmm12,%xmm7    mulpd  %xmm13,%xmm11    ## accumulate vctot    addpd  nb334_vctot(%rsp),%xmm1    addpd  %xmm9,%xmm5    addpd  %xmm5,%xmm1    movapd %xmm1,nb334_vctot(%rsp)    movapd nb334_tsc(%rsp),%xmm10    mulpd  %xmm10,%xmm3 ## fscal    mulpd  %xmm10,%xmm7    mulpd  %xmm11,%xmm10    xorpd  %xmm4,%xmm4    xorpd  %xmm8,%xmm8    xorpd  %xmm11,%xmm11    subpd  %xmm3,%xmm4    subpd  %xmm7,%xmm8    subpd  %xmm10,%xmm11    mulpd  nb334_rinvH1M(%rsp),%xmm4    mulpd  nb334_rinvH2M(%rsp),%xmm8    mulpd  nb334_rinvMM(%rsp),%xmm11   ## move j M forces to xmm0-xmm2    movq nb334_faction(%rbp),%rdi        movlpd 72(%rdi,%rax,8),%xmm0        movlpd 80(%rdi,%rax,8),%xmm1        movlpd 88(%rdi,%rax,8),%xmm2        movhpd 72(%rdi,%rbx,8),%xmm0        movhpd 80(%rdi,%rbx,8),%xmm1        movhpd 88(%rdi,%rbx,8),%xmm2    movapd %xmm4,%xmm3    movapd %xmm4,%xmm5    movapd %xmm8,%xmm7    movapd %xmm8,%xmm9    movapd %xmm11,%xmm10    movapd %xmm11,%xmm12        mulpd nb334_dxH1M(%rsp),%xmm3        mulpd nb334_dyH1M(%rsp),%xmm4        mulpd nb334_dzH1M(%rsp),%xmm5        mulpd nb334_dxH2M(%rsp),%xmm7        mulpd nb334_dyH2M(%rsp),%xmm8        mulpd nb334_dzH2M(%rsp),%xmm9        mulpd nb334_dxMM(%rsp),%xmm10        mulpd nb334_dyMM(%rsp),%xmm11        mulpd nb334_dzMM(%rsp),%xmm12    addpd %xmm3,%xmm0    addpd %xmm4,%xmm1    addpd %xmm5,%xmm2    addpd nb334_fixH1(%rsp),%xmm3    addpd nb334_fiyH1(%rsp),%xmm4    addpd nb334_fizH1(%rsp),%xmm5    addpd %xmm7,%xmm0    addpd %xmm8,%xmm1    addpd %xmm9,%xmm2    addpd nb334_fixH2(%rsp),%xmm7    addpd nb334_fiyH2(%rsp),%xmm8    addpd nb334_fizH2(%rsp),%xmm9    addpd %xmm10,%xmm0    addpd %xmm11,%xmm1    addpd %xmm12,%xmm2    addpd nb334_fixM(%rsp),%xmm10    addpd nb334_fiyM(%rsp),%xmm11    addpd nb334_fizM(%rsp),%xmm12    movapd %xmm3,nb334_fixH1(%rsp)    movapd %xmm4,nb334_fiyH1(%rsp)    movapd %xmm5,nb334_fizH1(%rsp)    movapd %xmm7,nb334_fixH2(%rsp)    movapd %xmm8,nb334_fiyH2(%rsp)    movapd %xmm9,nb334_fizH2(%rsp)    movapd %xmm10,nb334_fixM(%rsp)    movapd %xmm11,nb334_fiyM(%rsp)    movapd %xmm12,nb334_fizM(%rsp)    ## store back j M forces from xmm0-xmm2        movlpd %xmm0,72(%rdi,%rax,8)        movlpd %xmm1,80(%rdi,%rax,8)        movlpd %xmm2,88(%rdi,%rax,8)        movhpd %xmm0,72(%rdi,%rbx,8)        movhpd %xmm1,80(%rdi,%rbx,8)        movhpd %xmm2,88(%rdi,%rbx,8)        ## should we do one more iteration?         subl $2,nb334_innerk(%rsp)        jl    _nb_kernel334_x86_64_sse2.nb334_checksingle        jmp   _nb_kernel334_x86_64_sse2.nb334_unroll_loop_nb_kernel334_x86_64_sse2.nb334_checksingle:         movl  nb334_innerk(%rsp),%edx        andl  $1,%edx        jnz   _nb_kernel334_x86_64_sse2.nb334_dosingle        jmp   _nb_kernel334_x86_64_sse2.nb334_updateouterdata_nb_kernel334_x86_64_sse2.nb334_dosingle:         movq  nb334_innerjjnr(%rsp),%rdx       ## pointer to jjnr[k]         movl  (%rdx),%eax        movq nb334_pos(%rbp),%rsi        ## base of pos[]         lea  (%rax,%rax,2),%rax     ## replace jnr with j3         ## load j O coordinates    movsd (%rsi,%rax,8),%xmm4    movsd 8(%rsi,%rax,8),%xmm5    movsd 16(%rsi,%rax,8),%xmm6    ## xmm4 = Ox    ## xmm5 = Oy    ## xmm6 = Oz    subsd nb334_ixO(%rsp),%xmm4    subsd nb334_iyO(%rsp),%xmm5    subsd nb334_izO(%rsp),%xmm6    ## store dx/dy/dz    movapd %xmm4,%xmm13    movapd %xmm5,%xmm14    movapd %xmm6,%xmm15    ## square it        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        mulsd  %xmm6,%xmm6        addsd  %xmm5,%xmm4        addsd  %xmm6,%xmm4    ## rsq in xmm4        cvtsd2ss %xmm4,%xmm5        rsqrtss %xmm5,%xmm5        cvtss2sd %xmm5,%xmm2    ## lu in low xmm2         ## lookup seed in xmm2         movapd %xmm2,%xmm5      ## copy of lu         mulsd %xmm2,%xmm2       ## lu*lu         movapd nb334_three(%rsp),%xmm1        mulsd %xmm4,%xmm2       ## rsq*lu*lu                            movapd nb334_half(%rsp),%xmm0        subsd %xmm2,%xmm1       ## 30-rsq*lu*lu         mulsd %xmm5,%xmm1        mulsd %xmm0,%xmm1       ## xmm0=iter1 of rinv (new lu)         movapd %xmm1,%xmm5      ## copy of lu         mulsd %xmm1,%xmm1       ## lu*lu         movapd nb334_three(%rsp),%xmm2        mulsd %xmm4,%xmm1       ## rsq*lu*lu                            movapd nb334_half(%rsp),%xmm0        subsd %xmm1,%xmm2       ## 30-rsq*lu*lu         mulsd %xmm5,%xmm2        mulsd %xmm0,%xmm2       ## xmm0=iter2 of rinv (new lu)         mulsd %xmm2,%xmm4       ## xmm4=r         mulsd nb334_tsc(%rsp),%xmm4        cvttsd2si %xmm4,%r10d   ## mm6 = lu idx         cvtsi2sd %r10d,%xmm5        subsd %xmm5,%xmm4        movapd %xmm4,%xmm1    ## xmm1=eps     ## xmm2=rinv    movapd %xmm4,%xmm3  ## eps        shll $2,%r10d           ## idx *= 4         movq nb334_VFtab(%rbp),%rsi    ## multiply by 3        lea  (%r10,%r10,2),%r10    ## indices in r10, r11. Load dispersion and repulsion tables in parallel.    ## NB: We are using a combined (coul+lj) table, so LJ data is offest    ## 4*8=32 bytes.    movsd 32(%rsi,%r10,8),%xmm4    movsd 40(%rsi,%r10,8),%xmm5    movsd 48(%rsi,%r10,8),%xmm6    movsd 56(%rsi,%r10,8),%xmm7    movsd 64(%rsi,%r10,8),%xmm8    movsd 72(%rsi,%r10,8),%xmm9    movsd 80(%rsi,%r10,8),%xmm10    movsd 88(%rsi,%r10,8),%xmm11        ## tables ready, in xmm4-xmm7 and xmm8-xmm11    mulsd  %xmm1,%xmm7   ## Heps    mulsd  %xmm1,%xmm11    mulsd  %xmm1,%xmm6  ## Geps    mulsd  %xmm1,%xmm10    mulsd  %xmm1,%xmm7  ## Heps2    mulsd  %xmm1,%xmm11    addsd  %xmm6,%xmm5 ## F+Geps    addsd  %xmm10,%xmm9    addsd  %xmm7,%xmm5  ## F+Geps+Heps2 = Fp    addsd  %xmm11,%xmm9    addsd  %xmm7,%xmm7   ## 2*Heps2    addsd  %xmm11,%xmm11    addsd  %xmm6,%xmm7  ## 2*Heps2+Geps    addsd  %xmm10,%xmm11    addsd  %xmm5,%xmm7 ## FF = Fp + 2*Heps2 + Geps    addsd  %xmm9,%xmm11    mulsd  %xmm1,%xmm5 ## eps*Fp    mulsd  %xmm1,%xmm9    addsd  %xmm4,%xmm5 ## VV    addsd  %xmm8,%xmm9    mulsd  nb334_c6(%rsp),%xmm5    ## VV*c6 = vnb6    mulsd  nb334_c12(%rsp),%xmm9    ## VV*c12 = vnb12    addsd  %xmm9,%xmm5    addsd  nb334_Vvdwtot(%rsp),%xmm5    movsd %xmm5,nb334_Vvdwtot(%rsp)    mulsd  nb334_c6(%rsp),%xmm7     ## FF*c6 = fnb6    mulsd  nb334_c12(%rsp),%xmm11     ## FF*c12  = fnb12    addsd  %xmm11,%xmm7    mulsd  nb334_tsc(%rsp),%xmm7    mulsd  %xmm2,%xmm7    xorpd  %xmm9,%xmm9    subsd  %xmm7,%xmm9    mulsd %xmm9,%xmm13    mulsd %xmm9,%xmm14    mulsd %xmm9,%xmm15    movapd nb334_fixO(%rsp),%xmm0    movapd nb334_fiyO(%rsp),%xmm1    movapd nb334_fizO(%rsp),%xmm2    ## accumulate i forces    addsd %xmm13,%xmm0    addsd %xmm14,%xmm1    addsd %xmm15,%xmm2    movsd %xmm0,nb334_fixO(%rsp)    movsd %xmm1,nb334_fiyO(%rsp)    movsd %xmm2,nb334_fizO(%rsp)        ## the fj's - start by accumulating forces from memory     movq nb334_faction(%rbp),%rdi        movsd (%rdi,%rax,8),%xmm3        movsd 8(%rdi,%rax,8),%xmm4        movsd 16(%rdi,%rax,8),%xmm5        addsd %xmm13,%xmm3        addsd %xmm14,%xmm4        addsd %xmm15,%xmm5        movsd %xmm3,(%rdi,%rax,8)        movsd %xmm4,8(%rdi,%rax,8)        movsd %xmm5,16(%rdi,%rax,8)    ## done with OO interaction    ## move j H1 coordinates to local temp variables     movq nb334_pos(%rbp),%rsi    movsd 24(%rsi,%rax,8),%xmm0    movsd 32(%rsi,%rax,8),%xmm1    movsd 40(%rsi,%rax,8),%xmm2    ## xmm0 = H1x    ## xmm1 = H1y    ## xmm2 = H1z    movapd %xmm0,%xmm3    movapd %xmm1,%xmm4    movapd %xmm2,%xmm5    movapd %xmm0,%xmm6    movapd %xmm1,%xmm7    movapd %xmm2,%xmm8    subsd nb334_ixH1(%rsp),%xmm0    subsd nb334_iyH1(%rsp),%xmm1    subsd nb334_izH1(%rsp),%xmm2    subsd nb334_ixH2(%rsp),%xmm3    subsd nb334_iyH2(%rsp),%xmm4    subsd nb334_izH2(%rsp),%xmm5    subsd nb334_ixM(%rsp),%xmm6    subsd nb334_iyM(%rsp),%xmm7    subsd nb334_izM(%rsp),%xmm8        movapd %xmm0,nb334_dxH1H1(%rsp)        movapd %xmm1,nb334_dyH1H1(%rsp)        movapd %xmm2,nb334_dzH1H1(%rsp)        mulsd  %xmm0,%xmm0        mulsd  %xmm1,%xmm1        mulsd  %xmm2,%xmm2        movapd %xmm3,nb334_dxH2H1(%rsp)        movapd %xmm4,nb334_dyH2H1(%rsp)        movapd %xmm5,nb334_dzH2H1(%rsp)        mulsd  %xmm3,%xmm3        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        movapd %xmm6,nb334_dxMH1(%rsp)        movapd %xmm7,nb334_dyMH1(%rsp)        movapd %xmm8,nb334_dzMH1(%rsp)        mulsd  %xmm6,%xmm6        mulsd  %xmm7,%xmm7        mulsd  %xmm8,%xmm8        addsd  %xmm1,%xmm0        addsd  %xmm2,%xmm0        addsd  %xmm4,%xmm3        addsd  %xmm5,%xmm3    addsd  %xmm7,%xmm6    addsd  %xmm8,%xmm6        ## start doing invsqrt for jH1 atoms    cvtsd2ss %xmm0,%xmm1    cvtsd2ss %xmm3,%xmm4    cvtsd2ss %xmm6,%xmm7        rsqrtss %xmm1,%xmm1        rsqrtss %xmm4,%xmm4    rsqrtss %xmm7,%xmm7    cvtss2sd %xmm1,%xmm1    cvtss2sd %xmm4,%xmm4    cvtss2sd %xmm7,%xmm7        movapd  %xmm1,%xmm2        movapd  %xmm4,%xmm5    movapd  %xmm7,%xmm8        mulsd   %xmm1,%xmm1 ## lu*lu        mulsd   %xmm4,%xmm4 ## lu*lu    mulsd   %xmm7,%xmm7 ## lu*lu        movapd  nb334_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulsd   %xmm0,%xmm1 ## rsq*lu*lu        mulsd   %xmm3,%xmm4 ## rsq*lu*lu     mulsd   %xmm6,%xmm7 ## rsq*lu*lu        subsd   %xmm1,%xmm9        subsd   %xmm4,%xmm10    subsd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulsd   %xmm2,%xmm9        mulsd   %xmm5,%xmm10    mulsd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb334_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ## first iteration for rinvH1H1         mulsd   %xmm15,%xmm10 ## first iteration for rinvH2H1    mulsd   %xmm15,%xmm11 ## first iteration for rinvMH1     ## second iteration step            movapd  %xmm9,%xmm2

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?