nb_kernel334_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,355 行 · 第 1/5 页

S
2,355
字号
        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulsd   %xmm2,%xmm2 ## lu*lu        mulsd   %xmm5,%xmm5 ## lu*lu    mulsd   %xmm8,%xmm8 ## lu*lu        movapd  nb334_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulsd   %xmm0,%xmm2 ## rsq*lu*lu        mulsd   %xmm3,%xmm5 ## rsq*lu*lu     mulsd   %xmm6,%xmm8 ## rsq*lu*lu        subsd   %xmm2,%xmm1        subsd   %xmm5,%xmm4    subsd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulsd   %xmm1,%xmm9        mulsd   %xmm4,%xmm10    mulsd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb334_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ##  rinvH1H1         mulsd   %xmm15,%xmm10 ##   rinvH2H1    mulsd   %xmm15,%xmm11 ##   rinvMH1        movapd  %xmm9,nb334_rinvH1H1(%rsp)        movapd  %xmm10,nb334_rinvH2H1(%rsp)        movapd  %xmm11,nb334_rinvMH1(%rsp)        ## H1 interactions     ## rsq in xmm0,xmm3,xmm6      ## rinv in xmm9, xmm10, xmm11    movapd nb334_tsc(%rsp),%xmm1    mulsd  %xmm9,%xmm0 ## r    mulsd  %xmm10,%xmm3    mulsd  %xmm11,%xmm6    mulsd  %xmm1,%xmm0 ## rtab    mulsd  %xmm1,%xmm3    mulsd  %xmm1,%xmm6    ## truncate and convert to integers    cvttsd2si %xmm0,%r8d    cvttsd2si %xmm3,%r10d    cvttsd2si %xmm6,%r12d    ## convert back to float    cvtsi2sd  %r8d,%xmm2    cvtsi2sd  %r10d,%xmm5    cvtsi2sd  %r12d,%xmm8    ## multiply by 4    shll $2,%r8d    shll $2,%r10d    shll $2,%r12d    lea (%r8,%r8,2),%r8    lea (%r10,%r10,2),%r10    lea (%r12,%r12,2),%r12    movq nb334_VFtab(%rbp),%rsi    ## calculate eps    subsd     %xmm2,%xmm0    subsd     %xmm5,%xmm3    subsd     %xmm8,%xmm6    movapd    %xmm0,%xmm12 ## epsH1    movapd    %xmm3,%xmm13 ## epsH2    movapd    %xmm6,%xmm14 ## epsM    ## Load LOTS of table data    movsd (%rsi,%r8,8),%xmm0    movsd 8(%rsi,%r8,8),%xmm1    movsd 16(%rsi,%r8,8),%xmm2    movsd 24(%rsi,%r8,8),%xmm3    movsd (%rsi,%r10,8),%xmm4    movsd 8(%rsi,%r10,8),%xmm5    movsd 16(%rsi,%r10,8),%xmm6    movsd 24(%rsi,%r10,8),%xmm7    movsd (%rsi,%r12,8),%xmm8    movsd 8(%rsi,%r12,8),%xmm9    movsd 16(%rsi,%r12,8),%xmm10    movsd 24(%rsi,%r12,8),%xmm11    ## table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11    mulsd  %xmm12,%xmm3  ## Heps    mulsd  %xmm13,%xmm7    mulsd  %xmm14,%xmm11    mulsd  %xmm12,%xmm2  ## Geps    mulsd  %xmm13,%xmm6    mulsd  %xmm14,%xmm10    mulsd  %xmm12,%xmm3  ## Heps2    mulsd  %xmm13,%xmm7    mulsd  %xmm14,%xmm11    addsd  %xmm2,%xmm1  ## F+Geps    addsd  %xmm6,%xmm5    addsd  %xmm10,%xmm9    addsd  %xmm3,%xmm1  ## F+Geps+Heps2 = Fp    addsd  %xmm7,%xmm5    addsd  %xmm11,%xmm9    addsd  %xmm3,%xmm3   ## 2*Heps2    addsd  %xmm7,%xmm7    addsd  %xmm11,%xmm11    addsd  %xmm2,%xmm3   ## 2*Heps2+Geps    addsd  %xmm6,%xmm7    addsd  %xmm10,%xmm11    addsd  %xmm1,%xmm3  ## FF = Fp + 2*Heps2 + Geps    addsd  %xmm5,%xmm7    addsd  %xmm9,%xmm11    mulsd  %xmm12,%xmm1  ## eps*Fp    mulsd  %xmm13,%xmm5    mulsd  %xmm14,%xmm9    movapd nb334_qqHH(%rsp),%xmm12    movapd nb334_qqMH(%rsp),%xmm13    addsd  %xmm0,%xmm1    ## VV    addsd  %xmm4,%xmm5    addsd  %xmm8,%xmm9    mulsd  %xmm12,%xmm1  ## VV*qq = vcoul    mulsd  %xmm12,%xmm5    mulsd  %xmm13,%xmm9    mulsd  %xmm12,%xmm3   ## FF*qq = fij    mulsd  %xmm12,%xmm7    mulsd  %xmm13,%xmm11    ## accumulate vctot    addsd  nb334_vctot(%rsp),%xmm1    addsd  %xmm9,%xmm5    addsd  %xmm5,%xmm1    movsd %xmm1,nb334_vctot(%rsp)    movapd nb334_tsc(%rsp),%xmm10    mulsd  %xmm10,%xmm3    mulsd  %xmm10,%xmm7    mulsd  %xmm11,%xmm10    xorpd  %xmm4,%xmm4    xorpd  %xmm8,%xmm8    xorpd  %xmm11,%xmm11    subsd  %xmm3,%xmm4    subsd  %xmm7,%xmm8    subsd  %xmm10,%xmm11    mulsd  nb334_rinvH1H1(%rsp),%xmm4    mulsd  nb334_rinvH2H1(%rsp),%xmm8    mulsd  nb334_rinvMH1(%rsp),%xmm11    ## move j H1 forces to xmm0-xmm2    movq nb334_faction(%rbp),%rdi        movsd 24(%rdi,%rax,8),%xmm0        movsd 32(%rdi,%rax,8),%xmm1        movsd 40(%rdi,%rax,8),%xmm2    movapd %xmm4,%xmm3    movapd %xmm4,%xmm5    movapd %xmm8,%xmm7    movapd %xmm8,%xmm9    movapd %xmm11,%xmm10    movapd %xmm11,%xmm12        mulpd nb334_dxH1H1(%rsp),%xmm3        mulsd nb334_dyH1H1(%rsp),%xmm4        mulsd nb334_dzH1H1(%rsp),%xmm5        mulsd nb334_dxH2H1(%rsp),%xmm7        mulsd nb334_dyH2H1(%rsp),%xmm8        mulsd nb334_dzH2H1(%rsp),%xmm9        mulsd nb334_dxMH1(%rsp),%xmm10        mulsd nb334_dyMH1(%rsp),%xmm11        mulsd nb334_dzMH1(%rsp),%xmm12    addsd %xmm3,%xmm0    addsd %xmm4,%xmm1    addsd %xmm5,%xmm2    addsd nb334_fixH1(%rsp),%xmm3    addsd nb334_fiyH1(%rsp),%xmm4    addsd nb334_fizH1(%rsp),%xmm5    addsd %xmm7,%xmm0    addsd %xmm8,%xmm1    addsd %xmm9,%xmm2    addsd nb334_fixH2(%rsp),%xmm7    addsd nb334_fiyH2(%rsp),%xmm8    addsd nb334_fizH2(%rsp),%xmm9    addsd %xmm10,%xmm0    addsd %xmm11,%xmm1    addsd %xmm12,%xmm2    addsd nb334_fixM(%rsp),%xmm10    addsd nb334_fiyM(%rsp),%xmm11    addsd nb334_fizM(%rsp),%xmm12    movsd %xmm3,nb334_fixH1(%rsp)    movsd %xmm4,nb334_fiyH1(%rsp)    movsd %xmm5,nb334_fizH1(%rsp)    movsd %xmm7,nb334_fixH2(%rsp)    movsd %xmm8,nb334_fiyH2(%rsp)    movsd %xmm9,nb334_fizH2(%rsp)    movsd %xmm10,nb334_fixM(%rsp)    movsd %xmm11,nb334_fiyM(%rsp)    movsd %xmm12,nb334_fizM(%rsp)    ## store back j H1 forces from xmm0-xmm2        movsd %xmm0,24(%rdi,%rax,8)        movsd %xmm1,32(%rdi,%rax,8)        movsd %xmm2,40(%rdi,%rax,8)        ## move j H2 coordinates to local temp variables     movq nb334_pos(%rbp),%rsi    movsd 48(%rsi,%rax,8),%xmm0    movsd 56(%rsi,%rax,8),%xmm1    movsd 64(%rsi,%rax,8),%xmm2    ## xmm0 = H2x    ## xmm1 = H2y    ## xmm2 = H2z    movapd %xmm0,%xmm3    movapd %xmm1,%xmm4    movapd %xmm2,%xmm5    movapd %xmm0,%xmm6    movapd %xmm1,%xmm7    movapd %xmm2,%xmm8    subsd nb334_ixH1(%rsp),%xmm0    subsd nb334_iyH1(%rsp),%xmm1    subsd nb334_izH1(%rsp),%xmm2    subsd nb334_ixH2(%rsp),%xmm3    subsd nb334_iyH2(%rsp),%xmm4    subsd nb334_izH2(%rsp),%xmm5    subsd nb334_ixM(%rsp),%xmm6    subsd nb334_iyM(%rsp),%xmm7    subsd nb334_izM(%rsp),%xmm8        movapd %xmm0,nb334_dxH1H2(%rsp)        movapd %xmm1,nb334_dyH1H2(%rsp)        movapd %xmm2,nb334_dzH1H2(%rsp)        mulsd  %xmm0,%xmm0        mulsd  %xmm1,%xmm1        mulsd  %xmm2,%xmm2        movapd %xmm3,nb334_dxH2H2(%rsp)        movapd %xmm4,nb334_dyH2H2(%rsp)        movapd %xmm5,nb334_dzH2H2(%rsp)        mulsd  %xmm3,%xmm3        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        movapd %xmm6,nb334_dxMH2(%rsp)        movapd %xmm7,nb334_dyMH2(%rsp)        movapd %xmm8,nb334_dzMH2(%rsp)        mulsd  %xmm6,%xmm6        mulsd  %xmm7,%xmm7        mulsd  %xmm8,%xmm8        addsd  %xmm1,%xmm0        addsd  %xmm2,%xmm0        addsd  %xmm4,%xmm3        addsd  %xmm5,%xmm3    addsd  %xmm7,%xmm6    addsd  %xmm8,%xmm6        ## start doing invsqrt for jH2 atoms    cvtsd2ss %xmm0,%xmm1    cvtsd2ss %xmm3,%xmm4    cvtsd2ss %xmm6,%xmm7        rsqrtss %xmm1,%xmm1        rsqrtss %xmm4,%xmm4    rsqrtss %xmm7,%xmm7    cvtss2sd %xmm1,%xmm1    cvtss2sd %xmm4,%xmm4    cvtss2sd %xmm7,%xmm7        movapd  %xmm1,%xmm2        movapd  %xmm4,%xmm5    movapd  %xmm7,%xmm8        mulsd   %xmm1,%xmm1 ## lu*lu        mulsd   %xmm4,%xmm4 ## lu*lu    mulsd   %xmm7,%xmm7 ## lu*lu        movapd  nb334_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulsd   %xmm0,%xmm1 ## rsq*lu*lu        mulsd   %xmm3,%xmm4 ## rsq*lu*lu     mulsd   %xmm6,%xmm7 ## rsq*lu*lu        subsd   %xmm1,%xmm9        subsd   %xmm4,%xmm10    subsd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulsd   %xmm2,%xmm9        mulsd   %xmm5,%xmm10    mulsd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb334_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ## first iteration for rinvH1H2         mulsd   %xmm15,%xmm10 ## first iteration for rinvH2H2    mulsd   %xmm15,%xmm11 ## first iteration for rinvMH2    ## second iteration step            movapd  %xmm9,%xmm2        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulsd   %xmm2,%xmm2 ## lu*lu        mulsd   %xmm5,%xmm5 ## lu*lu    mulsd   %xmm8,%xmm8 ## lu*lu        movapd  nb334_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulsd   %xmm0,%xmm2 ## rsq*lu*lu        mulsd   %xmm3,%xmm5 ## rsq*lu*lu     mulsd   %xmm6,%xmm8 ## rsq*lu*lu        subsd   %xmm2,%xmm1        subsd   %xmm5,%xmm4    subsd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulsd   %xmm1,%xmm9        mulsd   %xmm4,%xmm10    mulsd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb334_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ##  rinvH1H2        mulsd   %xmm15,%xmm10 ##   rinvH2H2    mulsd   %xmm15,%xmm11 ##   rinvMH2        movapd  %xmm9,nb334_rinvH1H2(%rsp)        movapd  %xmm10,nb334_rinvH2H2(%rsp)        movapd  %xmm11,nb334_rinvMH2(%rsp)        ## H2 interactions     ## rsq in xmm0,xmm3,xmm6      ## rinv in xmm9, xmm10, xmm11    movapd nb334_tsc(%rsp),%xmm1    mulsd  %xmm9,%xmm0 ## r    mulsd  %xmm10,%xmm3    mulsd  %xmm11,%xmm6    mulsd  %xmm1,%xmm0 ## rtab    mulsd  %xmm1,%xmm3    mulsd  %xmm1,%xmm6    ## truncate and convert to integers    cvttsd2si %xmm0,%r8d    cvttsd2si %xmm3,%r10d    cvttsd2si %xmm6,%r12d    ## convert back to float    cvtsi2sd  %r8d,%xmm2    cvtsi2sd  %r10d,%xmm5    cvtsi2sd  %r12d,%xmm8    ## multiply by 4    shll $2,%r8d    shll $2,%r10d    shll $2,%r12d    lea (%r8,%r8,2),%r8    lea (%r10,%r10,2),%r10    lea (%r12,%r12,2),%r12    movq nb334_VFtab(%rbp),%rsi    ## calculate eps    subpd     %xmm2,%xmm0    subpd     %xmm5,%xmm3    subpd     %xmm8,%xmm6    movapd    %xmm0,%xmm12 ## epsH1    movapd    %xmm3,%xmm13 ## epsH2    movapd    %xmm6,%xmm14 ## epsM    ## Load LOTS of table data    movsd (%rsi,%r8,8),%xmm0    movsd 8(%rsi,%r8,8),%xmm1    movsd 16(%rsi,%r8,8),%xmm2    movsd 24(%rsi,%r8,8),%xmm3    movsd (%rsi,%r10,8),%xmm4    movsd 8(%rsi,%r10,8),%xmm5    movsd 16(%rsi,%r10,8),%xmm6    movsd 24(%rsi,%r10,8),%xmm7    movsd (%rsi,%r12,8),%xmm8    movsd 8(%rsi,%r12,8),%xmm9    movsd 16(%rsi,%r12,8),%xmm10    movsd 24(%rsi,%r12,8),%xmm11    ## table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11    mulsd  %xmm12,%xmm3  ## Heps    mulsd  %xmm13,%xmm7    mulsd  %xmm14,%xmm11    mulsd  %xmm12,%xmm2  ## Geps    mulsd  %xmm13,%xmm6    mulsd  %xmm14,%xmm10    mulsd  %xmm12,%xmm3  ## Heps2    mulsd  %xmm13,%xmm7    mulsd  %xmm14,%xmm11    addsd  %xmm2,%xmm1  ## F+Geps    addsd  %xmm6,%xmm5    addsd  %xmm10,%xmm9    addsd  %xmm3,%xmm1  ## F+Geps+Heps2 = Fp    addsd  %xmm7,%xmm5    addsd  %xmm11,%xmm9    addsd  %xmm3,%xmm3   ## 2*Heps2    addsd  %xmm7,%xmm7    addsd  %xmm11,%xmm11    addsd  %xmm2,%xmm3   ## 2*Heps2+Geps    addsd  %xmm6,%xmm7    addsd  %xmm10,%xmm11    addsd  %xmm1,%xmm3  ## FF = Fp + 2*Heps2 + Geps    addsd  %xmm5,%xmm7    addsd  %xmm9,%xmm11    mulsd  %xmm12,%xmm1  ## eps*Fp    mulsd  %xmm13,%xmm5    mulsd  %xmm14,%xmm9    movapd nb334_qqHH(%rsp),%xmm12    movapd nb334_qqMH(%rsp),%xmm13    addsd  %xmm0,%xmm1    ## VV    addsd  %xmm4,%xmm5    addsd  %xmm8,%xmm9    mulsd  %xmm12,%xmm1  ## VV*qq = vcoul    mulsd  %xmm12,%xmm5    mulsd  %xmm13,%xmm9    mulsd  %xmm12,%xmm3   ## FF*qq = fij    mulsd  %xmm12,%xmm7    mulsd  %xmm13,%xmm11    ## accumulate vctot    addsd  nb334_vctot(%rsp),%xmm1    addsd  %xmm9,%xmm5    addsd  %xmm5,%xmm1    movsd %xmm1,nb334_vctot(%rsp)    movapd nb334_tsc(%rsp),%xmm10    mulsd  %xmm10,%xmm3 ## fscal    mulsd  %xmm10,%xmm7    mulsd  %xmm11,%xmm10    xorpd  %xmm4,%xmm4    xorpd  %xmm8,%xmm8    xorpd  %xmm11,%xmm11    subsd  %xmm3,%xmm4    subsd  %xmm7,%xmm8    subsd  %xmm10,%xmm11    mulsd  nb334_rinvH1H2(%rsp),%xmm4    mulsd  nb334_rinvH2H2(%rsp),%xmm8    mulsd  nb334_rinvMH2(%rsp),%xmm11    ## move j H2 forces to xmm0-xmm2    movq nb334_faction(%rbp),%rdi        movsd 48(%rdi,%rax,8),%xmm0        movsd 56(%rdi,%rax,8),%xmm1        movsd 64(%rdi,%rax,8),%xmm2    movapd %xmm4,%xmm3    movapd %xmm4,%xmm5    movapd %xmm8,%xmm7    movapd %xmm8,%xmm9    movapd %xmm11,%xmm10    movapd %xmm11,%xmm12       

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?