nb_kernel132_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,287 行 · 第 1/5 页

S
2,287
字号
        movapd  nb132_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulpd   %xmm0,%xmm1 ## rsq*lu*lu        mulpd   %xmm3,%xmm4 ## rsq*lu*lu     mulpd   %xmm6,%xmm7 ## rsq*lu*lu        subpd   %xmm1,%xmm9        subpd   %xmm4,%xmm10    subpd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulpd   %xmm2,%xmm9        mulpd   %xmm5,%xmm10    mulpd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb132_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ## first iteration for rinvOO         mulpd   %xmm15,%xmm10 ## first iteration for rinvH1O    mulpd   %xmm15,%xmm11 ## first iteration for rinvH2O     ## second iteration step            movapd  %xmm9,%xmm2        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulpd   %xmm2,%xmm2 ## lu*lu        mulpd   %xmm5,%xmm5 ## lu*lu    mulpd   %xmm8,%xmm8 ## lu*lu        movapd  nb132_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulpd   %xmm0,%xmm2 ## rsq*lu*lu        mulpd   %xmm3,%xmm5 ## rsq*lu*lu     mulpd   %xmm6,%xmm8 ## rsq*lu*lu        subpd   %xmm2,%xmm1        subpd   %xmm5,%xmm4    subpd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulpd   %xmm1,%xmm9        mulpd   %xmm4,%xmm10    mulpd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb132_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ##  rinvOO         mulpd   %xmm15,%xmm10 ##   rinvH1O    mulpd   %xmm15,%xmm11 ##   rinvH2O        ## O interactions     ## rsq in xmm0,xmm3,xmm6      ## rinv in xmm9, xmm10, xmm11    movapd %xmm0,nb132_rsqOO(%rsp)    movapd %xmm3,nb132_rsqOH1(%rsp)    movapd %xmm6,nb132_rsqOH2(%rsp)    movapd %xmm9,nb132_rinvOO(%rsp)    movapd %xmm10,nb132_rinvOH1(%rsp)    movapd %xmm11,nb132_rinvOH2(%rsp)    ## table LJ interaction    mulpd  %xmm9,%xmm0    mulpd  nb132_tsc(%rsp),%xmm0   ## rtab    ## truncate and convert to integers    cvttpd2dq %xmm0,%xmm1    ## convert back to float    cvtdq2pd  %xmm1,%xmm2    ## multiply by 8    pslld   $3,%xmm1    ## move to integer registers    pshufd $1,%xmm1,%xmm13    movd    %xmm1,%r8d    movd    %xmm13,%r10d    ## calculate eps    subpd     %xmm2,%xmm0    movq nb132_VFtab(%rbp),%rsi    movlpd (%rsi,%r8,8),%xmm4        movlpd 8(%rsi,%r8,8),%xmm5        movlpd 16(%rsi,%r8,8),%xmm6        movlpd 24(%rsi,%r8,8),%xmm7    movlpd 32(%rsi,%r8,8),%xmm8        movlpd 40(%rsi,%r8,8),%xmm9        movlpd 48(%rsi,%r8,8),%xmm10        movlpd 56(%rsi,%r8,8),%xmm11    movhpd (%rsi,%r10,8),%xmm4        movhpd 8(%rsi,%r10,8),%xmm5        movhpd 16(%rsi,%r10,8),%xmm6        movhpd 24(%rsi,%r10,8),%xmm7    movhpd 32(%rsi,%r10,8),%xmm8        movhpd 40(%rsi,%r10,8),%xmm9        movhpd 48(%rsi,%r10,8),%xmm10        movhpd 56(%rsi,%r10,8),%xmm11    ## dispersion table in xmm4-xmm7, repulsion table in xmm8-xmm11    mulpd  %xmm0,%xmm7   ## Heps    mulpd  %xmm0,%xmm11    mulpd  %xmm0,%xmm6  ## Geps    mulpd  %xmm0,%xmm10    mulpd  %xmm0,%xmm7  ## Heps2    mulpd  %xmm0,%xmm11    addpd  %xmm6,%xmm5 ## F+Geps    addpd  %xmm10,%xmm9    addpd  %xmm7,%xmm5  ## F+Geps+Heps2 = Fp    addpd  %xmm11,%xmm9    addpd  %xmm7,%xmm7   ## 2*Heps2    addpd  %xmm11,%xmm11    addpd  %xmm6,%xmm7  ## 2*Heps2+Geps    addpd  %xmm10,%xmm11    addpd  %xmm5,%xmm7 ## FF = Fp + 2*Heps2 + Geps    addpd  %xmm9,%xmm11    mulpd  %xmm0,%xmm5 ## eps*Fp    mulpd  %xmm0,%xmm9    movapd nb132_c6(%rsp),%xmm12    movapd nb132_c12(%rsp),%xmm13    addpd  %xmm4,%xmm5 ## VV    addpd  %xmm8,%xmm9    mulpd  %xmm12,%xmm5 ## VV*c6 = vnb6    mulpd  %xmm13,%xmm9 ## VV*c12 = vnb12    addpd  %xmm9,%xmm5    addpd  nb132_Vvdwtot(%rsp),%xmm5    movapd %xmm5,nb132_Vvdwtot(%rsp)    mulpd  %xmm12,%xmm7  ## FF*c6 = fnb6    mulpd  %xmm13,%xmm11  ## FF*c12  = fnb12    addpd  %xmm11,%xmm7    mulpd  nb132_tsc(%rsp),%xmm7    movapd nb132_rinvOO(%rsp),%xmm9    movapd nb132_rinvOH1(%rsp),%xmm10    movapd nb132_rinvOH2(%rsp),%xmm11    movapd %xmm9,%xmm0    movapd %xmm10,%xmm1    movapd %xmm11,%xmm2    mulpd  %xmm10,%xmm10    mulpd  %xmm11,%xmm11    mulpd  nb132_qqOO(%rsp),%xmm0    mulpd  nb132_qqOH(%rsp),%xmm1    mulpd  nb132_qqOH(%rsp),%xmm2    mulpd  %xmm0,%xmm9    mulpd  %xmm1,%xmm10    mulpd  %xmm2,%xmm11    subpd  %xmm7,%xmm9    mulpd  nb132_rinvOO(%rsp),%xmm9    addpd nb132_vctot(%rsp),%xmm0    addpd %xmm2,%xmm1    addpd %xmm1,%xmm0    movapd %xmm0,nb132_vctot(%rsp)    ## move j O forces to xmm0-xmm2        movq  nb132_faction(%rbp),%rdi        movlpd (%rdi,%rax,8),%xmm0        movlpd 8(%rdi,%rax,8),%xmm1        movlpd 16(%rdi,%rax,8),%xmm2        movhpd (%rdi,%rbx,8),%xmm0        movhpd 8(%rdi,%rbx,8),%xmm1        movhpd 16(%rdi,%rbx,8),%xmm2    movapd %xmm9,%xmm7    movapd %xmm9,%xmm8    movapd %xmm11,%xmm13    movapd %xmm11,%xmm14    movapd %xmm11,%xmm15    movapd %xmm10,%xmm11    movapd %xmm10,%xmm12        mulpd nb132_dxOO(%rsp),%xmm7        mulpd nb132_dyOO(%rsp),%xmm8        mulpd nb132_dzOO(%rsp),%xmm9        mulpd nb132_dxH1O(%rsp),%xmm10        mulpd nb132_dyH1O(%rsp),%xmm11        mulpd nb132_dzH1O(%rsp),%xmm12        mulpd nb132_dxH2O(%rsp),%xmm13        mulpd nb132_dyH2O(%rsp),%xmm14        mulpd nb132_dzH2O(%rsp),%xmm15    addpd %xmm7,%xmm0    addpd %xmm8,%xmm1    addpd %xmm9,%xmm2    addpd nb132_fixO(%rsp),%xmm7    addpd nb132_fiyO(%rsp),%xmm8    addpd nb132_fizO(%rsp),%xmm9    addpd %xmm10,%xmm0    addpd %xmm11,%xmm1    addpd %xmm12,%xmm2    addpd nb132_fixH1(%rsp),%xmm10    addpd nb132_fiyH1(%rsp),%xmm11    addpd nb132_fizH1(%rsp),%xmm12    addpd %xmm13,%xmm0    addpd %xmm14,%xmm1    addpd %xmm15,%xmm2    addpd nb132_fixH2(%rsp),%xmm13    addpd nb132_fiyH2(%rsp),%xmm14    addpd nb132_fizH2(%rsp),%xmm15    movapd %xmm7,nb132_fixO(%rsp)    movapd %xmm8,nb132_fiyO(%rsp)    movapd %xmm9,nb132_fizO(%rsp)    movapd %xmm10,nb132_fixH1(%rsp)    movapd %xmm11,nb132_fiyH1(%rsp)    movapd %xmm12,nb132_fizH1(%rsp)    movapd %xmm13,nb132_fixH2(%rsp)    movapd %xmm14,nb132_fiyH2(%rsp)    movapd %xmm15,nb132_fizH2(%rsp)    ## store back j O forces from xmm0-xmm2        movq  nb132_faction(%rbp),%rdi        movlpd %xmm0,(%rdi,%rax,8)        movlpd %xmm1,8(%rdi,%rax,8)        movlpd %xmm2,16(%rdi,%rax,8)        movhpd %xmm0,(%rdi,%rbx,8)        movhpd %xmm1,8(%rdi,%rbx,8)        movhpd %xmm2,16(%rdi,%rbx,8)        ## move j H1 coordinates to local temp variables     movq nb132_pos(%rbp),%rsi    movlpd 24(%rsi,%rax,8),%xmm0    movlpd 32(%rsi,%rax,8),%xmm1    movlpd 40(%rsi,%rax,8),%xmm2    movhpd 24(%rsi,%rbx,8),%xmm0    movhpd 32(%rsi,%rbx,8),%xmm1    movhpd 40(%rsi,%rbx,8),%xmm2    ## xmm0 = H1x    ## xmm1 = H1y    ## xmm2 = H1z    movapd %xmm0,%xmm3    movapd %xmm1,%xmm4    movapd %xmm2,%xmm5    movapd %xmm0,%xmm6    movapd %xmm1,%xmm7    movapd %xmm2,%xmm8    subpd nb132_ixO(%rsp),%xmm0    subpd nb132_iyO(%rsp),%xmm1    subpd nb132_izO(%rsp),%xmm2    subpd nb132_ixH1(%rsp),%xmm3    subpd nb132_iyH1(%rsp),%xmm4    subpd nb132_izH1(%rsp),%xmm5    subpd nb132_ixH2(%rsp),%xmm6    subpd nb132_iyH2(%rsp),%xmm7    subpd nb132_izH2(%rsp),%xmm8        movapd %xmm0,nb132_dxOH1(%rsp)        movapd %xmm1,nb132_dyOH1(%rsp)        movapd %xmm2,nb132_dzOH1(%rsp)        mulpd  %xmm0,%xmm0        mulpd  %xmm1,%xmm1        mulpd  %xmm2,%xmm2        movapd %xmm3,nb132_dxH1H1(%rsp)        movapd %xmm4,nb132_dyH1H1(%rsp)        movapd %xmm5,nb132_dzH1H1(%rsp)        mulpd  %xmm3,%xmm3        mulpd  %xmm4,%xmm4        mulpd  %xmm5,%xmm5        movapd %xmm6,nb132_dxH2H1(%rsp)        movapd %xmm7,nb132_dyH2H1(%rsp)        movapd %xmm8,nb132_dzH2H1(%rsp)        mulpd  %xmm6,%xmm6        mulpd  %xmm7,%xmm7        mulpd  %xmm8,%xmm8        addpd  %xmm1,%xmm0        addpd  %xmm2,%xmm0        addpd  %xmm4,%xmm3        addpd  %xmm5,%xmm3    addpd  %xmm7,%xmm6    addpd  %xmm8,%xmm6        ## start doing invsqrt for jH1 atoms    cvtpd2ps %xmm0,%xmm1    cvtpd2ps %xmm3,%xmm4    cvtpd2ps %xmm6,%xmm7        rsqrtps %xmm1,%xmm1        rsqrtps %xmm4,%xmm4    rsqrtps %xmm7,%xmm7    cvtps2pd %xmm1,%xmm1    cvtps2pd %xmm4,%xmm4    cvtps2pd %xmm7,%xmm7        movapd  %xmm1,%xmm2        movapd  %xmm4,%xmm5    movapd  %xmm7,%xmm8        mulpd   %xmm1,%xmm1 ## lu*lu        mulpd   %xmm4,%xmm4 ## lu*lu    mulpd   %xmm7,%xmm7 ## lu*lu        movapd  nb132_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulpd   %xmm0,%xmm1 ## rsq*lu*lu        mulpd   %xmm3,%xmm4 ## rsq*lu*lu     mulpd   %xmm6,%xmm7 ## rsq*lu*lu        subpd   %xmm1,%xmm9        subpd   %xmm4,%xmm10    subpd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulpd   %xmm2,%xmm9        mulpd   %xmm5,%xmm10    mulpd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb132_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ## first iteration for rinvOH1         mulpd   %xmm15,%xmm10 ## first iteration for rinvH1H1    mulpd   %xmm15,%xmm11 ## first iteration for rinvH2OH1    ## second iteration step            movapd  %xmm9,%xmm2        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulpd   %xmm2,%xmm2 ## lu*lu        mulpd   %xmm5,%xmm5 ## lu*lu    mulpd   %xmm8,%xmm8 ## lu*lu        movapd  nb132_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulpd   %xmm0,%xmm2 ## rsq*lu*lu        mulpd   %xmm3,%xmm5 ## rsq*lu*lu     mulpd   %xmm6,%xmm8 ## rsq*lu*lu        subpd   %xmm2,%xmm1        subpd   %xmm5,%xmm4    subpd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulpd   %xmm1,%xmm9        mulpd   %xmm4,%xmm10    mulpd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb132_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ##  rinvOH1        mulpd   %xmm15,%xmm10 ##   rinvH1H1    mulpd   %xmm15,%xmm11 ##   rinvH2H1        ## H1 interactions     movapd %xmm9,%xmm0    movapd %xmm10,%xmm1    movapd %xmm11,%xmm2    mulpd  %xmm9,%xmm9    mulpd  %xmm10,%xmm10    mulpd  %xmm11,%xmm11    mulpd  nb132_qqOH(%rsp),%xmm0    mulpd  nb132_qqHH(%rsp),%xmm1    mulpd  nb132_qqHH(%rsp),%xmm2    mulpd  %xmm0,%xmm9    mulpd  %xmm1,%xmm10    mulpd  %xmm2,%xmm11    addpd nb132_vctot(%rsp),%xmm0    addpd %xmm2,%xmm1    addpd %xmm1,%xmm0    movapd %xmm0,nb132_vctot(%rsp)    ## move j H1 forces to xmm0-xmm2        movq  nb132_faction(%rbp),%rdi        movlpd 24(%rdi,%rax,8),%xmm0        movlpd 32(%rdi,%rax,8),%xmm1        movlpd 40(%rdi,%rax,8),%xmm2        movhpd 24(%rdi,%rbx,8),%xmm0        movhpd 32(%rdi,%rbx,8),%xmm1        movhpd 40(%rdi,%rbx,8),%xmm2    movapd %xmm9,%xmm7    movapd %xmm9,%xmm8    movapd %xmm11,%xmm13    movapd %xmm11,%xmm14    movapd %xmm11,%xmm15    movapd %xmm10,%xmm11    movapd %xmm10,%xmm12        mulpd nb132_dxOH1(%rsp),%xmm7        mulpd nb132_dyOH1(%rsp),%xmm8        mulpd nb132_dzOH1(%rsp),%xmm9        mulpd nb132_dxH1H1(%rsp),%xmm10        mulpd nb132_dyH1H1(%rsp),%xmm11        mulpd nb132_dzH1H1(%rsp),%xmm12        mulpd nb132_dxH2H1(%rsp),%xmm13        mulpd nb132_dyH2H1(%rsp),%xmm14        mulpd nb132_dzH2H1(%rsp),%xmm15    addpd %xmm7,%xmm0    addpd %xmm8,%xmm1    addpd %xmm9,%xmm2    addpd nb132_fixO(%rsp),%xmm7    addpd nb132_fiyO(%rsp),%xmm8    addpd nb132_fizO(%rsp),%xmm9    addpd %xmm10,%xmm0    addpd %xmm11,%xmm1    addpd %xmm12,%xmm2    addpd nb132_fixH1(%rsp),%xmm10    addpd nb132_fiyH1(%rsp),%xmm11    addpd nb132_fizH1(%rsp),%xmm12    addpd %xmm13,%xmm0    addpd %xmm14,%xmm1    addpd %xmm15,%xmm2    addpd nb132_fixH2(%rsp),%xmm13    addpd nb132_fiyH2(%rsp),%xmm14    addpd nb132_fizH2(%rsp),%xmm15    movapd %xmm7,nb132_fixO(%rsp)    movapd %xmm8,nb132_fiyO(%rsp)    movapd %xmm9,nb132_fizO(%rsp)    movapd %xmm10,nb132_fixH1(%rsp)    movapd %xmm11,nb132_fiyH1(%rsp)    movapd %xmm12,nb132_fizH1(%rsp)    movapd %xmm13,nb132_fixH2(%rsp)    movapd %xmm14,nb132_fiyH2(%rsp)    movapd %xmm15,nb132_fizH2(%rsp)    ## store back j H1 forces from xmm0-xmm2        movq  nb132_faction(%rbp),%rdi        movlpd %xmm0,24(%rdi,%rax,8)        movlpd %xmm1,32(%rdi,%rax,8)        movlpd %xmm2,40(%rdi,%rax,8)        movhpd %xmm0,24(%rdi,%rbx,8)        movhpd %xmm1,32(%rdi,%rbx,8)        movhpd %xmm2,40(%rdi,%rbx,8)        ## move j H2 coordinates to local temp variables     movq nb132_pos(%rbp),%rsi    movlpd 48(%rsi,%rax,8),%xmm0    movlpd 56(%rsi,%rax,8),%xmm1    movlpd 64(%rsi,%rax,8),%xmm2    movhpd 48(%rsi,%rbx,8),%xmm0    movhpd 56(%rsi,%rbx,8),%xmm1    movhpd 64(%rsi,%rbx,8),%xmm2    ## xmm0 = H2x    ## xmm1 = H2y    ## xmm2 = H2z    movapd %xmm0,%xmm3    movapd %xmm1,%xmm4    movapd %xmm2,%xmm5

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?