nb_kernel212_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,263 行 · 第 1/5 页

S
2,263
字号
    subpd nb212_izH1(%rsp),%xmm5    subpd nb212_ixH2(%rsp),%xmm6    subpd nb212_iyH2(%rsp),%xmm7    subpd nb212_izH2(%rsp),%xmm8        movapd %xmm0,nb212_dxOH2(%rsp)        movapd %xmm1,nb212_dyOH2(%rsp)        movapd %xmm2,nb212_dzOH2(%rsp)        mulpd  %xmm0,%xmm0        mulpd  %xmm1,%xmm1        mulpd  %xmm2,%xmm2        movapd %xmm3,nb212_dxH1H2(%rsp)        movapd %xmm4,nb212_dyH1H2(%rsp)        movapd %xmm5,nb212_dzH1H2(%rsp)        mulpd  %xmm3,%xmm3        mulpd  %xmm4,%xmm4        mulpd  %xmm5,%xmm5        movapd %xmm6,nb212_dxH2H2(%rsp)        movapd %xmm7,nb212_dyH2H2(%rsp)        movapd %xmm8,nb212_dzH2H2(%rsp)        mulpd  %xmm6,%xmm6        mulpd  %xmm7,%xmm7        mulpd  %xmm8,%xmm8        addpd  %xmm1,%xmm0        addpd  %xmm2,%xmm0        addpd  %xmm4,%xmm3        addpd  %xmm5,%xmm3    addpd  %xmm7,%xmm6    addpd  %xmm8,%xmm6        ## start doing invsqrt for jH2 atoms    cvtpd2ps %xmm0,%xmm1    cvtpd2ps %xmm3,%xmm4    cvtpd2ps %xmm6,%xmm7        rsqrtps %xmm1,%xmm1        rsqrtps %xmm4,%xmm4    rsqrtps %xmm7,%xmm7    cvtps2pd %xmm1,%xmm1    cvtps2pd %xmm4,%xmm4    cvtps2pd %xmm7,%xmm7        movapd  %xmm1,%xmm2        movapd  %xmm4,%xmm5    movapd  %xmm7,%xmm8        mulpd   %xmm1,%xmm1 ## lu*lu        mulpd   %xmm4,%xmm4 ## lu*lu    mulpd   %xmm7,%xmm7 ## lu*lu        movapd  nb212_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulpd   %xmm0,%xmm1 ## rsq*lu*lu        mulpd   %xmm3,%xmm4 ## rsq*lu*lu     mulpd   %xmm6,%xmm7 ## rsq*lu*lu        subpd   %xmm1,%xmm9        subpd   %xmm4,%xmm10    subpd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulpd   %xmm2,%xmm9        mulpd   %xmm5,%xmm10    mulpd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb212_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ## first iteration for rinvOH2         mulpd   %xmm15,%xmm10 ## first iteration for rinvH1H2    mulpd   %xmm15,%xmm11 ## first iteration for rinvH2H2    ## second iteration step            movapd  %xmm9,%xmm2        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulpd   %xmm2,%xmm2 ## lu*lu        mulpd   %xmm5,%xmm5 ## lu*lu    mulpd   %xmm8,%xmm8 ## lu*lu        movapd  nb212_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulpd   %xmm0,%xmm2 ## rsq*lu*lu        mulpd   %xmm3,%xmm5 ## rsq*lu*lu     mulpd   %xmm6,%xmm8 ## rsq*lu*lu        subpd   %xmm2,%xmm1        subpd   %xmm5,%xmm4    subpd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulpd   %xmm1,%xmm9        mulpd   %xmm4,%xmm10    mulpd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb212_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ##  rinvOH2        mulpd   %xmm15,%xmm10 ##   rinvH1H2    mulpd   %xmm15,%xmm11 ##   rinvH2H2        ## H2 interactions     ## rsq in xmm0,xmm3,xmm6      ## rinv in xmm9, xmm10, xmm11    movapd %xmm9,%xmm1 ## copy of rinv    movapd %xmm10,%xmm4    movapd %xmm11,%xmm7    movapd nb212_krf(%rsp),%xmm2    mulpd  %xmm9,%xmm9  ## rinvsq    mulpd  %xmm10,%xmm10    mulpd  %xmm11,%xmm11    mulpd  %xmm2,%xmm0 ## k*rsq    mulpd  %xmm2,%xmm3    mulpd  %xmm2,%xmm6    movapd %xmm0,%xmm2 ## copy of k*rsq    movapd %xmm3,%xmm5    movapd %xmm6,%xmm8    addpd  %xmm1,%xmm2 ## rinv+krsq    addpd  %xmm4,%xmm5    addpd  %xmm7,%xmm8    movapd nb212_crf(%rsp),%xmm14    subpd  %xmm14,%xmm2  ## rinv+krsq-crf    subpd  %xmm14,%xmm5    subpd  %xmm14,%xmm8    movapd nb212_qqOH(%rsp),%xmm12    movapd nb212_qqHH(%rsp),%xmm13    mulpd  %xmm12,%xmm2 ## xmm6=voul=qq*(rinv+ krsq-crf)    mulpd  %xmm13,%xmm5 ## xmm6=voul=qq*(rinv+ krsq-crf)    mulpd  %xmm13,%xmm8 ## xmm6=voul=qq*(rinv+ krsq-crf)    addpd  %xmm0,%xmm0 ## 2*krsq    addpd  %xmm3,%xmm3    addpd  %xmm6,%xmm6    subpd  %xmm0,%xmm1 ## rinv-2*krsq    subpd  %xmm3,%xmm4    subpd  %xmm6,%xmm7    mulpd  %xmm12,%xmm1  ## (rinv-2*krsq)*qq    mulpd  %xmm13,%xmm4    mulpd  %xmm13,%xmm7    addpd  nb212_vctot(%rsp),%xmm2    addpd  %xmm8,%xmm5    addpd  %xmm5,%xmm2    movapd %xmm2,nb212_vctot(%rsp)    mulpd  %xmm1,%xmm9  ## fscal    mulpd  %xmm4,%xmm10    mulpd  %xmm7,%xmm11    ## move j H2 forces to xmm0-xmm2        movlpd 48(%rdi,%rax,8),%xmm0        movlpd 56(%rdi,%rax,8),%xmm1        movlpd 64(%rdi,%rax,8),%xmm2        movhpd 48(%rdi,%rbx,8),%xmm0        movhpd 56(%rdi,%rbx,8),%xmm1        movhpd 64(%rdi,%rbx,8),%xmm2    movapd %xmm9,%xmm7    movapd %xmm9,%xmm8    movapd %xmm11,%xmm13    movapd %xmm11,%xmm14    movapd %xmm11,%xmm15    movapd %xmm10,%xmm11    movapd %xmm10,%xmm12        mulpd nb212_dxOH2(%rsp),%xmm7        mulpd nb212_dyOH2(%rsp),%xmm8        mulpd nb212_dzOH2(%rsp),%xmm9        mulpd nb212_dxH1H2(%rsp),%xmm10        mulpd nb212_dyH1H2(%rsp),%xmm11        mulpd nb212_dzH1H2(%rsp),%xmm12        mulpd nb212_dxH2H2(%rsp),%xmm13        mulpd nb212_dyH2H2(%rsp),%xmm14        mulpd nb212_dzH2H2(%rsp),%xmm15    addpd %xmm7,%xmm0    addpd %xmm8,%xmm1    addpd %xmm9,%xmm2    addpd nb212_fixO(%rsp),%xmm7    addpd nb212_fiyO(%rsp),%xmm8    addpd nb212_fizO(%rsp),%xmm9    addpd %xmm10,%xmm0    addpd %xmm11,%xmm1    addpd %xmm12,%xmm2    addpd nb212_fixH1(%rsp),%xmm10    addpd nb212_fiyH1(%rsp),%xmm11    addpd nb212_fizH1(%rsp),%xmm12    addpd %xmm13,%xmm0    addpd %xmm14,%xmm1    addpd %xmm15,%xmm2    addpd nb212_fixH2(%rsp),%xmm13    addpd nb212_fiyH2(%rsp),%xmm14    addpd nb212_fizH2(%rsp),%xmm15    movapd %xmm7,nb212_fixO(%rsp)    movapd %xmm8,nb212_fiyO(%rsp)    movapd %xmm9,nb212_fizO(%rsp)    movapd %xmm10,nb212_fixH1(%rsp)    movapd %xmm11,nb212_fiyH1(%rsp)    movapd %xmm12,nb212_fizH1(%rsp)    movapd %xmm13,nb212_fixH2(%rsp)    movapd %xmm14,nb212_fiyH2(%rsp)    movapd %xmm15,nb212_fizH2(%rsp)    ## store back j H2 forces from xmm0-xmm2        movlpd %xmm0,48(%rdi,%rax,8)        movlpd %xmm1,56(%rdi,%rax,8)        movlpd %xmm2,64(%rdi,%rax,8)        movhpd %xmm0,48(%rdi,%rbx,8)        movhpd %xmm1,56(%rdi,%rbx,8)        movhpd %xmm2,64(%rdi,%rbx,8)        ## should we do one more iteration?         subl $2,nb212_innerk(%rsp)        jl    _nb_kernel212_x86_64_sse2.nb212_checksingle        jmp   _nb_kernel212_x86_64_sse2.nb212_unroll_loop_nb_kernel212_x86_64_sse2.nb212_checksingle:         movl  nb212_innerk(%rsp),%edx        andl  $1,%edx        jnz   _nb_kernel212_x86_64_sse2.nb212_dosingle        jmp   _nb_kernel212_x86_64_sse2.nb212_updateouterdata_nb_kernel212_x86_64_sse2.nb212_dosingle:         movq  nb212_innerjjnr(%rsp),%rdx       ## pointer to jjnr[k]         movl  (%rdx),%eax        movq nb212_pos(%rbp),%rsi        lea  (%rax,%rax,2),%rax        ## move j O coordinates to local temp variables     movsd (%rsi,%rax,8),%xmm0    movsd 8(%rsi,%rax,8),%xmm1    movsd 16(%rsi,%rax,8),%xmm2    ## xmm0 = Ox    ## xmm1 = Oy    ## xmm2 = Oz    movsd %xmm0,%xmm3    movsd %xmm1,%xmm4    movsd %xmm2,%xmm5    movsd %xmm0,%xmm6    movsd %xmm1,%xmm7    movsd %xmm2,%xmm8    subsd nb212_ixO(%rsp),%xmm0    subsd nb212_iyO(%rsp),%xmm1    subsd nb212_izO(%rsp),%xmm2    subsd nb212_ixH1(%rsp),%xmm3    subsd nb212_iyH1(%rsp),%xmm4    subsd nb212_izH1(%rsp),%xmm5    subsd nb212_ixH2(%rsp),%xmm6    subsd nb212_iyH2(%rsp),%xmm7    subsd nb212_izH2(%rsp),%xmm8        movsd %xmm0,nb212_dxOO(%rsp)        movsd %xmm1,nb212_dyOO(%rsp)        movsd %xmm2,nb212_dzOO(%rsp)        mulsd  %xmm0,%xmm0        mulsd  %xmm1,%xmm1        mulsd  %xmm2,%xmm2        movsd %xmm3,nb212_dxH1O(%rsp)        movsd %xmm4,nb212_dyH1O(%rsp)        movsd %xmm5,nb212_dzH1O(%rsp)        mulsd  %xmm3,%xmm3        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        movsd %xmm6,nb212_dxH2O(%rsp)        movsd %xmm7,nb212_dyH2O(%rsp)        movsd %xmm8,nb212_dzH2O(%rsp)        mulsd  %xmm6,%xmm6        mulsd  %xmm7,%xmm7        mulsd  %xmm8,%xmm8        addsd  %xmm1,%xmm0        addsd  %xmm2,%xmm0        addsd  %xmm4,%xmm3        addsd  %xmm5,%xmm3    addsd  %xmm7,%xmm6    addsd  %xmm8,%xmm6        ## start doing invsqrt for jO atoms    cvtsd2ss %xmm0,%xmm1    cvtsd2ss %xmm3,%xmm4    cvtsd2ss %xmm6,%xmm7        rsqrtss %xmm1,%xmm1        rsqrtss %xmm4,%xmm4    rsqrtss %xmm7,%xmm7    cvtss2sd %xmm1,%xmm1    cvtss2sd %xmm4,%xmm4    cvtss2sd %xmm7,%xmm7        movsd  %xmm1,%xmm2        movsd  %xmm4,%xmm5    movsd  %xmm7,%xmm8        mulsd   %xmm1,%xmm1 ## lu*lu        mulsd   %xmm4,%xmm4 ## lu*lu    mulsd   %xmm7,%xmm7 ## lu*lu        movsd  nb212_three(%rsp),%xmm9        movsd  %xmm9,%xmm10    movsd  %xmm9,%xmm11        mulsd   %xmm0,%xmm1 ## rsq*lu*lu        mulsd   %xmm3,%xmm4 ## rsq*lu*lu     mulsd   %xmm6,%xmm7 ## rsq*lu*lu        subsd   %xmm1,%xmm9        subsd   %xmm4,%xmm10    subsd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulsd   %xmm2,%xmm9        mulsd   %xmm5,%xmm10    mulsd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb212_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ## first iteration for rinvOO         mulsd   %xmm15,%xmm10 ## first iteration for rinvH1O    mulsd   %xmm15,%xmm11 ## first iteration for rinvH2O     ## second iteration step            movsd  %xmm9,%xmm2        movsd  %xmm10,%xmm5    movsd  %xmm11,%xmm8        mulsd   %xmm2,%xmm2 ## lu*lu        mulsd   %xmm5,%xmm5 ## lu*lu    mulsd   %xmm8,%xmm8 ## lu*lu        movsd  nb212_three(%rsp),%xmm1        movsd  %xmm1,%xmm4    movsd  %xmm1,%xmm7        mulsd   %xmm0,%xmm2 ## rsq*lu*lu        mulsd   %xmm3,%xmm5 ## rsq*lu*lu     mulsd   %xmm6,%xmm8 ## rsq*lu*lu        subsd   %xmm2,%xmm1        subsd   %xmm5,%xmm4    subsd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulsd   %xmm1,%xmm9        mulsd   %xmm4,%xmm10    mulsd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb212_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ##  rinvOO         mulsd   %xmm15,%xmm10 ##   rinvH1O    mulsd   %xmm15,%xmm11 ##   rinvH2O        ## O interactions     ## rsq in xmm0,xmm3,xmm6      ## rinv in xmm9, xmm10, xmm11    movsd %xmm9,%xmm1 ## copy of rinv    movsd %xmm10,%xmm4    movsd %xmm11,%xmm7    movsd nb212_krf(%rsp),%xmm2    mulsd  %xmm9,%xmm9  ## rinvsq    mulsd  %xmm10,%xmm10    mulsd  %xmm11,%xmm11    mulsd  %xmm2,%xmm0 ## k*rsq    mulsd  %xmm2,%xmm3    mulsd  %xmm2,%xmm6    movsd %xmm0,%xmm2 ## copy of k*rsq    movsd %xmm3,%xmm5    movsd %xmm6,%xmm8    addsd  %xmm1,%xmm2 ## rinv+krsq    addsd  %xmm4,%xmm5    addsd  %xmm7,%xmm8    movsd %xmm9,%xmm12    mulsd  %xmm12,%xmm12 ## rinv4    mulsd  %xmm9,%xmm12 ## rinv6    subsd  nb212_crf(%rsp),%xmm2     ## rinv+krsq-crf    subsd  nb212_crf(%rsp),%xmm5    subsd  nb212_crf(%rsp),%xmm8    mulsd  nb212_qqOO(%rsp),%xmm2   ## voul=qq*(rinv+ krsq-crf)    mulsd  nb212_qqOH(%rsp),%xmm5   ## voul=qq*(rinv+ krsq-crf)    mulsd  nb212_qqOH(%rsp),%xmm8   ## voul=qq*(rinv+ krsq-crf)    addsd  %xmm0,%xmm0 ## 2*krsq    addsd  %xmm3,%xmm3    addsd  %xmm6,%xmm6    subsd  %xmm0,%xmm1 ## rinv-2*krsq    subsd  %xmm3,%xmm4    subsd  %xmm6,%xmm7    movsd %xmm12,%xmm13 ## rinv6    mulsd %xmm12,%xmm12 ## rinv12        mulsd  nb212_c6(%rsp),%xmm13        mulsd  nb212_c12(%rsp),%xmm12    movsd %xmm12,%xmm14    subsd  %xmm13,%xmm14    mulsd  nb212_qqOO(%rsp),%xmm1     ## (rinv-2*krsq)*qq    mulsd  nb212_qqOH(%rsp),%xmm4    mulsd  nb212_qqOH(%rsp),%xmm7    addsd  nb212_vctot(%rsp),%xmm2    addsd  %xmm8,%xmm5    addsd  %xmm5,%xmm2    movsd  %xmm2,nb212_vctot(%rsp)        addsd  nb212_Vvdwtot(%rsp),%xmm14        mulsd  nb212_six(%rsp),%xmm13        mulsd  nb212_twelve(%rsp),%xmm12        movsd %xmm14,nb212_Vvdwtot(%rsp)    subsd  %xmm13,%xmm12 ## LJ fscal            addsd %xmm12,%xmm1    mulsd  %xmm1,%xmm9  ## fscal    mulsd  %xmm4,%xmm10    mulsd  %xmm7,%xmm11    ## move j O forces to xmm0-xmm2        movsd (%rdi,%rax,8),%xmm0        movsd 8(%rdi,%rax,8),%xmm1        movsd 16(%rdi,%rax,8),%xmm2    movsd %xmm9,%xmm7    movsd %xmm9,%xmm8    movsd %xmm11,%xmm13    movsd %xmm11,%xmm14    movsd %xmm11,%xmm15    movsd %xmm10,%xmm11    movsd %xmm10,%xmm12        mulsd nb212_dxOO(%rsp),%xmm7        mulsd nb212_dyOO(%rsp),%xmm8        mulsd nb212_dzOO(%rsp),%xmm9        mulsd nb212_dxH1O(%rsp),%xmm10        mulsd nb212_dyH1O(%rsp),%xmm11        mulsd nb212_dzH1O(%rsp),%xmm12        mulsd nb212_dxH2O(%rsp),%xmm13        mulsd nb212_dyH2O(%rsp),%xmm14        mulsd nb212_dzH2O(%rsp),%xmm15    addsd %xmm7,%xmm0    addsd %xmm8,%xmm1    addsd %xmm9,%xmm2    addsd nb212_fixO(%rsp),%xmm7    addsd nb212_fiyO(%rsp),%xmm8    addsd nb212_fizO(%rsp),%xmm9    addsd %xmm10,%xmm0    addsd %xmm11,%xmm1    addsd %xmm12,%xmm2    addsd nb212_fixH1(%rsp),%xmm10    addsd nb212_fiyH1(%rsp),%xmm11    addsd nb212_fizH1(%rsp),%xmm12    addsd %xmm13,%xmm0    addsd %xmm14,%xmm1    addsd %xmm15,%xmm2    addsd nb212_fixH2(%rsp),%xmm13    addsd nb212_fiyH2(%rsp),%xmm14

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?