nb_kernel114_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,294 行 · 第 1/5 页

S
2,294
字号
    movapd %xmm7,nb114_fixH1(%rsp)    movapd %xmm8,nb114_fiyH1(%rsp)    movapd %xmm9,nb114_fizH1(%rsp)    movapd %xmm10,nb114_fixH2(%rsp)    movapd %xmm11,nb114_fiyH2(%rsp)    movapd %xmm12,nb114_fizH2(%rsp)    movapd %xmm13,nb114_fixM(%rsp)    movapd %xmm14,nb114_fiyM(%rsp)    movapd %xmm15,nb114_fizM(%rsp)    ## store back j H2 forces from xmm0-xmm2        movlpd %xmm0,48(%rdi,%rax,8)        movlpd %xmm1,56(%rdi,%rax,8)        movlpd %xmm2,64(%rdi,%rax,8)        movhpd %xmm0,48(%rdi,%rbx,8)        movhpd %xmm1,56(%rdi,%rbx,8)        movhpd %xmm2,64(%rdi,%rbx,8)        ## move j M coordinates to local temp variables         movq   nb114_pos(%rbp),%rsi    movlpd 72(%rsi,%rax,8),%xmm0    movlpd 80(%rsi,%rax,8),%xmm1    movlpd 88(%rsi,%rax,8),%xmm2    movhpd 72(%rsi,%rbx,8),%xmm0    movhpd 80(%rsi,%rbx,8),%xmm1    movhpd 88(%rsi,%rbx,8),%xmm2    ## xmm0 = Mx    ## xmm1 = My    ## xmm2 = Mz    movapd %xmm0,%xmm3    movapd %xmm1,%xmm4    movapd %xmm2,%xmm5    movapd %xmm0,%xmm6    movapd %xmm1,%xmm7    movapd %xmm2,%xmm8    subpd nb114_ixH1(%rsp),%xmm0    subpd nb114_iyH1(%rsp),%xmm1    subpd nb114_izH1(%rsp),%xmm2    subpd nb114_ixH2(%rsp),%xmm3    subpd nb114_iyH2(%rsp),%xmm4    subpd nb114_izH2(%rsp),%xmm5    subpd nb114_ixM(%rsp),%xmm6    subpd nb114_iyM(%rsp),%xmm7    subpd nb114_izM(%rsp),%xmm8        movapd %xmm0,nb114_dxH1M(%rsp)        movapd %xmm1,nb114_dyH1M(%rsp)        movapd %xmm2,nb114_dzH1M(%rsp)        mulpd  %xmm0,%xmm0        mulpd  %xmm1,%xmm1        mulpd  %xmm2,%xmm2        movapd %xmm3,nb114_dxH2M(%rsp)        movapd %xmm4,nb114_dyH2M(%rsp)        movapd %xmm5,nb114_dzH2M(%rsp)        mulpd  %xmm3,%xmm3        mulpd  %xmm4,%xmm4        mulpd  %xmm5,%xmm5        movapd %xmm6,nb114_dxMM(%rsp)        movapd %xmm7,nb114_dyMM(%rsp)        movapd %xmm8,nb114_dzMM(%rsp)        mulpd  %xmm6,%xmm6        mulpd  %xmm7,%xmm7        mulpd  %xmm8,%xmm8        addpd  %xmm1,%xmm0        addpd  %xmm2,%xmm0        addpd  %xmm4,%xmm3        addpd  %xmm5,%xmm3    addpd  %xmm7,%xmm6    addpd  %xmm8,%xmm6        ## start doing invsqrt for jM atoms    cvtpd2ps %xmm0,%xmm1    cvtpd2ps %xmm3,%xmm4    cvtpd2ps %xmm6,%xmm7        rsqrtps %xmm1,%xmm1        rsqrtps %xmm4,%xmm4    rsqrtps %xmm7,%xmm7    cvtps2pd %xmm1,%xmm1    cvtps2pd %xmm4,%xmm4    cvtps2pd %xmm7,%xmm7        movapd  %xmm1,%xmm2        movapd  %xmm4,%xmm5    movapd  %xmm7,%xmm8        mulpd   %xmm1,%xmm1 ## lu*lu        mulpd   %xmm4,%xmm4 ## lu*lu    mulpd   %xmm7,%xmm7 ## lu*lu        movapd  nb114_three(%rsp),%xmm9        movapd  %xmm9,%xmm10    movapd  %xmm9,%xmm11        mulpd   %xmm0,%xmm1 ## rsq*lu*lu        mulpd   %xmm3,%xmm4 ## rsq*lu*lu     mulpd   %xmm6,%xmm7 ## rsq*lu*lu        subpd   %xmm1,%xmm9        subpd   %xmm4,%xmm10    subpd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulpd   %xmm2,%xmm9        mulpd   %xmm5,%xmm10    mulpd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb114_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ## first iteration for rinvH1M         mulpd   %xmm15,%xmm10 ## first iteration for rinvH2M    mulpd   %xmm15,%xmm11 ## first iteration for rinvMM    ## second iteration step            movapd  %xmm9,%xmm2        movapd  %xmm10,%xmm5    movapd  %xmm11,%xmm8        mulpd   %xmm2,%xmm2 ## lu*lu        mulpd   %xmm5,%xmm5 ## lu*lu    mulpd   %xmm8,%xmm8 ## lu*lu        movapd  nb114_three(%rsp),%xmm1        movapd  %xmm1,%xmm4    movapd  %xmm1,%xmm7        mulpd   %xmm0,%xmm2 ## rsq*lu*lu        mulpd   %xmm3,%xmm5 ## rsq*lu*lu     mulpd   %xmm6,%xmm8 ## rsq*lu*lu        subpd   %xmm2,%xmm1        subpd   %xmm5,%xmm4    subpd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulpd   %xmm1,%xmm9        mulpd   %xmm4,%xmm10    mulpd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movapd  nb114_half(%rsp),%xmm15        mulpd   %xmm15,%xmm9 ##  rinvH1M        mulpd   %xmm15,%xmm10 ##   rinvH2M    mulpd   %xmm15,%xmm11 ##   rinvMM        ## M interactions     movapd %xmm9,%xmm0    movapd %xmm10,%xmm1    movapd %xmm11,%xmm2    mulpd  %xmm9,%xmm9    mulpd  %xmm10,%xmm10    mulpd  %xmm11,%xmm11    mulpd  nb114_qqMH(%rsp),%xmm0    mulpd  nb114_qqMH(%rsp),%xmm1    mulpd  nb114_qqMM(%rsp),%xmm2    mulpd  %xmm0,%xmm9    mulpd  %xmm1,%xmm10    mulpd  %xmm2,%xmm11    addpd nb114_vctot(%rsp),%xmm0    addpd %xmm2,%xmm1    addpd %xmm1,%xmm0    movapd %xmm0,nb114_vctot(%rsp)    ## move j M forces to xmm0-xmm2        movq   nb114_faction(%rbp),%rdi        movlpd 72(%rdi,%rax,8),%xmm0        movlpd 80(%rdi,%rax,8),%xmm1        movlpd 88(%rdi,%rax,8),%xmm2        movhpd 72(%rdi,%rbx,8),%xmm0        movhpd 80(%rdi,%rbx,8),%xmm1        movhpd 88(%rdi,%rbx,8),%xmm2    movapd %xmm9,%xmm7    movapd %xmm9,%xmm8    movapd %xmm11,%xmm13    movapd %xmm11,%xmm14    movapd %xmm11,%xmm15    movapd %xmm10,%xmm11    movapd %xmm10,%xmm12        mulpd nb114_dxH1M(%rsp),%xmm7        mulpd nb114_dyH1M(%rsp),%xmm8        mulpd nb114_dzH1M(%rsp),%xmm9        mulpd nb114_dxH2M(%rsp),%xmm10        mulpd nb114_dyH2M(%rsp),%xmm11        mulpd nb114_dzH2M(%rsp),%xmm12        mulpd nb114_dxMM(%rsp),%xmm13        mulpd nb114_dyMM(%rsp),%xmm14        mulpd nb114_dzMM(%rsp),%xmm15    addpd %xmm7,%xmm0    addpd %xmm8,%xmm1    addpd %xmm9,%xmm2    addpd nb114_fixH1(%rsp),%xmm7    addpd nb114_fiyH1(%rsp),%xmm8    addpd nb114_fizH1(%rsp),%xmm9    addpd %xmm10,%xmm0    addpd %xmm11,%xmm1    addpd %xmm12,%xmm2    addpd nb114_fixH2(%rsp),%xmm10    addpd nb114_fiyH2(%rsp),%xmm11    addpd nb114_fizH2(%rsp),%xmm12    addpd %xmm13,%xmm0    addpd %xmm14,%xmm1    addpd %xmm15,%xmm2    addpd nb114_fixM(%rsp),%xmm13    addpd nb114_fiyM(%rsp),%xmm14    addpd nb114_fizM(%rsp),%xmm15    movapd %xmm7,nb114_fixH1(%rsp)    movapd %xmm8,nb114_fiyH1(%rsp)    movapd %xmm9,nb114_fizH1(%rsp)    movapd %xmm10,nb114_fixH2(%rsp)    movapd %xmm11,nb114_fiyH2(%rsp)    movapd %xmm12,nb114_fizH2(%rsp)    movapd %xmm13,nb114_fixM(%rsp)    movapd %xmm14,nb114_fiyM(%rsp)    movapd %xmm15,nb114_fizM(%rsp)    ## store back j M forces from xmm0-xmm2        movlpd %xmm0,72(%rdi,%rax,8)        movlpd %xmm1,80(%rdi,%rax,8)        movlpd %xmm2,88(%rdi,%rax,8)        movhpd %xmm0,72(%rdi,%rbx,8)        movhpd %xmm1,80(%rdi,%rbx,8)        movhpd %xmm2,88(%rdi,%rbx,8)        ## should we do one more iteration?         subl $2,nb114_innerk(%rsp)        jl    _nb_kernel114_x86_64_sse2.nb114_checksingle        jmp   _nb_kernel114_x86_64_sse2.nb114_unroll_loop_nb_kernel114_x86_64_sse2.nb114_checksingle:         movl  nb114_innerk(%rsp),%edx        andl  $1,%edx        jnz   _nb_kernel114_x86_64_sse2.nb114_dosingle        jmp   _nb_kernel114_x86_64_sse2.nb114_updateouterdata_nb_kernel114_x86_64_sse2.nb114_dosingle:         movq  nb114_innerjjnr(%rsp),%rdx       ## pointer to jjnr[k]         movl  (%rdx),%eax        movq nb114_pos(%rbp),%rsi        lea  (%rax,%rax,2),%rax        ## load j O coordinates    movsd (%rsi,%rax,8),%xmm4    movsd 8(%rsi,%rax,8),%xmm5    movsd 16(%rsi,%rax,8),%xmm6    ## xmm4 = Ox    ## xmm5 = Oy    ## xmm6 = Oz    subsd nb114_ixO(%rsp),%xmm4    subsd nb114_iyO(%rsp),%xmm5    subsd nb114_izO(%rsp),%xmm6    ## store dx/dy/dz    movapd %xmm4,%xmm9    movapd %xmm5,%xmm10    movapd %xmm6,%xmm11        ## square it         mulsd %xmm4,%xmm4        mulsd %xmm5,%xmm5        mulsd %xmm6,%xmm6        addsd %xmm5,%xmm4        addsd %xmm6,%xmm4       ## rsq in xmm4         cvtsd2ss %xmm4,%xmm6        rcpss %xmm6,%xmm6        cvtss2sd %xmm6,%xmm6    ## lu in low xmm6         ## 1/x lookup seed in xmm6         movapd nb114_two(%rsp),%xmm0        movapd %xmm4,%xmm5        mulsd %xmm6,%xmm4       ## lu*rsq         subsd %xmm4,%xmm0       ## 2-lu*rsq         mulsd %xmm0,%xmm6       ## (new lu)         movapd nb114_two(%rsp),%xmm0        mulsd %xmm6,%xmm5       ## lu*rsq         subsd %xmm5,%xmm0       ## 2-lu*rsq         mulsd %xmm6,%xmm0       ## xmm0=rinvsq         movapd %xmm0,%xmm1        mulsd  %xmm0,%xmm1        mulsd  %xmm0,%xmm1      ## xmm1=rinvsix         movapd %xmm1,%xmm2        mulsd  %xmm2,%xmm2      ## xmm2=rinvtwelve         mulsd  nb114_c6(%rsp),%xmm1     ## mult by c6        mulsd  nb114_c12(%rsp),%xmm2     ## mult by c12        movapd %xmm2,%xmm5        subsd  %xmm1,%xmm5      ## Vvdw=Vvdw12-Vvdw6         mulsd  nb114_six(%rsp),%xmm1        mulsd  nb114_twelve(%rsp),%xmm2        subsd  %xmm1,%xmm2        mulsd  %xmm2,%xmm0      ## xmm0=total fscal     ## increment potential    addsd  nb114_Vvdwtot(%rsp),%xmm5    movsd %xmm5,nb114_Vvdwtot(%rsp)        movq   nb114_faction(%rbp),%rdi        mulsd  %xmm0,%xmm9        mulsd  %xmm0,%xmm10        mulsd  %xmm0,%xmm11    movapd nb114_fixO(%rsp),%xmm0    movapd nb114_fiyO(%rsp),%xmm1    movapd nb114_fizO(%rsp),%xmm2    ## accumulate i forces    addsd %xmm9,%xmm0    addsd %xmm10,%xmm1    addsd %xmm11,%xmm2    movsd %xmm0,nb114_fixO(%rsp)    movsd %xmm1,nb114_fiyO(%rsp)    movsd %xmm2,nb114_fizO(%rsp)        addsd (%rdi,%rax,8),%xmm9        addsd 8(%rdi,%rax,8),%xmm10        addsd 16(%rdi,%rax,8),%xmm11        movsd %xmm9,(%rdi,%rax,8)        movsd %xmm10,8(%rdi,%rax,8)        movsd %xmm11,16(%rdi,%rax,8)    ## done with OO interaction        ## move j H1 coordinates to local temp variables     movsd 24(%rsi,%rax,8),%xmm0    movsd 32(%rsi,%rax,8),%xmm1    movsd 40(%rsi,%rax,8),%xmm2    ## xmm0 = H1x    ## xmm1 = H1y    ## xmm2 = H1z    movsd %xmm0,%xmm3    movsd %xmm1,%xmm4    movsd %xmm2,%xmm5    movsd %xmm0,%xmm6    movsd %xmm1,%xmm7    movsd %xmm2,%xmm8    subsd nb114_ixH1(%rsp),%xmm0    subsd nb114_iyH1(%rsp),%xmm1    subsd nb114_izH1(%rsp),%xmm2    subsd nb114_ixH2(%rsp),%xmm3    subsd nb114_iyH2(%rsp),%xmm4    subsd nb114_izH2(%rsp),%xmm5    subsd nb114_ixM(%rsp),%xmm6    subsd nb114_iyM(%rsp),%xmm7    subsd nb114_izM(%rsp),%xmm8        movsd %xmm0,nb114_dxH1H1(%rsp)        movsd %xmm1,nb114_dyH1H1(%rsp)        movsd %xmm2,nb114_dzH1H1(%rsp)        mulsd  %xmm0,%xmm0        mulsd  %xmm1,%xmm1        mulsd  %xmm2,%xmm2        movsd %xmm3,nb114_dxH2H1(%rsp)        movsd %xmm4,nb114_dyH2H1(%rsp)        movsd %xmm5,nb114_dzH2H1(%rsp)        mulsd  %xmm3,%xmm3        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        movsd %xmm6,nb114_dxMH1(%rsp)        movsd %xmm7,nb114_dyMH1(%rsp)        movsd %xmm8,nb114_dzMH1(%rsp)        mulsd  %xmm6,%xmm6        mulsd  %xmm7,%xmm7        mulsd  %xmm8,%xmm8        addsd  %xmm1,%xmm0        addsd  %xmm2,%xmm0        addsd  %xmm4,%xmm3        addsd  %xmm5,%xmm3    addsd  %xmm7,%xmm6    addsd  %xmm8,%xmm6        ## start doing invsqrt for jH1 atoms    cvtsd2ss %xmm0,%xmm1    cvtsd2ss %xmm3,%xmm4    cvtsd2ss %xmm6,%xmm7        rsqrtss %xmm1,%xmm1        rsqrtss %xmm4,%xmm4    rsqrtss %xmm7,%xmm7    cvtss2sd %xmm1,%xmm1    cvtss2sd %xmm4,%xmm4    cvtss2sd %xmm7,%xmm7        movsd  %xmm1,%xmm2        movsd  %xmm4,%xmm5    movsd  %xmm7,%xmm8        mulsd   %xmm1,%xmm1 ## lu*lu        mulsd   %xmm4,%xmm4 ## lu*lu    mulsd   %xmm7,%xmm7 ## lu*lu        movsd  nb114_three(%rsp),%xmm9        movsd  %xmm9,%xmm10    movsd  %xmm9,%xmm11        mulsd   %xmm0,%xmm1 ## rsq*lu*lu        mulsd   %xmm3,%xmm4 ## rsq*lu*lu     mulsd   %xmm6,%xmm7 ## rsq*lu*lu        subsd   %xmm1,%xmm9        subsd   %xmm4,%xmm10    subsd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulsd   %xmm2,%xmm9        mulsd   %xmm5,%xmm10    mulsd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb114_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ## first iteration for rinvH1H1         mulsd   %xmm15,%xmm10 ## first iteration for rinvH2H1    mulsd   %xmm15,%xmm11 ## first iteration for rinvMH1     ## second iteration step            movsd  %xmm9,%xmm2        movsd  %xmm10,%xmm5    movsd  %xmm11,%xmm8        mulsd   %xmm2,%xmm2 ## lu*lu        mulsd   %xmm5,%xmm5 ## lu*lu    mulsd   %xmm8,%xmm8 ## lu*lu        movsd  nb114_three(%rsp),%xmm1        movsd  %xmm1,%xmm4    movsd  %xmm1,%xmm7        mulsd   %xmm0,%xmm2 ## rsq*lu*lu        mulsd   %xmm3,%xmm5 ## rsq*lu*lu     mulsd   %xmm6,%xmm8 ## rsq*lu*lu        subsd   %xmm2,%xmm1        subsd   %xmm5,%xmm4    subsd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulsd   %xmm1,%xmm9        mulsd   %xmm4,%xmm10    mulsd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb114_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ##  rinvH1H1         mulsd   %xmm15,%xmm10 ##   rinvH2H1    mulsd   %xmm15,%xmm11 ##   rinvMH1        ## H1 interactions     movsd %xmm9,%xmm0    movsd %xmm10,%xmm1    movsd %xmm11,%xmm2    mulsd  %xmm9,%xmm9    mulsd  %xmm10,%xmm10    mulsd  %xmm11,%xmm11

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?