nb_kernel104_x86_64_sse2.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,227 行 · 第 1/5 页

S
2,227
字号
    addsd nb104_vctot(%rsp),%xmm0    addsd %xmm2,%xmm1    addsd %xmm1,%xmm0    movsd %xmm0,nb104_vctot(%rsp)    ## move j H2 forces to xmm0-xmm2        movsd 48(%rdi,%rax,8),%xmm0        movsd 56(%rdi,%rax,8),%xmm1        movsd 64(%rdi,%rax,8),%xmm2    movsd %xmm9,%xmm7    movsd %xmm9,%xmm8    movsd %xmm11,%xmm13    movsd %xmm11,%xmm14    movsd %xmm11,%xmm15    movsd %xmm10,%xmm11    movsd %xmm10,%xmm12        mulsd nb104_dxH1H2(%rsp),%xmm7        mulsd nb104_dyH1H2(%rsp),%xmm8        mulsd nb104_dzH1H2(%rsp),%xmm9        mulsd nb104_dxH2H2(%rsp),%xmm10        mulsd nb104_dyH2H2(%rsp),%xmm11        mulsd nb104_dzH2H2(%rsp),%xmm12        mulsd nb104_dxMH2(%rsp),%xmm13        mulsd nb104_dyMH2(%rsp),%xmm14        mulsd nb104_dzMH2(%rsp),%xmm15    addsd %xmm7,%xmm0    addsd %xmm8,%xmm1    addsd %xmm9,%xmm2    addsd nb104_fixH1(%rsp),%xmm7    addsd nb104_fiyH1(%rsp),%xmm8    addsd nb104_fizH1(%rsp),%xmm9    addsd %xmm10,%xmm0    addsd %xmm11,%xmm1    addsd %xmm12,%xmm2    addsd nb104_fixH2(%rsp),%xmm10    addsd nb104_fiyH2(%rsp),%xmm11    addsd nb104_fizH2(%rsp),%xmm12    addsd %xmm13,%xmm0    addsd %xmm14,%xmm1    addsd %xmm15,%xmm2    addsd nb104_fixM(%rsp),%xmm13    addsd nb104_fiyM(%rsp),%xmm14    addsd nb104_fizM(%rsp),%xmm15    movsd %xmm7,nb104_fixH1(%rsp)    movsd %xmm8,nb104_fiyH1(%rsp)    movsd %xmm9,nb104_fizH1(%rsp)    movsd %xmm10,nb104_fixH2(%rsp)    movsd %xmm11,nb104_fiyH2(%rsp)    movsd %xmm12,nb104_fizH2(%rsp)    movsd %xmm13,nb104_fixM(%rsp)    movsd %xmm14,nb104_fiyM(%rsp)    movsd %xmm15,nb104_fizM(%rsp)    ## store back j H2 forces from xmm0-xmm2        movsd %xmm0,48(%rdi,%rax,8)        movsd %xmm1,56(%rdi,%rax,8)        movsd %xmm2,64(%rdi,%rax,8)        ## move j M coordinates to local temp variables     movsd 72(%rsi,%rax,8),%xmm0    movsd 80(%rsi,%rax,8),%xmm1    movsd 88(%rsi,%rax,8),%xmm2    ## xmm0 = Mx    ## xmm1 = My    ## xmm2 = Mz    movsd %xmm0,%xmm3    movsd %xmm1,%xmm4    movsd %xmm2,%xmm5    movsd %xmm0,%xmm6    movsd %xmm1,%xmm7    movsd %xmm2,%xmm8    subsd nb104_ixH1(%rsp),%xmm0    subsd nb104_iyH1(%rsp),%xmm1    subsd nb104_izH1(%rsp),%xmm2    subsd nb104_ixH2(%rsp),%xmm3    subsd nb104_iyH2(%rsp),%xmm4    subsd nb104_izH2(%rsp),%xmm5    subsd nb104_ixM(%rsp),%xmm6    subsd nb104_iyM(%rsp),%xmm7    subsd nb104_izM(%rsp),%xmm8        movsd %xmm0,nb104_dxH1M(%rsp)        movsd %xmm1,nb104_dyH1M(%rsp)        movsd %xmm2,nb104_dzH1M(%rsp)        mulsd  %xmm0,%xmm0        mulsd  %xmm1,%xmm1        mulsd  %xmm2,%xmm2        movsd %xmm3,nb104_dxH2M(%rsp)        movsd %xmm4,nb104_dyH2M(%rsp)        movsd %xmm5,nb104_dzH2M(%rsp)        mulsd  %xmm3,%xmm3        mulsd  %xmm4,%xmm4        mulsd  %xmm5,%xmm5        movsd %xmm6,nb104_dxMM(%rsp)        movsd %xmm7,nb104_dyMM(%rsp)        movsd %xmm8,nb104_dzMM(%rsp)        mulsd  %xmm6,%xmm6        mulsd  %xmm7,%xmm7        mulsd  %xmm8,%xmm8        addsd  %xmm1,%xmm0        addsd  %xmm2,%xmm0        addsd  %xmm4,%xmm3        addsd  %xmm5,%xmm3    addsd  %xmm7,%xmm6    addsd  %xmm8,%xmm6        ## start doing invsqrt for jM atoms    cvtsd2ss %xmm0,%xmm1    cvtsd2ss %xmm3,%xmm4    cvtsd2ss %xmm6,%xmm7        rsqrtss %xmm1,%xmm1        rsqrtss %xmm4,%xmm4    rsqrtss %xmm7,%xmm7    cvtss2sd %xmm1,%xmm1    cvtss2sd %xmm4,%xmm4    cvtss2sd %xmm7,%xmm7        movsd  %xmm1,%xmm2        movsd  %xmm4,%xmm5    movsd  %xmm7,%xmm8        mulsd   %xmm1,%xmm1 ## lu*lu        mulsd   %xmm4,%xmm4 ## lu*lu    mulsd   %xmm7,%xmm7 ## lu*lu        movsd  nb104_three(%rsp),%xmm9        movsd  %xmm9,%xmm10    movsd  %xmm9,%xmm11        mulsd   %xmm0,%xmm1 ## rsq*lu*lu        mulsd   %xmm3,%xmm4 ## rsq*lu*lu     mulsd   %xmm6,%xmm7 ## rsq*lu*lu        subsd   %xmm1,%xmm9        subsd   %xmm4,%xmm10    subsd   %xmm7,%xmm11 ## 3-rsq*lu*lu        mulsd   %xmm2,%xmm9        mulsd   %xmm5,%xmm10    mulsd   %xmm8,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb104_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ## first iteration for rinvH1M         mulsd   %xmm15,%xmm10 ## first iteration for rinvH2M    mulsd   %xmm15,%xmm11 ## first iteration for rinvMM    ## second iteration step            movsd  %xmm9,%xmm2        movsd  %xmm10,%xmm5    movsd  %xmm11,%xmm8        mulsd   %xmm2,%xmm2 ## lu*lu        mulsd   %xmm5,%xmm5 ## lu*lu    mulsd   %xmm8,%xmm8 ## lu*lu        movsd  nb104_three(%rsp),%xmm1        movsd  %xmm1,%xmm4    movsd  %xmm1,%xmm7        mulsd   %xmm0,%xmm2 ## rsq*lu*lu        mulsd   %xmm3,%xmm5 ## rsq*lu*lu     mulsd   %xmm6,%xmm8 ## rsq*lu*lu        subsd   %xmm2,%xmm1        subsd   %xmm5,%xmm4    subsd   %xmm8,%xmm7 ## 3-rsq*lu*lu        mulsd   %xmm1,%xmm9        mulsd   %xmm4,%xmm10    mulsd   %xmm7,%xmm11 ## lu*(3-rsq*lu*lu)        movsd  nb104_half(%rsp),%xmm15        mulsd   %xmm15,%xmm9 ##  rinvH1M        mulsd   %xmm15,%xmm10 ##   rinvH2M    mulsd   %xmm15,%xmm11 ##   rinvMM        ## M interactions     movsd %xmm9,%xmm0    movsd %xmm10,%xmm1    movsd %xmm11,%xmm2    mulsd  %xmm9,%xmm9    mulsd  %xmm10,%xmm10    mulsd  %xmm11,%xmm11    mulsd  nb104_qqMH(%rsp),%xmm0    mulsd  nb104_qqMH(%rsp),%xmm1    mulsd  nb104_qqMM(%rsp),%xmm2    mulsd  %xmm0,%xmm9    mulsd  %xmm1,%xmm10    mulsd  %xmm2,%xmm11    addsd nb104_vctot(%rsp),%xmm0    addsd %xmm2,%xmm1    addsd %xmm1,%xmm0    movsd %xmm0,nb104_vctot(%rsp)    ## move j M forces to xmm0-xmm2        movsd 72(%rdi,%rax,8),%xmm0        movsd 80(%rdi,%rax,8),%xmm1        movsd 88(%rdi,%rax,8),%xmm2    movsd %xmm9,%xmm7    movsd %xmm9,%xmm8    movsd %xmm11,%xmm13    movsd %xmm11,%xmm14    movsd %xmm11,%xmm15    movsd %xmm10,%xmm11    movsd %xmm10,%xmm12        mulsd nb104_dxH1M(%rsp),%xmm7        mulsd nb104_dyH1M(%rsp),%xmm8        mulsd nb104_dzH1M(%rsp),%xmm9        mulsd nb104_dxH2M(%rsp),%xmm10        mulsd nb104_dyH2M(%rsp),%xmm11        mulsd nb104_dzH2M(%rsp),%xmm12        mulsd nb104_dxMM(%rsp),%xmm13        mulsd nb104_dyMM(%rsp),%xmm14        mulsd nb104_dzMM(%rsp),%xmm15    addsd %xmm7,%xmm0    addsd %xmm8,%xmm1    addsd %xmm9,%xmm2    addsd nb104_fixH1(%rsp),%xmm7    addsd nb104_fiyH1(%rsp),%xmm8    addsd nb104_fizH1(%rsp),%xmm9    addsd %xmm10,%xmm0    addsd %xmm11,%xmm1    addsd %xmm12,%xmm2    addsd nb104_fixH2(%rsp),%xmm10    addsd nb104_fiyH2(%rsp),%xmm11    addsd nb104_fizH2(%rsp),%xmm12    addsd %xmm13,%xmm0    addsd %xmm14,%xmm1    addsd %xmm15,%xmm2    addsd nb104_fixM(%rsp),%xmm13    addsd nb104_fiyM(%rsp),%xmm14    addsd nb104_fizM(%rsp),%xmm15    movsd %xmm7,nb104_fixH1(%rsp)    movsd %xmm8,nb104_fiyH1(%rsp)    movsd %xmm9,nb104_fizH1(%rsp)    movsd %xmm10,nb104_fixH2(%rsp)    movsd %xmm11,nb104_fiyH2(%rsp)    movsd %xmm12,nb104_fizH2(%rsp)    movsd %xmm13,nb104_fixM(%rsp)    movsd %xmm14,nb104_fiyM(%rsp)    movsd %xmm15,nb104_fizM(%rsp)    ## store back j M forces from xmm0-xmm2        movsd %xmm0,72(%rdi,%rax,8)        movsd %xmm1,80(%rdi,%rax,8)        movsd %xmm2,88(%rdi,%rax,8)_nb_kernel104_x86_64_sse2.nb104_updateouterdata:         movl  nb104_ii3(%rsp),%ecx        movq  nb104_faction(%rbp),%rdi        movq  nb104_fshift(%rbp),%rsi        movl  nb104_is3(%rsp),%edx        ## accumulate H1i forces in xmm0, xmm1, xmm2         movapd nb104_fixH1(%rsp),%xmm0        movapd nb104_fiyH1(%rsp),%xmm1        movapd nb104_fizH1(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addsd  %xmm3,%xmm0        addsd  %xmm4,%xmm1        addsd  %xmm5,%xmm2 ## sum is in low xmm0-xmm2         ## increment i force         movsd  24(%rdi,%rcx,8),%xmm3        movsd  32(%rdi,%rcx,8),%xmm4        movsd  40(%rdi,%rcx,8),%xmm5        subsd  %xmm0,%xmm3        subsd  %xmm1,%xmm4        subsd  %xmm2,%xmm5        movsd  %xmm3,24(%rdi,%rcx,8)        movsd  %xmm4,32(%rdi,%rcx,8)        movsd  %xmm5,40(%rdi,%rcx,8)        ## accumulate force in xmm6/xmm7 for fshift         movapd %xmm0,%xmm6        movsd %xmm2,%xmm7        unpcklpd %xmm1,%xmm6        ## accumulate H2i forces in xmm0, xmm1, xmm2         movapd nb104_fixH2(%rsp),%xmm0        movapd nb104_fiyH2(%rsp),%xmm1        movapd nb104_fizH2(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addsd  %xmm3,%xmm0        addsd  %xmm4,%xmm1        addsd  %xmm5,%xmm2 ## sum is in low xmm0-xmm2         ## increment i force         movsd  48(%rdi,%rcx,8),%xmm3        movsd  56(%rdi,%rcx,8),%xmm4        movsd  64(%rdi,%rcx,8),%xmm5        subsd  %xmm0,%xmm3        subsd  %xmm1,%xmm4        subsd  %xmm2,%xmm5        movsd  %xmm3,48(%rdi,%rcx,8)        movsd  %xmm4,56(%rdi,%rcx,8)        movsd  %xmm5,64(%rdi,%rcx,8)        ## accumulate force in xmm6/xmm7 for fshift         addsd %xmm2,%xmm7        unpcklpd %xmm1,%xmm0        addpd %xmm0,%xmm6        ## accumulate H2i forces in xmm0, xmm1, xmm2         movapd nb104_fixM(%rsp),%xmm0        movapd nb104_fiyM(%rsp),%xmm1        movapd nb104_fizM(%rsp),%xmm2        movhlps %xmm0,%xmm3        movhlps %xmm1,%xmm4        movhlps %xmm2,%xmm5        addsd  %xmm3,%xmm0        addsd  %xmm4,%xmm1        addsd  %xmm5,%xmm2 ## sum is in low xmm0-xmm2         movapd %xmm0,%xmm3        movapd %xmm1,%xmm4        movapd %xmm2,%xmm5        ## increment i force         movsd  72(%rdi,%rcx,8),%xmm3        movsd  80(%rdi,%rcx,8),%xmm4        movsd  88(%rdi,%rcx,8),%xmm5        subsd  %xmm0,%xmm3        subsd  %xmm1,%xmm4        subsd  %xmm2,%xmm5        movsd  %xmm3,72(%rdi,%rcx,8)        movsd  %xmm4,80(%rdi,%rcx,8)        movsd  %xmm5,88(%rdi,%rcx,8)        ## accumulate force in xmm6/xmm7 for fshift         addsd %xmm2,%xmm7        unpcklpd %xmm1,%xmm0        addpd %xmm0,%xmm6        ## increment fshift force         movlpd (%rsi,%rdx,8),%xmm3        movhpd 8(%rsi,%rdx,8),%xmm3        movsd  16(%rsi,%rdx,8),%xmm4        subpd  %xmm6,%xmm3        subsd  %xmm7,%xmm4        movlpd %xmm3,(%rsi,%rdx,8)        movhpd %xmm3,8(%rsi,%rdx,8)        movsd  %xmm4,16(%rsi,%rdx,8)        ## get n from stack        movl nb104_n(%rsp),%esi        ## get group index for i particle         movq  nb104_gid(%rbp),%rdx              ## base of gid[]        movl  (%rdx,%rsi,4),%edx                ## ggid=gid[n]        ## accumulate total potential energy and update it         movapd nb104_vctot(%rsp),%xmm7        ## accumulate         movhlps %xmm7,%xmm6        addsd  %xmm6,%xmm7      ## pos 0-1 in xmm7 have the sum now         ## add earlier value from mem         movq  nb104_Vc(%rbp),%rax        addsd (%rax,%rdx,8),%xmm7        ## move back to mem         movsd %xmm7,(%rax,%rdx,8)        ## finish if last         movl nb104_nn1(%rsp),%ecx        ## esi already loaded with n        incl %esi        subl %esi,%ecx        jz _nb_kernel104_x86_64_sse2.nb104_outerend        ## not last, iterate outer loop once more!          movl %esi,nb104_n(%rsp)        jmp _nb_kernel104_x86_64_sse2.nb104_outer_nb_kernel104_x86_64_sse2.nb104_outerend:         ## check if more outer neighborlists remain        movl  nb104_nri(%rsp),%ecx        ## esi already loaded with n above        subl  %esi,%ecx        jz _nb_kernel104_x86_64_sse2.nb104_end        ## non-zero, do one more workunit        jmp   _nb_kernel104_x86_64_sse2.nb104_threadloop_nb_kernel104_x86_64_sse2.nb104_end:         movl nb104_nouter(%rsp),%eax        movl nb104_ninner(%rsp),%ebx        movq nb104_outeriter(%rbp),%rcx        movq nb104_inneriter(%rbp),%rdx        movl %eax,(%rcx)        movl %ebx,(%rdx)        addq $1496,%rsp        emms        pop %r15        pop %r14        pop %r13        pop %r12        pop %rbx        pop    %rbp        ret.globl nb_kernel104nf_x86_64_sse2.globl _nb_kernel104nf_x86_64_sse2nb_kernel104nf_x86_64_sse2:     _nb_kernel104nf_x86_64_sse2:    .set nb104nf_fshift, 16.set nb104nf_gid, 24.set nb104nf_pos, 32.set nb104nf_faction, 40.set nb104nf_charge, 48.set nb104nf_p_facel, 56.set nb104nf_argkrf, 64.set nb104nf_argcrf, 72.set nb104nf_Vc, 80.set nb104nf_type, 88.set nb104nf_p_ntype, 96.set nb104nf_vdwparam, 104.set nb104nf_Vvdw, 112.set nb104nf_p_tabscale, 120.set nb104nf_VFtab, 128

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?