nb_kernel102_x86_64_sse.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,099 行 · 第 1/5 页
S
2,099 行
movq nb102nf_jjnr(%rsp),%rax shll $2,%ecx addq %rcx,%rax movq %rax,nb102nf_innerjjnr(%rsp) ## pointer to jjnr[nj0] movl %edx,%ecx subl $4,%edx addl nb102nf_ninner(%rsp),%ecx movl %ecx,nb102nf_ninner(%rsp) addl $0,%edx movl %edx,nb102nf_innerk(%rsp) ## number of innerloop atoms jge _nb_kernel102nf_x86_64_sse.nb102nf_unroll_loop jmp _nb_kernel102nf_x86_64_sse.nb102nf_single_check_nb_kernel102nf_x86_64_sse.nb102nf_unroll_loop: ## quad-unroll innerloop here movq nb102nf_innerjjnr(%rsp),%rdx ## pointer to jjnr[k] movl (%rdx),%eax movl 4(%rdx),%ebx movl 8(%rdx),%ecx movl 12(%rdx),%edx ## eax-edx=jnr1-4 addq $16,nb102nf_innerjjnr(%rsp) ## advance pointer (unrolled 4) movq nb102nf_pos(%rbp),%rsi ## base of pos[] lea (%rax,%rax,2),%rax ## replace jnr with j3 lea (%rbx,%rbx,2),%rbx lea (%rcx,%rcx,2),%rcx ## replace jnr with j3 lea (%rdx,%rdx,2),%rdx ## move j coordinates to local temp variables movlps (%rsi,%rax,4),%xmm2 movlps 12(%rsi,%rax,4),%xmm3 movlps 24(%rsi,%rax,4),%xmm4 movlps (%rsi,%rbx,4),%xmm5 movlps 12(%rsi,%rbx,4),%xmm6 movlps 24(%rsi,%rbx,4),%xmm7 movhps (%rsi,%rcx,4),%xmm2 movhps 12(%rsi,%rcx,4),%xmm3 movhps 24(%rsi,%rcx,4),%xmm4 movhps (%rsi,%rdx,4),%xmm5 movhps 12(%rsi,%rdx,4),%xmm6 movhps 24(%rsi,%rdx,4),%xmm7 ## current state: ## xmm2= jxOa jyOa jxOc jyOc ## xmm3= jxH1a jyH1a jxH1c jyH1c ## xmm4= jxH2a jyH2a jxH2c jyH2c ## xmm5= jxOb jyOb jxOd jyOd ## xmm6= jxH1b jyH1b jxH1d jyH1d ## xmm7= jxH2b jyH2b jxH2d jyH2d movaps %xmm2,%xmm0 movaps %xmm3,%xmm1 unpcklps %xmm5,%xmm0 ## xmm0= jxOa jxOb jyOa jyOb unpcklps %xmm6,%xmm1 ## xmm1= jxH1a jxH1b jyH1a jyH1b unpckhps %xmm5,%xmm2 ## xmm2= jxOc jxOd jyOc jyOd unpckhps %xmm6,%xmm3 ## xmm3= jxH1c jxH1d jyH1c jyH1d movaps %xmm4,%xmm5 movaps %xmm0,%xmm6 unpcklps %xmm7,%xmm4 ## xmm4= jxH2a jxH2b jyH2a jyH2b unpckhps %xmm7,%xmm5 ## xmm5= jxH2c jxH2d jyH2c jyH2d movaps %xmm1,%xmm7 movlhps %xmm2,%xmm0 ## xmm0= jxOa jxOb jxOc jxOd movaps %xmm0,nb102nf_jxO(%rsp) movhlps %xmm6,%xmm2 ## xmm2= jyOa jyOb jyOc jyOd movaps %xmm2,nb102nf_jyO(%rsp) movlhps %xmm3,%xmm1 movaps %xmm1,nb102nf_jxH1(%rsp) movhlps %xmm7,%xmm3 movaps %xmm4,%xmm6 movaps %xmm3,nb102nf_jyH1(%rsp) movlhps %xmm5,%xmm4 movaps %xmm4,nb102nf_jxH2(%rsp) movhlps %xmm6,%xmm5 movaps %xmm5,nb102nf_jyH2(%rsp) movss 8(%rsi,%rax,4),%xmm0 movss 20(%rsi,%rax,4),%xmm1 movss 32(%rsi,%rax,4),%xmm2 movss 8(%rsi,%rcx,4),%xmm3 movss 20(%rsi,%rcx,4),%xmm4 movss 32(%rsi,%rcx,4),%xmm5 movhps 4(%rsi,%rbx,4),%xmm0 movhps 16(%rsi,%rbx,4),%xmm1 movhps 28(%rsi,%rbx,4),%xmm2 movhps 4(%rsi,%rdx,4),%xmm3 movhps 16(%rsi,%rdx,4),%xmm4 movhps 28(%rsi,%rdx,4),%xmm5 shufps $204,%xmm3,%xmm0 ## 11001100 shufps $204,%xmm4,%xmm1 ## 11001100 shufps $204,%xmm5,%xmm2 ## 11001100 movaps %xmm0,nb102nf_jzO(%rsp) movaps %xmm1,nb102nf_jzH1(%rsp) movaps %xmm2,nb102nf_jzH2(%rsp) movaps nb102nf_ixO(%rsp),%xmm0 movaps nb102nf_iyO(%rsp),%xmm1 movaps nb102nf_izO(%rsp),%xmm2 movaps nb102nf_ixO(%rsp),%xmm3 movaps nb102nf_iyO(%rsp),%xmm4 movaps nb102nf_izO(%rsp),%xmm5 subps nb102nf_jxO(%rsp),%xmm0 subps nb102nf_jyO(%rsp),%xmm1 subps nb102nf_jzO(%rsp),%xmm2 subps nb102nf_jxH1(%rsp),%xmm3 subps nb102nf_jyH1(%rsp),%xmm4 subps nb102nf_jzH1(%rsp),%xmm5 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 mulps %xmm3,%xmm3 mulps %xmm4,%xmm4 mulps %xmm5,%xmm5 addps %xmm1,%xmm0 addps %xmm2,%xmm0 addps %xmm4,%xmm3 addps %xmm5,%xmm3 movaps %xmm0,nb102nf_rsqOO(%rsp) movaps %xmm3,nb102nf_rsqOH1(%rsp) movaps nb102nf_ixO(%rsp),%xmm0 movaps nb102nf_iyO(%rsp),%xmm1 movaps nb102nf_izO(%rsp),%xmm2 movaps nb102nf_ixH1(%rsp),%xmm3 movaps nb102nf_iyH1(%rsp),%xmm4 movaps nb102nf_izH1(%rsp),%xmm5 subps nb102nf_jxH2(%rsp),%xmm0 subps nb102nf_jyH2(%rsp),%xmm1 subps nb102nf_jzH2(%rsp),%xmm2 subps nb102nf_jxO(%rsp),%xmm3 subps nb102nf_jyO(%rsp),%xmm4 subps nb102nf_jzO(%rsp),%xmm5 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 mulps %xmm3,%xmm3 mulps %xmm4,%xmm4 mulps %xmm5,%xmm5 addps %xmm1,%xmm0 addps %xmm2,%xmm0 addps %xmm4,%xmm3 addps %xmm5,%xmm3 movaps %xmm0,nb102nf_rsqOH2(%rsp) movaps %xmm3,nb102nf_rsqH1O(%rsp) movaps nb102nf_ixH1(%rsp),%xmm0 movaps nb102nf_iyH1(%rsp),%xmm1 movaps nb102nf_izH1(%rsp),%xmm2 movaps nb102nf_ixH1(%rsp),%xmm3 movaps nb102nf_iyH1(%rsp),%xmm4 movaps nb102nf_izH1(%rsp),%xmm5 subps nb102nf_jxH1(%rsp),%xmm0 subps nb102nf_jyH1(%rsp),%xmm1 subps nb102nf_jzH1(%rsp),%xmm2 subps nb102nf_jxH2(%rsp),%xmm3 subps nb102nf_jyH2(%rsp),%xmm4 subps nb102nf_jzH2(%rsp),%xmm5 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 mulps %xmm3,%xmm3 mulps %xmm4,%xmm4 mulps %xmm5,%xmm5 addps %xmm1,%xmm0 addps %xmm2,%xmm0 addps %xmm4,%xmm3 addps %xmm5,%xmm3 movaps %xmm0,nb102nf_rsqH1H1(%rsp) movaps %xmm3,nb102nf_rsqH1H2(%rsp) movaps nb102nf_ixH2(%rsp),%xmm0 movaps nb102nf_iyH2(%rsp),%xmm1 movaps nb102nf_izH2(%rsp),%xmm2 movaps nb102nf_ixH2(%rsp),%xmm3 movaps nb102nf_iyH2(%rsp),%xmm4 movaps nb102nf_izH2(%rsp),%xmm5 subps nb102nf_jxO(%rsp),%xmm0 subps nb102nf_jyO(%rsp),%xmm1 subps nb102nf_jzO(%rsp),%xmm2 subps nb102nf_jxH1(%rsp),%xmm3 subps nb102nf_jyH1(%rsp),%xmm4 subps nb102nf_jzH1(%rsp),%xmm5 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 mulps %xmm3,%xmm3 mulps %xmm4,%xmm4 mulps %xmm5,%xmm5 addps %xmm1,%xmm0 addps %xmm2,%xmm0 addps %xmm3,%xmm4 addps %xmm5,%xmm4 movaps %xmm0,nb102nf_rsqH2O(%rsp) movaps %xmm4,nb102nf_rsqH2H1(%rsp) movaps nb102nf_ixH2(%rsp),%xmm0 movaps nb102nf_iyH2(%rsp),%xmm1 movaps nb102nf_izH2(%rsp),%xmm2 subps nb102nf_jxH2(%rsp),%xmm0 subps nb102nf_jyH2(%rsp),%xmm1 subps nb102nf_jzH2(%rsp),%xmm2 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 addps %xmm1,%xmm0 addps %xmm2,%xmm0 movaps %xmm0,nb102nf_rsqH2H2(%rsp) ## start doing invsqrt use rsq values in xmm0, xmm4 rsqrtps %xmm0,%xmm1 rsqrtps %xmm4,%xmm5 movaps %xmm1,%xmm2 movaps %xmm5,%xmm6 mulps %xmm1,%xmm1 mulps %xmm5,%xmm5 movaps nb102nf_three(%rsp),%xmm3 movaps %xmm3,%xmm7 mulps %xmm0,%xmm1 mulps %xmm4,%xmm5 subps %xmm1,%xmm3 subps %xmm5,%xmm7 mulps %xmm2,%xmm3 mulps %xmm6,%xmm7 mulps nb102nf_half(%rsp),%xmm3 ## rinvH2H2 mulps nb102nf_half(%rsp),%xmm7 ## rinvH2H1 movaps %xmm3,nb102nf_rinvH2H2(%rsp) movaps %xmm7,nb102nf_rinvH2H1(%rsp) rsqrtps nb102nf_rsqOO(%rsp),%xmm1 rsqrtps nb102nf_rsqOH1(%rsp),%xmm5 movaps %xmm1,%xmm2 movaps %xmm5,%xmm6 mulps %xmm1,%xmm1 mulps %xmm5,%xmm5 movaps nb102nf_three(%rsp),%xmm3 movaps %xmm3,%xmm7 mulps nb102nf_rsqOO(%rsp),%xmm1 mulps nb102nf_rsqOH1(%rsp),%xmm5 subps %xmm1,%xmm3 subps %xmm5,%xmm7 mulps %xmm2,%xmm3 mulps %xmm6,%xmm7 mulps nb102nf_half(%rsp),%xmm3 mulps nb102nf_half(%rsp),%xmm7 movaps %xmm3,nb102nf_rinvOO(%rsp) movaps %xmm7,nb102nf_rinvOH1(%rsp) rsqrtps nb102nf_rsqOH2(%rsp),%xmm1 rsqrtps nb102nf_rsqH1O(%rsp),%xmm5 movaps %xmm1,%xmm2 movaps %xmm5,%xmm6 mulps %xmm1,%xmm1 mulps %xmm5,%xmm5 movaps nb102nf_three(%rsp),%xmm3 movaps %xmm3,%xmm7 mulps nb102nf_rsqOH2(%rsp),%xmm1 mulps nb102nf_rsqH1O(%rsp),%xmm5 subps %xmm1,%xmm3 subps %xmm5,%xmm7 mulps %xmm2,%xmm3 mulps %xmm6,%xmm7 mulps nb102nf_half(%rsp),%xmm3 mulps nb102nf_half(%rsp),%xmm7 movaps %xmm3,nb102nf_rinvOH2(%rsp) movaps %xmm7,nb102nf_rinvH1O(%rsp) rsqrtps nb102nf_rsqH1H1(%rsp),%xmm1 rsqrtps nb102nf_rsqH1H2(%rsp),%xmm5 movaps %xmm1,%xmm2 movaps %xmm5,%xmm6 mulps %xmm1,%xmm1 mulps %xmm5,%xmm5 movaps nb102nf_three(%rsp),%xmm3 movaps %xmm3,%xmm7 mulps nb102nf_rsqH1H1(%rsp),%xmm1 mulps nb102nf_rsqH1H2(%rsp),%xmm5 subps %xmm1,%xmm3 subps %xmm5,%xmm7 mulps %xmm2,%xmm3 mulps %xmm6,%xmm7 mulps nb102nf_half(%rsp),%xmm3 mulps nb102nf_half(%rsp),%xmm7 movaps %xmm3,nb102nf_rinvH1H1(%rsp) movaps %xmm7,nb102nf_rinvH1H2(%rsp) rsqrtps nb102nf_rsqH2O(%rsp),%xmm1 movaps %xmm1,%xmm2 mulps %xmm1,%xmm1 movaps nb102nf_three(%rsp),%xmm3 mulps nb102nf_rsqH2O(%rsp),%xmm1 subps %xmm1,%xmm3 mulps %xmm2,%xmm3 mulps nb102nf_half(%rsp),%xmm3 movaps %xmm3,nb102nf_rinvH2O(%rsp) ## sum OO pot in xmm0, OH in xmm1 HH in xmm2 movaps nb102nf_rinvOO(%rsp),%xmm0 movaps nb102nf_rinvOH1(%rsp),%xmm1 movaps nb102nf_rinvH1H1(%rsp),%xmm2 addps nb102nf_rinvOH2(%rsp),%xmm1 addps nb102nf_rinvH1H2(%rsp),%xmm2 addps nb102nf_rinvH1O(%rsp),%xmm1 addps nb102nf_rinvH2H1(%rsp),%xmm2 addps nb102nf_rinvH2O(%rsp),%xmm1 addps nb102nf_rinvH2H2(%rsp),%xmm2 mulps nb102nf_qqOO(%rsp),%xmm0 mulps nb102nf_qqOH(%rsp),%xmm1 mulps nb102nf_qqHH(%rsp),%xmm2 addps nb102nf_vctot(%rsp),%xmm0 addps %xmm2,%xmm1 addps %xmm1,%xmm0 movaps %xmm0,nb102nf_vctot(%rsp) ## should we do one more iteration? subl $4,nb102nf_innerk(%rsp) jl _nb_kernel102nf_x86_64_sse.nb102nf_single_check jmp _nb_kernel102nf_x86_64_sse.nb102nf_unroll_loop_nb_kernel102nf_x86_64_sse.nb102nf_single_check: addl $4,nb102nf_innerk(%rsp) jnz _nb_kernel102nf_x86_64_sse.nb102nf_single_loop jmp _nb_kernel102nf_x86_64_sse.nb102nf_updateouterdata_nb_kernel102nf_x86_64_sse.nb102nf_single_loop: movq nb102nf_innerjjnr(%rsp),%rdx ## pointer to jjnr[k] movl (%rdx),%eax addq $4,nb102nf_innerjjnr(%rsp) movq nb102nf_pos(%rbp),%rsi lea (%rax,%rax,2),%rax ## fetch j coordinates xorps %xmm3,%xmm3 xorps %xmm4,%xmm4 xorps %xmm5,%xmm5 movss (%rsi,%rax,4),%xmm3 ## jxO - - - movss 4(%rsi,%rax,4),%xmm4 ## jyO - - - movss 8(%rsi,%rax,4),%xmm5 ## jzO - - - movlps 12(%rsi,%rax,4),%xmm6 ## xmm6 = jxH1 jyH1 - - movss 20(%rsi,%rax,4),%xmm7 ## xmm7 = jzH1 - - - movhps 24(%rsi,%rax,4),%xmm6 ## xmm6 = jxH1 jyH1 jxH2 jyH2 movss 32(%rsi,%rax,4),%xmm2 ## xmm2 = jzH2 - - - ## have all coords, time for some shuffling. shufps $216,%xmm6,%xmm6 ## 11011000 ;# xmm6 = jxH1 jxH2 jyH1 jyH2 unpcklps %xmm2,%xmm7 ## xmm7 = jzH1 jzH2 - - movaps nb102nf_ixO(%rsp),%xmm0 movaps nb102nf_iyO(%rsp),%xmm1 movaps nb102nf_izO(%rsp),%xmm2 movlhps %xmm6,%xmm3 ## xmm3 = jxO 0 jxH1 jxH2 shufps $228,%xmm6,%xmm4 ## 11100100 ;# xmm4 = jyO 0 jyH1 jyH2 shufps $68,%xmm7,%xmm5 ## 01000100 ;# xmm5 = jzO 0 jzH1 jzH2 ## store all j coordinates in jO movaps %xmm3,nb102nf_jxO(%rsp) movaps %xmm4,nb102nf_jyO(%rsp) movaps %xmm5,nb102nf_jzO(%rsp) subps %xmm3,%xmm0 subps %xmm4,%xmm1 subps %xmm5,%xmm2 mulps %xmm0,%xmm0 mulps %xmm1,%xmm1 mulps %xmm2,%xmm2 addps %xmm1,%xmm0 addps %xmm2,%xmm0 ## have rsq in xmm0 ## do invsqrt rsqrtps %xmm0,%xmm1 movaps %xmm1,%xmm2 mulps %xmm1,%xmm1 movaps nb102nf_three(%rsp),%xmm3 mulps %xmm0,%xmm1 subps %xmm1,%xmm3 mulps %xmm2,%xmm3 mulps nb102nf_half(%rsp),%xmm3 ## rinv iO - j water xorps %xmm1,%xmm1 xorps %xmm4,%xmm4 ## fetch charges to xmm4 (temporary) movss nb102nf_qqOO(%rsp),%xmm4 movhps nb102nf_qqOH(%rsp),%xmm4 mulps %xmm4,%xmm3 ## xmm3=vcoul addps nb102nf_vctot(%rsp),%xmm3 movaps %xmm3,nb102nf_vctot(%rsp) ## done with i O Now do i H1 & H2 simultaneously: movaps nb102nf_ixH1(%rsp),%xmm0 movaps nb102nf_iyH1(%rsp),%xmm1 movaps nb102nf_izH1(%rsp),%xmm2 movaps nb102nf_ixH2(%rsp),%xmm3 movaps nb102nf_iyH2(%rsp),%xmm4 movaps nb102nf_izH2(%rsp),%xmm5 subps nb102nf_jxO(%rsp),%xmm0 subps nb102nf_jyO(%rsp),
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?