nb_kernel114_ia32_sse.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,017 行 · 第 1/5 页

S
2,017
字号
        movaps nb114_rinvH1H2(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqHH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs H1-H2          addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        xorps %xmm3,%xmm3        movaps %xmm3,%xmm4        movaps %xmm3,%xmm5        mulps nb114_dxH1H2(%esp),%xmm0        mulps nb114_dyH1H2(%esp),%xmm1        mulps nb114_dzH1H2(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixH1(%esp),%xmm0        addps nb114_fiyH1(%esp),%xmm1        addps nb114_fizH1(%esp),%xmm2        movaps %xmm3,nb114_fjxH2(%esp)        movaps %xmm4,nb114_fjyH2(%esp)        movaps %xmm5,nb114_fjzH2(%esp)        movaps %xmm0,nb114_fixH1(%esp)        movaps %xmm1,nb114_fiyH1(%esp)        movaps %xmm2,nb114_fizH1(%esp)        ## H1-M interaction          movaps nb114_rinvH1M(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqMH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs H1-M          addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        xorps %xmm3,%xmm3        movaps %xmm3,%xmm4        movaps %xmm3,%xmm5        mulps nb114_dxH1M(%esp),%xmm0        mulps nb114_dyH1M(%esp),%xmm1        mulps nb114_dzH1M(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixH1(%esp),%xmm0        addps nb114_fiyH1(%esp),%xmm1        addps nb114_fizH1(%esp),%xmm2        movaps %xmm3,nb114_fjxM(%esp)        movaps %xmm4,nb114_fjyM(%esp)        movaps %xmm5,nb114_fjzM(%esp)        movaps %xmm0,nb114_fixH1(%esp)        movaps %xmm1,nb114_fiyH1(%esp)        movaps %xmm2,nb114_fizH1(%esp)        ## H2-H1 interaction         movaps nb114_rinvH2H1(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqHH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs H2-H1         addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        movaps nb114_fjxH1(%esp),%xmm3        movaps nb114_fjyH1(%esp),%xmm4        movaps nb114_fjzH1(%esp),%xmm5        mulps nb114_dxH2H1(%esp),%xmm0        mulps nb114_dyH2H1(%esp),%xmm1        mulps nb114_dzH2H1(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixH2(%esp),%xmm0        addps nb114_fiyH2(%esp),%xmm1        addps nb114_fizH2(%esp),%xmm2        movaps %xmm3,nb114_fjxH1(%esp)        movaps %xmm4,nb114_fjyH1(%esp)        movaps %xmm5,nb114_fjzH1(%esp)        movaps %xmm0,nb114_fixH2(%esp)        movaps %xmm1,nb114_fiyH2(%esp)        movaps %xmm2,nb114_fizH2(%esp)        ## H2-H2 interaction         movaps nb114_rinvH2H2(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqHH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fsH2H2        addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        movaps nb114_fjxH2(%esp),%xmm3        movaps nb114_fjyH2(%esp),%xmm4        movaps nb114_fjzH2(%esp),%xmm5        mulps nb114_dxH2H2(%esp),%xmm0        mulps nb114_dyH2H2(%esp),%xmm1        mulps nb114_dzH2H2(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixH2(%esp),%xmm0        addps nb114_fiyH2(%esp),%xmm1        addps nb114_fizH2(%esp),%xmm2        movaps %xmm3,nb114_fjxH2(%esp)        movaps %xmm4,nb114_fjyH2(%esp)        movaps %xmm5,nb114_fjzH2(%esp)        movaps %xmm0,nb114_fixH2(%esp)        movaps %xmm1,nb114_fiyH2(%esp)        movaps %xmm2,nb114_fizH2(%esp)        ## H2-M interaction         movaps nb114_rinvH2M(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqMH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs H2-M          addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        movaps nb114_fjxM(%esp),%xmm3        movaps nb114_fjyM(%esp),%xmm4        movaps nb114_fjzM(%esp),%xmm5        mulps nb114_dxH2M(%esp),%xmm0        mulps nb114_dyH2M(%esp),%xmm1        mulps nb114_dzH2M(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixH2(%esp),%xmm0        addps nb114_fiyH2(%esp),%xmm1        addps nb114_fizH2(%esp),%xmm2        movaps %xmm3,nb114_fjxM(%esp)        movaps %xmm4,nb114_fjyM(%esp)        movaps %xmm5,nb114_fjzM(%esp)        movaps %xmm0,nb114_fixH2(%esp)        movaps %xmm1,nb114_fiyH2(%esp)        movaps %xmm2,nb114_fizH2(%esp)        ## M-H1 interaction         movaps nb114_rinvMH1(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqMH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs M-H1         addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        movaps nb114_fjxH1(%esp),%xmm3        movaps nb114_fjyH1(%esp),%xmm4        movaps nb114_fjzH1(%esp),%xmm5        mulps nb114_dxMH1(%esp),%xmm0        mulps nb114_dyMH1(%esp),%xmm1        mulps nb114_dzMH1(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixM(%esp),%xmm0        addps nb114_fiyM(%esp),%xmm1        addps nb114_fizM(%esp),%xmm2        movaps %xmm3,nb114_fjxH1(%esp)        movaps %xmm4,nb114_fjyH1(%esp)        movaps %xmm5,nb114_fjzH1(%esp)        movaps %xmm0,nb114_fixM(%esp)        movaps %xmm1,nb114_fiyM(%esp)        movaps %xmm2,nb114_fizM(%esp)        ## M-H2 interaction         movaps nb114_rinvMH2(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqMH(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs M-H2         addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm0,%xmm2        movaps nb114_fjxH2(%esp),%xmm3        movaps nb114_fjyH2(%esp),%xmm4        movaps nb114_fjzH2(%esp),%xmm5        mulps nb114_dxMH2(%esp),%xmm0        mulps nb114_dyMH2(%esp),%xmm1        mulps nb114_dzMH2(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixM(%esp),%xmm0        addps nb114_fiyM(%esp),%xmm1        addps nb114_fizM(%esp),%xmm2        movaps %xmm3,nb114_fjxH2(%esp)        movaps %xmm4,nb114_fjyH2(%esp)        movaps %xmm5,nb114_fjzH2(%esp)        movaps %xmm0,nb114_fixM(%esp)        movaps %xmm1,nb114_fiyM(%esp)        movaps %xmm2,nb114_fizM(%esp)        ## M-M interaction         movaps nb114_rinvMM(%esp),%xmm0        movaps %xmm0,%xmm1        mulps %xmm0,%xmm0        mulps nb114_qqMM(%esp),%xmm1        mulps %xmm1,%xmm0       ## fs M-M         addps %xmm1,%xmm7       ## add to local vctot         movaps %xmm0,%xmm1        movaps %xmm7,nb114_vctot(%esp)        movaps %xmm0,%xmm2        movaps nb114_fjxM(%esp),%xmm3        movaps nb114_fjyM(%esp),%xmm4        movaps nb114_fjzM(%esp),%xmm5        mulps nb114_dxMM(%esp),%xmm0        mulps nb114_dyMM(%esp),%xmm1        mulps nb114_dzMM(%esp),%xmm2        subps %xmm0,%xmm3        subps %xmm1,%xmm4        subps %xmm2,%xmm5        addps nb114_fixM(%esp),%xmm0        addps nb114_fiyM(%esp),%xmm1        addps nb114_fizM(%esp),%xmm2        movaps %xmm3,nb114_fjxM(%esp)        movaps %xmm4,nb114_fjyM(%esp)        movaps %xmm5,nb114_fjzM(%esp)        movaps %xmm0,nb114_fixM(%esp)        movaps %xmm1,nb114_fiyM(%esp)        movaps %xmm2,nb114_fizM(%esp)        ## Did all interactions - now update j forces         movl nb114_faction(%ebp),%edi        ## 4 j waters with four atoms each.        ## step 1 : transpose fjxO, fjyO, fjzO, fjxH1        movaps nb114_fjxO(%esp),%xmm0        movaps nb114_fjyO(%esp),%xmm1        movaps nb114_fjzO(%esp),%xmm2        movaps nb114_fjxH1(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   (%edi,%eax,4),%xmm1        movlps   (%edi,%ebx,4),%xmm5        movlps   (%edi,%ecx,4),%xmm6        movlps   (%edi,%edx,4),%xmm7        movhps   8(%edi,%eax,4),%xmm1        movhps   8(%edi,%ebx,4),%xmm5        movhps   8(%edi,%ecx,4),%xmm6        movhps   8(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,(%edi,%eax,4)        movlps   %xmm5,(%edi,%ebx,4)        movlps   %xmm6,(%edi,%ecx,4)        movlps   %xmm7,(%edi,%edx,4)        movhps   %xmm1,8(%edi,%eax,4)        movhps   %xmm5,8(%edi,%ebx,4)        movhps   %xmm6,8(%edi,%ecx,4)        movhps   %xmm7,8(%edi,%edx,4)        ## step 2 : transpose fjyH1, fjzH1, fjxH2, fjyH2        movaps nb114_fjyH1(%esp),%xmm0        movaps nb114_fjzH1(%esp),%xmm1        movaps nb114_fjxH2(%esp),%xmm2        movaps nb114_fjyH2(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm4, xmm2, xmm0, xmm3        ## load the corresponding j forces from memory        movlps   16(%edi,%eax,4),%xmm1        movlps   16(%edi,%ebx,4),%xmm5        movlps   16(%edi,%ecx,4),%xmm6        movlps   16(%edi,%edx,4),%xmm7        movhps   24(%edi,%eax,4),%xmm1        movhps   24(%edi,%ebx,4),%xmm5        movhps   24(%edi,%ecx,4),%xmm6        movhps   24(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,16(%edi,%eax,4)        movlps   %xmm5,16(%edi,%ebx,4)        movlps   %xmm6,16(%edi,%ecx,4)        movlps   %xmm7,16(%edi,%edx,4)        movhps   %xmm1,24(%edi,%eax,4)        movhps   %xmm5,24(%edi,%ebx,4)        movhps   %xmm6,24(%edi,%ecx,4)        movhps   %xmm7,24(%edi,%edx,4)        ## step 3 : transpose fjzH2, fjxM, fjyM, fjzM. xmm4 is scratch        movaps nb114_fjzH2(%esp),%xmm0        movaps nb114_fjxM(%esp),%xmm1        movaps nb114_fjyM(%esp),%xmm2        movaps nb114_fjzM(%esp),%xmm3        movaps %xmm0,%xmm4        movaps %xmm1,%xmm5        unpcklps %xmm2,%xmm4        unpcklps %xmm3,%xmm5        unpckhps %xmm2,%xmm0        unpckhps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm0,%xmm3        unpcklps %xmm5,%xmm4        unpckhps %xmm5,%xmm2        unpcklps %xmm1,%xmm0        unpckhps %xmm1,%xmm3        ## results are now in xmm0, xmm1, xmm2, xmm3        ## load the corresponding j forces from memory        movlps   32(%edi,%eax,4),%xmm1        movlps   32(%edi,%ebx,4),%xmm5        movlps   32(%edi,%ecx,4),%xmm6        movlps   32(%edi,%edx,4),%xmm7        movhps   40(%edi,%eax,4),%xmm1        movhps   40(%edi,%ebx,4),%xmm5        movhps   40(%edi,%ecx,4),%xmm6        movhps   40(%edi,%edx,4),%xmm7        ## add        addps    %xmm4,%xmm1        addps    %xmm2,%xmm5        addps    %xmm0,%xmm6        addps    %xmm3,%xmm7        ## store back        movlps   %xmm1,32(%edi,%eax,4)        movlps   %xmm5,32(%edi,%ebx,4)        movlps   %xmm6,32(%edi,%ecx,4)        movlps   %xmm7,32(%edi,%edx,4)        movhps   %xmm1,40(%edi,%eax,4)        movhps   %xmm5,40(%edi,%ebx,4)        movhps   %xmm6,40(%edi,%ecx,4)        movhps   %xmm7,40(%edi,%edx,4)        ## should we do one more iteration?         subl $4,nb114_innerk(%esp)        jl    _nb_kernel114_ia32_sse.nb114_single_check        jmp   _nb_kernel114_ia32_sse.nb114_unroll_loop_nb_kernel114_ia32_sse.nb114_single_check:         addl $4,nb114_innerk(%esp)        jnz   _nb_kernel114_ia32_sse.nb114_single_loop        jmp   _nb_kernel114_ia32_sse.nb114_updateouterdata_nb_kernel114_ia32_sse.nb114_single_loop:         movl  nb114_innerjjnr(%esp),%edx        ## pointer to jjnr[k]         movl  (%edx),%eax        addl $4,nb114_innerjjnr(%esp)        movl nb114_pos(%ebp),%esi        leal  (%eax,%eax,2),%eax        ## fetch j coordinates          movlps (%esi,%eax,4),%xmm3              ##  Ox  Oy          movlps 16(%esi,%eax,4),%xmm4            ## H1y H1z         movlps 32(%esi,%eax,4),%xmm5            ## H2z  Mx         movhps 8(%esi,%eax,4),%xmm3             ##  Ox  Oy  Oz H1x        movhps 24(%esi,%eax,4),%xmm4            ## H1y H1z H2x H2y        movhps 40(%esi,%eax,4),%xmm5            ## H2z  Mx  My  Mz        ## transpose        movaps %xmm4,%xmm0        movaps %xmm3,%xmm1        movaps %xmm4,%xmm2        movaps %xmm3,%xmm6        shufps $18,%xmm5,%xmm4 ## (00010010)  h2x - Mx  -         shufps $193,%xmm0,%xmm3 ## (11000001)  Oy  - H1y -         shufps $35,%xmm5,%xmm2 ## (00100011) H2y - My  -         shufps $18,%xmm0,%xmm1 ## (00010010)  Oz  - H1z -         ##  xmm6: Ox - - H1x   xmm5: H2z - - Mz         shufps $140,%xmm4,%xmm6 ## (10001100) Ox H1x H2x Mx         shufps $136,%xmm2,%xmm3 ## (10001000) Oy H1y H2y My         shufps $200,%xmm5,%xmm1 ## (11001000) Oz H1z H2z Mz        ## store all j coordinates in jO          movaps %xmm6,nb114_jxO(%esp)        movaps %xmm3,nb114_jyO(%esp)        movaps %xmm1,nb114_jzO(%esp)        ## do O and M in parallel

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?