nb_kernel314_ia32_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,300 行 · 第 1/5 页
S
2,300 行
addps xmm5, xmm6 addps xmm5, xmm7 ;# xmm5=Fp mulps xmm7, [esp + nb314_two] ;# two*Heps2 movaps xmm3, [esp + nb314_qqMH] addps xmm7, xmm6 addps xmm7, xmm5 ;# xmm7=FF mulps xmm5, xmm1 ;# xmm5=eps*Fp addps xmm5, xmm4 ;# xmm5=VV mulps xmm5, xmm3 ;# vcoul=qq*VV mulps xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and mm3 fijC addps xmm5, [esp + nb314_vctot] movaps [esp + nb314_vctot], xmm5 xorps xmm1, xmm1 mulps xmm3, [esp + nb314_tsc] mulps xmm3, xmm0 subps xmm1, xmm3 movaps xmm0, xmm1 movaps xmm2, xmm1 movaps xmm3, [esp + nb314_fjxH1] movaps xmm4, [esp + nb314_fjyH1] movaps xmm5, [esp + nb314_fjzH1] mulps xmm0, [esp + nb314_dxMH1] mulps xmm1, [esp + nb314_dyMH1] mulps xmm2, [esp + nb314_dzMH1] subps xmm3, xmm0 subps xmm4, xmm1 subps xmm5, xmm2 addps xmm0, [esp + nb314_fixM] addps xmm1, [esp + nb314_fiyM] addps xmm2, [esp + nb314_fizM] movaps [esp + nb314_fjxH1], xmm3 movaps [esp + nb314_fjyH1], xmm4 movaps [esp + nb314_fjzH1], xmm5 movaps [esp + nb314_fixM], xmm0 movaps [esp + nb314_fiyM], xmm1 movaps [esp + nb314_fizM], xmm2 ;# M-H2 interaction movaps xmm0, [esp + nb314_rinvMH2] movaps xmm1, xmm0 mulps xmm1, [esp + nb314_rsqMH2] ;# xmm1=r mulps xmm1, [esp + nb314_tsc] movhlps xmm2, xmm1 cvttps2pi mm6, xmm1 cvttps2pi mm7, xmm2 ;# mm6/mm7 contain lu indices cvtpi2ps xmm3, mm6 cvtpi2ps xmm2, mm7 movlhps xmm3, xmm2 subps xmm1, xmm3 ;# xmm1=eps movaps xmm2, xmm1 mulps xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 pslld mm7, 2 movd eax, mm6 psrlq mm6, 32 movd ecx, mm7 psrlq mm7, 32 movd ebx, mm6 movd edx, mm7 movlps xmm5, [esi + eax*4] movlps xmm7, [esi + ecx*4] movhps xmm5, [esi + ebx*4] movhps xmm7, [esi + edx*4] ;# got half coulomb table movaps xmm4, xmm5 shufps xmm4, xmm7, 136 ;# constant 10001000 shufps xmm5, xmm7, 221 ;# constant 11011101 movlps xmm7, [esi + eax*4 + 8] movlps xmm3, [esi + ecx*4 + 8] movhps xmm7, [esi + ebx*4 + 8] movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table movaps xmm6, xmm7 shufps xmm6, xmm3, 136 ;# constant 10001000 shufps xmm7, xmm3, 221 ;# constant 11011101 ;# coulomb table ready, in xmm4-xmm7 mulps xmm6, xmm1 ;# xmm6=Geps mulps xmm7, xmm2 ;# xmm7=Heps2 addps xmm5, xmm6 addps xmm5, xmm7 ;# xmm5=Fp mulps xmm7, [esp + nb314_two] ;# two*Heps2 movaps xmm3, [esp + nb314_qqMH] addps xmm7, xmm6 addps xmm7, xmm5 ;# xmm7=FF mulps xmm5, xmm1 ;# xmm5=eps*Fp addps xmm5, xmm4 ;# xmm5=VV mulps xmm5, xmm3 ;# vcoul=qq*VV mulps xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and mm3 fijC addps xmm5, [esp + nb314_vctot] movaps [esp + nb314_vctot], xmm5 xorps xmm1, xmm1 mulps xmm3, [esp + nb314_tsc] mulps xmm3, xmm0 subps xmm1, xmm3 movaps xmm0, xmm1 movaps xmm2, xmm1 movaps xmm3, [esp + nb314_fjxH2] movaps xmm4, [esp + nb314_fjyH2] movaps xmm5, [esp + nb314_fjzH2] mulps xmm0, [esp + nb314_dxMH2] mulps xmm1, [esp + nb314_dyMH2] mulps xmm2, [esp + nb314_dzMH2] subps xmm3, xmm0 subps xmm4, xmm1 subps xmm5, xmm2 addps xmm0, [esp + nb314_fixM] addps xmm1, [esp + nb314_fiyM] addps xmm2, [esp + nb314_fizM] movaps [esp + nb314_fjxH2], xmm3 movaps [esp + nb314_fjyH2], xmm4 movaps [esp + nb314_fjzH2], xmm5 movaps [esp + nb314_fixM], xmm0 movaps [esp + nb314_fiyM], xmm1 movaps [esp + nb314_fizM], xmm2 ;# M-M interaction movaps xmm0, [esp + nb314_rinvMM] movaps xmm1, xmm0 mulps xmm1, [esp + nb314_rsqMM] ;# xmm1=r mulps xmm1, [esp + nb314_tsc] movhlps xmm2, xmm1 cvttps2pi mm6, xmm1 cvttps2pi mm7, xmm2 ;# mm6/mm7 contain lu indices cvtpi2ps xmm3, mm6 cvtpi2ps xmm2, mm7 movlhps xmm3, xmm2 subps xmm1, xmm3 ;# xmm1=eps movaps xmm2, xmm1 mulps xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 pslld mm7, 2 movd eax, mm6 psrlq mm6, 32 movd ecx, mm7 psrlq mm7, 32 movd ebx, mm6 movd edx, mm7 movlps xmm5, [esi + eax*4] movlps xmm7, [esi + ecx*4] movhps xmm5, [esi + ebx*4] movhps xmm7, [esi + edx*4] ;# got half coulomb table movaps xmm4, xmm5 shufps xmm4, xmm7, 136 ;# constant 10001000 shufps xmm5, xmm7, 221 ;# constant 11011101 movlps xmm7, [esi + eax*4 + 8] movlps xmm3, [esi + ecx*4 + 8] movhps xmm7, [esi + ebx*4 + 8] movhps xmm3, [esi + edx*4 + 8] ;# other half of coulomb table movaps xmm6, xmm7 shufps xmm6, xmm3, 136 ;# constant 10001000 shufps xmm7, xmm3, 221 ;# constant 11011101 ;# coulomb table ready, in xmm4-xmm7 mulps xmm6, xmm1 ;# xmm6=Geps mulps xmm7, xmm2 ;# xmm7=Heps2 addps xmm5, xmm6 addps xmm5, xmm7 ;# xmm5=Fp mulps xmm7, [esp + nb314_two] ;# two*Heps2 movaps xmm3, [esp + nb314_qqMM] addps xmm7, xmm6 addps xmm7, xmm5 ;# xmm7=FF mulps xmm5, xmm1 ;# xmm5=eps*Fp addps xmm5, xmm4 ;# xmm5=VV mulps xmm5, xmm3 ;# vcoul=qq*VV mulps xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and mm3 fijC addps xmm5, [esp + nb314_vctot] movaps [esp + nb314_vctot], xmm5 xorps xmm1, xmm1 mulps xmm3, [esp + nb314_tsc] mulps xmm3, xmm0 subps xmm1, xmm3 movaps xmm0, xmm1 movaps xmm2, xmm1 movaps xmm3, [esp + nb314_fjxM] movaps xmm4, [esp + nb314_fjyM] movaps xmm5, [esp + nb314_fjzM] mulps xmm0, [esp + nb314_dxMM] mulps xmm1, [esp + nb314_dyMM] mulps xmm2, [esp + nb314_dzMM] subps xmm3, xmm0 subps xmm4, xmm1 subps xmm5, xmm2 addps xmm0, [esp + nb314_fixM] addps xmm1, [esp + nb314_fiyM] addps xmm2, [esp + nb314_fizM] movaps [esp + nb314_fjxM], xmm3 movaps [esp + nb314_fjyM], xmm4 movaps [esp + nb314_fjzM], xmm5 movaps [esp + nb314_fixM], xmm0 movaps [esp + nb314_fiyM], xmm1 movaps [esp + nb314_fizM], xmm2 mov edi, [ebp + nb314_faction] movd eax, mm0 movd ebx, mm1 movd ecx, mm2 movd edx, mm3 ;# Did all interactions - now update j forces ;# 4 j waters with four atoms each. ;# step 1 : transpose fjxO, fjyO, fjzO, fjxH1 movaps xmm0, [esp + nb314_fjxO] movaps xmm1, [esp + nb314_fjyO] movaps xmm2, [esp + nb314_fjzO] movaps xmm3, [esp + nb314_fjxH1] movaps xmm4, xmm0 movaps xmm5, xmm1 unpcklps xmm4, xmm2 unpcklps xmm5, xmm3 unpckhps xmm0, xmm2 unpckhps xmm1, xmm3 movaps xmm2, xmm4 movaps xmm3, xmm0 unpcklps xmm4, xmm5 unpckhps xmm2, xmm5 unpcklps xmm0, xmm1 unpckhps xmm3, xmm1 ;# results are now in xmm4, xmm2, xmm0, xmm3 ;# load the corresponding j forces from memory movlps xmm1, [edi + eax*4] movlps xmm5, [edi + ebx*4] movlps xmm6, [edi + ecx*4] movlps xmm7, [edi + edx*4] movhps xmm1, [edi + eax*4 + 8] movhps xmm5, [edi + ebx*4 + 8] movhps xmm6, [edi + ecx*4 + 8] movhps xmm7, [edi + edx*4 + 8] ;# add addps xmm1, xmm4 addps xmm5, xmm2 addps xmm6, xmm0 addps xmm7, xmm3 ;# store back movlps [edi + eax*4], xmm1 movlps [edi + ebx*4], xmm5 movlps [edi + ecx*4], xmm6 movlps [edi + edx*4], xmm7 movhps [edi + eax*4 + 8], xmm1 movhps [edi + ebx*4 + 8], xmm5 movhps [edi + ecx*4 + 8], xmm6 movhps [edi + edx*4 + 8], xmm7 ;# step 2 : transpose fjyH1, fjzH1, fjxH2, fjyH2 movaps xmm0, [esp + nb314_fjyH1] movaps xmm1, [esp + nb314_fjzH1] movaps xmm2, [esp + nb314_fjxH2] movaps xmm3, [esp + nb314_fjyH2] movaps xmm4, xmm0 movaps xmm5, xmm1 unpcklps xmm4, xmm2 unpcklps xmm5, xmm3 unpckhps xmm0, xmm2 unpckhps xmm1, xmm3 movaps xmm2, xmm4 movaps xmm3, xmm0 unpcklps xmm4, xmm5 unpckhps xmm2, xmm5 unpcklps xmm0, xmm1 unpckhps xmm3, xmm1 ;# results are now in xmm4, xmm2, xmm0, xmm3 ;# load the corresponding j forces from memory movlps xmm1, [edi + eax*4 + 16] movlps xmm5, [edi + ebx*4 + 16] movlps xmm6, [edi + ecx*4 + 16] movlps xmm7, [edi + edx*4 + 16] movhps xmm1, [edi + eax*4 + 24] movhps xmm5, [edi + ebx*4 + 24] movhps xmm6, [edi + ecx*4 + 24] movhps xmm7, [edi + edx*4 + 24] ;# add addps xmm1, xmm4 addps xmm5, xmm2 addps xmm6, xmm0 addps xmm7, xmm3 ;# store back movlps [edi + eax*4 + 16], xmm1 movlps [edi + ebx*4 + 16], xmm5 movlps [edi + ecx*4 + 16], xmm6 movlps [edi + edx*4 + 16], xmm7 movhps [edi + eax*4 + 24], xmm1 movhps [edi + ebx*4 + 24], xmm5 movhps [edi + ecx*4 + 24], xmm6 movhps [edi + edx*4 + 24], xmm7 ;# step 3 : transpose fjzH2, fjxM, fjyM, fjzM. xmm4 is scratch movaps xmm0, [esp + nb314_fjzH2] movaps xmm1, [esp + nb314_fjxM] movaps xmm2, [esp + nb314_fjyM] movaps xmm3, [esp + nb314_fjzM] movaps xmm4, xmm0 movaps xmm5, xmm1 unpcklps xmm4, xmm2 unpcklps xmm5, xmm3 unpckhps xmm0, xmm2 unpckhps xmm1, xmm3 movaps xmm2, xmm4 movaps xmm3, xmm0 unpcklps xmm4, xmm5 unpckhps xmm2, xmm5 unpcklps xmm0, xmm1 unpckhps xmm3, xmm1 ;# results are now in xmm0, xmm1, xmm2, xmm3 ;# load the corresponding j forces from memory movlps xmm1, [edi + eax*4 + 32] movlps xmm5, [edi + ebx*4 + 32] movlps xmm6, [edi + ecx*4 + 32] movlps xmm7, [edi + edx*4 + 32] movhps xmm1, [edi + eax*4 + 40] movhps xmm5, [edi + ebx*4 + 40] movhps xmm6, [edi + ecx*4 + 40] movhps xmm7, [edi + edx*4 + 40] ;# add addps xmm1, xmm4 addps xmm5, xmm2 addps xmm6, xmm0 addps xmm7, xmm3 ;# store back movlps [edi + eax*4 + 32], xmm1 movlps [edi + ebx*4 + 32], xmm5 movlps [edi + ecx*4 + 32], xmm6 movlps [edi + edx*4 + 32], xmm7 movhps [edi + eax*4 + 40], xmm1 movhps [edi + ebx*4 + 40], xmm5 movhps [edi + ecx*4 + 40], xmm6 movhps [edi + edx*4 + 40], xmm7 ;# should we do one more iteration? sub dword ptr [esp + nb314_innerk], 4 jl .nb314_single_check jmp .nb314_unroll_loop.nb314_single_check: add dword ptr [esp + nb314_innerk], 4 jnz .nb314_single_loop jmp .nb314_updateouterdata.nb314_single_loop: mov edx, [esp + nb314_innerjjnr] ;# pointer to jjnr[k] mov eax, [edx] add dword ptr [esp + nb314_innerjjnr], 4 mov esi, [ebp + nb314_pos] lea eax, [eax + eax*2] ;# fetch j coordinates movlps xmm3, [esi + eax*4] ;# Ox Oy movlps xmm4, [esi + eax*4 + 16] ;# H1y H1z movlps xmm5, [esi + eax*4 + 32] ;# H2z Mx movhps xmm3, [esi + eax*4 + 8] ;# Ox Oy Oz H1x movhps xmm4, [esi + eax*4 + 24] ;# H1y H1z H2x H2y movhps xmm5, [esi + eax*4 + 40] ;# H2z Mx My Mz ;# transpose movaps xmm0, xmm4 movaps xmm1, xmm3 movaps xmm2, xmm4 movaps xmm6, xmm3 shufps xmm4, xmm5, 18 ;# (00010010) h2x - Mx - shufps xmm3, xmm0, 193 ;# (11000001) Oy - H1y - shufps xmm2, xmm5, 35 ;# (00100011) H2y - My - shufps xmm1, xmm0, 18 ;# (00010010) Oz - H1z - ;# xmm6: Ox - - H1x xmm5: H2z - - Mz shufps xmm6, xmm4, 140 ;# (10001100) Ox H1x H2x Mx shufps xmm3, xmm2, 136 ;# (10001000) Oy H1y H2y My shufps xmm1, xmm5, 200 ;# (11001000) Oz H1z H2z Mz ;# store all j coordinates in jO movaps [esp + nb314_jxO], xmm6 movaps [esp + nb314_jyO], xmm3 movaps [esp + nb314_jzO], xmm1 ;# do O and H1 in parallel movaps xmm0, [esp + nb314_ixO] movaps xmm1, [esp + nb314_iyO] movaps xmm2, [esp + nb314_izO] movaps xmm3, [esp + nb314_ixH1] movaps xmm4, [esp + nb314_iyH1] movaps xmm5, [esp + nb314_izH1] subps xmm0, [esp + nb314_jxO] subps xmm1, [esp + nb314_jyO] subps xmm2, [esp + nb314_jzO] subps xmm3, [esp + nb314_jxO] subps xmm4, [esp + nb314_jyO] subps xmm5, [esp + nb314_jzO] movaps [esp + nb314_dxOO], xmm0 movaps [esp + nb314_dyOO], xmm1 movaps [esp + nb314_dzOO], xmm2 movaps [esp + nb314_dxH1H1], xmm3 movaps [esp + nb314_dyH1H1], xmm4 movaps [esp + nb314_dzH1H1], xmm5 mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 addps xmm0, xmm1 addps xmm0, xmm2 ;# have rsq in xmm0 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm4, xmm3 addps xmm4, xmm5 ;# have rsq in xmm4 ;# Save H1 data in H1H1 movaps [esp + nb314_rsqH1H1], xmm4 ;# do 1/x for O and 1/sqrt(x) for H1 rcpss xmm1, xmm0 rsqrtps xmm5, xmm4 movss xmm2, [esp + nb314_two] movaps xmm6, xmm5 mulss xmm0, xmm1 mulps xmm5, xmm5 subss xmm2, xmm0 movaps xmm7, [esp + nb314_three] mulss xmm2, xmm1 ;# constant 1/r2 mulps xmm5, xmm4 movss xmm0, xmm2 subps xmm7, xmm5 mulss xmm2, xmm2 mulps xmm7, xmm6 mulss xmm2, xmm0 ;# constant 1/r6 mulps xmm7, [esp + nb314_half] ;# rinv iH1 - j water movss xmm1, xmm2 movaps [esp + nb314_rinvH1H1], xmm7 mulss xmm2, xmm2 ;# constant 1/r12 mulss xmm1, [esp + nb314_c6] mulss xmm2, [esp + nb314_c12] movss xmm3, xmm2 subss xmm3, xmm1 addss xmm3, [esp + nb314_Vvdwtot] movss [esp + nb314_Vvdwtot], xmm3 mulss xmm1, [esp + nb314_six] mulss xmm2, [esp + nb314_twelve]
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?