nb_kernel314_ia32_sse2.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,193 行 · 第 1/5 页
S
2,193 行
pslld mm6, 2 ;# idx *= 4 mov esi, [ebp + nb314_VFtab] movd eax, mm6 psrlq mm6, 32 movd ebx, mm6 ;# indices in eax/ebx movlpd xmm4, [esi + eax*8] ;# Y1 movlpd xmm3, [esi + ebx*8] ;# Y2 movhpd xmm4, [esi + eax*8 + 8] ;# Y1 F1 movhpd xmm3, [esi + ebx*8 + 8] ;# Y2 F2 movapd xmm5, xmm4 unpcklpd xmm4, xmm3 ;# Y1 Y2 unpckhpd xmm5, xmm3 ;# F1 F2 movlpd xmm6, [esi + eax*8 + 16] ;# G1 movlpd xmm3, [esi + ebx*8 + 16] ;# G2 movhpd xmm6, [esi + eax*8 + 24] ;# G1 H1 movhpd xmm3, [esi + ebx*8 + 24] ;# G2 H2 movapd xmm7, xmm6 unpcklpd xmm6, xmm3 ;# G1 G2 unpckhpd xmm7, xmm3 ;# H1 H2 ;# coulomb table ready, in xmm4-xmm7 mulpd xmm6, xmm1 ;# xmm6=Geps mulpd xmm7, xmm2 ;# xmm7=Heps2 addpd xmm5, xmm6 addpd xmm5, xmm7 ;# xmm5=Fp mulpd xmm7, [esp + nb314_two] ;# two*Heps2 movapd xmm3, [esp + nb314_qqMH] addpd xmm7, xmm6 addpd xmm7, xmm5 ;# xmm7=FF mulpd xmm5, xmm1 ;# xmm5=eps*Fp addpd xmm5, xmm4 ;# xmm5=VV mulpd xmm5, xmm3 ;# vcoul=qq*VV mulpd xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and xmm3 fijC addpd xmm5, [esp + nb314_vctot] movapd [esp + nb314_vctot], xmm5 xorpd xmm1, xmm1 mulpd xmm3, [esp + nb314_tsc] mulpd xmm3, xmm0 subpd xmm1, xmm3 movapd xmm0, xmm1 movapd xmm2, xmm1 movapd xmm3, [esp + nb314_fjxM] movapd xmm4, [esp + nb314_fjyM] movapd xmm5, [esp + nb314_fjzM] mulpd xmm0, [esp + nb314_dxH2M] mulpd xmm1, [esp + nb314_dyH2M] mulpd xmm2, [esp + nb314_dzH2M] subpd xmm3, xmm0 subpd xmm4, xmm1 subpd xmm5, xmm2 addpd xmm0, [esp + nb314_fixH2] addpd xmm1, [esp + nb314_fiyH2] addpd xmm2, [esp + nb314_fizH2] movapd [esp + nb314_fjxM], xmm3 movapd [esp + nb314_fjyM], xmm4 movapd [esp + nb314_fjzM], xmm5 movapd [esp + nb314_fixH2], xmm0 movapd [esp + nb314_fiyH2], xmm1 movapd [esp + nb314_fizH2], xmm2 ;# M-H1 interaction movapd xmm0, [esp + nb314_rinvMH1] movapd xmm1, xmm0 mulpd xmm1, [esp + nb314_rsqMH1] ;# xmm1=r mulpd xmm1, [esp + nb314_tsc] cvttpd2pi mm6, xmm1 ;# mm6 = lu idx cvtpi2pd xmm6, mm6 subpd xmm1, xmm6 ;# xmm1=eps movapd xmm2, xmm1 mulpd xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 ;# idx *= 4 mov esi, [ebp + nb314_VFtab] movd eax, mm6 psrlq mm6, 32 movd ebx, mm6 ;# indices in eax/ebx movlpd xmm4, [esi + eax*8] ;# Y1 movlpd xmm3, [esi + ebx*8] ;# Y2 movhpd xmm4, [esi + eax*8 + 8] ;# Y1 F1 movhpd xmm3, [esi + ebx*8 + 8] ;# Y2 F2 movapd xmm5, xmm4 unpcklpd xmm4, xmm3 ;# Y1 Y2 unpckhpd xmm5, xmm3 ;# F1 F2 movlpd xmm6, [esi + eax*8 + 16] ;# G1 movlpd xmm3, [esi + ebx*8 + 16] ;# G2 movhpd xmm6, [esi + eax*8 + 24] ;# G1 H1 movhpd xmm3, [esi + ebx*8 + 24] ;# G2 H2 movapd xmm7, xmm6 unpcklpd xmm6, xmm3 ;# G1 G2 unpckhpd xmm7, xmm3 ;# H1 H2 ;# coulomb table ready, in xmm4-xmm7 mulpd xmm6, xmm1 ;# xmm6=Geps mulpd xmm7, xmm2 ;# xmm7=Heps2 addpd xmm5, xmm6 addpd xmm5, xmm7 ;# xmm5=Fp mulpd xmm7, [esp + nb314_two] ;# two*Heps2 movapd xmm3, [esp + nb314_qqMH] addpd xmm7, xmm6 addpd xmm7, xmm5 ;# xmm7=FF mulpd xmm5, xmm1 ;# xmm5=eps*Fp addpd xmm5, xmm4 ;# xmm5=VV mulpd xmm5, xmm3 ;# vcoul=qq*VV mulpd xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and xmm3 fijC addpd xmm5, [esp + nb314_vctot] movapd [esp + nb314_vctot], xmm5 xorpd xmm1, xmm1 mulpd xmm3, [esp + nb314_tsc] mulpd xmm3, xmm0 subpd xmm1, xmm3 movapd xmm0, xmm1 movapd xmm2, xmm1 movapd xmm3, [esp + nb314_fjxH1] movapd xmm4, [esp + nb314_fjyH1] movapd xmm5, [esp + nb314_fjzH1] mulpd xmm0, [esp + nb314_dxMH1] mulpd xmm1, [esp + nb314_dyMH1] mulpd xmm2, [esp + nb314_dzMH1] subpd xmm3, xmm0 subpd xmm4, xmm1 subpd xmm5, xmm2 addpd xmm0, [esp + nb314_fixM] addpd xmm1, [esp + nb314_fiyM] addpd xmm2, [esp + nb314_fizM] movapd [esp + nb314_fjxH1], xmm3 movapd [esp + nb314_fjyH1], xmm4 movapd [esp + nb314_fjzH1], xmm5 movapd [esp + nb314_fixM], xmm0 movapd [esp + nb314_fiyM], xmm1 movapd [esp + nb314_fizM], xmm2 ;# M-H2 interaction movapd xmm0, [esp + nb314_rinvMH2] movapd xmm1, xmm0 mulpd xmm1, [esp + nb314_rsqMH2] ;# xmm1=r mulpd xmm1, [esp + nb314_tsc] cvttpd2pi mm6, xmm1 ;# mm6 = lu idx cvtpi2pd xmm6, mm6 subpd xmm1, xmm6 ;# xmm1=eps movapd xmm2, xmm1 mulpd xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 ;# idx *= 4 mov esi, [ebp + nb314_VFtab] movd eax, mm6 psrlq mm6, 32 movd ebx, mm6 ;# indices in eax/ebx movlpd xmm4, [esi + eax*8] ;# Y1 movlpd xmm3, [esi + ebx*8] ;# Y2 movhpd xmm4, [esi + eax*8 + 8] ;# Y1 F1 movhpd xmm3, [esi + ebx*8 + 8] ;# Y2 F2 movapd xmm5, xmm4 unpcklpd xmm4, xmm3 ;# Y1 Y2 unpckhpd xmm5, xmm3 ;# F1 F2 movlpd xmm6, [esi + eax*8 + 16] ;# G1 movlpd xmm3, [esi + ebx*8 + 16] ;# G2 movhpd xmm6, [esi + eax*8 + 24] ;# G1 H1 movhpd xmm3, [esi + ebx*8 + 24] ;# G2 H2 movapd xmm7, xmm6 unpcklpd xmm6, xmm3 ;# G1 G2 unpckhpd xmm7, xmm3 ;# H1 H2 ;# coulomb table ready, in xmm4-xmm7 mulpd xmm6, xmm1 ;# xmm6=Geps mulpd xmm7, xmm2 ;# xmm7=Heps2 addpd xmm5, xmm6 addpd xmm5, xmm7 ;# xmm5=Fp mulpd xmm7, [esp + nb314_two] ;# two*Heps2 movapd xmm3, [esp + nb314_qqMH] addpd xmm7, xmm6 addpd xmm7, xmm5 ;# xmm7=FF mulpd xmm5, xmm1 ;# xmm5=eps*Fp addpd xmm5, xmm4 ;# xmm5=VV mulpd xmm5, xmm3 ;# vcoul=qq*VV mulpd xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and xmm3 fijC addpd xmm5, [esp + nb314_vctot] movapd [esp + nb314_vctot], xmm5 xorpd xmm1, xmm1 mulpd xmm3, [esp + nb314_tsc] mulpd xmm3, xmm0 subpd xmm1, xmm3 movapd xmm0, xmm1 movapd xmm2, xmm1 movapd xmm3, [esp + nb314_fjxH2] movapd xmm4, [esp + nb314_fjyH2] movapd xmm5, [esp + nb314_fjzH2] mulpd xmm0, [esp + nb314_dxMH2] mulpd xmm1, [esp + nb314_dyMH2] mulpd xmm2, [esp + nb314_dzMH2] subpd xmm3, xmm0 subpd xmm4, xmm1 subpd xmm5, xmm2 addpd xmm0, [esp + nb314_fixM] addpd xmm1, [esp + nb314_fiyM] addpd xmm2, [esp + nb314_fizM] movapd [esp + nb314_fjxH2], xmm3 movapd [esp + nb314_fjyH2], xmm4 movapd [esp + nb314_fjzH2], xmm5 movapd [esp + nb314_fixM], xmm0 movapd [esp + nb314_fiyM], xmm1 movapd [esp + nb314_fizM], xmm2 ;# M-M interaction movapd xmm0, [esp + nb314_rinvMM] movapd xmm1, xmm0 mulpd xmm1, [esp + nb314_rsqMM] ;# xmm1=r mulpd xmm1, [esp + nb314_tsc] cvttpd2pi mm6, xmm1 ;# mm6 = lu idx cvtpi2pd xmm6, mm6 subpd xmm1, xmm6 ;# xmm1=eps movapd xmm2, xmm1 mulpd xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 ;# idx *= 4 mov esi, [ebp + nb314_VFtab] movd eax, mm6 psrlq mm6, 32 movd ebx, mm6 ;# indices in eax/ebx movlpd xmm4, [esi + eax*8] ;# Y1 movlpd xmm3, [esi + ebx*8] ;# Y2 movhpd xmm4, [esi + eax*8 + 8] ;# Y1 F1 movhpd xmm3, [esi + ebx*8 + 8] ;# Y2 F2 movapd xmm5, xmm4 unpcklpd xmm4, xmm3 ;# Y1 Y2 unpckhpd xmm5, xmm3 ;# F1 F2 movlpd xmm6, [esi + eax*8 + 16] ;# G1 movlpd xmm3, [esi + ebx*8 + 16] ;# G2 movhpd xmm6, [esi + eax*8 + 24] ;# G1 H1 movhpd xmm3, [esi + ebx*8 + 24] ;# G2 H2 movapd xmm7, xmm6 unpcklpd xmm6, xmm3 ;# G1 G2 unpckhpd xmm7, xmm3 ;# H1 H2 ;# coulomb table ready, in xmm4-xmm7 mulpd xmm6, xmm1 ;# xmm6=Geps mulpd xmm7, xmm2 ;# xmm7=Heps2 addpd xmm5, xmm6 addpd xmm5, xmm7 ;# xmm5=Fp mulpd xmm7, [esp + nb314_two] ;# two*Heps2 movapd xmm3, [esp + nb314_qqMM] addpd xmm7, xmm6 addpd xmm7, xmm5 ;# xmm7=FF mulpd xmm5, xmm1 ;# xmm5=eps*Fp addpd xmm5, xmm4 ;# xmm5=VV mulpd xmm5, xmm3 ;# vcoul=qq*VV mulpd xmm3, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and xmm3 fijC addpd xmm5, [esp + nb314_vctot] movapd [esp + nb314_vctot], xmm5 xorpd xmm1, xmm1 mulpd xmm3, [esp + nb314_tsc] mulpd xmm3, xmm0 subpd xmm1, xmm3 movapd xmm0, xmm1 movapd xmm2, xmm1 movapd xmm3, [esp + nb314_fjxM] movapd xmm4, [esp + nb314_fjyM] movapd xmm5, [esp + nb314_fjzM] mulpd xmm0, [esp + nb314_dxMM] mulpd xmm1, [esp + nb314_dyMM] mulpd xmm2, [esp + nb314_dzMM] subpd xmm3, xmm0 subpd xmm4, xmm1 subpd xmm5, xmm2 addpd xmm0, [esp + nb314_fixM] addpd xmm1, [esp + nb314_fiyM] addpd xmm2, [esp + nb314_fizM] movapd [esp + nb314_fjxM], xmm3 movapd [esp + nb314_fjyM], xmm4 movapd [esp + nb314_fjzM], xmm5 movapd [esp + nb314_fixM], xmm0 movapd [esp + nb314_fiyM], xmm1 movapd [esp + nb314_fizM], xmm2 mov edi, [ebp + nb314_faction] movd eax, mm0 movd ebx, mm1 ;# Did all interactions - now update j forces ;# Step1 - transpose fjxO, fjyO and fjzO, fjxH1 movapd xmm0, [esp + nb314_fjxO] movapd xmm1, [esp + nb314_fjyO] movapd xmm2, [esp + nb314_fjzO] movapd xmm3, [esp + nb314_fjxH1] movapd xmm4, xmm0 movapd xmm5, xmm2 unpcklpd xmm0, xmm1 ;# fjOxA fjOyA unpckhpd xmm4, xmm1 ;# fjOxB fjOyB unpcklpd xmm2, xmm3 ;# fjOzA fjH1xA unpckhpd xmm5, xmm3 ;# fjOzB fjH1xB movlpd xmm1, [edi + eax*8] movlpd xmm3, [edi + ebx*8] movhpd xmm1, [edi + eax*8 + 8] movhpd xmm3, [edi + ebx*8 + 8] movlpd xmm6, [edi + eax*8 + 16] movlpd xmm7, [edi + ebx*8 + 16] movhpd xmm6, [edi + eax*8 + 24] movhpd xmm7, [edi + ebx*8 + 24] addpd xmm1, xmm0 addpd xmm3, xmm4 addpd xmm6, xmm2 addpd xmm7, xmm5 movlpd [edi + eax*8], xmm1 movlpd [edi + ebx*8], xmm3 movhpd [edi + eax*8 + 8], xmm1 movhpd [edi + ebx*8 + 8], xmm3 movlpd [edi + eax*8 + 16], xmm6 movlpd [edi + ebx*8 + 16], xmm7 movhpd [edi + eax*8 + 24], xmm6 movhpd [edi + ebx*8 + 24], xmm7 ;# Step2 - transpose fjyH1, fjzH1 and fjxH2, fjyH2 movapd xmm0, [esp + nb314_fjyH1] movapd xmm1, [esp + nb314_fjzH1] movapd xmm2, [esp + nb314_fjxH2] movapd xmm3, [esp + nb314_fjyH2] movapd xmm4, xmm0 movapd xmm5, xmm2 unpcklpd xmm0, xmm1 ;# fjOxA fjOyA unpckhpd xmm4, xmm1 ;# fjOxB fjOyB unpcklpd xmm2, xmm3 ;# fjOzA fjH1xA unpckhpd xmm5, xmm3 ;# fjOzB fjH1xB movlpd xmm1, [edi + eax*8 + 32] movlpd xmm3, [edi + ebx*8 + 32] movhpd xmm1, [edi + eax*8 + 40] movhpd xmm3, [edi + ebx*8 + 40] movlpd xmm6, [edi + eax*8 + 48] movlpd xmm7, [edi + ebx*8 + 48] movhpd xmm6, [edi + eax*8 + 56] movhpd xmm7, [edi + ebx*8 + 56] addpd xmm1, xmm0 addpd xmm3, xmm4 addpd xmm6, xmm2 addpd xmm7, xmm5 movlpd [edi + eax*8 + 32], xmm1 movlpd [edi + ebx*8 + 32], xmm3 movhpd [edi + eax*8 + 40], xmm1 movhpd [edi + ebx*8 + 40], xmm3 movlpd [edi + eax*8 + 48], xmm6 movlpd [edi + ebx*8 + 48], xmm7 movhpd [edi + eax*8 + 56], xmm6 movhpd [edi + ebx*8 + 56], xmm7 ;# Step3 - transpose fjzH2, fjxM and fjyM, fjzM movapd xmm0, [esp + nb314_fjzH2] movapd xmm1, [esp + nb314_fjxM] movapd xmm2, [esp + nb314_fjyM] movapd xmm3, [esp + nb314_fjzM] movapd xmm4, xmm0 movapd xmm5, xmm2 unpcklpd xmm0, xmm1 ;# fjOxA fjOyA unpckhpd xmm4, xmm1 ;# fjOxB fjOyB unpcklpd xmm2, xmm3 ;# fjOzA fjH1xA unpckhpd xmm5, xmm3 ;# fjOzB fjH1xB movlpd xmm1, [edi + eax*8 + 64] movlpd xmm3, [edi + ebx*8 + 64] movhpd xmm1, [edi + eax*8 + 72] movhpd xmm3, [edi + ebx*8 + 72] movlpd xmm6, [edi + eax*8 + 80] movlpd xmm7, [edi + ebx*8 + 80] movhpd xmm6, [edi + eax*8 + 88] movhpd xmm7, [edi + ebx*8 + 88] addpd xmm1, xmm0 addpd xmm3, xmm4 addpd xmm6, xmm2 addpd xmm7, xmm5 movlpd [edi + eax*8 + 64], xmm1 movlpd [edi + ebx*8 + 64], xmm3 movhpd [edi + eax*8 + 72], xmm1 movhpd [edi + ebx*8 + 72], xmm3 movlpd [edi + eax*8 + 80], xmm6 movlpd [edi + ebx*8 + 80], xmm7 movhpd [edi + eax*8 + 88], xmm6 movhpd [edi + ebx*8 + 88], xmm7 ;# should we do one more iteration? sub dword ptr [esp + nb314_innerk], 2 jl .nb314_checksingle jmp .nb314_unroll_loop.nb314_checksingle: mov edx, [esp + nb314_innerk] and edx, 1 jnz .nb314_dosingle jmp .nb314_updateouterdata.nb314_dosingle: mov edx, [esp + nb314_innerjjnr] ;# pointer to jjnr[k] mov eax, [edx] mov esi, [ebp + nb314_pos] ;# base of pos[] lea eax, [eax + eax*2] ;# replace jnr with j3 ;# move j coordinates to local temp variables ;# load ox, oy, oz, h1x movlpd xmm0, [esi + eax*8] movhpd xmm0, [esi + eax*8 + 8] movlpd xmm1, [esi + eax*8 + 16] movhpd xmm1, [esi + eax*8 + 24] movlpd xmm2, [esi + eax*8 + 32] movhpd xmm2, [esi + eax*8 + 40] movlpd xmm3, [esi + eax*8 + 48] movhpd xmm3, [esi + eax*8 + 56] movlpd xmm4, [esi + eax*8 + 64] movhpd xmm4, [esi + eax*8 + 72] movlpd xmm5, [esi + eax*8 + 80] movhpd xmm5, [esi + eax*8 + 88] movsd [esp + nb314_jxO], xmm0 movsd [esp + nb314_jzO], xmm1 movsd [esp + nb314_jyH1], xmm2 movsd [esp + nb314_jxH2], xmm3
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?