nb_kernel430_ia32_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,411 行 · 第 1/5 页
S
2,411 行
;# put scalar force on stack Update Vvdwtot directly addps xmm5, [esp + nb430_Vvdwtot] movaps [esp + nb430_fscal], xmm7 movaps [esp + nb430_Vvdwtot], xmm5 ;# repulsion movaps xmm4, [esi + ecx*4 + 16] movaps xmm7, [esi + edx*4 + 16] ;# transpose, using xmm3 for scratch movaps xmm6, xmm4 unpcklps xmm4, xmm7 ;# Y1 Y2 F1 F2 unpckhps xmm6, xmm7 ;# G1 G2 H1 H2 movhlps xmm5, xmm4 ;# F1 F2 movhlps xmm7, xmm6 ;# H1 H2 ;# table ready, in xmm4-xmm7 mulps xmm6, xmm1 ;# xmm6=Geps mulps xmm7, xmm2 ;# xmm7=Heps2 addps xmm5, xmm6 addps xmm5, xmm7 ;# xmm5=Fp mulps xmm7, [esp + nb430_two] ;# two*Heps2 addps xmm7, xmm6 addps xmm7, xmm5 ;# xmm7=FF mulps xmm5, xmm1 ;# xmm5=eps*Fp addps xmm5, xmm4 ;# xmm5=VV movaps xmm4, [esp + nb430_c12] mulps xmm7, xmm4 ;# fijR mulps xmm5, xmm4 ;# Vvdw12 mulps xmm7, [esp + nb430_tsc] addps xmm7, [esp + nb430_fscal] addps xmm5, [esp + nb430_Vvdwtot] movaps [esp + nb430_Vvdwtot], xmm5 xorps xmm4, xmm4 mulps xmm7, xmm0 subps xmm4, xmm7 movaps xmm0, [esp + nb430_dx] movaps xmm1, [esp + nb430_dy] movaps xmm2, [esp + nb430_dz] mulps xmm0, xmm4 mulps xmm1, xmm4 mulps xmm2, xmm4 ;# xmm0-xmm2 contains tx-tz (partial force) ;# now update f_i movaps xmm3, [esp + nb430_fix] movaps xmm4, [esp + nb430_fiy] movaps xmm5, [esp + nb430_fiz] addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps [esp + nb430_fix], xmm3 movaps [esp + nb430_fiy], xmm4 movaps [esp + nb430_fiz], xmm5 ;# update the fj's movss xmm3, [edi + eax*4] movss xmm4, [edi + eax*4 + 4] movss xmm5, [edi + eax*4 + 8] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [edi + eax*4], xmm3 movss [edi + eax*4 + 4], xmm4 movss [edi + eax*4 + 8], xmm5 shufps xmm0, xmm0, 225 ;# constant 11100001 shufps xmm1, xmm1, 225 ;# constant 11100001 shufps xmm2, xmm2, 225 ;# constant 11100001 movss xmm3, [edi + ebx*4] movss xmm4, [edi + ebx*4 + 4] movss xmm5, [edi + ebx*4 + 8] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [edi + ebx*4], xmm3 movss [edi + ebx*4 + 4], xmm4 movss [edi + ebx*4 + 8], xmm5 .nb430_checksingle: mov edx, [esp + nb430_innerk] and edx, 1 jnz .nb430_dosingle jmp .nb430_updateouterdata.nb430_dosingle: mov esi, [ebp + nb430_charge] mov edx, [ebp + nb430_invsqrta] mov edi, [ebp + nb430_pos] mov ecx, [esp + nb430_innerjjnr] mov eax, [ecx] xorps xmm2, xmm2 movaps xmm6, xmm2 movss xmm2, [edx + eax*4] ;# isaj mulss xmm2, [esp + nb430_isai] movss [esp + nb430_isaprod], xmm2 movss xmm1, xmm2 mulss xmm1, [esp + nb430_gbtsc] movss [esp + nb430_gbscale], xmm1 mulss xmm2, [esp + nb430_iq] movss xmm6, [esi + eax*4] ;# xmm6(0) has the charge mulss xmm6, xmm2 movss [esp + nb430_qq], xmm6 mov esi, [ebp + nb430_type] mov ecx, eax mov ecx, [esi + ecx*4] mov esi, [ebp + nb430_vdwparam] shl ecx, 1 add ecx, [esp + nb430_ntia] movlps xmm6, [esi + ecx*4] movaps xmm4, xmm6 shufps xmm4, xmm4, 252 ;# constant 11111100 shufps xmm6, xmm6, 253 ;# constant 11111101 movss [esp + nb430_c6], xmm4 movss [esp + nb430_c12], xmm6 movd mm0, eax lea eax, [eax + eax*2] ;# move coordinates to xmm0-xmm2 movss xmm0, [edi + eax*4] movss xmm1, [edi + eax*4 + 4] movss xmm2, [edi + eax*4 + 8] movss xmm4, [esp + nb430_ix] movss xmm5, [esp + nb430_iy] movss xmm6, [esp + nb430_iz] ;# calc dr subss xmm4, xmm0 subss xmm5, xmm1 subss xmm6, xmm2 ;# store dr movaps [esp + nb430_dx], xmm4 movaps [esp + nb430_dy], xmm5 movaps [esp + nb430_dz], xmm6 ;# square it mulss xmm4,xmm4 mulss xmm5,xmm5 mulss xmm6,xmm6 addss xmm4, xmm5 addss xmm4, xmm6 ;# rsq in xmm4 rsqrtss xmm5, xmm4 ;# lookup seed in xmm5 movaps xmm2, xmm5 mulss xmm5, xmm5 movss xmm1, [esp + nb430_three] mulss xmm5, xmm4 ;# rsq*lu*lu movss xmm0, [esp + nb430_half] subss xmm1, xmm5 ;# constant 30-rsq*lu*lu mulss xmm1, xmm2 mulss xmm0, xmm1 ;# xmm0=rinv mulss xmm4, xmm0 ;# xmm4=r movss [esp + nb430_r], xmm4 mulss xmm4, [esp + nb430_gbscale] cvttss2si ebx, xmm4 ;# mm6 contain lu indices cvtsi2ss xmm6, ebx subss xmm4, xmm6 movaps xmm1, xmm4 ;# xmm1=eps movaps xmm2, xmm1 mulss xmm2, xmm2 ;# xmm2=eps2 shl ebx, 2 mov esi, [ebp + nb430_GBtab] movaps xmm4, [esi + ebx*4] movhlps xmm6, xmm4 movaps xmm5, xmm4 movaps xmm7, xmm6 shufps xmm5, xmm5, 1 shufps xmm7, xmm7, 1 ;# table ready in xmm4-xmm7 mulss xmm6, xmm1 ;# xmm6=Geps mulss xmm7, xmm2 ;# xmm7=Heps2 addss xmm5, xmm6 addss xmm5, xmm7 ;# xmm5=Fp mulss xmm7, [esp + nb430_two] ;# two*Heps2 movss xmm3, [esp + nb430_qq] addss xmm7, xmm6 addss xmm7, xmm5 ;# xmm7=FF mulss xmm5, xmm1 ;# xmm5=eps*Fp addss xmm5, xmm4 ;# xmm5=VV mulss xmm5, xmm3 ;# vcoul=qq*VV mulss xmm3, xmm7 ;# fijC=FF*qq movd ebx, mm0 mov esi, [ebp + nb430_dvda] ;# Calculate dVda xorps xmm7, xmm7 mulss xmm3, [esp + nb430_gbscale] movaps xmm6, xmm3 mulss xmm6, [esp + nb430_r] addss xmm6, xmm5 addss xmm5, [esp + nb430_vctot] movss [esp + nb430_vctot], xmm5 ;# xmm6=(vcoul+fijC*r) subss xmm7, xmm6 movaps xmm6, xmm7 ;# update dvdasum addss xmm7, [esp + nb430_dvdasum] movaps [esp + nb430_dvdasum], xmm7 ;# update j atoms dvdaj addss xmm6, [esi + ebx*4] movss [esi + ebx*4], xmm6 ;# put scalar force on stack temporarily movss [esp + nb430_fscal], xmm3 movss xmm4, [esp + nb430_r] mulps xmm4, [esp + nb430_tsc] cvttss2si ebx, xmm4 cvtsi2ss xmm6, ebx subss xmm4, xmm6 movss xmm1, xmm4 ;# xmm1=eps movss xmm2, xmm1 mulss xmm2, xmm2 ;# xmm2=eps2 shl ebx, 3 mov esi, [ebp + nb430_VFtab] ;# dispersion movaps xmm4, [esi + ebx*4] movhlps xmm6, xmm4 movaps xmm5, xmm4 movaps xmm7, xmm6 shufps xmm5, xmm5, 1 shufps xmm7, xmm7, 1 ;# table ready in xmm4-xmm7 mulss xmm6, xmm1 ;# xmm6=Geps mulss xmm7, xmm2 ;# xmm7=Heps2 addss xmm5, xmm6 addss xmm5, xmm7 ;# xmm5=Fp mulss xmm7, [esp + nb430_two] ;# two*Heps2 addss xmm7, xmm6 addss xmm7, xmm5 ;# xmm7=FF mulss xmm5, xmm1 ;# xmm5=eps*Fp addss xmm5, xmm4 ;# xmm5=VV movss xmm4, [esp + nb430_c6] mulss xmm7, xmm4 ;# fijD mulss xmm5, xmm4 ;# Vvdw6 mulps xmm7, [esp + nb430_tsc] addss xmm7, [esp + nb430_fscal] ;# add to fscal ;# put scalar force on stack Update Vvdwtot directly addss xmm5, [esp + nb430_Vvdwtot] movss [esp + nb430_fscal], xmm7 movss [esp + nb430_Vvdwtot], xmm5 ;# repulsion movaps xmm4, [esi + ebx*4 + 16] movhlps xmm6, xmm4 movaps xmm5, xmm4 movaps xmm7, xmm6 shufps xmm5, xmm5, 1 shufps xmm7, xmm7, 1 ;# table ready in xmm4-xmm7 mulss xmm6, xmm1 ;# xmm6=Geps mulss xmm7, xmm2 ;# xmm7=Heps2 addss xmm5, xmm6 addss xmm5, xmm7 ;# xmm5=Fp mulss xmm7, [esp + nb430_two] ;# two*Heps2 addss xmm7, xmm6 addss xmm7, xmm5 ;# xmm7=FF mulss xmm5, xmm1 ;# xmm5=eps*Fp addss xmm5, xmm4 ;# xmm5=VV movss xmm4, [esp + nb430_c12] mulss xmm7, xmm4 ;# fijR mulss xmm5, xmm4 ;# Vvdw12 mulps xmm7, [esp + nb430_tsc] addss xmm7, [esp + nb430_fscal] addss xmm5, [esp + nb430_Vvdwtot] movss [esp + nb430_Vvdwtot], xmm5 xorps xmm4, xmm4 mulss xmm7, xmm0 subss xmm4, xmm7 mov edi, [ebp + nb430_faction] movss xmm0, [esp + nb430_dx] movss xmm1, [esp + nb430_dy] movss xmm2, [esp + nb430_dz] mulss xmm0, xmm4 mulss xmm1, xmm4 mulss xmm2, xmm4 ;# xmm0-xmm2 contains tx-tz (partial force) ;# now update f_i movss xmm3, [esp + nb430_fix] movss xmm4, [esp + nb430_fiy] movss xmm5, [esp + nb430_fiz] addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movss [esp + nb430_fix], xmm3 movss [esp + nb430_fiy], xmm4 movss [esp + nb430_fiz], xmm5 ;# update fj movss xmm3, [edi + eax*4] movss xmm4, [edi + eax*4 + 4] movss xmm5, [edi + eax*4 + 8] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [edi + eax*4], xmm3 movss [edi + eax*4 + 4], xmm4 movss [edi + eax*4 + 8], xmm5 .nb430_updateouterdata: mov ecx, [esp + nb430_ii3] mov edi, [ebp + nb430_faction] mov esi, [ebp + nb430_fshift] mov edx, [esp + nb430_is3] ;# accumulate i forces in xmm0, xmm1, xmm2 movaps xmm0, [esp + nb430_fix] movaps xmm1, [esp + nb430_fiy] movaps xmm2, [esp + nb430_fiz] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 ;# xmm0-xmm2 has single force in pos0 ;# increment i force movss xmm3, [edi + ecx*4] movss xmm4, [edi + ecx*4 + 4] movss xmm5, [edi + ecx*4 + 8] addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movss [edi + ecx*4], xmm3 movss [edi + ecx*4 + 4], xmm4 movss [edi + ecx*4 + 8], xmm5 ;# increment fshift force movss xmm3, [esi + edx*4] movss xmm4, [esi + edx*4 + 4] movss xmm5, [esi + edx*4 + 8] addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movss [esi + edx*4], xmm3 movss [esi + edx*4 + 4], xmm4 movss [esi + edx*4 + 8], xmm5 ;# get n from stack mov esi, [esp + nb430_n] ;# get group index for i particle mov edx, [ebp + nb430_gid] ;# base of gid[] mov edx, [edx + esi*4] ;# ggid=gid[n] ;# accumulate total potential energy and update it movaps xmm7, [esp + nb430_vctot] ;# accumulate movhlps xmm6, xmm7 addps xmm7, xmm6 ;# pos 0-1 in xmm7 have the sum now movaps xmm6, xmm7 shufps xmm6, xmm6, 1 addss xmm7, xmm6 ;# add earlier value from mem mov eax, [ebp + nb430_Vc] addss xmm7, [eax + edx*4] ;# move back to mem movss [eax + edx*4], xmm7 ;# accumulate total lj energy and update it movaps xmm7, [esp + nb430_Vvdwtot] ;# accumulate movhlps xmm6, xmm7 addps xmm7, xmm6 ;# pos 0-1 in xmm7 have the sum now movaps xmm6, xmm7 shufps xmm6, xmm6, 1 addss xmm7, xmm6 ;# add earlier value from mem mov eax, [ebp + nb430_Vvdw] addss xmm7, [eax + edx*4] ;# move back to mem movss [eax + edx*4], xmm7 ;# accumulate dVda and update it movaps xmm7, [esp + nb430_dvdasum] ;# accumulate movhlps xmm6, xmm7 addps xmm7, xmm6 ;# pos 0-1 in xmm7 have the sum now movaps xmm6, xmm7 shufps xmm6, xmm6, 1 addss xmm7, xmm6 mov edx, [esp + nb430_ii] mov eax, [ebp + nb430_dvda] addss xmm7, [eax + edx*4] movss [eax + edx*4], xmm7 ;# finish if last mov ecx, [esp + nb430_nn1] ;# esi already loaded with n inc esi sub ecx, esi jecxz .nb430_outerend ;# not last, iterate outer loop once more! mov [esp + nb430_n], esi jmp .nb430_outer.nb430_outerend: ;# check if more outer neighborlists remain mov ecx, [esp + nb430_nri] ;# esi already loaded with n above sub ecx, esi jecxz .nb430_end ;# non-zero, do one more workunit jmp .nb430_threadloop.nb430_end: emms mov eax, [esp + nb430_nouter] mov ebx, [esp + nb430_ninner] mov ecx, [ebp + nb430_outeriter] mov edx, [ebp + nb430_inneriter] mov [ecx], eax mov [edx], ebx mov eax, [esp + nb430_salign] add esp, eax add esp, 488 pop edi pop esi pop edx pop ecx pop ebx pop eax leave ret .globl nb_kernel430nf_ia32_sse.globl _nb_kernel430nf_ia32_ssenb_kernel430nf_ia32_sse: _nb_kernel430nf_ia32_sse: .equiv nb430nf_p_nri, 8.equiv nb430nf_iinr, 12
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?