nb_kernel214_x86_64_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,201 行 · 第 1/5 页
S
2,201 行
movaps xmm0, xmm4 movaps xmm1, xmm3 movaps xmm2, xmm4 movaps xmm6, xmm3 shufps xmm4, xmm5, 18 ;# (00010010) h2x - Mx - shufps xmm3, xmm0, 193 ;# (11000001) Oy - H1y - shufps xmm2, xmm5, 35 ;# (00100011) H2y - My - shufps xmm1, xmm0, 18 ;# (00010010) Oz - H1z - ;# xmm6: Ox - - H1x xmm5: H2z - - Mz shufps xmm6, xmm4, 140 ;# (10001100) Ox H1x H2x Mx shufps xmm3, xmm2, 136 ;# (10001000) Oy H1y H2y My shufps xmm1, xmm5, 200 ;# (11001000) Oz H1z H2z Mz ;# store all j coordinates in jO movaps [rsp + nb214_jxO], xmm6 movaps [rsp + nb214_jyO], xmm3 movaps [rsp + nb214_jzO], xmm1 movaps xmm0, xmm6 ;# jxO movaps xmm2, xmm1 ;# jzO movaps xmm1, xmm3 ;# jyO movaps xmm4, xmm3 ;# jyO movaps xmm3, xmm6 ;# jxO movaps xmm5, xmm2 ;# jzO ;# do O and M in parallel subps xmm0, [rsp + nb214_ixO] subps xmm1, [rsp + nb214_iyO] subps xmm2, [rsp + nb214_izO] subps xmm3, [rsp + nb214_ixM] subps xmm4, [rsp + nb214_iyM] subps xmm5, [rsp + nb214_izM] movaps [rsp + nb214_dxOO], xmm0 movaps [rsp + nb214_dyOO], xmm1 movaps [rsp + nb214_dzOO], xmm2 movaps [rsp + nb214_dxMM], xmm3 movaps [rsp + nb214_dyMM], xmm4 movaps [rsp + nb214_dzMM], xmm5 mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 addps xmm0, xmm1 addps xmm0, xmm2 ;# have rsq in xmm0 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm4, xmm3 addps xmm4, xmm5 ;# have rsq in xmm4 ;# Save M data movaps [rsp + nb214_rsqMM], xmm4 ;# do 1/x for O and 1/sqrt(x) for M rcpss xmm1, xmm0 rsqrtps xmm5, xmm4 movss xmm2, [rsp + nb214_two] movaps xmm6, xmm5 mulss xmm0, xmm1 mulps xmm5, xmm5 subss xmm2, xmm0 movaps xmm7, [rsp + nb214_three] mulss xmm2, xmm1 ;# 1/r2 mulps xmm5, xmm4 movss xmm0, xmm2 subps xmm7, xmm5 mulss xmm2, xmm2 mulps xmm7, xmm6 mulss xmm2, xmm0 ;# 1/r6 mulps xmm7, [rsp + nb214_half] ;# rinv iH1 - j water movss xmm1, xmm2 movaps [rsp + nb214_rinvMM], xmm7 mulss xmm2, xmm2 ;# 1/r12 mulss xmm1, [rsp + nb214_c6] mulss xmm2, [rsp + nb214_c12] movss xmm3, xmm2 subss xmm3, xmm1 addss xmm3, [rsp + nb214_Vvdwtot] movss [rsp + nb214_Vvdwtot], xmm3 mulss xmm1, [rsp + nb214_six] mulss xmm2, [rsp + nb214_twelve] subss xmm2, xmm1 mulss xmm0, xmm2 ;# fscal movss xmm1, xmm0 movss xmm2, xmm0 mulss xmm0, [rsp + nb214_dxOO] mulss xmm1, [rsp + nb214_dyOO] mulss xmm2, [rsp + nb214_dzOO] xorps xmm3, xmm3 xorps xmm4, xmm4 xorps xmm5, xmm5 addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movaps [rsp + nb214_fjxO], xmm3 movaps [rsp + nb214_fjyO], xmm4 movaps [rsp + nb214_fjzO], xmm5 addss xmm0, [rsp + nb214_fixO] addss xmm1, [rsp + nb214_fiyO] addss xmm2, [rsp + nb214_fizO] movss [rsp + nb214_fixO], xmm0 movss [rsp + nb214_fiyO], xmm1 movss [rsp + nb214_fizO], xmm2 ;# do M coulomb interaction movaps xmm0, [rsp + nb214_rinvMM] movaps xmm7, xmm0 ;# xmm7=rinv movaps xmm5, [rsp + nb214_krf] mulps xmm0, xmm0 ;# xmm0=rinvsq ;# fetch charges to xmm3 (temporary) xorps xmm3, xmm3 movss xmm3, [rsp + nb214_qqMH] movhps xmm3, [rsp + nb214_qqMM] shufps xmm3, xmm3, 193 ;# 11000001 mulps xmm5, [rsp + nb214_rsqMM] ;# xmm5=krsq movaps xmm6, xmm5 addps xmm6, xmm7 ;# xmm6=rinv+ krsq subps xmm6, [rsp + nb214_crf] mulps xmm6, xmm3 ;# xmm6=voul=qq*(rinv+ krsq-crf) mulps xmm5, [rsp + nb214_two] subps xmm7, xmm5 ;# xmm7=rinv-2*krsq mulps xmm7, xmm3 ;# xmm7 = coul part of fscal addps xmm6, [rsp + nb214_vctot] movaps [rsp + nb214_vctot], xmm6 mulps xmm0, xmm7 movaps xmm1, xmm0 movaps xmm2, xmm0 mulps xmm0, [rsp + nb214_dxMM] mulps xmm1, [rsp + nb214_dyMM] mulps xmm2, [rsp + nb214_dzMM] ;# update forces M - j water movaps xmm3, [rsp + nb214_fjxO] movaps xmm4, [rsp + nb214_fjyO] movaps xmm5, [rsp + nb214_fjzO] addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps [rsp + nb214_fjxO], xmm3 movaps [rsp + nb214_fjyO], xmm4 movaps [rsp + nb214_fjzO], xmm5 addps xmm0, [rsp + nb214_fixM] addps xmm1, [rsp + nb214_fiyM] addps xmm2, [rsp + nb214_fizM] movaps [rsp + nb214_fixM], xmm0 movaps [rsp + nb214_fiyM], xmm1 movaps [rsp + nb214_fizM], xmm2 ;# i H1 & H2 simultaneously first get i particle coords: movaps xmm0, [rsp + nb214_jxO] movaps xmm1, [rsp + nb214_jyO] movaps xmm2, [rsp + nb214_jzO] movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 subps xmm0, [rsp + nb214_ixH1] subps xmm1, [rsp + nb214_iyH1] subps xmm2, [rsp + nb214_izH1] subps xmm3, [rsp + nb214_ixH2] subps xmm4, [rsp + nb214_iyH2] subps xmm5, [rsp + nb214_izH2] movaps [rsp + nb214_dxH1H1], xmm0 movaps [rsp + nb214_dyH1H1], xmm1 movaps [rsp + nb214_dzH1H1], xmm2 movaps [rsp + nb214_dxH2H2], xmm3 movaps [rsp + nb214_dyH2H2], xmm4 movaps [rsp + nb214_dzH2H2], xmm5 mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm0, xmm1 addps xmm4, xmm3 addps xmm0, xmm2 ;# have rsqH1 in xmm0 addps xmm4, xmm5 ;# have rsqH2 in xmm4 movaps [rsp + nb214_rsqH1H1], xmm0 movaps [rsp + nb214_rsqH2H2], xmm4 ;# start doing invsqrt use rsq values in xmm0, xmm4 rsqrtps xmm1, xmm0 rsqrtps xmm5, xmm4 movaps xmm2, xmm1 movaps xmm6, xmm5 mulps xmm1, xmm1 mulps xmm5, xmm5 movaps xmm3, [rsp + nb214_three] movaps xmm7, xmm3 mulps xmm1, xmm0 mulps xmm5, xmm4 subps xmm3, xmm1 subps xmm7, xmm5 mulps xmm3, xmm2 mulps xmm7, xmm6 mulps xmm3, [rsp + nb214_half] ;# rinvH1H1 mulps xmm7, [rsp + nb214_half] ;# rinvH2H2 movaps [rsp + nb214_rinvH1H1], xmm3 movaps [rsp + nb214_rinvH2H2], xmm7 ;# Do H1 coulomb interaction movaps xmm0, [rsp + nb214_rinvH1H1] movaps xmm7, xmm0 ;# xmm7=rinv movaps xmm5, [rsp + nb214_krf] mulps xmm0, xmm0 ;# xmm0=rinvsq ;# fetch charges to xmm3 (temporary) xorps xmm3, xmm3 movss xmm3, [rsp + nb214_qqHH] movhps xmm3, [rsp + nb214_qqMH] shufps xmm3, xmm3, 193 ;# 11000001 mulps xmm5, [rsp + nb214_rsqH1H1] ;# xmm5=krsq movaps xmm6, xmm5 addps xmm6, xmm7 ;# xmm6=rinv+ krsq subps xmm6, [rsp + nb214_crf] mulps xmm6, xmm3 ;# xmm6=voul=qq*(rinv+ krsq-crf) mulps xmm5, [rsp + nb214_two] subps xmm7, xmm5 ;# xmm7=rinv-2*krsq mulps xmm7, xmm3 ;# xmm7 = coul part of fscal addps xmm6, [rsp + nb214_vctot] movaps [rsp + nb214_vctot], xmm6 mulps xmm0, xmm7 movaps xmm1, xmm0 movaps xmm2, xmm0 mulps xmm0, [rsp + nb214_dxH1H1] mulps xmm1, [rsp + nb214_dyH1H1] mulps xmm2, [rsp + nb214_dzH1H1] ;# update forces H1 - j water movaps xmm3, [rsp + nb214_fjxO] movaps xmm4, [rsp + nb214_fjyO] movaps xmm5, [rsp + nb214_fjzO] addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps [rsp + nb214_fjxO], xmm3 movaps [rsp + nb214_fjyO], xmm4 movaps [rsp + nb214_fjzO], xmm5 addps xmm0, [rsp + nb214_fixH1] addps xmm1, [rsp + nb214_fiyH1] addps xmm2, [rsp + nb214_fizH1] movaps [rsp + nb214_fixH1], xmm0 movaps [rsp + nb214_fiyH1], xmm1 movaps [rsp + nb214_fizH1], xmm2 ;# H2 Coulomb movaps xmm0, [rsp + nb214_rinvH2H2] movaps xmm7, xmm0 ;# xmm7=rinv movaps xmm5, [rsp + nb214_krf] mulps xmm0, xmm0 ;# xmm0=rinvsq ;# fetch charges to xmm3 (temporary) xorps xmm3, xmm3 movss xmm3, [rsp + nb214_qqHH] movhps xmm3, [rsp + nb214_qqMH] shufps xmm3, xmm3, 193 ;# 11000001 mulps xmm5, [rsp + nb214_rsqH2H2] ;# xmm5=krsq movaps xmm6, xmm5 addps xmm6, xmm7 ;# xmm6=rinv+ krsq subps xmm6, [rsp + nb214_crf] mulps xmm6, xmm3 ;# xmm6=voul=qq*(rinv+ krsq-crf) mulps xmm5, [rsp + nb214_two] subps xmm7, xmm5 ;# xmm7=rinv-2*krsq mulps xmm7, xmm3 ;# xmm7 = coul part of fscal addps xmm6, [rsp + nb214_vctot] ;# local vctot summation variable movaps [rsp + nb214_vctot], xmm6 mulps xmm0, xmm7 movaps xmm1, xmm0 movaps xmm2, xmm0 mulps xmm0, [rsp + nb214_dxH2H2] mulps xmm1, [rsp + nb214_dyH2H2] mulps xmm2, [rsp + nb214_dzH2H2] ;# update forces H2 - j water movaps xmm3, [rsp + nb214_fjxO] movaps xmm4, [rsp + nb214_fjyO] movaps xmm5, [rsp + nb214_fjzO] addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps [rsp + nb214_fjxO], xmm3 movaps [rsp + nb214_fjyO], xmm4 movaps [rsp + nb214_fjzO], xmm5 addps xmm0, [rsp + nb214_fixH2] addps xmm1, [rsp + nb214_fiyH2] addps xmm2, [rsp + nb214_fizH2] movaps [rsp + nb214_fixH2], xmm0 movaps [rsp + nb214_fiyH2], xmm1 movaps [rsp + nb214_fizH2], xmm2 mov rsi, [rbp + nb214_faction] ;# update j water forces from local variables. ;# transpose back first movaps xmm0, [rsp + nb214_fjxO] ;# Ox H1x H2x Mx movaps xmm1, [rsp + nb214_fjyO] ;# Oy H1y H2y My movaps xmm2, [rsp + nb214_fjzO] ;# Oz H1z H2z Mz movaps xmm3, xmm0 movaps xmm4, xmm0 unpcklps xmm3, xmm1 ;# Ox Oy - - shufps xmm4, xmm2, 0x1 ;# h1x - Oz - movaps xmm5, xmm1 movaps xmm6, xmm0 unpcklps xmm5, xmm2 ;# - - H1y H1z unpckhps xmm6, xmm1 ;# h2x h2y - - unpckhps xmm1, xmm2 ;# - - My Mz shufps xmm2, xmm0, 0x32 ;# (00110010) h2z - Mx - shufps xmm3, xmm4, 36 ;# 00100100 ;# Ox Oy Oz H1x shufps xmm5, xmm6, 78 ;# 01001110 ;# h1y h1z h2x h2y shufps xmm2, xmm1, 232 ;# 11101000 ;# h2z mx my mz movlps xmm0, [rsi + rax*4] movlps xmm1, [rsi + rax*4 + 16] movlps xmm4, [rsi + rax*4 + 32] movhps xmm0, [rsi + rax*4 + 8] movhps xmm1, [rsi + rax*4 + 24] movhps xmm4, [rsi + rax*4 + 40] addps xmm0, xmm3 addps xmm1, xmm5 addps xmm4, xmm2 movlps [rsi + rax*4], xmm0 movlps [rsi + rax*4 + 16], xmm1 movlps [rsi + rax*4 + 32], xmm4 movhps [rsi + rax*4 + 8], xmm0 movhps [rsi + rax*4 + 24], xmm1 movhps [rsi + rax*4 + 40], xmm4 dec dword ptr [rsp + nb214_innerk] jz .nb214_updateouterdata jmp .nb214_single_loop.nb214_updateouterdata: mov ecx, [rsp + nb214_ii3] mov rdi, [rbp + nb214_faction] mov rsi, [rbp + nb214_fshift] mov edx, [rsp + nb214_is3] ;# accumulate Oi forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb214_fixO] movaps xmm1, [rsp + nb214_fiyO] movaps xmm2, [rsp + nb214_fizO] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 ;# xmm0-xmm2 has single force in pos0 ;# increment i force movss xmm3, [rdi + rcx*4] movss xmm4, [rdi + rcx*4 + 4] movss xmm5, [rdi + rcx*4 + 8] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [rdi + rcx*4], xmm3 movss [rdi + rcx*4 + 4], xmm4 movss [rdi + rcx*4 + 8], xmm5 ;# accumulate force in xmm6/xmm7 for fshift movaps xmm6, xmm0 movss xmm7, xmm2 movlhps xmm6, xmm1 shufps xmm6, xmm6, 8 ;# 00001000 ;# accumulate H1i forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb214_fixH1] movaps xmm1, [rsp + nb214_fiyH1] movaps xmm2, [rsp + nb214_fizH1] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 ;# xmm0-xmm2 has single force in pos0 ;# increment i force movss xmm3, [rdi + rcx*4 + 12] movss xmm4, [rdi + rcx*4 + 16] movss xmm5, [rdi + rcx*4 + 20] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [rdi + rcx*4 + 12], xmm3 movss [rdi + rcx*4 + 16], xmm4 movss [rdi + rcx*4 + 20], xmm5 ;# accumulate force in xmm6/xmm7 for fshift addss xmm7, xmm2 movlhps xmm0, xmm1 shufps xmm0, xmm0, 8 ;# 00001000 addps xmm6, xmm0 ;# accumulate H2i forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb214_fixH2] movaps xmm1, [rsp + nb214_fiyH2] movaps xmm2, [rsp + nb214_fizH2] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?