nb_kernel113_x86_64_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 1,845 行 · 第 1/4 页
S
1,845 行
movaps xmm14, xmm4 movaps xmm15, xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm3, xmm4 addps xmm3, xmm5 ;# calc 1/rsq rcpps xmm5, xmm3 movaps xmm4, [rsp + nb113_two] mulps xmm3, xmm5 subps xmm4, xmm3 mulps xmm4, xmm5 ;# xmm4=rinvsq movaps xmm3, xmm4 ;# rinvsq mulps xmm4, xmm4 ;# rinv4 mulps xmm4, xmm3 ;# rinv6 movaps xmm5, xmm4 mulps xmm5, xmm5 ;# rinv12 mulps xmm4, [rsp + nb113_c6] mulps xmm5, [rsp + nb113_c12] movaps xmm6, xmm5 subps xmm6, xmm4 ;# Vvdw=vvdw12-vvdw6 mulps xmm4, [rsp + nb113_six] mulps xmm5, [rsp + nb113_twelve] subps xmm5, xmm4 mulps xmm3, xmm5 ;# fscal addps xmm6, [rsp + nb113_Vvdwtot] movaps [rsp + nb113_Vvdwtot], xmm6 mulps xmm13, xmm3 ;# fx mulps xmm14, xmm3 ;# fy mulps xmm15, xmm3 ;# fz ;# save j force temporarily movaps [rsp + nb113_fjx], xmm13 movaps [rsp + nb113_fjy], xmm14 movaps [rsp + nb113_fjz], xmm15 ;# increment i O force addps xmm13, [rsp + nb113_fixO] addps xmm14, [rsp + nb113_fiyO] addps xmm15, [rsp + nb113_fizO] movaps [rsp + nb113_fixO], xmm13 movaps [rsp + nb113_fiyO], xmm14 movaps [rsp + nb113_fizO], xmm15 ;# finished O LJ interaction. ;# do H1, H2, and M interactions in parallel. ;# xmm0-xmm2 still contain j coordinates. movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 movaps xmm6, xmm0 movaps xmm7, xmm1 movaps xmm8, xmm2 subps xmm0, [rsp + nb113_ixH1] subps xmm1, [rsp + nb113_iyH1] subps xmm2, [rsp + nb113_izH1] subps xmm3, [rsp + nb113_ixH2] subps xmm4, [rsp + nb113_iyH2] subps xmm5, [rsp + nb113_izH2] subps xmm6, [rsp + nb113_ixM] subps xmm7, [rsp + nb113_iyM] subps xmm8, [rsp + nb113_izM] movaps [rsp + nb113_dxH1], xmm0 movaps [rsp + nb113_dyH1], xmm1 movaps [rsp + nb113_dzH1], xmm2 mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 movaps [rsp + nb113_dxH2], xmm3 movaps [rsp + nb113_dyH2], xmm4 movaps [rsp + nb113_dzH2], xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 movaps [rsp + nb113_dxM], xmm6 movaps [rsp + nb113_dyM], xmm7 movaps [rsp + nb113_dzM], xmm8 mulps xmm6, xmm6 mulps xmm7, xmm7 mulps xmm8, xmm8 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm3, xmm4 addps xmm3, xmm5 addps xmm6, xmm7 addps xmm6, xmm8 ;# start doing invsqrt for j atoms rsqrtps xmm1, xmm0 rsqrtps xmm4, xmm3 rsqrtps xmm7, xmm6 movaps xmm2, xmm1 movaps xmm5, xmm4 movaps xmm8, xmm7 mulps xmm1, xmm1 ;# lu*lu mulps xmm4, xmm4 ;# lu*lu mulps xmm7, xmm7 ;# lu*lu movaps xmm9, [rsp + nb113_three] movaps xmm10, xmm9 movaps xmm11, xmm9 mulps xmm1, xmm0 ;# rsq*lu*lu mulps xmm4, xmm3 ;# rsq*lu*lu mulps xmm7, xmm6 ;# rsq*lu*lu subps xmm9, xmm1 subps xmm10, xmm4 subps xmm11, xmm7 ;# 3-rsq*lu*lu mulps xmm9, xmm2 mulps xmm10, xmm5 mulps xmm11, xmm8 ;# lu*(3-rsq*lu*lu) movaps xmm0, [rsp + nb113_half] mulps xmm9, xmm0 ;# rinvH1 mulps xmm10, xmm0 ;# rinvH2 mulps xmm11, xmm0 ;# rinvM ;# interactions movaps xmm0, xmm9 movaps xmm1, xmm10 movaps xmm2, xmm11 mulps xmm9, xmm9 mulps xmm10, xmm10 mulps xmm11, xmm11 mulps xmm0, [rsp + nb113_qqH] mulps xmm1, [rsp + nb113_qqH] mulps xmm2, [rsp + nb113_qqM] mulps xmm9, xmm0 mulps xmm10, xmm1 mulps xmm11, xmm2 addps xmm0, [rsp + nb113_vctot] addps xmm1, xmm2 addps xmm0, xmm1 movaps [rsp + nb113_vctot], xmm0 mov rdi, [rbp + nb113_faction] ;# move j forces to local temp variables movlps xmm0, [rdi + rax*4] ;# jxa jya - - movlps xmm1, [rdi + rcx*4] ;# jxc jyc - - movhps xmm0, [rdi + rbx*4] ;# jxa jya jxb jyb movhps xmm1, [rdi + rdx*4] ;# jxc jyc jxd jyd movss xmm2, [rdi + rax*4 + 8] ;# jza - - - movss xmm3, [rdi + rcx*4 + 8] ;# jzc - - - movss xmm4, [rdi + rbx*4 + 8] ;# jzb movss xmm5, [rdi + rdx*4 + 8] ;# jzd movlhps xmm2, xmm4 ;# jza - jzb - movlhps xmm3, xmm5 ;# jzc - jzd - shufps xmm2, xmm3, 136 ;# 10001000 => jza jzb jzc jzd ;# xmm0: jxa jya jxb jyb ;# xmm1: jxc jyc jxd jyd ;# xmm2: jza jzb jzc jzd movaps xmm7, xmm9 movaps xmm8, xmm9 movaps xmm13, xmm11 movaps xmm14, xmm11 movaps xmm15, xmm11 movaps xmm11, xmm10 movaps xmm12, xmm10 mulps xmm7, [rsp + nb113_dxH1] mulps xmm8, [rsp + nb113_dyH1] mulps xmm9, [rsp + nb113_dzH1] mulps xmm10, [rsp + nb113_dxH2] mulps xmm11, [rsp + nb113_dyH2] mulps xmm12, [rsp + nb113_dzH2] mulps xmm13, [rsp + nb113_dxM] mulps xmm14, [rsp + nb113_dyM] mulps xmm15, [rsp + nb113_dzM] ;# fetch forces from O interaction movaps xmm3, [rsp + nb113_fjx] movaps xmm4, [rsp + nb113_fjy] addps xmm2, [rsp + nb113_fjz] addps xmm3, xmm7 addps xmm4, xmm8 addps xmm2, xmm9 addps xmm7, [rsp + nb113_fixH1] addps xmm8, [rsp + nb113_fiyH1] addps xmm9, [rsp + nb113_fizH1] addps xmm3, xmm10 addps xmm4, xmm11 addps xmm2, xmm12 addps xmm10, [rsp + nb113_fixH2] addps xmm11, [rsp + nb113_fiyH2] addps xmm12, [rsp + nb113_fizH2] addps xmm3, xmm13 addps xmm4, xmm14 addps xmm2, xmm15 addps xmm13, [rsp + nb113_fixM] addps xmm14, [rsp + nb113_fiyM] addps xmm15, [rsp + nb113_fizM] movaps [rsp + nb113_fixH1], xmm7 movaps [rsp + nb113_fiyH1], xmm8 movaps [rsp + nb113_fizH1], xmm9 movaps [rsp + nb113_fixH2], xmm10 movaps [rsp + nb113_fiyH2], xmm11 movaps [rsp + nb113_fizH2], xmm12 movaps [rsp + nb113_fixM], xmm13 movaps [rsp + nb113_fiyM], xmm14 movaps [rsp + nb113_fizM], xmm15 ;# xmm3 = fjx , xmm4 = fjy movaps xmm5, xmm3 unpcklps xmm3, xmm4 unpckhps xmm5, xmm4 addps xmm0, xmm3 addps xmm1, xmm5 movhlps xmm3, xmm2 ;# fjzc fjzd movlps [rdi + rax*4], xmm0 movhps [rdi + rbx*4], xmm0 movlps [rdi + rcx*4], xmm1 movhps [rdi + rdx*4], xmm1 movss [rdi + rax*4 + 8], xmm2 movss [rdi + rcx*4 + 8], xmm3 shufps xmm2, xmm2, 1 shufps xmm3, xmm3, 1 movss [rdi + rbx*4 + 8], xmm2 movss [rdi + rdx*4 + 8], xmm3 ;# should we do one more iteration? sub dword ptr [rsp + nb113_innerk], 4 jl .nb113_odd_inner jmp .nb113_unroll_loop.nb113_odd_inner: add dword ptr [rsp + nb113_innerk], 4 jnz .nb113_odd_loop jmp .nb113_updateouterdata.nb113_odd_loop: mov rdx, [rsp + nb113_innerjjnr] ;# pointer to jjnr[k] mov eax, [rdx] add qword ptr [rsp + nb113_innerjjnr], 4 xorps xmm4, xmm4 ;# clear reg. movss xmm4, [rsp + nb113_iqM] mov rsi, [rbp + nb113_charge] movhps xmm4, [rsp + nb113_iqH] ;# [qM 0 qH qH] shufps xmm4, xmm4, 41 ;# [0 qH qH qM] movss xmm3, [rsi + rax*4] ;# charge in xmm3 shufps xmm3, xmm3, 0 mulps xmm3, xmm4 movaps [rsp + nb113_qqM], xmm3 ;# use dummy qq for storage xorps xmm6, xmm6 mov rsi, [rbp + nb113_type] mov ebx, [rsi + rax*4] mov rsi, [rbp + nb113_vdwparam] shl ebx, 1 add ebx, [rsp + nb113_ntia] movlps xmm6, [rsi + rbx*4] movaps xmm7, xmm6 shufps xmm6, xmm6, 252 ;# 11111100 shufps xmm7, xmm7, 253 ;# 11111101 movaps [rsp + nb113_c6], xmm6 movaps [rsp + nb113_c12], xmm7 mov rsi, [rbp + nb113_pos] lea rax, [rax + rax*2] movss xmm0, [rsp + nb113_ixO] movss xmm1, [rsp + nb113_iyO] movss xmm2, [rsp + nb113_izO] movss xmm3, [rsp + nb113_ixH1] movss xmm4, [rsp + nb113_iyH1] movss xmm5, [rsp + nb113_izH1] unpcklps xmm0, [rsp + nb113_ixH2] ;# ixO ixH2 - - unpcklps xmm1, [rsp + nb113_iyH2] ;# iyO iyH2 - - unpcklps xmm2, [rsp + nb113_izH2] ;# izO izH2 - - unpcklps xmm3, [rsp + nb113_ixM] ;# ixH1 ixM - - unpcklps xmm4, [rsp + nb113_iyM] ;# iyH1 iyM - - unpcklps xmm5, [rsp + nb113_izM] ;# izH1 izM - - unpcklps xmm0, xmm3 ;# ixO ixH1 ixH2 ixM unpcklps xmm1, xmm4 ;# same for y unpcklps xmm2, xmm5 ;# same for z ;# move j coords to xmm0-xmm2 movss xmm3, [rsi + rax*4] movss xmm4, [rsi + rax*4 + 4] movss xmm5, [rsi + rax*4 + 8] shufps xmm3, xmm3, 0 shufps xmm4, xmm4, 0 shufps xmm5, xmm5, 0 subps xmm3, xmm0 subps xmm4, xmm1 subps xmm5, xmm2 ;# use O distances for storage movaps [rsp + nb113_dxO], xmm3 movaps [rsp + nb113_dyO], xmm4 movaps [rsp + nb113_dzO], xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm4, xmm3 addps xmm4, xmm5 ;# rsq in xmm4 rsqrtps xmm5, xmm4 ;# lookup seed in xmm5 movaps xmm2, xmm5 mulps xmm5, xmm5 movaps xmm1, [rsp + nb113_three] mulps xmm5, xmm4 ;# rsq*lu*lu movaps xmm0, [rsp + nb113_half] subps xmm1, xmm5 ;# 30-rsq*lu*lu mulps xmm1, xmm2 mulps xmm0, xmm1 ;# xmm0=rinv movaps xmm1, xmm0 mulps xmm1, xmm1 ;# rinvsq movaps xmm7, xmm0 mulps xmm7, [rsp + nb113_qqM] ;# vcoul movaps xmm6, xmm7 addps xmm7, [rsp + nb113_vctot] movaps [rsp + nb113_vctot], xmm7 movaps xmm2, xmm1 mulss xmm1, xmm1 mulss xmm1, xmm2 ;# xmm1=rinvsix xorps xmm4, xmm4 movss xmm4, xmm1 mulss xmm4, xmm4 ;# xmm4=rinvtwelve mulss xmm1, [rsp + nb113_c6] mulss xmm4, [rsp + nb113_c12] movaps xmm3, xmm4 subss xmm3, xmm1 ;# xmm3=Vvdw12-Vvdw6 mulss xmm1, [rsp + nb113_six] mulss xmm4, [rsp + nb113_twelve] subss xmm4, xmm1 addss xmm3, [rsp + nb113_Vvdwtot] movss [rsp + nb113_Vvdwtot], xmm3 addps xmm4, xmm6 mulps xmm4, xmm0 mulps xmm4, xmm0 ;# fscal movaps xmm0, [rsp + nb113_dxO] movaps xmm1, [rsp + nb113_dyO] movaps xmm2, [rsp + nb113_dzO] mulps xmm0, xmm4 mulps xmm1, xmm4 mulps xmm2, xmm4 ;# xmm0-xmm2 now contains tx-tz (partial force) movss xmm3, [rsp + nb113_fixO] movss xmm4, [rsp + nb113_fiyO] movss xmm5, [rsp + nb113_fizO] addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movss [rsp + nb113_fixO], xmm3 movss [rsp + nb113_fiyO], xmm4 movss [rsp + nb113_fizO], xmm5 ;# updated the O force now do the H's movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 0x39 ;# shift right shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb113_fixH1] addss xmm4, [rsp + nb113_fiyH1] addss xmm5, [rsp + nb113_fizH1] movss [rsp + nb113_fixH1], xmm3 movss [rsp + nb113_fiyH1], xmm4 movss [rsp + nb113_fizH1], xmm5 ;# updated the H1 force shufps xmm3, xmm3, 0x39 shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb113_fixH2] addss xmm4, [rsp + nb113_fiyH2] addss xmm5, [rsp + nb113_fizH2] movss [rsp + nb113_fixH2], xmm3 movss [rsp + nb113_fiyH2], xmm4 movss [rsp + nb113_fizH2], xmm5 ;# updated the H2 force mov rdi, [rbp + nb113_faction] shufps xmm3, xmm3, 0x39 shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb113_fixM] addss xmm4, [rsp + nb113_fiyM] addss xmm5, [rsp + nb113_fizM] movss [rsp + nb113_fixM], xmm3 movss [rsp + nb113_fiyM], xmm4 movss [rsp + nb113_fizM], xmm5 ;# updated the M force ;# the fj's - move in from mem start by acc. tx/ty/tz in xmm0, xmm1 movlps xmm6, [rdi + rax*4] movss xmm7, [rdi + rax*4 + 8] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps xmm0, xmm3 movaps xmm1, xmm4 movaps xmm2, xmm5 shufps xmm3, xmm3, 0x39 ;# shift right shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 unpcklps xmm0, xmm1 ;# x,y sum in xmm0, z sum in xmm2 addps xmm6, xmm0 addss xmm7, xmm2 movlps [rdi + rax*4], xmm6 movss [rdi + rax*4 + 8], xmm7 dec dword ptr [rsp + nb113_innerk] jz .nb113_updateouterdata jmp .nb113_odd_loop.nb113_updateouterdata: mov ecx, [rsp + nb113_ii3] mov rdi, [rbp + nb113_faction] mov rsi, [rbp + nb113_fshift] mov edx, [rsp + nb113_is3] ;# accumulate Oi forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb113_fixO] movaps xmm1, [rsp + nb113_fiyO] movaps xmm2, [rsp + nb113_fizO] movhlps xmm3, xmm0 movhlps xmm4, xmm1
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?