nb_kernel313_x86_64_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,333 行 · 第 1/5 页
S
2,333 行
movaps xmm13, xmm3 movaps xmm14, xmm4 movaps xmm15, xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm3, xmm4 addps xmm3, xmm5 ;# calc 1/rsq rcpps xmm5, xmm3 movaps xmm4, [rsp + nb313_two] mulps xmm3, xmm5 subps xmm4, xmm3 mulps xmm4, xmm5 ;# xmm4=rinvsq movaps xmm3, xmm4 ;# rinvsq mulps xmm4, xmm4 ;# rinv4 mulps xmm4, xmm3 ;# rinv6 movaps xmm5, xmm4 mulps xmm5, xmm5 ;# rinv12 mulps xmm4, [rsp + nb313_c6] mulps xmm5, [rsp + nb313_c12] movaps xmm6, xmm5 subps xmm6, xmm4 ;# Vvdw=vvdw12-vvdw6 mulps xmm4, [rsp + nb313_six] mulps xmm5, [rsp + nb313_twelve] subps xmm5, xmm4 mulps xmm3, xmm5 ;# fscal addps xmm6, [rsp + nb313_Vvdwtot] movaps [rsp + nb313_Vvdwtot], xmm6 mulps xmm13, xmm3 ;# fx mulps xmm14, xmm3 ;# fy mulps xmm15, xmm3 ;# fz ;# save j force temporarily movaps [rsp + nb313_fjx], xmm13 movaps [rsp + nb313_fjy], xmm14 movaps [rsp + nb313_fjz], xmm15 ;# increment i O force addps xmm13, [rsp + nb313_fixO] addps xmm14, [rsp + nb313_fiyO] addps xmm15, [rsp + nb313_fizO] movaps [rsp + nb313_fixO], xmm13 movaps [rsp + nb313_fiyO], xmm14 movaps [rsp + nb313_fizO], xmm15 ;# finished O LJ interaction. ;# do H1, H2, and M interactions in parallel. ;# xmm0-xmm2 still contain j coordinates. movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 movaps xmm6, xmm0 movaps xmm7, xmm1 movaps xmm8, xmm2 subps xmm0, [rsp + nb313_ixH1] subps xmm1, [rsp + nb313_iyH1] subps xmm2, [rsp + nb313_izH1] subps xmm3, [rsp + nb313_ixH2] subps xmm4, [rsp + nb313_iyH2] subps xmm5, [rsp + nb313_izH2] subps xmm6, [rsp + nb313_ixM] subps xmm7, [rsp + nb313_iyM] subps xmm8, [rsp + nb313_izM] movd mm0, eax ;# use mmx registers as temp storage movd mm1, ebx movd mm2, ecx movd mm3, edx movaps [rsp + nb313_dxH1], xmm0 movaps [rsp + nb313_dyH1], xmm1 movaps [rsp + nb313_dzH1], xmm2 mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 movaps [rsp + nb313_dxH2], xmm3 movaps [rsp + nb313_dyH2], xmm4 movaps [rsp + nb313_dzH2], xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 movaps [rsp + nb313_dxM], xmm6 movaps [rsp + nb313_dyM], xmm7 movaps [rsp + nb313_dzM], xmm8 mulps xmm6, xmm6 mulps xmm7, xmm7 mulps xmm8, xmm8 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm3, xmm4 addps xmm3, xmm5 addps xmm6, xmm7 addps xmm6, xmm8 ;# start doing invsqrt for j atoms rsqrtps xmm1, xmm0 rsqrtps xmm4, xmm3 rsqrtps xmm7, xmm6 movaps xmm2, xmm1 movaps xmm5, xmm4 movaps xmm8, xmm7 mulps xmm1, xmm1 ;# lu*lu mulps xmm4, xmm4 ;# lu*lu mulps xmm7, xmm7 ;# lu*lu movaps xmm9, [rsp + nb313_three] movaps xmm10, xmm9 movaps xmm11, xmm9 mulps xmm1, xmm0 ;# rsq*lu*lu mulps xmm4, xmm3 ;# rsq*lu*lu mulps xmm7, xmm6 ;# rsq*lu*lu subps xmm9, xmm1 subps xmm10, xmm4 subps xmm11, xmm7 ;# 3-rsq*lu*lu mulps xmm9, xmm2 mulps xmm10, xmm5 mulps xmm11, xmm8 ;# lu*(3-rsq*lu*lu) movaps xmm4, [rsp + nb313_half] mulps xmm9, xmm4 ;# rinvH1 mulps xmm10, xmm4 ;# rinvH2 mulps xmm11, xmm4 ;# rinvM movaps [rsp + nb313_rinvH1], xmm9 movaps [rsp + nb313_rinvH2], xmm10 movaps [rsp + nb313_rinvM], xmm11 ;# interactions ;# rsq in xmm0,xmm3,xmm6 ;# rinv in xmm9, xmm10, xmm11 movaps xmm1, [rsp + nb313_tsc] mulps xmm0, xmm9 ;# r mulps xmm3, xmm10 mulps xmm6, xmm11 mulps xmm0, xmm1 ;# rtab mulps xmm3, xmm1 mulps xmm6, xmm1 ;# truncate and convert to integers cvttps2dq xmm1, xmm0 cvttps2dq xmm4, xmm3 cvttps2dq xmm7, xmm6 ;# convert back to float cvtdq2ps xmm2, xmm1 cvtdq2ps xmm5, xmm4 cvtdq2ps xmm8, xmm7 ;# multiply by 4 pslld xmm1, 2 pslld xmm4, 2 pslld xmm7, 2 ;# move to integer registers movhlps xmm13, xmm1 movhlps xmm14, xmm4 movhlps xmm15, xmm7 movd eax, xmm1 movd r8d, xmm4 movd r12d, xmm7 movd ecx, xmm13 movd r10d, xmm14 movd r14d, xmm15 pshufd xmm1, xmm1, 1 pshufd xmm4, xmm4, 1 pshufd xmm7, xmm7, 1 pshufd xmm13, xmm13, 1 pshufd xmm14, xmm14, 1 pshufd xmm15, xmm15, 1 movd ebx, xmm1 movd r9d, xmm4 movd r13d, xmm7 movd edx, xmm13 movd r11d, xmm14 movd r15d, xmm15 mov rsi, [rbp + nb313_VFtab] ;# calculate eps subps xmm0, xmm2 subps xmm3, xmm5 subps xmm6, xmm8 movaps [rsp + nb313_epsH1], xmm0 movaps [rsp + nb313_epsH2], xmm3 movaps [rsp + nb313_epsM], xmm6 ;# Load LOTS of table data movlps xmm1, [rsi + rax*4] movlps xmm5, [rsi + r8*4] movlps xmm9, [rsi + r12*4] movlps xmm3, [rsi + rcx*4] movlps xmm7, [rsi + r10*4] movlps xmm11, [rsi + r14*4] movhps xmm1, [rsi + rbx*4] movhps xmm5, [rsi + r9*4] movhps xmm9, [rsi + r13*4] movhps xmm3, [rsi + rdx*4] movhps xmm7, [rsi + r11*4] movhps xmm11, [rsi + r15*4] movaps xmm0, xmm1 movaps xmm4, xmm5 movaps xmm8, xmm9 shufps xmm0, xmm3, 136 ;# 10001000 shufps xmm4, xmm7, 136 ;# 10001000 shufps xmm8, xmm11, 136 ;# 10001000 shufps xmm1, xmm3, 221 ;# 11011101 shufps xmm5, xmm7, 221 ;# 11011101 shufps xmm9, xmm11, 221 ;# 11011101 movlps xmm3, [rsi + rax*4 + 8] movlps xmm7, [rsi + r8*4 + 8] movlps xmm11, [rsi + r12*4 + 8] movlps xmm12, [rsi + rcx*4 + 8] movlps xmm13, [rsi + r10*4 + 8] movlps xmm14, [rsi + r14*4 + 8] movhps xmm3, [rsi + rbx*4 + 8] movhps xmm7, [rsi + r9*4 + 8] movhps xmm11, [rsi + r13*4 + 8] movhps xmm12, [rsi + rdx*4 + 8] movhps xmm13, [rsi + r11*4 + 8] movhps xmm14, [rsi + r15*4 + 8] movaps xmm2, xmm3 movaps xmm6, xmm7 movaps xmm10, xmm11 shufps xmm2, xmm12, 136 ;# 10001000 shufps xmm6, xmm13, 136 ;# 10001000 shufps xmm10, xmm14, 136 ;# 10001000 shufps xmm3, xmm12, 221 ;# 11011101 shufps xmm7, xmm13, 221 ;# 11011101 shufps xmm11, xmm14, 221 ;# 11011101 ;# table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11 movaps xmm12, [rsp + nb313_epsH1] movaps xmm13, [rsp + nb313_epsH2] movaps xmm14, [rsp + nb313_epsM] mulps xmm3, xmm12 ;# Heps mulps xmm7, xmm13 mulps xmm11, xmm14 mulps xmm2, xmm12 ;# Geps mulps xmm6, xmm13 mulps xmm10, xmm14 mulps xmm3, xmm12 ;# Heps2 mulps xmm7, xmm13 mulps xmm11, xmm14 addps xmm1, xmm2 ;# F+Geps addps xmm5, xmm6 addps xmm9, xmm10 addps xmm1, xmm3 ;# F+Geps+Heps2 = Fp addps xmm5, xmm7 addps xmm9, xmm11 addps xmm3, xmm3 ;# 2*Heps2 addps xmm7, xmm7 addps xmm11, xmm11 addps xmm3, xmm2 ;# 2*Heps2+Geps addps xmm7, xmm6 addps xmm11, xmm10 addps xmm3, xmm1 ;# FF = Fp + 2*Heps2 + Geps addps xmm7, xmm5 addps xmm11, xmm9 mulps xmm1, xmm12 ;# eps*Fp mulps xmm5, xmm13 mulps xmm9, xmm14 movaps xmm12, [rsp + nb313_qqH] movaps xmm13, [rsp + nb313_qqM] addps xmm1, xmm0 ;# VV addps xmm5, xmm4 addps xmm9, xmm8 mulps xmm1, xmm12 ;# VV*qq = vcoul mulps xmm5, xmm12 mulps xmm9, xmm13 mulps xmm3, xmm12 ;# FF*qq = fij mulps xmm7, xmm12 mulps xmm11, xmm13 ;# accumulate vctot addps xmm1, [rsp + nb313_vctot] addps xmm5, xmm9 addps xmm1, xmm5 movaps [rsp + nb313_vctot], xmm1 movaps xmm10, [rsp + nb313_tsc] mulps xmm3, xmm10 ;# fscal mulps xmm7, xmm10 mulps xmm10, xmm11 movd eax, mm0 movd ebx, mm1 movd ecx, mm2 movd edx, mm3 ;# move j forces to local temp variables mov rdi, [rbp + nb313_faction] movlps xmm11, [rdi + rax*4] ;# jxa jya - - movlps xmm12, [rdi + rcx*4] ;# jxc jyc - - movhps xmm11, [rdi + rbx*4] ;# jxa jya jxb jyb movhps xmm12, [rdi + rdx*4] ;# jxc jyc jxd jyd movss xmm13, [rdi + rax*4 + 8] ;# jza - - - movss xmm14, [rdi + rcx*4 + 8] ;# jzc - - - movss xmm2, [rdi + rbx*4 + 8] ;# jzb movss xmm5, [rdi + rdx*4 + 8] ;# jzd movlhps xmm13, xmm2 ;# jza - jzb - movlhps xmm14, xmm5 ;# jzc - jzd - shufps xmm13, xmm14, 136 ;# 10001000 => jza jzb jzc jzd ;# xmm11: jxa jya jxb jyb ;# xmm12: jxc jyc jxd jyd ;# xmm13: jza jzb jzc jzd xorps xmm0, xmm0 xorps xmm4, xmm4 xorps xmm8, xmm8 mulps xmm3, [rsp + nb313_rinvH1] mulps xmm7, [rsp + nb313_rinvH2] mulps xmm10, [rsp + nb313_rinvM] subps xmm0, xmm3 subps xmm4, xmm7 subps xmm8, xmm10 movaps xmm1, xmm0 movaps xmm2, xmm0 movaps xmm3, xmm4 movaps xmm5, xmm4 movaps xmm6, xmm8 movaps xmm7, xmm8 mulps xmm0, [rsp + nb313_dxH1] mulps xmm1, [rsp + nb313_dyH1] mulps xmm2, [rsp + nb313_dzH1] mulps xmm3, [rsp + nb313_dxH2] mulps xmm4, [rsp + nb313_dyH2] mulps xmm5, [rsp + nb313_dzH2] mulps xmm6, [rsp + nb313_dxM] mulps xmm7, [rsp + nb313_dyM] mulps xmm8, [rsp + nb313_dzM] ;# fetch forces from O interaction movaps xmm14, [rsp + nb313_fjx] movaps xmm15, [rsp + nb313_fjy] addps xmm13, [rsp + nb313_fjz] addps xmm14, xmm0 addps xmm15, xmm1 addps xmm13, xmm2 addps xmm0, [rsp + nb313_fixH1] addps xmm1, [rsp + nb313_fiyH1] addps xmm2, [rsp + nb313_fizH1] addps xmm14, xmm3 addps xmm15, xmm4 addps xmm13, xmm5 addps xmm3, [rsp + nb313_fixH2] addps xmm4, [rsp + nb313_fiyH2] addps xmm5, [rsp + nb313_fizH2] addps xmm14, xmm6 addps xmm15, xmm7 addps xmm13, xmm8 addps xmm6, [rsp + nb313_fixM] addps xmm7, [rsp + nb313_fiyM] addps xmm8, [rsp + nb313_fizM] movaps [rsp + nb313_fixH1], xmm0 movaps [rsp + nb313_fiyH1], xmm1 movaps [rsp + nb313_fizH1], xmm2 movaps [rsp + nb313_fixH2], xmm3 movaps [rsp + nb313_fiyH2], xmm4 movaps [rsp + nb313_fizH2], xmm5 movaps [rsp + nb313_fixM], xmm6 movaps [rsp + nb313_fiyM], xmm7 movaps [rsp + nb313_fizM], xmm8 ;# xmm14 = fjx ;# xmm15 = fjy ;# xmm13 = fjz movaps xmm0, xmm14 unpcklps xmm14, xmm15 unpckhps xmm0, xmm15 addps xmm11, xmm14 addps xmm12, xmm0 movhlps xmm14, xmm13 ;# fjzc fjzd movlps [rdi + rax*4], xmm11 movhps [rdi + rbx*4], xmm11 movlps [rdi + rcx*4], xmm12 movhps [rdi + rdx*4], xmm12 movss [rdi + rax*4 + 8], xmm13 movss [rdi + rcx*4 + 8], xmm14 shufps xmm13, xmm13, 1 shufps xmm14, xmm14, 1 movss [rdi + rbx*4 + 8], xmm13 movss [rdi + rdx*4 + 8], xmm14 ;# should we do one more iteration? sub dword ptr [rsp + nb313_innerk], 4 jl .nb313_odd_inner jmp .nb313_unroll_loop.nb313_odd_inner: add dword ptr [rsp + nb313_innerk], 4 jnz .nb313_odd_loop jmp .nb313_updateouterdata.nb313_odd_loop: mov rdx, [rsp + nb313_innerjjnr] ;# pointer to jjnr[k] mov eax, [rdx] add qword ptr [rsp + nb313_innerjjnr], 4 xorps xmm4, xmm4 ;# clear reg. movss xmm4, [rsp + nb313_iqM] mov rsi, [rbp + nb313_charge] movhps xmm4, [rsp + nb313_iqH] ;# [qM 0 qH qH] shufps xmm4, xmm4, 41 ;# [0 qH qH qM] movss xmm3, [rsi + rax*4] ;# charge in xmm3 shufps xmm3, xmm3, 0 mulps xmm3, xmm4 movaps [rsp + nb313_qqM], xmm3 ;# use dummy qq for storage xorps xmm6, xmm6 mov rsi, [rbp + nb313_type] mov ebx, [rsi + rax*4] mov rsi, [rbp + nb313_vdwparam] shl ebx, 1 add ebx, [rsp + nb313_ntia] movlps xmm6, [rsi + rbx*4] movaps xmm7, xmm6 shufps xmm6, xmm6, 252 ;# 11111100 shufps xmm7, xmm7, 253 ;# 11111101 movaps [rsp + nb313_c6], xmm6 movaps [rsp + nb313_c12], xmm7 mov rsi, [rbp + nb313_pos] lea rax, [rax + rax*2] movss xmm0, [rsp + nb313_ixO]
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?