nb_kernel333_x86_64_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,385 行 · 第 1/5 页
S
2,385 行
addps xmm15, xmm1 addps xmm13, xmm2 addps xmm0, [rsp + nb333_fixH1] addps xmm1, [rsp + nb333_fiyH1] addps xmm2, [rsp + nb333_fizH1] addps xmm14, xmm3 addps xmm15, xmm4 addps xmm13, xmm5 addps xmm3, [rsp + nb333_fixH2] addps xmm4, [rsp + nb333_fiyH2] addps xmm5, [rsp + nb333_fizH2] addps xmm14, xmm6 addps xmm15, xmm7 addps xmm13, xmm8 addps xmm6, [rsp + nb333_fixM] addps xmm7, [rsp + nb333_fiyM] addps xmm8, [rsp + nb333_fizM] movaps [rsp + nb333_fixH1], xmm0 movaps [rsp + nb333_fiyH1], xmm1 movaps [rsp + nb333_fizH1], xmm2 movaps [rsp + nb333_fixH2], xmm3 movaps [rsp + nb333_fiyH2], xmm4 movaps [rsp + nb333_fizH2], xmm5 movaps [rsp + nb333_fixM], xmm6 movaps [rsp + nb333_fiyM], xmm7 movaps [rsp + nb333_fizM], xmm8 ;# xmm14 = fjx ;# xmm15 = fjy ;# xmm13 = fjz movaps xmm0, xmm14 unpcklps xmm14, xmm15 unpckhps xmm0, xmm15 addps xmm11, xmm14 addps xmm12, xmm0 movhlps xmm14, xmm13 ;# fjzc fjzd movlps [rdi + rax*4], xmm11 movhps [rdi + rbx*4], xmm11 movlps [rdi + rcx*4], xmm12 movhps [rdi + rdx*4], xmm12 movss [rdi + rax*4 + 8], xmm13 movss [rdi + rcx*4 + 8], xmm14 shufps xmm13, xmm13, 1 shufps xmm14, xmm14, 1 movss [rdi + rbx*4 + 8], xmm13 movss [rdi + rdx*4 + 8], xmm14 ;# should we do one more iteration? sub dword ptr [rsp + nb333_innerk], 4 jl .nb333_odd_inner jmp .nb333_unroll_loop.nb333_odd_inner: add dword ptr [rsp + nb333_innerk], 4 jnz .nb333_odd_loop jmp .nb333_updateouterdata.nb333_odd_loop: mov rdx, [rsp + nb333_innerjjnr] ;# pointer to jjnr[k] mov eax, [rdx] add qword ptr [rsp + nb333_innerjjnr], 4 xorps xmm4, xmm4 ;# clear reg. movss xmm4, [rsp + nb333_iqM] mov rsi, [rbp + nb333_charge] movhps xmm4, [rsp + nb333_iqH] ;# [qM 0 qH qH] shufps xmm4, xmm4, 41 ;# [0 qH qH qM] movss xmm3, [rsi + rax*4] ;# charge in xmm3 shufps xmm3, xmm3, 0 mulps xmm3, xmm4 movaps [rsp + nb333_qqM], xmm3 ;# use dummy qq for storage xorps xmm6, xmm6 mov rsi, [rbp + nb333_type] mov ebx, [rsi + rax*4] mov rsi, [rbp + nb333_vdwparam] shl ebx, 1 add ebx, [rsp + nb333_ntia] movlps xmm6, [rsi + rbx*4] movaps xmm7, xmm6 shufps xmm6, xmm6, 252 ;# 11111100 shufps xmm7, xmm7, 253 ;# 11111101 movaps [rsp + nb333_c6], xmm6 movaps [rsp + nb333_c12], xmm7 mov rsi, [rbp + nb333_pos] lea rax, [rax + rax*2] movss xmm0, [rsp + nb333_ixO] movss xmm1, [rsp + nb333_iyO] movss xmm2, [rsp + nb333_izO] movss xmm3, [rsp + nb333_ixH1] movss xmm4, [rsp + nb333_iyH1] movss xmm5, [rsp + nb333_izH1] unpcklps xmm0, [rsp + nb333_ixH2] ;# ixO ixH2 - - unpcklps xmm1, [rsp + nb333_iyH2] ;# iyO iyH2 - - unpcklps xmm2, [rsp + nb333_izH2] ;# izO izH2 - - unpcklps xmm3, [rsp + nb333_ixM] ;# ixH1 ixM - - unpcklps xmm4, [rsp + nb333_iyM] ;# iyH1 iyM - - unpcklps xmm5, [rsp + nb333_izM] ;# izH1 izM - - unpcklps xmm0, xmm3 ;# ixO ixH1 ixH2 ixM unpcklps xmm1, xmm4 ;# same for y unpcklps xmm2, xmm5 ;# same for z ;# move j coords to xmm0-xmm2 movss xmm3, [rsi + rax*4] movss xmm4, [rsi + rax*4 + 4] movss xmm5, [rsi + rax*4 + 8] shufps xmm3, xmm3, 0 shufps xmm4, xmm4, 0 shufps xmm5, xmm5, 0 subps xmm3, xmm0 subps xmm4, xmm1 subps xmm5, xmm2 ;# use O distances for storage movaps [rsp + nb333_dxO], xmm3 movaps [rsp + nb333_dyO], xmm4 movaps [rsp + nb333_dzO], xmm5 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm4, xmm3 addps xmm4, xmm5 ;# rsq in xmm4 rsqrtps xmm5, xmm4 ;# lookup seed in xmm5 movaps xmm2, xmm5 mulps xmm5, xmm5 movaps xmm1, [rsp + nb333_three] mulps xmm5, xmm4 ;# rsq*lu*lu movaps xmm0, [rsp + nb333_half] subps xmm1, xmm5 ;# 30-rsq*lu*lu mulps xmm1, xmm2 mulps xmm0, xmm1 ;# xmm0=rinv movaps [rsp + nb333_rinvM], xmm0 mulps xmm4, xmm0 ;# r mulps xmm4, [rsp + nb333_tsc] movhlps xmm7, xmm4 cvttps2pi mm6, xmm4 cvttps2pi mm7, xmm7 ;# mm6/mm7 contain lu indices cvtpi2ps xmm3, mm6 cvtpi2ps xmm7, mm7 movlhps xmm3, xmm7 subps xmm4, xmm3 movaps xmm1, xmm4 ;# xmm1=eps movaps xmm2, xmm1 mulps xmm2, xmm2 ;# xmm2=eps2 pslld mm6, 2 pslld mm7, 2 movd mm0, eax mov rsi, [rbp + nb333_VFtab] movd eax, mm6 psrlq mm6, 32 movd ebx, mm6 movd ecx, mm7 psrlq mm7, 32 movd edx, mm7 lea rax, [rax + rax*2] lea rbx, [rbx + rbx*2] lea rcx, [rcx + rcx*2] lea rdx, [rdx + rdx*2] ;# first do LJ table for O ;# load dispersion table data into xmm4 movlps xmm4, [rsi + rax*4 + 16] movlps xmm6, [rsi + rax*4 + 24] movaps xmm5, xmm4 movaps xmm7, xmm6 shufps xmm5, xmm5, 0x1 shufps xmm7, xmm7, 0x1 ;# dispersion table YFGH ready in xmm4-xmm7 mulss xmm6, xmm1 ;# xmm6=Geps mulss xmm7, xmm2 ;# xmm7=Heps2 addss xmm5, xmm6 addss xmm5, xmm7 ;# xmm5=Fp mulss xmm7, [rsp + nb333_two] ;# two*Heps2 addss xmm7, xmm6 addss xmm7, xmm5 ;# xmm7=FF mulss xmm5, xmm1 ;# xmm5=eps*Fp addss xmm5, xmm4 ;# xmm5=VV movaps xmm4, [rsp + nb333_c6] mulss xmm7, xmm4 ;# fijD mulss xmm5, xmm4 ;# Vvdw6 ;# save scalar force in xmm3. Update Vvdwtot directly addss xmm5, [rsp + nb333_Vvdwtot] xorps xmm3, xmm3 movss xmm3, xmm7 ;# fscal movss [rsp + nb333_Vvdwtot], xmm5 ;# load repulsion table data into xmm4 movlps xmm4, [rsi + rax*4 + 32] movlps xmm6, [rsi + rax*4 + 40] movaps xmm5, xmm4 movaps xmm7, xmm6 shufps xmm5, xmm5, 0x1 shufps xmm7, xmm7, 0x1 ;# repulsion table YFGH ready in xmm4-xmm7 mulss xmm6, xmm1 ;# xmm6=Geps mulss xmm7, xmm2 ;# xmm7=Heps2 addss xmm5, xmm6 addss xmm5, xmm7 ;# xmm5=Fp mulss xmm7, [rsp + nb333_two] ;# two*Heps2 addss xmm7, xmm6 addss xmm7, xmm5 ;# xmm7=FF mulss xmm5, xmm1 ;# xmm5=eps*Fp addss xmm5, xmm4 ;# xmm5=VV movaps xmm4, [rsp + nb333_c12] mulss xmm7, xmm4 ;# fijR mulss xmm5, xmm4 ;# Vvdw12 addss xmm3, xmm7 addss xmm5, [rsp + nb333_Vvdwtot] movss [rsp + nb333_Vvdwtot], xmm5 movaps [rsp+nb333_rinvO], xmm3 ;# save fscal temp. in rinvO ;# do the Coulomb interaction for H1,H2,M xorps xmm5, xmm5 movlps xmm3, [rsi + rcx*4] ;# data: Y3 F3 - - movhps xmm5, [rsi + rbx*4] ;# data: 0 0 Y2 F2 movhps xmm3, [rsi + rdx*4] ;# data: Y3 F3 Y4 F4 movaps xmm4, xmm5 ;# data: 0 0 Y2 F2 shufps xmm4, xmm3, 0x88 ;# data: 0 Y2 Y3 Y3 shufps xmm5, xmm3, 0xDD ;# data: 0 F2 F3 F4 xorps xmm7, xmm7 movlps xmm3, [rsi + rcx*4 + 8] ;# data: G3 H3 - - movhps xmm7, [rsi + rbx*4 + 8] ;# data: 0 0 G2 H2 movhps xmm3, [rsi + rdx*4 + 8] ;# data: G3 H3 G4 H4 movaps xmm6, xmm7 ;# data: 0 0 G2 H2 shufps xmm6, xmm3, 0x88 ;# data: 0 G2 G3 G3 shufps xmm7, xmm3, 0xDD ;# data: 0 H2 H3 H4 ;# xmm4 = 0 Y2 Y3 Y4 ;# xmm5 = 0 F2 F3 F4 ;# xmm6 = 0 G2 G3 G4 ;# xmm7 = 0 H2 H3 H4 ;# coulomb table ready, in xmm4-xmm7 mulps xmm6, xmm1 ;# xmm6=Geps mulps xmm7, xmm2 ;# xmm7=Heps2 addps xmm5, xmm6 addps xmm5, xmm7 ;# xmm5=Fp mulps xmm7, [rsp + nb333_two] ;# two*Heps2 movaps xmm0, [rsp + nb333_qqM] addps xmm7, xmm6 addps xmm7, xmm5 ;# xmm7=FF mulps xmm5, xmm1 ;# xmm5=eps*Fp addps xmm5, xmm4 ;# xmm5=VV mulps xmm5, xmm0 ;# vcoul=qq*VV mulps xmm0, xmm7 ;# fijC=FF*qq ;# at this point mm5 contains vcoul and xmm0 fijC ;# increment vcoul - then we can get rid of mm5 addps xmm5, [rsp + nb333_vctot] movaps [rsp + nb333_vctot], xmm5 addps xmm0, [rsp+nb333_rinvO] ;# total fscal (temp. storage in rinvO) xorps xmm4, xmm4 mulps xmm0, [rsp + nb333_rinvM] mulps xmm0, [rsp + nb333_tsc] subps xmm4, xmm0 movaps xmm0, [rsp + nb333_dxO] movaps xmm1, [rsp + nb333_dyO] movaps xmm2, [rsp + nb333_dzO] mulps xmm0, xmm4 mulps xmm1, xmm4 mulps xmm2, xmm4 ;# xmm0-xmm2 now contains tx-tz (partial force) movss xmm3, [rsp + nb333_fixO] movss xmm4, [rsp + nb333_fiyO] movss xmm5, [rsp + nb333_fizO] addss xmm3, xmm0 addss xmm4, xmm1 addss xmm5, xmm2 movss [rsp + nb333_fixO], xmm3 movss [rsp + nb333_fiyO], xmm4 movss [rsp + nb333_fizO], xmm5 ;# updated the O force now do the H's movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 0x39 ;# shift right shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb333_fixH1] addss xmm4, [rsp + nb333_fiyH1] addss xmm5, [rsp + nb333_fizH1] movss [rsp + nb333_fixH1], xmm3 movss [rsp + nb333_fiyH1], xmm4 movss [rsp + nb333_fizH1], xmm5 ;# updated the H1 force shufps xmm3, xmm3, 0x39 shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb333_fixH2] addss xmm4, [rsp + nb333_fiyH2] addss xmm5, [rsp + nb333_fizH2] movss [rsp + nb333_fixH2], xmm3 movss [rsp + nb333_fiyH2], xmm4 movss [rsp + nb333_fizH2], xmm5 ;# updated the H2 force mov rdi, [rbp + nb333_faction] shufps xmm3, xmm3, 0x39 shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm3, [rsp + nb333_fixM] addss xmm4, [rsp + nb333_fiyM] addss xmm5, [rsp + nb333_fizM] movss [rsp + nb333_fixM], xmm3 movss [rsp + nb333_fiyM], xmm4 movss [rsp + nb333_fizM], xmm5 ;# updated the M force movd eax, mm0 ;# the fj's - move in from mem start by acc. tx/ty/tz in xmm0, xmm1 movlps xmm6, [rdi + rax*4] movss xmm7, [rdi + rax*4 + 8] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm3, xmm0 addps xmm4, xmm1 addps xmm5, xmm2 movaps xmm0, xmm3 movaps xmm1, xmm4 movaps xmm2, xmm5 shufps xmm3, xmm3, 0x39 ;# shift right shufps xmm4, xmm4, 0x39 shufps xmm5, xmm5, 0x39 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 unpcklps xmm0, xmm1 ;# x,y sum in xmm0, z sum in xmm2 addps xmm6, xmm0 addss xmm7, xmm2 movlps [rdi + rax*4], xmm6 movss [rdi + rax*4 + 8], xmm7 dec dword ptr [rsp + nb333_innerk] jz .nb333_updateouterdata jmp .nb333_odd_loop.nb333_updateouterdata: mov ecx, [rsp + nb333_ii3] mov rdi, [rbp + nb333_faction] mov rsi, [rbp + nb333_fshift] mov edx, [rsp + nb333_is3] ;# accumulate Oi forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb333_fixO] movaps xmm1, [rsp + nb333_fiyO] movaps xmm2, [rsp + nb333_fizO] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 ;# xmm0-xmm2 has single force in pos0 ;# increment i force movss xmm3, [rdi + rcx*4] movss xmm4, [rdi + rcx*4 + 4] movss xmm5, [rdi + rcx*4 + 8] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [rdi + rcx*4], xmm3 movss [rdi + rcx*4 + 4], xmm4 movss [rdi + rcx*4 + 8], xmm5 ;# accumulate force in xmm6/xmm7 for fshift movaps xmm6, xmm0 movss xmm7, xmm2 movlhps xmm6, xmm1 shufps xmm6, xmm6, 8 ;# 00001000 ;# accumulate H1i forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb333_fixH1] movaps xmm1, [rsp + nb333_fiyH1] movaps xmm2, [rsp + nb333_fizH1] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4 addss xmm2, xmm5 ;# xmm0-xmm2 has single force in pos0 ;# increment i force movss xmm3, [rdi + rcx*4 + 12] movss xmm4, [rdi + rcx*4 + 16] movss xmm5, [rdi + rcx*4 + 20] subss xmm3, xmm0 subss xmm4, xmm1 subss xmm5, xmm2 movss [rdi + rcx*4 + 12], xmm3 movss [rdi + rcx*4 + 16], xmm4 movss [rdi + rcx*4 + 20], xmm5 ;# accumulate force in xmm6/xmm7 for fshift addss xmm7, xmm2 movlhps xmm0, xmm1 shufps xmm0, xmm0, 8 ;# 00001000 addps xmm6, xmm0 ;# accumulate H2i forces in xmm0, xmm1, xmm2 movaps xmm0, [rsp + nb333_fixH2] movaps xmm1, [rsp + nb333_fiyH2] movaps xmm2, [rsp + nb333_fizH2] movhlps xmm3, xmm0 movhlps xmm4, xmm1 movhlps xmm5, xmm2 addps xmm0, xmm3 addps xmm1, xmm4 addps xmm2, xmm5 ;# sum is in 1/2 in xmm0-xmm2 movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 shufps xmm3, xmm3, 1 shufps xmm4, xmm4, 1 shufps xmm5, xmm5, 1 addss xmm0, xmm3 addss xmm1, xmm4
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?