nb_kernel204_x86_64_sse.intel_syntax.s
来自「最著名最快的分子模拟软件」· S 代码 · 共 2,224 行 · 第 1/5 页
S
2,224 行
.nb204nf_outer: mov rax, [rsp + nb204nf_shift] ;# rax = pointer into shift[] mov ebx, [rax + rsi*4] ;# rbx=shift[n] lea rbx, [rbx + rbx*2] ;# rbx=3*is mov [rsp + nb204nf_is3],ebx ;# store is3 mov rax, [rsp + nb204nf_shiftvec] ;# rax = base of shiftvec[] movss xmm0, [rax + rbx*4] movss xmm1, [rax + rbx*4 + 4] movss xmm2, [rax + rbx*4 + 8] mov rcx, [rsp + nb204nf_iinr] ;# rcx = pointer into iinr[] mov ebx, [rcx + rsi*4] ;# ebx =ii lea rbx, [rbx + rbx*2] ;# rbx = 3*ii=ii3 mov rax, [rbp + nb204nf_pos] ;# rax = base of pos[] mov [rsp + nb204nf_ii3], ebx movaps xmm3, xmm0 movaps xmm4, xmm1 movaps xmm5, xmm2 addss xmm3, [rax + rbx*4 + 12] addss xmm4, [rax + rbx*4 + 16] addss xmm5, [rax + rbx*4 + 20] shufps xmm3, xmm3, 0 shufps xmm4, xmm4, 0 shufps xmm5, xmm5, 0 movaps [rsp + nb204nf_ixH1], xmm3 movaps [rsp + nb204nf_iyH1], xmm4 movaps [rsp + nb204nf_izH1], xmm5 movss xmm3, xmm0 movss xmm4, xmm1 movss xmm5, xmm2 addss xmm0, [rax + rbx*4 + 24] addss xmm1, [rax + rbx*4 + 28] addss xmm2, [rax + rbx*4 + 32] addss xmm3, [rax + rbx*4 + 36] addss xmm4, [rax + rbx*4 + 40] addss xmm5, [rax + rbx*4 + 44] shufps xmm0, xmm0, 0 shufps xmm1, xmm1, 0 shufps xmm2, xmm2, 0 shufps xmm3, xmm3, 0 shufps xmm4, xmm4, 0 shufps xmm5, xmm5, 0 movaps [rsp + nb204nf_ixH2], xmm0 movaps [rsp + nb204nf_iyH2], xmm1 movaps [rsp + nb204nf_izH2], xmm2 movaps [rsp + nb204nf_ixM], xmm3 movaps [rsp + nb204nf_iyM], xmm4 movaps [rsp + nb204nf_izM], xmm5 ;# clear vctot xorps xmm4, xmm4 movaps [rsp + nb204nf_vctot], xmm4 mov rax, [rsp + nb204nf_jindex] mov ecx, [rax + rsi*4] ;# jindex[n] mov edx, [rax + rsi*4 + 4] ;# jindex[n+1] sub edx, ecx ;# number of innerloop atoms mov rsi, [rbp + nb204nf_pos] mov rdi, [rbp + nb204nf_faction] mov rax, [rsp + nb204nf_jjnr] shl ecx, 2 add rax, rcx mov [rsp + nb204nf_innerjjnr], rax ;# pointer to jjnr[nj0] mov ecx, edx sub edx, 4 add ecx, [rsp + nb204nf_ninner] mov [rsp + nb204nf_ninner], ecx add edx, 0 mov [rsp + nb204nf_innerk], edx ;# number of innerloop atoms jge .nb204nf_unroll_loop jmp .nb204nf_single_check.nb204nf_unroll_loop: ;# quad-unroll innerloop here mov rdx, [rsp + nb204nf_innerjjnr] ;# pointer to jjnr[k] mov eax, [rdx] mov ebx, [rdx + 4] mov ecx, [rdx + 8] mov edx, [rdx + 12] ;# eax-edx=jnr1-4 add qword ptr [rsp + nb204nf_innerjjnr], 16 ;# advance pointer (unrolled 4) mov rsi, [rbp + nb204nf_pos] ;# base of pos[] lea rax, [rax + rax*2] ;# replace jnr with j3 lea rbx, [rbx + rbx*2] lea rcx, [rcx + rcx*2] ;# replace jnr with j3 lea rdx, [rdx + rdx*2] ;# move j coordinates to local temp variables movlps xmm2, [rsi + rax*4 + 12] movlps xmm3, [rsi + rax*4 + 24] movlps xmm4, [rsi + rax*4 + 36] movlps xmm5, [rsi + rbx*4 + 12] movlps xmm6, [rsi + rbx*4 + 24] movlps xmm7, [rsi + rbx*4 + 36] movhps xmm2, [rsi + rcx*4 + 12] movhps xmm3, [rsi + rcx*4 + 24] movhps xmm4, [rsi + rcx*4 + 36] movhps xmm5, [rsi + rdx*4 + 12] movhps xmm6, [rsi + rdx*4 + 24] movhps xmm7, [rsi + rdx*4 + 36] movaps xmm0, xmm2 movaps xmm1, xmm3 unpcklps xmm0, xmm5 unpcklps xmm1, xmm6 unpckhps xmm2, xmm5 unpckhps xmm3, xmm6 movaps xmm5, xmm4 movaps xmm6, xmm0 unpcklps xmm4, xmm7 unpckhps xmm5, xmm7 movaps xmm7, xmm1 movlhps xmm0, xmm2 movaps [rsp + nb204nf_jxH1], xmm0 movhlps xmm2, xmm6 movaps [rsp + nb204nf_jyH1], xmm2 movlhps xmm1, xmm3 movaps [rsp + nb204nf_jxH2], xmm1 movhlps xmm3, xmm7 movaps xmm6, xmm4 movaps [rsp + nb204nf_jyH2], xmm3 movlhps xmm4, xmm5 movaps [rsp + nb204nf_jxM], xmm4 movhlps xmm5, xmm6 movaps [rsp + nb204nf_jyM], xmm5 movss xmm0, [rsi + rax*4 + 20] movss xmm1, [rsi + rax*4 + 32] movss xmm2, [rsi + rax*4 + 44] movss xmm3, [rsi + rcx*4 + 20] movss xmm4, [rsi + rcx*4 + 32] movss xmm5, [rsi + rcx*4 + 44] movhps xmm0, [rsi + rbx*4 + 16] movhps xmm1, [rsi + rbx*4 + 28] movhps xmm2, [rsi + rbx*4 + 40] movhps xmm3, [rsi + rdx*4 + 16] movhps xmm4, [rsi + rdx*4 + 28] movhps xmm5, [rsi + rdx*4 + 40] shufps xmm0, xmm3, 204 ;# 11001100 shufps xmm1, xmm4, 204 ;# 11001100 shufps xmm2, xmm5, 204 ;# 11001100 movaps [rsp + nb204nf_jzH1], xmm0 movaps [rsp + nb204nf_jzH2], xmm1 movaps [rsp + nb204nf_jzM], xmm2 movaps xmm0, [rsp + nb204nf_ixH1] movaps xmm1, [rsp + nb204nf_iyH1] movaps xmm2, [rsp + nb204nf_izH1] movaps xmm3, [rsp + nb204nf_ixH1] movaps xmm4, [rsp + nb204nf_iyH1] movaps xmm5, [rsp + nb204nf_izH1] subps xmm0, [rsp + nb204nf_jxH1] subps xmm1, [rsp + nb204nf_jyH1] subps xmm2, [rsp + nb204nf_jzH1] subps xmm3, [rsp + nb204nf_jxH2] subps xmm4, [rsp + nb204nf_jyH2] subps xmm5, [rsp + nb204nf_jzH2] mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm3, xmm4 addps xmm3, xmm5 movaps [rsp + nb204nf_rsqH1H1], xmm0 movaps [rsp + nb204nf_rsqH1H2], xmm3 movaps xmm0, [rsp + nb204nf_ixH1] movaps xmm1, [rsp + nb204nf_iyH1] movaps xmm2, [rsp + nb204nf_izH1] movaps xmm3, [rsp + nb204nf_ixH2] movaps xmm4, [rsp + nb204nf_iyH2] movaps xmm5, [rsp + nb204nf_izH2] subps xmm0, [rsp + nb204nf_jxM] subps xmm1, [rsp + nb204nf_jyM] subps xmm2, [rsp + nb204nf_jzM] subps xmm3, [rsp + nb204nf_jxH1] subps xmm4, [rsp + nb204nf_jyH1] subps xmm5, [rsp + nb204nf_jzH1] mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm3, xmm4 addps xmm3, xmm5 movaps [rsp + nb204nf_rsqH1M], xmm0 movaps [rsp + nb204nf_rsqH2H1], xmm3 movaps xmm0, [rsp + nb204nf_ixH2] movaps xmm1, [rsp + nb204nf_iyH2] movaps xmm2, [rsp + nb204nf_izH2] movaps xmm3, [rsp + nb204nf_ixH2] movaps xmm4, [rsp + nb204nf_iyH2] movaps xmm5, [rsp + nb204nf_izH2] subps xmm0, [rsp + nb204nf_jxH2] subps xmm1, [rsp + nb204nf_jyH2] subps xmm2, [rsp + nb204nf_jzH2] subps xmm3, [rsp + nb204nf_jxM] subps xmm4, [rsp + nb204nf_jyM] subps xmm5, [rsp + nb204nf_jzM] mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm3, xmm4 addps xmm3, xmm5 movaps [rsp + nb204nf_rsqH2H2], xmm0 movaps [rsp + nb204nf_rsqH2M], xmm3 movaps xmm0, [rsp + nb204nf_ixM] movaps xmm1, [rsp + nb204nf_iyM] movaps xmm2, [rsp + nb204nf_izM] movaps xmm3, [rsp + nb204nf_ixM] movaps xmm4, [rsp + nb204nf_iyM] movaps xmm5, [rsp + nb204nf_izM] subps xmm0, [rsp + nb204nf_jxH1] subps xmm1, [rsp + nb204nf_jyH1] subps xmm2, [rsp + nb204nf_jzH1] subps xmm3, [rsp + nb204nf_jxH2] subps xmm4, [rsp + nb204nf_jyH2] subps xmm5, [rsp + nb204nf_jzH2] mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 mulps xmm3, xmm3 mulps xmm4, xmm4 mulps xmm5, xmm5 addps xmm0, xmm1 addps xmm0, xmm2 addps xmm4, xmm3 addps xmm4, xmm5 movaps [rsp + nb204nf_rsqMH1], xmm0 movaps [rsp + nb204nf_rsqMH2], xmm4 movaps xmm0, [rsp + nb204nf_ixM] movaps xmm1, [rsp + nb204nf_iyM] movaps xmm2, [rsp + nb204nf_izM] subps xmm0, [rsp + nb204nf_jxM] subps xmm1, [rsp + nb204nf_jyM] subps xmm2, [rsp + nb204nf_jzM] mulps xmm0, xmm0 mulps xmm1, xmm1 mulps xmm2, xmm2 addps xmm0, xmm1 addps xmm0, xmm2 movaps [rsp + nb204nf_rsqMM], xmm0 ;# start doing invsqrt use rsq values in xmm0, xmm4 rsqrtps xmm1, xmm0 rsqrtps xmm5, xmm4 movaps xmm2, xmm1 movaps xmm6, xmm5 mulps xmm1, xmm1 mulps xmm5, xmm5 movaps xmm3, [rsp + nb204nf_three] movaps xmm7, xmm3 mulps xmm1, xmm0 mulps xmm5, xmm4 subps xmm3, xmm1 subps xmm7, xmm5 mulps xmm3, xmm2 mulps xmm7, xmm6 mulps xmm3, [rsp + nb204nf_half] ;# rinvH2H2 mulps xmm7, [rsp + nb204nf_half] ;# rinvH2H1 movaps [rsp + nb204nf_rinvMM], xmm3 movaps [rsp + nb204nf_rinvMH2], xmm7 rsqrtps xmm1, [rsp + nb204nf_rsqH1H1] rsqrtps xmm5, [rsp + nb204nf_rsqH1H2] movaps xmm2, xmm1 movaps xmm6, xmm5 mulps xmm1, xmm1 mulps xmm5, xmm5 movaps xmm3, [rsp + nb204nf_three] movaps xmm7, xmm3 mulps xmm1, [rsp + nb204nf_rsqH1H1] mulps xmm5, [rsp + nb204nf_rsqH1H2] subps xmm3, xmm1 subps xmm7, xmm5 mulps xmm3, xmm2 mulps xmm7, xmm6 mulps xmm3, [rsp + nb204nf_half] mulps xmm7, [rsp + nb204nf_half] movaps [rsp + nb204nf_rinvH1H1], xmm3 movaps [rsp + nb204nf_rinvH1H2], xmm7 rsqrtps xmm1, [rsp + nb204nf_rsqH1M] rsqrtps xmm5, [rsp + nb204nf_rsqH2H1] movaps xmm2, xmm1 movaps xmm6, xmm5 mulps xmm1, xmm1 mulps xmm5, xmm5 movaps xmm3, [rsp + nb204nf_three] movaps xmm7, xmm3 mulps xmm1, [rsp + nb204nf_rsqH1M] mulps xmm5, [rsp + nb204nf_rsqH2H1] subps xmm3, xmm1 subps xmm7, xmm5 mulps xmm3, xmm2 mulps xmm7, xmm6 mulps xmm3, [rsp + nb204nf_half] mulps xmm7, [rsp + nb204nf_half] movaps [rsp + nb204nf_rinvH1M], xmm3 movaps [rsp + nb204nf_rinvH2H1], xmm7 rsqrtps xmm1, [rsp + nb204nf_rsqH2H2] rsqrtps xmm5, [rsp + nb204nf_rsqH2M] movaps xmm2, xmm1 movaps xmm6, xmm5 mulps xmm1, xmm1 mulps xmm5, xmm5 movaps xmm3, [rsp + nb204nf_three] movaps xmm7, xmm3 mulps xmm1, [rsp + nb204nf_rsqH2H2] mulps xmm5, [rsp + nb204nf_rsqH2M] subps xmm3, xmm1 subps xmm7, xmm5 mulps xmm3, xmm2 mulps xmm7, xmm6 mulps xmm3, [rsp + nb204nf_half] mulps xmm7, [rsp + nb204nf_half] movaps [rsp + nb204nf_rinvH2H2], xmm3 movaps [rsp + nb204nf_rinvH2M], xmm7 rsqrtps xmm1, [rsp + nb204nf_rsqMH1] movaps xmm2, xmm1 mulps xmm1, xmm1 movaps xmm3, [rsp + nb204nf_three] mulps xmm1, [rsp + nb204nf_rsqMH1] subps xmm3, xmm1 mulps xmm3, xmm2 mulps xmm3, [rsp + nb204nf_half] movaps [rsp + nb204nf_rinvMH1], xmm3 ;# Coulomb interactions ;# add all H-H rsq in xmm2, H-M rsq xmm4 ;# H-H rinv in xmm0, H-M in xmm1 movaps xmm0, [rsp + nb204nf_rinvH1H1] movaps xmm1, [rsp + nb204nf_rinvH1M] movaps xmm2, [rsp + nb204nf_rsqH1H1] movaps xmm4, [rsp + nb204nf_rsqH1M] addps xmm0, [rsp + nb204nf_rinvH1H2] addps xmm1, [rsp + nb204nf_rinvH2M] addps xmm2, [rsp + nb204nf_rsqH1H2] addps xmm4, [rsp + nb204nf_rsqH2M] addps xmm0, [rsp + nb204nf_rinvH2H1] addps xmm1, [rsp + nb204nf_rinvMH1] addps xmm2, [rsp + nb204nf_rsqH2H1] addps xmm4, [rsp + nb204nf_rsqMH1] addps xmm0, [rsp + nb204nf_rinvH2H2] addps xmm1, [rsp + nb204nf_rinvMH2] addps xmm2, [rsp + nb204nf_rsqH2H2] addps xmm4, [rsp + nb204nf_rsqMH2] movaps xmm5, [rsp + nb204nf_krf] movaps xmm6, [rsp + nb204nf_crf] ;# calc 4*crf in xmm7 movaps xmm7, xmm6 addps xmm7, xmm7 addps xmm7, xmm7 mulps xmm2, xmm5 ;# H-H krsq mulps xmm4, xmm5 ;# H-M krsq addps xmm0, xmm2 ;# H-H rinv+krsq addps xmm1, xmm4 ;# H-M rinv+krsq subps xmm0, xmm7 ;# H-H rinv+krsq-crf subps xmm1, xmm7 ;# H-M rinv+krsq-crf mulps xmm0, [rsp + nb204nf_qqHH] mulps xmm1, [rsp + nb204nf_qqMH] addps xmm0, xmm1 addps xmm0, [rsp + nb204nf_vctot] ;# M-M interaction movaps xmm4, [rsp + nb204nf_rinvMM] mulps xmm5, [rsp + nb204nf_rsqMM] ;# krsq addps xmm5, xmm4 ;# rinv+krsq subps xmm5, [rsp + nb204nf_crf] ;# xmm5=rinv+ krsq-crf mulps xmm5, [rsp + nb204nf_qqMM] addps xmm5, xmm0 movaps [rsp + nb204nf_vctot], xmm5 ;# should we do one more iteration? sub dword ptr [rsp + nb204nf_innerk], 4 jl .nb204nf_single_check jmp .nb204nf_unroll_loop.nb204nf_single_check: add dword ptr [rsp + nb204nf_innerk], 4 jnz .nb204nf_single_loop jmp .nb204nf_updateouterdata.nb204nf_single_loop: mov rdx, [rsp + nb204nf_innerjjnr] ;# pointer to jjnr[k] mov eax, [rdx] add qword ptr [rsp + nb204nf_innerjjnr], 4 mov rsi, [rbp + nb204nf_pos] lea rax, [rax + rax*2] ;# fetch j coordinates xorps xmm3, xmm3 xorps xmm4, xmm4 xorps xmm5, xmm5 movss xmm3, [rsi + rax*4 + 36] ;# jxM - - - movss xmm4, [rsi + rax*4 + 40] ;# jyM - - - movss xmm5, [rsi + rax*4 + 44] ;# jzM - - - movlps xmm6, [rsi + rax*4 + 12] ;# xmm6 = jxH1 jyH1 - - movss xmm7, [rsi + rax*4 + 20] ;# xmm7 = jzH1 - - - movhps xmm6, [rsi + rax*4 + 24] ;# xmm6 = jxH1 jyH1 jxH2 jyH2 movss xmm2, [rsi + rax*4 + 32] ;# xmm2 = jzH2 - - - ;# have all coords, time for some shuffling. shufps xmm6, xmm6, 216 ;# 11011000 ;# xmm6 = jxH1 jxH2 jyH1 jyH2 unpcklps xmm7, xmm2 ;# xmm7 = jzH1 jzH2 - - movaps xmm0, [rsp + nb204nf_ixM] movaps xmm1, [rsp + nb204nf_iyM]
⌨️ 快捷键说明
复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?