nb_kernel313_x86_64_sse.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,333 行 · 第 1/5 页

S
2,333
字号
        movaps xmm13, xmm3    movaps xmm14, xmm4    movaps xmm15, xmm5    	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	addps  xmm3, xmm4	addps  xmm3, xmm5    ;# calc 1/rsq    rcpps xmm5, xmm3    movaps xmm4, [rsp + nb313_two]    mulps xmm3, xmm5    subps xmm4, xmm3    mulps xmm4, xmm5        ;# xmm4=rinvsq    movaps xmm3, xmm4       ;# rinvsq    mulps  xmm4, xmm4       ;# rinv4    mulps  xmm4, xmm3       ;# rinv6    movaps xmm5, xmm4         mulps  xmm5, xmm5       ;# rinv12    mulps  xmm4, [rsp + nb313_c6]    mulps  xmm5, [rsp + nb313_c12]    movaps xmm6, xmm5    subps  xmm6, xmm4  ;# Vvdw=vvdw12-vvdw6    mulps  xmm4, [rsp + nb313_six]    mulps  xmm5, [rsp + nb313_twelve]    subps  xmm5, xmm4    mulps  xmm3, xmm5   ;# fscal        addps  xmm6, [rsp + nb313_Vvdwtot]    movaps [rsp + nb313_Vvdwtot], xmm6        mulps  xmm13, xmm3 ;# fx    mulps  xmm14, xmm3 ;# fy    mulps  xmm15, xmm3 ;# fz    ;# save j force temporarily    movaps [rsp + nb313_fjx], xmm13    movaps [rsp + nb313_fjy], xmm14    movaps [rsp + nb313_fjz], xmm15        ;# increment i O force    addps xmm13, [rsp + nb313_fixO]    addps xmm14, [rsp + nb313_fiyO]    addps xmm15, [rsp + nb313_fizO]    movaps [rsp + nb313_fixO], xmm13    movaps [rsp + nb313_fiyO], xmm14    movaps [rsp + nb313_fizO], xmm15        ;# finished O LJ interaction.    ;# do H1, H2, and M interactions in parallel.    ;# xmm0-xmm2 still contain j coordinates.            movaps xmm3, xmm0    movaps xmm4, xmm1    movaps xmm5, xmm2    movaps xmm6, xmm0    movaps xmm7, xmm1    movaps xmm8, xmm2        subps xmm0, [rsp + nb313_ixH1]    subps xmm1, [rsp + nb313_iyH1]    subps xmm2, [rsp + nb313_izH1]    subps xmm3, [rsp + nb313_ixH2]    subps xmm4, [rsp + nb313_iyH2]    subps xmm5, [rsp + nb313_izH2]    subps xmm6, [rsp + nb313_ixM]    subps xmm7, [rsp + nb313_iyM]    subps xmm8, [rsp + nb313_izM]    	movd  mm0, eax		;# use mmx registers as temp storage 	movd  mm1, ebx	movd  mm2, ecx	movd  mm3, edx	movaps [rsp + nb313_dxH1], xmm0	movaps [rsp + nb313_dyH1], xmm1	movaps [rsp + nb313_dzH1], xmm2	mulps  xmm0, xmm0	mulps  xmm1, xmm1	mulps  xmm2, xmm2	movaps [rsp + nb313_dxH2], xmm3	movaps [rsp + nb313_dyH2], xmm4	movaps [rsp + nb313_dzH2], xmm5	mulps  xmm3, xmm3	mulps  xmm4, xmm4	mulps  xmm5, xmm5	movaps [rsp + nb313_dxM], xmm6	movaps [rsp + nb313_dyM], xmm7	movaps [rsp + nb313_dzM], xmm8	mulps  xmm6, xmm6	mulps  xmm7, xmm7	mulps  xmm8, xmm8	addps  xmm0, xmm1	addps  xmm0, xmm2	addps  xmm3, xmm4	addps  xmm3, xmm5    addps  xmm6, xmm7    addps  xmm6, xmm8	;# start doing invsqrt for j atoms	rsqrtps xmm1, xmm0	rsqrtps xmm4, xmm3    rsqrtps xmm7, xmm6		movaps  xmm2, xmm1	movaps  xmm5, xmm4    movaps  xmm8, xmm7    	mulps   xmm1, xmm1 ;# lu*lu	mulps   xmm4, xmm4 ;# lu*lu    mulps   xmm7, xmm7 ;# lu*lu			movaps  xmm9, [rsp + nb313_three]	movaps  xmm10, xmm9    movaps  xmm11, xmm9	mulps   xmm1, xmm0 ;# rsq*lu*lu	mulps   xmm4, xmm3 ;# rsq*lu*lu     mulps   xmm7, xmm6 ;# rsq*lu*lu		subps   xmm9, xmm1	subps   xmm10, xmm4    subps   xmm11, xmm7 ;# 3-rsq*lu*lu	mulps   xmm9, xmm2	mulps   xmm10, xmm5    mulps   xmm11, xmm8 ;# lu*(3-rsq*lu*lu)	movaps  xmm4, [rsp + nb313_half]	mulps   xmm9, xmm4  ;# rinvH1 	mulps   xmm10, xmm4 ;# rinvH2    mulps   xmm11, xmm4 ;# rinvM	movaps  [rsp + nb313_rinvH1], xmm9	movaps  [rsp + nb313_rinvH2], xmm10	movaps  [rsp + nb313_rinvM], xmm11		;# interactions     ;# rsq in xmm0,xmm3,xmm6      ;# rinv in xmm9, xmm10, xmm11    movaps xmm1, [rsp + nb313_tsc]    mulps  xmm0, xmm9  ;# r    mulps  xmm3, xmm10    mulps  xmm6, xmm11    mulps  xmm0, xmm1 ;# rtab    mulps  xmm3, xmm1    mulps  xmm6, xmm1        ;# truncate and convert to integers    cvttps2dq xmm1, xmm0    cvttps2dq xmm4, xmm3    cvttps2dq xmm7, xmm6            ;# convert back to float    cvtdq2ps  xmm2, xmm1    cvtdq2ps  xmm5, xmm4    cvtdq2ps  xmm8, xmm7        ;# multiply by 4    pslld   xmm1, 2    pslld   xmm4, 2    pslld   xmm7, 2        ;# move to integer registers    movhlps xmm13, xmm1    movhlps xmm14, xmm4    movhlps xmm15, xmm7    movd    eax, xmm1    movd    r8d, xmm4    movd    r12d, xmm7    movd    ecx, xmm13    movd    r10d, xmm14    movd    r14d, xmm15    pshufd  xmm1, xmm1, 1    pshufd  xmm4, xmm4, 1    pshufd  xmm7, xmm7, 1    pshufd  xmm13, xmm13, 1    pshufd  xmm14, xmm14, 1    pshufd  xmm15, xmm15, 1    movd    ebx, xmm1    movd    r9d, xmm4    movd    r13d, xmm7        movd    edx, xmm13    movd    r11d, xmm14    movd    r15d, xmm15               mov  rsi, [rbp + nb313_VFtab]    ;# calculate eps    subps     xmm0, xmm2    subps     xmm3, xmm5    subps     xmm6, xmm8    movaps    [rsp + nb313_epsH1], xmm0    movaps    [rsp + nb313_epsH2], xmm3    movaps    [rsp + nb313_epsM], xmm6    ;# Load LOTS of table data   	movlps xmm1, [rsi + rax*4]   	movlps xmm5, [rsi + r8*4]   	movlps xmm9, [rsi + r12*4]	movlps xmm3, [rsi + rcx*4]	movlps xmm7, [rsi + r10*4]	movlps xmm11, [rsi + r14*4]	movhps xmm1, [rsi + rbx*4]	movhps xmm5, [rsi + r9*4]	movhps xmm9, [rsi + r13*4]	movhps xmm3, [rsi + rdx*4]	movhps xmm7, [rsi + r11*4]	movhps xmm11, [rsi + r15*4]    movaps xmm0, xmm1    movaps xmm4, xmm5    movaps xmm8, xmm9	shufps xmm0, xmm3, 136  ;# 10001000	shufps xmm4, xmm7, 136  ;# 10001000	shufps xmm8, xmm11, 136  ;# 10001000	shufps xmm1, xmm3, 221  ;# 11011101	shufps xmm5, xmm7, 221  ;# 11011101	shufps xmm9, xmm11, 221  ;# 11011101    	movlps xmm3, [rsi + rax*4 + 8]	movlps xmm7, [rsi + r8*4 + 8]	movlps xmm11, [rsi + r12*4 + 8]    	movlps xmm12, [rsi + rcx*4 + 8]	movlps xmm13, [rsi + r10*4 + 8]	movlps xmm14, [rsi + r14*4 + 8]	movhps xmm3, [rsi + rbx*4 + 8]	movhps xmm7, [rsi + r9*4 + 8]	movhps xmm11, [rsi + r13*4 + 8]    	movhps xmm12, [rsi + rdx*4 + 8]	movhps xmm13, [rsi + r11*4 + 8]	movhps xmm14, [rsi + r15*4 + 8]    movaps xmm2, xmm3    movaps xmm6, xmm7    movaps xmm10, xmm11    	shufps xmm2, xmm12, 136  ;# 10001000	shufps xmm6, xmm13, 136  ;# 10001000	shufps xmm10, xmm14, 136  ;# 10001000	shufps xmm3, xmm12, 221  ;# 11011101	shufps xmm7, xmm13, 221  ;# 11011101	shufps xmm11, xmm14, 221  ;# 11011101    ;# table data ready in xmm0-xmm3 , xmm4-xmm7 , and xmm8-xmm11        movaps xmm12, [rsp + nb313_epsH1]    movaps xmm13, [rsp + nb313_epsH2]    movaps xmm14, [rsp + nb313_epsM]        mulps  xmm3, xmm12   ;# Heps    mulps  xmm7, xmm13    mulps  xmm11, xmm14     mulps  xmm2, xmm12   ;# Geps    mulps  xmm6, xmm13    mulps  xmm10, xmm14     mulps  xmm3, xmm12   ;# Heps2    mulps  xmm7, xmm13    mulps  xmm11, xmm14     addps  xmm1, xmm2   ;# F+Geps    addps  xmm5, xmm6    addps  xmm9, xmm10     addps  xmm1, xmm3   ;# F+Geps+Heps2 = Fp    addps  xmm5, xmm7    addps  xmm9, xmm11     addps  xmm3, xmm3    ;# 2*Heps2    addps  xmm7, xmm7    addps  xmm11, xmm11    addps  xmm3, xmm2    ;# 2*Heps2+Geps    addps  xmm7, xmm6      addps  xmm11, xmm10    addps  xmm3, xmm1   ;# FF = Fp + 2*Heps2 + Geps    addps  xmm7, xmm5    addps  xmm11, xmm9    mulps  xmm1, xmm12   ;# eps*Fp    mulps  xmm5, xmm13    mulps  xmm9, xmm14    movaps xmm12, [rsp + nb313_qqH]    movaps xmm13, [rsp + nb313_qqM]    addps  xmm1, xmm0     ;# VV    addps  xmm5, xmm4    addps  xmm9, xmm8    mulps  xmm1, xmm12   ;# VV*qq = vcoul    mulps  xmm5, xmm12    mulps  xmm9, xmm13    mulps  xmm3, xmm12    ;# FF*qq = fij    mulps  xmm7, xmm12    mulps  xmm11, xmm13        ;# accumulate vctot    addps  xmm1, [rsp + nb313_vctot]    addps  xmm5, xmm9    addps  xmm1, xmm5    movaps [rsp + nb313_vctot], xmm1        movaps xmm10, [rsp + nb313_tsc]    mulps  xmm3, xmm10  ;# fscal    mulps  xmm7, xmm10    mulps  xmm10, xmm11        movd eax, mm0    movd ebx, mm1    movd ecx, mm2    movd edx, mm3	;# move j forces to local temp variables     mov rdi, [rbp + nb313_faction]    movlps xmm11, [rdi + rax*4] ;# jxa jya  -   -    movlps xmm12, [rdi + rcx*4] ;# jxc jyc  -   -    movhps xmm11, [rdi + rbx*4] ;# jxa jya jxb jyb     movhps xmm12, [rdi + rdx*4] ;# jxc jyc jxd jyd     movss  xmm13, [rdi + rax*4 + 8] ;# jza  -  -  -    movss  xmm14, [rdi + rcx*4 + 8] ;# jzc  -  -  -    movss  xmm2,  [rdi + rbx*4 + 8] ;# jzb    movss  xmm5,  [rdi + rdx*4 + 8] ;# jzd    movlhps xmm13, xmm2 ;# jza  -  jzb  -    movlhps xmm14, xmm5 ;# jzc  -  jzd -        shufps xmm13, xmm14,  136  ;# 10001000 => jza jzb jzc jzd    ;# xmm11: jxa jya jxb jyb     ;# xmm12: jxc jyc jxd jyd    ;# xmm13: jza jzb jzc jzd    xorps  xmm0, xmm0    xorps  xmm4, xmm4    xorps  xmm8, xmm8    mulps  xmm3, [rsp + nb313_rinvH1]    mulps  xmm7, [rsp + nb313_rinvH2]    mulps  xmm10, [rsp + nb313_rinvM]        subps  xmm0, xmm3    subps  xmm4, xmm7    subps  xmm8, xmm10        movaps xmm1, xmm0    movaps xmm2, xmm0    movaps xmm3, xmm4    movaps xmm5, xmm4    movaps xmm6, xmm8    movaps xmm7, xmm8	mulps xmm0, [rsp + nb313_dxH1]	mulps xmm1, [rsp + nb313_dyH1]	mulps xmm2, [rsp + nb313_dzH1]	mulps xmm3, [rsp + nb313_dxH2]	mulps xmm4, [rsp + nb313_dyH2]	mulps xmm5, [rsp + nb313_dzH2]	mulps xmm6, [rsp + nb313_dxM]	mulps xmm7, [rsp + nb313_dyM]	mulps xmm8, [rsp + nb313_dzM]    ;# fetch forces from O interaction    movaps xmm14, [rsp + nb313_fjx]    movaps xmm15, [rsp + nb313_fjy]    addps  xmm13, [rsp + nb313_fjz]    addps xmm14, xmm0    addps xmm15, xmm1    addps xmm13,  xmm2    addps xmm0, [rsp + nb313_fixH1]    addps xmm1, [rsp + nb313_fiyH1]    addps xmm2, [rsp + nb313_fizH1]    addps xmm14, xmm3    addps xmm15, xmm4    addps xmm13, xmm5    addps xmm3, [rsp + nb313_fixH2]    addps xmm4, [rsp + nb313_fiyH2]    addps xmm5, [rsp + nb313_fizH2]    addps xmm14, xmm6    addps xmm15, xmm7    addps xmm13, xmm8    addps xmm6, [rsp + nb313_fixM]    addps xmm7, [rsp + nb313_fiyM]    addps xmm8, [rsp + nb313_fizM]    movaps [rsp + nb313_fixH1], xmm0    movaps [rsp + nb313_fiyH1], xmm1    movaps [rsp + nb313_fizH1], xmm2    movaps [rsp + nb313_fixH2], xmm3    movaps [rsp + nb313_fiyH2], xmm4    movaps [rsp + nb313_fizH2], xmm5    movaps [rsp + nb313_fixM], xmm6    movaps [rsp + nb313_fiyM], xmm7    movaps [rsp + nb313_fizM], xmm8        ;# xmm14 = fjx    ;# xmm15 = fjy    ;# xmm13 = fjz    movaps xmm0, xmm14    unpcklps xmm14, xmm15    unpckhps xmm0,  xmm15        addps  xmm11, xmm14    addps  xmm12, xmm0        movhlps  xmm14, xmm13 ;# fjzc fjzd        movlps [rdi + rax*4], xmm11    movhps [rdi + rbx*4], xmm11    movlps [rdi + rcx*4], xmm12    movhps [rdi + rdx*4], xmm12    movss  [rdi + rax*4 + 8], xmm13    movss  [rdi + rcx*4 + 8], xmm14    shufps xmm13, xmm13, 1    shufps xmm14, xmm14, 1    movss  [rdi + rbx*4 + 8], xmm13    movss  [rdi + rdx*4 + 8], xmm14    	;# should we do one more iteration? 	sub dword ptr [rsp + nb313_innerk],  4	jl    .nb313_odd_inner	jmp   .nb313_unroll_loop.nb313_odd_inner:		add dword ptr [rsp + nb313_innerk],  4	jnz   .nb313_odd_loop	jmp   .nb313_updateouterdata.nb313_odd_loop:	mov   rdx, [rsp + nb313_innerjjnr] 	;# pointer to jjnr[k] 	mov   eax, [rdx]		add qword ptr [rsp + nb313_innerjjnr],  4	 	xorps xmm4, xmm4  	;# clear reg.	movss xmm4, [rsp + nb313_iqM]	mov rsi, [rbp + nb313_charge] 	movhps xmm4, [rsp + nb313_iqH]  ;# [qM  0  qH  qH] 	shufps xmm4, xmm4, 41	;# [0 qH qH qM]	movss xmm3, [rsi + rax*4]	;# charge in xmm3 	shufps xmm3, xmm3, 0	mulps xmm3, xmm4	movaps [rsp + nb313_qqM], xmm3	;# use dummy qq for storage 		xorps xmm6, xmm6	mov rsi, [rbp + nb313_type]	mov ebx, [rsi + rax*4]	mov rsi, [rbp + nb313_vdwparam]	shl ebx, 1		add ebx, [rsp + nb313_ntia]	movlps xmm6, [rsi + rbx*4]	movaps xmm7, xmm6	shufps xmm6, xmm6, 252  ;# 11111100	shufps xmm7, xmm7, 253  ;# 11111101	movaps [rsp + nb313_c6], xmm6	movaps [rsp + nb313_c12], xmm7		mov rsi, [rbp + nb313_pos]	lea rax, [rax + rax*2]  	movss xmm0, [rsp + nb313_ixO]

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?