nb_kernel213_ia32_sse2.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,246 行 · 第 1/5 页

S
2,246
字号
	mulsd xmm3,xmm3	mulsd xmm4,xmm4	mulsd xmm5,xmm5	addsd xmm5, xmm4	addsd xmm5, xmm3	;# move ixM-izM to xmm2-xmm4  	movapd xmm3, [esp + nb213_iyM]	movapd xmm4, [esp + nb213_izM]	subpd  xmm3, xmm1	subpd  xmm4, xmm2	movapd xmm2, [esp + nb213_ixM]	subpd  xmm2, xmm0		;# store dr 	movapd [esp + nb213_dxM], xmm2	movapd [esp + nb213_dyM], xmm3	movapd [esp + nb213_dzM], xmm4	;# square it 	mulpd xmm2,xmm2	mulpd xmm3,xmm3	mulpd xmm4,xmm4	addpd xmm4, xmm3	addpd xmm4, xmm2		;# rsqM in xmm4, rsqH2 in xmm5, rsqH1 in xmm6, rsqO in xmm7 	;# calculate krsq	movsd xmm0, [esp + nb213_krf]	movsd xmm1, xmm0	movsd xmm2, xmm0	mulsd xmm0, xmm4  	mulsd xmm1, xmm5	mulsd xmm2, xmm6	movsd [esp + nb213_krsqM], xmm0	movsd [esp + nb213_krsqH2], xmm1	movsd [esp + nb213_krsqH1], xmm2	;# start with rsqH1 - put seed in xmm2 	cvtsd2ss xmm2, xmm6		rsqrtss xmm2, xmm2	cvtss2sd xmm2, xmm2	movapd  xmm3, xmm2	mulsd   xmm2, xmm2	movapd  xmm1, [esp + nb213_three]	mulsd   xmm2, xmm6	;# rsq*lu*lu 	subsd   xmm1, xmm2	;# 30-rsq*lu*lu 	mulsd   xmm1, xmm3	;# lu*(3-rsq*lu*lu) 	mulsd   xmm1, [esp + nb213_half] ;# iter1 ( new lu) 	movapd xmm3, xmm1	mulsd xmm1, xmm1	;# lu*lu 	mulsd xmm6, xmm1	;# rsq*lu*lu 	movapd xmm1, [esp + nb213_three]	subsd xmm1, xmm6	;# 3-rsq*lu*lu 	mulsd xmm1, xmm3	;# lu*(	3-rsq*lu*lu) 	mulsd xmm1, [esp + nb213_half] ;# rinv 	movapd [esp + nb213_rinvH1], xmm1		;# rsqH2 - seed in xmm2 	cvtsd2ss xmm2, xmm5		rsqrtss xmm2, xmm2	cvtss2sd xmm2, xmm2	movapd  xmm3, xmm2	mulsd   xmm2, xmm2	movapd  xmm1, [esp + nb213_three]	mulsd   xmm2, xmm5	;# rsq*lu*lu 	subsd   xmm1, xmm2	;# 30-rsq*lu*lu 	mulsd   xmm1, xmm3	;# lu*(3-rsq*lu*lu) 	mulsd   xmm1, [esp + nb213_half] ;# iter1 ( new lu) 	movapd xmm3, xmm1	mulsd xmm1, xmm1	;# lu*lu 	mulsd xmm5, xmm1	;# rsq*lu*lu 	movapd xmm1, [esp + nb213_three]	subsd xmm1, xmm5	;# 3-rsq*lu*lu 	mulsd xmm1, xmm3	;# lu*(	3-rsq*lu*lu) 	mulsd xmm1, [esp + nb213_half] ;# rinv 	movapd [esp + nb213_rinvH2], xmm1		;# rsqM - seed in xmm2 	cvtsd2ss xmm2, xmm4	rsqrtss xmm2, xmm2	cvtss2sd xmm2, xmm2	movapd  xmm3, xmm2	mulsd   xmm2, xmm2	movapd  xmm1, [esp + nb213_three]	mulsd   xmm2, xmm4	;# rsq*lu*lu 	subsd   xmm1, xmm2	;# 30-rsq*lu*lu 	mulsd   xmm1, xmm3	;# lu*(3-rsq*lu*lu) 	mulsd   xmm1, [esp + nb213_half] ;# iter1 ( new lu) 	movapd xmm3, xmm1	mulsd xmm1, xmm1	;# lu*lu 	mulsd xmm4, xmm1	;# rsq*lu*lu 	movapd xmm1, [esp + nb213_three]	subsd xmm1, xmm4	;# 3-rsq*lu*lu 	mulsd xmm1, xmm3	;# lu*(	3-rsq*lu*lu) 	mulsd xmm1, [esp + nb213_half] ;# rinv 	movapd [esp + nb213_rinvM], xmm1	;# do O interactions directly. xmm7=rsq	cvtsd2ss xmm2, xmm7	movapd   xmm6, xmm7	rcpps    xmm2, xmm2	cvtss2sd xmm2, xmm2	movapd   xmm1, [esp + nb213_two]	movapd   xmm0, xmm1	mulsd   xmm7, xmm2	subsd   xmm1, xmm7	mulsd   xmm2, xmm1 ;# iter1 	mulsd   xmm6, xmm2	subsd   xmm0, xmm6	mulsd   xmm0, xmm2 ;# xmm0=rinvsq	movapd  xmm1, xmm0		mulsd   xmm1, xmm1 ;# rinv4	mulsd   xmm1, xmm0 ;#rinvsix	movapd  xmm2, xmm1	mulsd	xmm2, xmm2 ;# rinvtwelve	mulsd  xmm1, [esp + nb213_c6]	mulsd  xmm2, [esp + nb213_c12]	movapd xmm3, xmm2	subsd  xmm3, xmm1	;# Vvdw=Vvdw12-Vvdw6 			addsd  xmm3, [esp + nb213_Vvdwtot]	mulsd  xmm1, [esp + nb213_six]	mulsd  xmm2, [esp + nb213_twelve]	subsd  xmm2, xmm1	mulsd  xmm2, xmm0	movapd xmm4, xmm2 ;# total fsO 	movsd [esp + nb213_Vvdwtot], xmm3	movapd xmm0, [esp + nb213_dxO]	movapd xmm1, [esp + nb213_dyO]	movapd xmm2, [esp + nb213_dzO]	mulsd  xmm0, xmm4	mulsd  xmm1, xmm4	mulsd  xmm2, xmm4	;# update O forces 	movapd xmm3, [esp + nb213_fixO]	movapd xmm4, [esp + nb213_fiyO]	movapd xmm7, [esp + nb213_fizO]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm7, xmm2	movsd [esp + nb213_fixO], xmm3	movsd [esp + nb213_fiyO], xmm4	movsd [esp + nb213_fizO], xmm7	;# update j forces with water O 	movsd [esp + nb213_fjx], xmm0	movsd [esp + nb213_fjy], xmm1	movsd [esp + nb213_fjz], xmm2	;# H1 interactions	movsd  xmm6, [esp + nb213_rinvH1] 	movsd  xmm4, xmm6	mulsd   xmm4, xmm4	;# xmm6=rinv, xmm4=rinvsq 	movsd  xmm7, xmm6	movsd  xmm0, [esp + nb213_krsqH1]	addsd   xmm6, xmm0	;# xmm6=rinv+ krsq 	mulsd   xmm0, [esp + nb213_two]	subsd   xmm6, [esp + nb213_crf]	subsd   xmm7, xmm0	;# xmm7=rinv-2*krsq 	mulsd   xmm6, [esp + nb213_qqH] ;# vcoul 	mulsd   xmm7, [esp + nb213_qqH]	mulsd  xmm4, xmm7		;# total fsH1 in xmm4 		addsd  xmm6, [esp + nb213_vctot]	movapd xmm0, [esp + nb213_dxH1]	movapd xmm1, [esp + nb213_dyH1]	movapd xmm2, [esp + nb213_dzH1]	movsd [esp + nb213_vctot], xmm6	mulsd  xmm0, xmm4	mulsd  xmm1, xmm4	mulsd  xmm2, xmm4	;# update H1 forces 	movapd xmm3, [esp + nb213_fixH1]	movapd xmm4, [esp + nb213_fiyH1]	movapd xmm7, [esp + nb213_fizH1]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm7, xmm2	movsd [esp + nb213_fixH1], xmm3	movsd [esp + nb213_fiyH1], xmm4	movsd [esp + nb213_fizH1], xmm7	;# update j forces with water H1 	addsd  xmm0, [esp + nb213_fjx]	addsd  xmm1, [esp + nb213_fjy]	addsd  xmm2, [esp + nb213_fjz]	movsd [esp + nb213_fjx], xmm0	movsd [esp + nb213_fjy], xmm1	movsd [esp + nb213_fjz], xmm2	;# H2 interactions 	movsd  xmm5, [esp + nb213_rinvH2] 	movsd  xmm4, xmm5		mulsd   xmm4, xmm4	;# xmm5=rinv, xmm4=rinvsq 	movsd  xmm7, xmm5	movsd  xmm0, [esp + nb213_krsqH2]	addsd   xmm5, xmm0	;# xmm5=rinv+ krsq 	mulsd   xmm0, [esp + nb213_two]	subsd   xmm5, [esp + nb213_crf]	subsd   xmm7, xmm0	;# xmm7=rinv-2*krsq 	mulsd   xmm5, [esp + nb213_qqH] ;# vcoul 	mulsd   xmm7, [esp + nb213_qqH]	mulsd  xmm4, xmm7		;# total fsH2 in xmm4 		addsd  xmm5, [esp + nb213_vctot]	movapd xmm0, [esp + nb213_dxH2]	movapd xmm1, [esp + nb213_dyH2]	movapd xmm2, [esp + nb213_dzH2]	movsd [esp + nb213_vctot], xmm5	mulsd  xmm0, xmm4	mulsd  xmm1, xmm4	mulsd  xmm2, xmm4	;# update H2 forces 	movapd xmm3, [esp + nb213_fixH2]	movapd xmm4, [esp + nb213_fiyH2]	movapd xmm7, [esp + nb213_fizH2]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm7, xmm2	movsd [esp + nb213_fixH2], xmm3	movsd [esp + nb213_fiyH2], xmm4	movsd [esp + nb213_fizH2], xmm7	;# update j forces with water H2 	addsd  xmm0, [esp + nb213_fjx]	addsd  xmm1, [esp + nb213_fjy]	addsd  xmm2, [esp + nb213_fjz]	movsd [esp + nb213_fjx], xmm0	movsd [esp + nb213_fjy], xmm1	movsd [esp + nb213_fjz], xmm2	;# M interactions 	movsd  xmm5, [esp + nb213_rinvM] 	movsd  xmm4, xmm5		mulsd   xmm4, xmm4	;# xmm5=rinv, xmm4=rinvsq 	movsd  xmm7, xmm5	movsd  xmm0, [esp + nb213_krsqM]	addsd   xmm5, xmm0	;# xmm5=rinv+ krsq 	mulsd   xmm0, [esp + nb213_two]	subsd   xmm5, [esp + nb213_crf]	subsd   xmm7, xmm0	;# xmm7=rinv-2*krsq 	mulsd   xmm5, [esp + nb213_qqM] ;# vcoul 	mulsd   xmm7, [esp + nb213_qqM]	mulsd  xmm4, xmm7		;# total fsH2 in xmm4 		addsd  xmm5, [esp + nb213_vctot]	movapd xmm0, [esp + nb213_dxM]	movapd xmm1, [esp + nb213_dyM]	movapd xmm2, [esp + nb213_dzM]	movsd [esp + nb213_vctot], xmm5	mulsd  xmm0, xmm4	mulsd  xmm1, xmm4	mulsd  xmm2, xmm4	;# update M forces 	movapd xmm3, [esp + nb213_fixM]	movapd xmm4, [esp + nb213_fiyM]	movapd xmm7, [esp + nb213_fizM]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm7, xmm2	movsd [esp + nb213_fixM], xmm3	movsd [esp + nb213_fiyM], xmm4	movsd [esp + nb213_fizM], xmm7	mov edi, [ebp + nb213_faction]	;# update j forces 	addsd  xmm0, [esp + nb213_fjx]	addsd  xmm1, [esp + nb213_fjy]	addsd  xmm2, [esp + nb213_fjz]	movlpd xmm3, [edi + eax*8]	movlpd xmm4, [edi + eax*8 + 8]	movlpd xmm5, [edi + eax*8 + 16]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	movlpd [edi + eax*8], xmm3	movlpd [edi + eax*8 + 8], xmm4	movlpd [edi + eax*8 + 16], xmm5.nb213_updateouterdata:	mov   ecx, [esp + nb213_ii3]	mov   edi, [ebp + nb213_faction]	mov   esi, [ebp + nb213_fshift]	mov   edx, [esp + nb213_is3]	;# accumulate  Oi forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb213_fixO]	movapd xmm1, [esp + nb213_fiyO]	movapd xmm2, [esp + nb213_fizO]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	;# increment i force 	movsd  xmm3, [edi + ecx*8]	movsd  xmm4, [edi + ecx*8 + 8]	movsd  xmm5, [edi + ecx*8 + 16]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8],     xmm3	movsd  [edi + ecx*8 + 8], xmm4	movsd  [edi + ecx*8 + 16], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	movapd xmm6, xmm0	movsd xmm7, xmm2	unpcklpd xmm6,xmm1 	;# accumulate H1i forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb213_fixH1]	movapd xmm1, [esp + nb213_fiyH1]	movapd xmm2, [esp + nb213_fizH1]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	;# increment i force 	movsd  xmm3, [edi + ecx*8 + 24]	movsd  xmm4, [edi + ecx*8 + 32]	movsd  xmm5, [edi + ecx*8 + 40]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8 + 24], xmm3	movsd  [edi + ecx*8 + 32], xmm4	movsd  [edi + ecx*8 + 40], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addsd xmm7, xmm2	unpcklpd xmm0, xmm1	addpd xmm6, xmm0	;# accumulate H2i forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb213_fixH2]	movapd xmm1, [esp + nb213_fiyH2]	movapd xmm2, [esp + nb213_fizH2]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	;# increment i force 	movsd  xmm3, [edi + ecx*8 + 48]	movsd  xmm4, [edi + ecx*8 + 56]	movsd  xmm5, [edi + ecx*8 + 64]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8 + 48], xmm3	movsd  [edi + ecx*8 + 56], xmm4	movsd  [edi + ecx*8 + 64], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addsd xmm7, xmm2	unpcklpd xmm0, xmm1	addpd xmm6, xmm0	;# accumulate Mi forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb213_fixM]	movapd xmm1, [esp + nb213_fiyM]	movapd xmm2, [esp + nb213_fizM]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	;# increment i force 	movsd  xmm3, [edi + ecx*8 + 72]	movsd  xmm4, [edi + ecx*8 + 80]	movsd  xmm5, [edi + ecx*8 + 88]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8 + 72], xmm3	movsd  [edi + ecx*8 + 80], xmm4	movsd  [edi + ecx*8 + 88], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addsd xmm7, xmm2	unpcklpd xmm0, xmm1	addpd xmm6, xmm0	;# increment fshift force 	movlpd xmm3, [esi + edx*8]	movhpd xmm3, [esi + edx*8 + 8]	movsd  xmm4, [esi + edx*8 + 16]	addpd  xmm3, xmm6	addsd  xmm4, xmm7	movlpd [esi + edx*8],      xmm3	movhpd [esi + edx*8 + 8],  xmm3	movsd  [esi + edx*8 + 16], xmm4	;# get n from stack	mov esi, [esp + nb213_n]        ;# get group index for i particle         mov   edx, [ebp + nb213_gid]      	;# base of gid[]        mov   edx, [edx + esi*4]		;# ggid=gid[n]	;# accumulate total potential energy and update it 	movapd xmm7, [esp + nb213_vctot]	;# accumulate 	movhlps xmm6, xmm7	addsd  xmm7, xmm6	;# low xmm7 has the sum now         	;# add earlier value from mem 	mov   eax, [ebp + nb213_Vc]	addsd xmm7, [eax + edx*8] 	;# move back to mem 	movsd [eax + edx*8], xmm7 		;# accumulate total lj energy and update it 	movapd xmm7, [esp + nb213_Vvdwtot]	;# accumulate 	movhlps xmm6, xmm7	addsd  xmm7, xmm6	;# low xmm7 has the sum now 	;# add earlier value from mem 	mov   eax, [ebp + nb213_Vvdw]	addsd xmm7, [eax + edx*8] 	;# move back to mem 	movsd [eax + edx*8], xmm7 	       ;# finish if last         mov ecx, [esp + nb213_nn1]	;# esi already loaded with n	inc esi

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?