nb_kernel212_ia32_sse2.intel_syntax.s

来自「最著名最快的分子模拟软件」· S 代码 · 共 2,141 行 · 第 1/5 页

S
2,141
字号
	movlpd [esp + nb212_fizH1], xmm2	;# H1-H1 interaction 	movapd xmm0, [esp + nb212_rinvH1H1]	movapd xmm7, xmm0	;# xmm7=rinv 	movapd xmm5, [esp + nb212_krf]		movapd xmm1, xmm0	mulsd  xmm5, [esp + nb212_rsqH1H1] ;# xmm5=krsq 	movapd xmm4, xmm5	addsd  xmm4, xmm7	;# xmm4=r inv+ krsq 	subsd  xmm4, [esp + nb212_crf]	mulsd xmm0, xmm0	mulsd  xmm4, [esp + nb212_qqHH] ;# xmm4=voul=qq*(rinv+ krsq) 	mulsd  xmm5, [esp + nb212_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb212_qqHH] ;# xmm7 = coul part of fscal 	addsd  xmm6, xmm4	;# add to local vctot 	mulsd xmm0, xmm7	;# fsOH2 	movapd xmm1, xmm0	movapd xmm2, xmm0	movapd xmm3, [esp + nb212_fjxH1]	movapd xmm4, [esp + nb212_fjyH1]	movapd xmm5, [esp + nb212_fjzH1]	mulsd xmm0, [esp + nb212_dxH1H1]	mulsd xmm1, [esp + nb212_dyH1H1]	mulsd xmm2, [esp + nb212_dzH1H1]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb212_fixH1]	addsd xmm1, [esp + nb212_fiyH1]	addsd xmm2, [esp + nb212_fizH1]	movlpd [esp + nb212_fjxH1], xmm3	movlpd [esp + nb212_fjyH1], xmm4	movlpd [esp + nb212_fjzH1], xmm5	movlpd [esp + nb212_fixH1], xmm0	movlpd [esp + nb212_fiyH1], xmm1	movlpd [esp + nb212_fizH1], xmm2	;# H1-H2 interaction 	movapd xmm0, [esp + nb212_rinvH1H2]	movapd xmm7, xmm0	;# xmm7=rinv 	movapd xmm5, [esp + nb212_krf]		movapd xmm1, xmm0	mulsd  xmm5, [esp + nb212_rsqH1H2] ;# xmm5=krsq 	movapd xmm4, xmm5	addsd  xmm4, xmm7	;# xmm4=r inv+ krsq 	mulsd xmm0, xmm0	subsd  xmm4, [esp + nb212_crf]	mulsd  xmm4, [esp + nb212_qqHH] ;# xmm4=voul=qq*(rinv+ krsq) 	mulsd  xmm5, [esp + nb212_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb212_qqHH] ;# xmm7 = coul part of fscal 	addsd  xmm6, xmm4	;# add to local vctot 	mulsd xmm0, xmm7	;# fsOH2 	movapd xmm1, xmm0	movapd xmm2, xmm0		movapd xmm3, [esp + nb212_fjxH2]	movapd xmm4, [esp + nb212_fjyH2]	movapd xmm5, [esp + nb212_fjzH2]	mulsd xmm0, [esp + nb212_dxH1H2]	mulsd xmm1, [esp + nb212_dyH1H2]	mulsd xmm2, [esp + nb212_dzH1H2]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb212_fixH1]	addsd xmm1, [esp + nb212_fiyH1]	addsd xmm2, [esp + nb212_fizH1]	movlpd [esp + nb212_fjxH2], xmm3	movlpd [esp + nb212_fjyH2], xmm4	movlpd [esp + nb212_fjzH2], xmm5	movlpd [esp + nb212_fixH1], xmm0	movlpd [esp + nb212_fiyH1], xmm1	movlpd [esp + nb212_fizH1], xmm2	;# H2-O interaction 	movapd xmm0, [esp + nb212_rinvH2O]	movapd xmm7, xmm0	;# xmm7=rinv 	movapd xmm5, [esp + nb212_krf]		movapd xmm1, xmm0	mulsd  xmm5, [esp + nb212_rsqH2O] ;# xmm5=krsq 	movapd xmm4, xmm5	addsd  xmm4, xmm7	;# xmm4=r inv+ krsq 	subsd  xmm4, [esp + nb212_crf]	mulsd xmm0, xmm0	mulsd  xmm4, [esp + nb212_qqOH] ;# xmm4=voul=qq*(rinv+ krsq) 	mulsd  xmm5, [esp + nb212_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb212_qqOH] ;# xmm7 = coul part of fscal 	addsd  xmm6, xmm4	;# add to local vctot 	mulsd xmm0, xmm7	;# fsOH2 	movapd xmm1, xmm0	movapd xmm2, xmm0	movapd xmm3, [esp + nb212_fjxO]	movapd xmm4, [esp + nb212_fjyO]	movapd xmm5, [esp + nb212_fjzO]	mulsd xmm0, [esp + nb212_dxH2O]	mulsd xmm1, [esp + nb212_dyH2O]	mulsd xmm2, [esp + nb212_dzH2O]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb212_fixH2]	addsd xmm1, [esp + nb212_fiyH2]	addsd xmm2, [esp + nb212_fizH2]	movlpd [esp + nb212_fjxO], xmm3	movlpd [esp + nb212_fjyO], xmm4	movlpd [esp + nb212_fjzO], xmm5	movlpd [esp + nb212_fixH2], xmm0	movlpd [esp + nb212_fiyH2], xmm1	movlpd [esp + nb212_fizH2], xmm2	;# H2-H1 interaction 	movapd xmm0, [esp + nb212_rinvH2H1]	movapd xmm7, xmm0	;# xmm7=rinv 	movapd xmm5, [esp + nb212_krf]		movapd xmm1, xmm0	mulsd  xmm5, [esp + nb212_rsqH2H1] ;# xmm5=krsq 	movapd xmm4, xmm5	addsd  xmm4, xmm7	;# xmm4=r inv+ krsq 	subsd  xmm4, [esp + nb212_crf]	mulsd xmm0, xmm0	mulsd  xmm4, [esp + nb212_qqHH] ;# xmm4=voul=qq*(rinv+ krsq) 	mulsd  xmm5, [esp + nb212_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb212_qqHH] ;# xmm7 = coul part of fscal 	addsd  xmm6, xmm4	;# add to local vctot 	mulsd xmm0, xmm7	;# fsOH2 	movapd xmm1, xmm0	movapd xmm2, xmm0	movapd xmm3, [esp + nb212_fjxH1]	movapd xmm4, [esp + nb212_fjyH1]	movapd xmm5, [esp + nb212_fjzH1]	mulsd xmm0, [esp + nb212_dxH2H1]	mulsd xmm1, [esp + nb212_dyH2H1]	mulsd xmm2, [esp + nb212_dzH2H1]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb212_fixH2]	addsd xmm1, [esp + nb212_fiyH2]	addsd xmm2, [esp + nb212_fizH2]	movlpd [esp + nb212_fjxH1], xmm3	movlpd [esp + nb212_fjyH1], xmm4	movlpd [esp + nb212_fjzH1], xmm5	movlpd [esp + nb212_fixH2], xmm0	movlpd [esp + nb212_fiyH2], xmm1	movlpd [esp + nb212_fizH2], xmm2	;# H2-H2 interaction 	movapd xmm0, [esp + nb212_rinvH2H2]	movapd xmm7, xmm0	;# xmm7=rinv 	movapd xmm5, [esp + nb212_krf]		movapd xmm1, xmm0	mulsd  xmm5, [esp + nb212_rsqH2H2] ;# xmm5=krsq 	movapd xmm4, xmm5	addsd  xmm4, xmm7	;# xmm4=r inv+ krsq 	subsd  xmm4, [esp + nb212_crf]	mulsd xmm0, xmm0	mulsd  xmm4, [esp + nb212_qqHH] ;# xmm4=voul=qq*(rinv+ krsq) 	mulsd  xmm5, [esp + nb212_two]	subsd  xmm7, xmm5	;# xmm7=rinv-2*krsq 	mulsd  xmm7, [esp + nb212_qqHH] ;# xmm7 = coul part of fscal 	addsd  xmm6, xmm4	;# add to local vctot 	mulsd xmm0, xmm7	;# fsOH2 	movapd xmm1, xmm0	movapd xmm2, xmm0	movapd xmm1, xmm0	movlpd [esp + nb212_vctot], xmm6	movapd xmm2, xmm0		movapd xmm3, [esp + nb212_fjxH2]	movapd xmm4, [esp + nb212_fjyH2]	movapd xmm5, [esp + nb212_fjzH2]	mulsd xmm0, [esp + nb212_dxH2H2]	mulsd xmm1, [esp + nb212_dyH2H2]	mulsd xmm2, [esp + nb212_dzH2H2]	subsd xmm3, xmm0	subsd xmm4, xmm1	subsd xmm5, xmm2	addsd xmm0, [esp + nb212_fixH2]	addsd xmm1, [esp + nb212_fiyH2]	addsd xmm2, [esp + nb212_fizH2]	movlpd [esp + nb212_fjxH2], xmm3	movlpd [esp + nb212_fjyH2], xmm4	movlpd [esp + nb212_fjzH2], xmm5	movlpd [esp + nb212_fixH2], xmm0	movlpd [esp + nb212_fiyH2], xmm1	movlpd [esp + nb212_fizH2], xmm2	mov edi, [ebp + nb212_faction]	;# Did all interactions - now update j forces 	movlpd xmm0, [edi + eax*8]	movlpd xmm1, [edi + eax*8 + 8]	movlpd xmm2, [edi + eax*8 + 16]	movlpd xmm3, [edi + eax*8 + 24]	movlpd xmm4, [edi + eax*8 + 32]	movlpd xmm5, [edi + eax*8 + 40]	movlpd xmm6, [edi + eax*8 + 48]	movlpd xmm7, [edi + eax*8 + 56]	addsd xmm0, [esp + nb212_fjxO]	addsd xmm1, [esp + nb212_fjyO]	addsd xmm2, [esp + nb212_fjzO]	addsd xmm3, [esp + nb212_fjxH1]	addsd xmm4, [esp + nb212_fjyH1]	addsd xmm5, [esp + nb212_fjzH1]	addsd xmm6, [esp + nb212_fjxH2]	addsd xmm7, [esp + nb212_fjyH2]	movlpd [edi + eax*8], xmm0	movlpd [edi + eax*8 + 8], xmm1	movlpd [edi + eax*8 + 16], xmm2	movlpd [edi + eax*8 + 24], xmm3	movlpd [edi + eax*8 + 32], xmm4	movlpd [edi + eax*8 + 40], xmm5	movlpd [edi + eax*8 + 48], xmm6	movlpd [edi + eax*8 + 56], xmm7	movlpd xmm0, [edi + eax*8 + 64]	addsd xmm0, [esp + nb212_fjzH2]	movlpd [edi + eax*8 + 64], xmm0	.nb212_updateouterdata:	mov   ecx, [esp + nb212_ii3]	mov   edi, [ebp + nb212_faction]	mov   esi, [ebp + nb212_fshift]	mov   edx, [esp + nb212_is3]	;# accumulate  Oi forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb212_fixO]	movapd xmm1, [esp + nb212_fiyO]	movapd xmm2, [esp + nb212_fizO]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	movapd xmm3, xmm0		movapd xmm4, xmm1		movapd xmm5, xmm2		;# increment i force 	movsd  xmm3, [edi + ecx*8]	movsd  xmm4, [edi + ecx*8 + 8]	movsd  xmm5, [edi + ecx*8 + 16]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8],     xmm3	movsd  [edi + ecx*8 + 8], xmm4	movsd  [edi + ecx*8 + 16], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	movapd xmm6, xmm0	movsd xmm7, xmm2	unpcklpd xmm6, xmm1	;# accumulate H1i forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb212_fixH1]	movapd xmm1, [esp + nb212_fiyH1]	movapd xmm2, [esp + nb212_fizH1]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	;# increment i force 	movsd  xmm3, [edi + ecx*8 + 24]	movsd  xmm4, [edi + ecx*8 + 32]	movsd  xmm5, [edi + ecx*8 + 40]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8 + 24], xmm3	movsd  [edi + ecx*8 + 32], xmm4	movsd  [edi + ecx*8 + 40], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addsd xmm7, xmm2	unpcklpd xmm0, xmm1	addpd xmm6, xmm0	;# accumulate H2i forces in xmm0, xmm1, xmm2 	movapd xmm0, [esp + nb212_fixH2]	movapd xmm1, [esp + nb212_fiyH2]	movapd xmm2, [esp + nb212_fizH2]	movhlps xmm3, xmm0	movhlps xmm4, xmm1	movhlps xmm5, xmm2	addsd  xmm0, xmm3	addsd  xmm1, xmm4	addsd  xmm2, xmm5 ;# sum is in low xmm0-xmm2 	movapd xmm3, xmm0		movapd xmm4, xmm1		movapd xmm5, xmm2		;# increment i force 	movsd  xmm3, [edi + ecx*8 + 48]	movsd  xmm4, [edi + ecx*8 + 56]	movsd  xmm5, [edi + ecx*8 + 64]	addsd  xmm3, xmm0	addsd  xmm4, xmm1	addsd  xmm5, xmm2	movsd  [edi + ecx*8 + 48], xmm3	movsd  [edi + ecx*8 + 56], xmm4	movsd  [edi + ecx*8 + 64], xmm5	;# accumulate force in xmm6/xmm7 for fshift 	addsd xmm7, xmm2	unpcklpd xmm0, xmm1	addpd xmm6, xmm0	;# increment fshift force 	movlpd xmm3, [esi + edx*8]	movhpd xmm3, [esi + edx*8 + 8]	movsd  xmm4, [esi + edx*8 + 16]	addpd  xmm3, xmm6	addsd  xmm4, xmm7	movlpd [esi + edx*8],      xmm3	movhpd [esi + edx*8 + 8],  xmm3	movsd  [esi + edx*8 + 16], xmm4	;# get n from stack	mov esi, [esp + nb212_n]        ;# get group index for i particle         mov   edx, [ebp + nb212_gid]      	;# base of gid[]        mov   edx, [edx + esi*4]		;# ggid=gid[n]	;# accumulate total potential energy and update it 	movapd xmm7, [esp + nb212_vctot]	;# accumulate 	movhlps xmm6, xmm7	addsd  xmm7, xmm6	;# low xmm7 has the sum now 	;# add earlier value from mem 	mov   eax, [ebp + nb212_Vc]	addsd xmm7, [eax + edx*8] 	;# move back to mem 	movsd [eax + edx*8], xmm7 		;# accumulate total lj energy and update it 	movapd xmm7, [esp + nb212_Vvdwtot]	;# accumulate 	movhlps xmm6, xmm7	addsd  xmm7, xmm6	;# low xmm7 has the sum now 		;# add earlier value from mem 	mov   eax, [ebp + nb212_Vvdw]	addsd xmm7, [eax + edx*8] 	;# move back to mem 	movsd [eax + edx*8], xmm7 	        ;# finish if last         mov ecx, [esp + nb212_nn1]	;# esi already loaded with n	inc esi        sub ecx, esi        jz .nb212_outerend        ;# not last, iterate outer loop once more!          mov [esp + nb212_n], esi        jmp .nb212_outer.nb212_outerend:        ;# check if more outer neighborlists remain        mov   ecx, [esp + nb212_nri]	;# esi already loaded with n above        sub   ecx, esi        jz .nb212_end        ;# non-zero, do one more workunit        jmp   .nb212_threadloop.nb212_end:	emms	mov eax, [esp + nb212_nouter]	mov ebx, [esp + nb212_ninner]	mov ecx, [ebp + nb212_outeriter]	mov edx, [ebp + nb212_inneriter]	mov [ecx], eax	mov [edx], ebx	mov eax, [esp + nb212_salign]	add esp, eax	add esp, 1560	pop edi	pop esi    pop edx    pop ecx    pop ebx    pop eax	leave	ret	.globl nb_kernel212nf_ia32_sse2.globl _nb_kernel212nf_ia32_sse2nb_kernel212nf_ia32_sse2:	_nb_kernel212nf_ia32_sse2:	.equiv          nb212nf_p_nri,          8.equiv          nb212nf_iinr,           12.equiv          nb212nf_jindex,         16.equiv          nb212nf_jjnr,           20.equiv          nb212nf_shift,          24.equiv          nb212nf_shiftvec,       28.equiv          nb212nf_fshift,         32.equiv          nb212nf_gid,            36.equiv          nb212nf_pos,            40.equiv          nb212nf_faction,        44.equiv          nb212nf_charge,         48.equiv          nb212nf_p_facel,        52.equiv          n

⌨️ 快捷键说明

复制代码Ctrl + C
搜索代码Ctrl + F
全屏模式F11
增大字号Ctrl + =
减小字号Ctrl + -
显示快捷键?