| Loop Id: 93 | Module: exec | Source: ljForce.c:178-216 [...] | Coverage: 0.24% |
|---|
| Loop Id: 93 | Module: exec | Source: ljForce.c:178-216 [...] | Coverage: 0.24% |
|---|
0x40be70 INC %R10 |
0x40be73 CMP $0x1b,%R10 |
0x40be77 MOV -0x80(%RBP),%RDX |
0x40be7b JE 40be20 |
0x40be7d MOV (%RDX,%R10,4),%EAX |
0x40be81 TEST %EAX,%EAX |
0x40be83 JS 40c06d |
0x40be89 MOV -0x60(%RBP),%RCX |
0x40be8d MOVSXD (%RCX,%RAX,4),%RDX |
0x40be91 TEST %RDX,%RDX |
0x40be94 JLE 40be70 |
0x40be96 SAL $0x6,%EAX |
0x40be99 MOV -0x58(%RBP),%RCX |
0x40be9d MOV 0x20(%RCX),%R14 |
0x40bea1 MOV 0x18(%R14),%R12 |
0x40bea5 CLTQ |
0x40bea7 ADD %RAX,%RDX |
0x40beaa LEA 0x1(%RAX),%RCX |
0x40beae CMP %RCX,%RDX |
0x40beb1 CMOVLE %RCX,%RDX |
0x40beb5 SUB %RAX,%RDX |
0x40beb8 LEA (%RAX,%RAX,2),%RAX |
0x40bebc LEA (%R12,%RAX,8),%R15 |
0x40bec0 ADD $0x10,%R15 |
0x40bec4 XOR %EBX,%EBX |
0x40bec6 JMP 40bedc |
(94) 0x40bed0 LEA 0x1(%RBX),%RAX |
(94) 0x40bed4 CMP %R9,%RBX |
(94) 0x40bed7 MOV %RAX,%RBX |
(94) 0x40beda JE 40be70 |
(94) 0x40bedc LEA (%RBX,%RDI,1),%RSI |
(94) 0x40bee0 LEA (%RSI,%RSI,2),%RCX |
(94) 0x40bee4 LEA (%R12,%RCX,8),%RAX |
(94) 0x40bee8 MOV %R15,%R13 |
(94) 0x40beeb MOV %RDX,%R11 |
(94) 0x40beee JMP 40bef9 |
(95) 0x40bef0 ADD $0x18,%R13 |
(95) 0x40bef4 DEC %R11 |
(95) 0x40bef7 JE 40bed0 |
(95) 0x40bef9 VMOVUPD (%RAX),%XMM11 |
(95) 0x40befd VSUBPD -0x10(%R13),%XMM11,%XMM11 |
(95) 0x40bf03 VMULPD %XMM11,%XMM11,%XMM12 |
(95) 0x40bf08 VSHUFPD $0x1,%XMM12,%XMM12,%XMM13 |
(95) 0x40bf0e VADDSD %XMM12,%XMM13,%XMM13 |
(95) 0x40bf13 VMOVSD 0x10(%RAX),%XMM12 |
(95) 0x40bf18 VSUBSD (%R13),%XMM12,%XMM12 |
(95) 0x40bf1e VFMADD231SD %XMM12,%XMM12,%XMM13 |
(95) 0x40bf23 VUCOMISD %XMM2,%XMM13 |
(95) 0x40bf27 JA 40bef0 |
(95) 0x40bf29 VUCOMISD %XMM4,%XMM13 |
(95) 0x40bf2d JBE 40bef0 |
(95) 0x40bf2f VDIVSD %XMM13,%XMM6,%XMM13 |
(95) 0x40bf34 VMULSD %XMM13,%XMM13,%XMM14 |
(95) 0x40bf39 VMULSD %XMM1,%XMM13,%XMM15 |
(95) 0x40bf3d VMULSD %XMM15,%XMM14,%XMM14 |
(95) 0x40bf42 VADDSD %XMM7,%XMM14,%XMM15 |
(95) 0x40bf46 VFNMADD213SD %XMM0,%XMM14,%XMM15 |
(95) 0x40bf4b VMULSD %XMM8,%XMM15,%XMM15 |
(95) 0x40bf50 MOV 0x30(%R14),%R8 |
(95) 0x40bf54 VADDSD (%R8,%RSI,8),%XMM15,%XMM16 |
(95) 0x40bf5b VMOVSD %XMM16,(%R8,%RSI,8) |
(95) 0x40bf62 VMOVAPD %XMM9,%XMM16 |
(95) 0x40bf68 VFMADD213SD %XMM10,%XMM14,%XMM16 |
(95) 0x40bf6e VMULSD %XMM3,%XMM13,%XMM13 |
(95) 0x40bf72 VMULSD %XMM14,%XMM16,%XMM14 |
(95) 0x40bf78 VMULSD %XMM13,%XMM14,%XMM13 |
(95) 0x40bf7d MOV 0x28(%R14),%R8 |
(95) 0x40bf81 VMOVDDUP %XMM13,%XMM14 |
(95) 0x40bf86 VFMADD213PD (%R8,%RCX,8),%XMM14,%XMM11 |
(95) 0x40bf8c VMOVUPD %XMM11,(%R8,%RCX,8) |
(95) 0x40bf92 VFMADD213SD 0x10(%R8,%RCX,8),%XMM13,%XMM12 |
(95) 0x40bf99 VMOVSD %XMM12,0x10(%R8,%RCX,8) |
(95) 0x40bfa0 VADDSD %XMM5,%XMM15,%XMM5 |
(95) 0x40bfa4 JMP 40bef0 |
/home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/build/CoMD/CoMD/src-openmp/ljForce.c: 178 - 216 |
-------------------------------------------------------------------------------- |
178: for (int jTmp=0; jTmp<nNbrBoxes; jTmp++) |
179: { |
180: int jBox = s->boxes->nbrBoxes[iBox][jTmp]; |
181: |
182: assert(jBox>=0); |
183: |
184: int nJBox = s->boxes->nAtoms[jBox]; |
185: |
186: // loop over atoms in iBox |
187: for (int iOff=MAXATOMS*iBox; iOff<(iBox*MAXATOMS+nIBox); iOff++) |
188: { |
189: |
190: // loop over atoms in jBox |
191: for (int jOff=jBox*MAXATOMS; jOff<(jBox*MAXATOMS+nJBox); jOff++) |
[...] |
197: dr[m] = s->atoms->r[iOff][m]-s->atoms->r[jOff][m]; |
198: r2+=dr[m]*dr[m]; |
199: } |
200: |
201: if ( r2 <= rCut2 && r2 > 0.0) |
202: { |
203: |
204: // Important note: |
205: // from this point on r actually refers to 1.0/r |
206: r2 = 1.0/r2; |
207: real_t r6 = s6 * (r2*r2*r2); |
208: real_t eLocal = r6 * (r6 - 1.0) - eShift; |
209: s->atoms->U[iOff] += 0.5*eLocal; |
210: ePot += 0.5*eLocal; |
211: |
212: // different formulation to avoid sqrt computation |
213: real_t fr = - 4.0*epsilon*r6*r2*(12.0*r6 - 6.0); |
214: for (int m=0; m<3; m++) |
215: { |
216: s->atoms->f[iOff][m] -= dr[m]*fr; |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►98.36+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| ►1.28+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| ○ | __libc_start_call_main | libc.so.6 |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►92.12+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►6.84+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►93.50+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►5.55+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►95.32+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►4.19+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►95.53+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►3.51+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►96.09+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►2.58+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| Coverage (%) | Name | Source Location | Module |
|---|---|---|---|
| ►95.90+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_launch_thread | libiomp5.so | |
| ○ | _INTERNALea951ae6::__kmp_launc[...] | libiomp5.so | |
| ○ | start_thread | libc.so.6 | |
| ○ | __GI___clone3 | libc.so.6 | |
| ►3.43+ | __kmp_invoke_microtask | libiomp5.so | |
| ○ | __kmp_invoke_task_func | libiomp5.so | |
| ○ | __kmp_fork_call | libiomp5.so | |
| ○ | __kmpc_fork_call | libiomp5.so | |
| ○ | ljForce | ljForce.c:172 | exec |
| ○ | timestep | timestep.c:51 | exec |
| ○ | main | CoMD.c:125 | exec |
| min | med | avg | max |
|---|---|---|---|
| Percentile Index | 10 | 20 | 30 | 40 | 50 | 60 | 70 | 80 | 90 | 100 |
|---|---|---|---|---|---|---|---|---|---|---|
| Value |
| min | med | avg | max |
|---|---|---|---|
| Percentile Index | 10 | 20 | 30 | 40 | 50 | 60 | 70 | 80 | 90 | 100 |
|---|---|---|---|---|---|---|---|---|---|---|
| Value |
| Path / |
| Metric | Value |
|---|---|
| CQA speedup if no scalar integer | 1.00 |
| CQA speedup if FP arith vectorized | 1.00 |
| CQA speedup if fully vectorized | 13.95 |
| CQA speedup if no inter-iteration dependency | NA |
| CQA speedup if next bottleneck killed | 1.03 |
| Bottlenecks | |
| Function | ljForce.extracted |
| Source | ljForce.c:178-184,ljForce.c:187-187,ljForce.c:191-191,ljForce.c:197-197 |
| Source loop unroll info | NA |
| Source loop unroll confidence level | NA |
| Unroll/vectorization loop type | NA |
| Unroll factor | NA |
| CQA cycles | 2.75 |
| CQA cycles if no scalar integer | 2.75 |
| CQA cycles if FP arith vectorized | 2.75 |
| CQA cycles if fully vectorized | 0.20 |
| Front-end cycles | 2.75 |
| P0 cycles | 2.67 |
| P1 cycles | 2.67 |
| P2 cycles | 2.67 |
| P3 cycles | 2.67 |
| P4 cycles | 2.67 |
| P5 cycles | 2.67 |
| P6 cycles | 1.56 |
| P7 cycles | 1.56 |
| P8 cycles | 1.56 |
| P9 cycles | 1.56 |
| P10 cycles | 0.00 |
| P11 cycles | 0.00 |
| P12 cycles | 0.00 |
| P13 cycles | 0.00 |
| P14 cycles | 0.00 |
| P15 cycles | 0.00 |
| DIV/SQRT cycles | 0.00 |
| Inter-iter dependencies cycles | 0 |
| FE+BE cycles (UFS) | NA |
| Stall cycles (UFS) | NA |
| Nb insns | 22.25 |
| Nb uops | 22.00 |
| Nb loads | 6.25 |
| Nb stores | 0.00 |
| Nb stack references | 2.75 |
| FLOP/cycle | 0.00 |
| Nb FLOP add-sub | 0.00 |
| Nb FLOP mul | 0.00 |
| Nb FLOP fma | 0.00 |
| Nb FLOP div | 0.00 |
| Nb FLOP rcp | 0.00 |
| Nb FLOP sqrt | 0.00 |
| Nb FLOP rsqrt | 0.00 |
| Bytes/cycle | 15.88 |
| Bytes prefetched | 0.00 |
| Bytes loaded | 42.00 |
| Bytes stored | 0.00 |
| Stride 0 | NA |
| Stride 1 | NA |
| Stride n | NA |
| Stride unknown | NA |
| Stride indirect | NA |
| Vectorization ratio all | 0.00 |
| Vectorization ratio load | NA |
| Vectorization ratio store | NA |
| Vectorization ratio mul | NA |
| Vectorization ratio add_sub | NA |
| Vectorization ratio fma | NA |
| Vectorization ratio div_sqrt | NA |
| Vectorization ratio other | 0.00 |
| Vector-efficiency ratio all | 10.16 |
| Vector-efficiency ratio load | NA |
| Vector-efficiency ratio store | NA |
| Vector-efficiency ratio mul | NA |
| Vector-efficiency ratio add_sub | NA |
| Vector-efficiency ratio fma | NA |
| Vector-efficiency ratio div_sqrt | NA |
| Vector-efficiency ratio other | 10.16 |
| Metric | Value |
|---|---|
| CQA speedup if no scalar integer | 1.00 |
| CQA speedup if FP arith vectorized | 1.00 |
| CQA speedup if fully vectorized | 14.67 |
| CQA speedup if no inter-iteration dependency | NA |
| CQA speedup if next bottleneck killed | 1.07 |
| Bottlenecks | micro-operation queue, |
| Function | ljForce.extracted |
| Source | ljForce.c:178-184,ljForce.c:187-187,ljForce.c:191-191,ljForce.c:197-197 |
| Source loop unroll info | NA |
| Source loop unroll confidence level | NA |
| Unroll/vectorization loop type | NA |
| Unroll factor | NA |
| CQA cycles | 1.25 |
| CQA cycles if no scalar integer | 1.25 |
| CQA cycles if FP arith vectorized | 1.25 |
| CQA cycles if fully vectorized | 0.09 |
| Front-end cycles | 1.25 |
| P0 cycles | 1.17 |
| P1 cycles | 1.17 |
| P2 cycles | 1.17 |
| P3 cycles | 1.17 |
| P4 cycles | 1.17 |
| P5 cycles | 1.17 |
| P6 cycles | 1.00 |
| P7 cycles | 1.00 |
| P8 cycles | 1.00 |
| P9 cycles | 1.00 |
| P10 cycles | 0.00 |
| P11 cycles | 0.00 |
| P12 cycles | 0.00 |
| P13 cycles | 0.00 |
| P14 cycles | 0.00 |
| P15 cycles | 0.00 |
| DIV/SQRT cycles | 0.00 |
| Inter-iter dependencies cycles | 0 |
| FE+BE cycles (UFS) | NA |
| Stall cycles (UFS) | NA |
| Nb insns | 11.00 |
| Nb uops | 10.00 |
| Nb loads | 4.00 |
| Nb stores | 0.00 |
| Nb stack references | 2.00 |
| FLOP/cycle | 0.00 |
| Nb FLOP add-sub | 0.00 |
| Nb FLOP mul | 0.00 |
| Nb FLOP fma | 0.00 |
| Nb FLOP div | 0.00 |
| Nb FLOP rcp | 0.00 |
| Nb FLOP sqrt | 0.00 |
| Nb FLOP rsqrt | 0.00 |
| Bytes/cycle | 19.20 |
| Bytes prefetched | 0.00 |
| Bytes loaded | 24.00 |
| Bytes stored | 0.00 |
| Stride 0 | NA |
| Stride 1 | NA |
| Stride n | NA |
| Stride unknown | NA |
| Stride indirect | NA |
| Vectorization ratio all | 0.00 |
| Vectorization ratio load | NA |
| Vectorization ratio store | NA |
| Vectorization ratio mul | NA |
| Vectorization ratio add_sub | NA |
| Vectorization ratio fma | NA |
| Vectorization ratio div_sqrt | NA |
| Vectorization ratio other | 0.00 |
| Vector-efficiency ratio all | 9.38 |
| Vector-efficiency ratio load | NA |
| Vector-efficiency ratio store | NA |
| Vector-efficiency ratio mul | NA |
| Vector-efficiency ratio add_sub | NA |
| Vector-efficiency ratio fma | NA |
| Vector-efficiency ratio div_sqrt | NA |
| Vector-efficiency ratio other | 9.38 |
| Metric | Value |
|---|---|
| CQA speedup if no scalar integer | 1.00 |
| CQA speedup if FP arith vectorized | 1.00 |
| CQA speedup if fully vectorized | 13.87 |
| CQA speedup if no inter-iteration dependency | NA |
| CQA speedup if next bottleneck killed | 1.03 |
| Bottlenecks | micro-operation queue, |
| Function | ljForce.extracted |
| Source | ljForce.c:178-184,ljForce.c:187-187,ljForce.c:191-191,ljForce.c:197-197 |
| Source loop unroll info | NA |
| Source loop unroll confidence level | NA |
| Unroll/vectorization loop type | NA |
| Unroll factor | NA |
| CQA cycles | 3.25 |
| CQA cycles if no scalar integer | 3.25 |
| CQA cycles if FP arith vectorized | 3.25 |
| CQA cycles if fully vectorized | 0.23 |
| Front-end cycles | 3.25 |
| P0 cycles | 3.17 |
| P1 cycles | 3.17 |
| P2 cycles | 3.17 |
| P3 cycles | 3.17 |
| P4 cycles | 3.17 |
| P5 cycles | 3.17 |
| P6 cycles | 1.75 |
| P7 cycles | 1.75 |
| P8 cycles | 1.75 |
| P9 cycles | 1.75 |
| P10 cycles | 0.00 |
| P11 cycles | 0.00 |
| P12 cycles | 0.00 |
| P13 cycles | 0.00 |
| P14 cycles | 0.00 |
| P15 cycles | 0.00 |
| DIV/SQRT cycles | 0.00 |
| Inter-iter dependencies cycles | 0 |
| FE+BE cycles (UFS) | NA |
| Stall cycles (UFS) | NA |
| Nb insns | 26.00 |
| Nb uops | 26.00 |
| Nb loads | 7.00 |
| Nb stores | 0.00 |
| Nb stack references | 3.00 |
| FLOP/cycle | 0.00 |
| Nb FLOP add-sub | 0.00 |
| Nb FLOP mul | 0.00 |
| Nb FLOP fma | 0.00 |
| Nb FLOP div | 0.00 |
| Nb FLOP rcp | 0.00 |
| Nb FLOP sqrt | 0.00 |
| Nb FLOP rsqrt | 0.00 |
| Bytes/cycle | 14.77 |
| Bytes prefetched | 0.00 |
| Bytes loaded | 48.00 |
| Bytes stored | 0.00 |
| Stride 0 | 0.00 |
| Stride 1 | 0.00 |
| Stride n | 0.00 |
| Stride unknown | 2.00 |
| Stride indirect | 0.00 |
| Vectorization ratio all | 0.00 |
| Vectorization ratio load | NA |
| Vectorization ratio store | NA |
| Vectorization ratio mul | NA |
| Vectorization ratio add_sub | NA |
| Vectorization ratio fma | NA |
| Vectorization ratio div_sqrt | NA |
| Vectorization ratio other | 0.00 |
| Vector-efficiency ratio all | 10.42 |
| Vector-efficiency ratio load | NA |
| Vector-efficiency ratio store | NA |
| Vector-efficiency ratio mul | NA |
| Vector-efficiency ratio add_sub | NA |
| Vector-efficiency ratio fma | NA |
| Vector-efficiency ratio div_sqrt | NA |
| Vector-efficiency ratio other | 10.42 |
| Path / |
| Function | ljForce.extracted |
| Source file and lines | ljForce.c:178-216 |
| Module | exec |
| nb instructions | 22.25 |
| nb uops | 22 |
| loop length | 75.50 |
| used x86 registers | 8 |
| used mmx registers | 0 |
| used xmm registers | 0 |
| used ymm registers | 0 |
| used zmm registers | 0 |
| nb stack references | 2.75 |
| micro-operation queue | 2.75 cycles |
| front end | 2.75 cycles |
| P0 | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | P13 | P14 | P15 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| uops | 2.67 | 2.67 | 2.67 | 2.67 | 2.67 | 2.67 | 1.56 | 1.56 | 1.56 | 1.56 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| cycles | 2.67 | 2.67 | 2.67 | 2.67 | 2.67 | 2.67 | 1.56 | 1.56 | 1.56 | 1.56 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| Cycles executing div or sqrt instructions | NA |
| Longest recurrence chain latency (RecMII) | 0.00 |
| Front-end | 2.75 |
| Dispatch | 2.67 |
| Data deps. | 0.00 |
| Overall L1 | 2.75 |
| all | 0% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 0% |
| all | 10% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 10% |
| Function | ljForce.extracted |
| Source file and lines | ljForce.c:178-216 |
| Module | exec |
| nb instructions | 11 |
| nb uops | 10 |
| loop length | 38 |
| used x86 registers | 5 |
| used mmx registers | 0 |
| used xmm registers | 0 |
| used ymm registers | 0 |
| used zmm registers | 0 |
| nb stack references | 2 |
| micro-operation queue | 1.25 cycles |
| front end | 1.25 cycles |
| P0 | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | P13 | P14 | P15 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| uops | 1.17 | 1.17 | 1.17 | 1.17 | 1.17 | 1.17 | 1.00 | 1.00 | 1.00 | 1.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| cycles | 1.17 | 1.17 | 1.17 | 1.17 | 1.17 | 1.17 | 1.00 | 1.00 | 1.00 | 1.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| Cycles executing div or sqrt instructions | NA |
| Longest recurrence chain latency (RecMII) | 0.00 |
| Front-end | 1.25 |
| Dispatch | 1.17 |
| Data deps. | 0.00 |
| Overall L1 | 1.25 |
| all | 0% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 0% |
| all | 9% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 9% |
| Instruction | Nb FU | P0 | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | P13 | P14 | P15 | Latency | Recip. throughput | Vectorization |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| INC %R10 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| CMP $0x1b,%R10 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (12.5%) |
| MOV -0x80(%RBP),%RDX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| JE 40be20 <ljForce.extracted+0x170> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| MOV (%RDX,%R10,4),%EAX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| TEST %EAX,%EAX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (6.3%) |
| JS 40c06d <ljForce.extracted+0x3bd> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| MOV -0x60(%RBP),%RCX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| MOVSXD (%RCX,%RAX,4),%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.25 | N/A |
| TEST %RDX,%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| JLE 40be70 <ljForce.extracted+0x1c0> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| Function | ljForce.extracted |
| Source file and lines | ljForce.c:178-216 |
| Module | exec |
| nb instructions | 26 |
| nb uops | 26 |
| loop length | 88 |
| used x86 registers | 9 |
| used mmx registers | 0 |
| used xmm registers | 0 |
| used ymm registers | 0 |
| used zmm registers | 0 |
| nb stack references | 3 |
| micro-operation queue | 3.25 cycles |
| front end | 3.25 cycles |
| P0 | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | P13 | P14 | P15 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| uops | 3.17 | 3.17 | 3.17 | 3.17 | 3.17 | 3.17 | 1.75 | 1.75 | 1.75 | 1.75 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| cycles | 3.17 | 3.17 | 3.17 | 3.17 | 3.17 | 3.17 | 1.75 | 1.75 | 1.75 | 1.75 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| Cycles executing div or sqrt instructions | NA |
| Longest recurrence chain latency (RecMII) | 0.00 |
| Front-end | 3.25 |
| Dispatch | 3.17 |
| Data deps. | 0.00 |
| Overall L1 | 3.25 |
| all | 0% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 0% |
| all | 10% |
| load | NA (no load vectorizable/vectorized instructions) |
| store | NA (no store vectorizable/vectorized instructions) |
| mul | NA (no mul vectorizable/vectorized instructions) |
| add-sub | NA (no add-sub vectorizable/vectorized instructions) |
| fma | NA (no fma vectorizable/vectorized instructions) |
| div/sqrt | NA (no div/sqrt vectorizable/vectorized instructions) |
| other | 10% |
| Instruction | Nb FU | P0 | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | P13 | P14 | P15 | Latency | Recip. throughput | Vectorization |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| INC %R10 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| CMP $0x1b,%R10 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (12.5%) |
| MOV -0x80(%RBP),%RDX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| JE 40be20 <ljForce.extracted+0x170> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| MOV (%RDX,%R10,4),%EAX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| TEST %EAX,%EAX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (6.3%) |
| JS 40c06d <ljForce.extracted+0x3bd> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| MOV -0x60(%RBP),%RCX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| MOVSXD (%RCX,%RAX,4),%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.25 | N/A |
| TEST %RDX,%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (12.5%) |
| JLE 40be70 <ljForce.extracted+0x1c0> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.50-1 | N/A |
| SAL $0x6,%EAX | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.33 | N/A |
| MOV -0x58(%RBP),%RCX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| MOV 0x20(%RCX),%R14 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| MOV 0x18(%R14),%R12 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | 0.25 | 0.25 | 0.25 | 0 | 0 | 0 | 0 | 0 | 0 | 3 | 0.25 | N/A |
| CLTQ | scal (12.5%) | |||||||||||||||||||
| ADD %RAX,%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| LEA 0x1(%RAX),%RCX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.25 | N/A |
| CMP %RCX,%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | scal (12.5%) |
| CMOVLE %RCX,%RDX | 2 | 0.33 | 0.33 | 0.33 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.33 | N/A |
| SUB %RAX,%RDX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| LEA (%RAX,%RAX,2),%RAX | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.25 | N/A |
| LEA (%R12,%RAX,8),%R15 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.25 | N/A |
| ADD $0x10,%R15 | 1 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0.17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0.17 | N/A |
| XOR %EBX,%EBX | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0.25 | scal (6.3%) |
| JMP 40bedc <ljForce.extracted+0x22c> | 1 | 0 | 0 | 0 | 0.33 | 0.33 | 0.33 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | N/A |
| Run 8x1 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 1I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
|---|---|
| Run 8x12 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 12I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| Run 8x16 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 16I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| Run 8x20 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 20I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| Run 8x24 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 24I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| Run 8x28 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 28I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| Run 8x32 | Number processes: 8Number nodes: 1Run Command: <executable> -x 200 -y 200 -z 200 --xproc=2 --yproc=2 --zproc=2MPI Command: mpirun -n <number_processes> Dataset: Run Directory: /home/eoseret/qaas_runs_ZEN5/174-043-3878/intel/CoMD/run/oneview_runs/multicore/icx/oneview_run_1740438801OMP_NUM_THREADS: 32I_MPI_PIN_ORDER: bunchOMP_DISPLAY_AFFINITY: TRUEOMP_PROC_BIND: spreadOMP_AFFINITY_FORMAT: 'OMP: pid %P tid %i thread %n bound to OS proc set {%A}'OMP_DISPLAY_ENV: TRUEI_MPI_PIN_DOMAIN: autoI_MPI_DEBUG: 4OMP_PLACES: threads |
| (8x1) Efficiency | (8x1) Potential Speed-Up (%) | (8x12) Efficiency | (8x12) Potential Speed-Up (%) | (8x16) Efficiency | (8x16) Potential Speed-Up (%) | (8x20) Efficiency | (8x20) Potential Speed-Up (%) | (8x24) Efficiency | (8x24) Potential Speed-Up (%) | (8x28) Efficiency | (8x28) Potential Speed-Up (%) | (8x32) Efficiency | (8x32) Potential Speed-Up (%) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 0.84 | 0.04 | 0.93 | 0.01 | 0.87 | 0.02 | 0.85 | 0.03 | 0.72 | 0.06 | 0.77 | 0.04 |
| Run | Number of threads | Efficiency (ideal is 1) | Speedup | Ideal Speedup | Time (s) | Coverage (%) |
|---|---|---|---|---|---|---|
| 8x1 | 8 | 1 | 1 | 1 | 1.3049997091293 | 0.24434669315815 |
| 8x12 | 96 | 0.84 | 10.1 | 12 | 0.1799999922514 | 0.24332135915756 |
| 8x16 | 128 | 0.93 | 14.87 | 16 | 0.14500001072884 | 0.21124579012394 |
| 8x20 | 160 | 0.87 | 17.5 | 20 | 0.13500000536442 | 0.19925059378147 |
| 8x24 | 192 | 0.85 | 20.43 | 24 | 0.10999999940395 | 0.19309537112713 |
| 8x28 | 224 | 0.72 | 20.04 | 28 | 0.10999999195337 | 0.21157456934452 |
| 8x32 | 256 | 0.77 | 24.52 | 32 | 0.094999998807907 | 0.18302683532238 |
