diff --git a/onnxruntime/core/mlas/lib/amd64/QgemmU8U8KernelAvx2.asm b/onnxruntime/core/mlas/lib/amd64/QgemmU8U8KernelAvx2.asm index 365348a14d..60d58e6206 100644 --- a/onnxruntime/core/mlas/lib/amd64/QgemmU8U8KernelAvx2.asm +++ b/onnxruntime/core/mlas/lib/amd64/QgemmU8U8KernelAvx2.asm @@ -215,7 +215,7 @@ ProcessNextRowM4: mov rdx,rsi mov rcx,rdi lea rsi,[rsi+r8*4] ; advance next matrix A by 4 rows - lea rdi,[rdi+r11*(2*4)] ; advance next matrix D by 4 rows + lea rdi,[rdi+r11*8] ; advance next matrix D by 4 rows mov rbx,r10 ; reload columns remaining sub rbx,16 jb ProcessRemainingColumnsM4 diff --git a/onnxruntime/core/mlas/lib/x86_64/QgemmU8U8KernelAvx2.S b/onnxruntime/core/mlas/lib/x86_64/QgemmU8U8KernelAvx2.S index 8837be62c5..f53059e313 100644 --- a/onnxruntime/core/mlas/lib/x86_64/QgemmU8U8KernelAvx2.S +++ b/onnxruntime/core/mlas/lib/x86_64/QgemmU8U8KernelAvx2.S @@ -158,7 +158,7 @@ C_UNDERSCORE(MlasGemmU8U8CopyPackAAvx2): mov rdx,rsi mov rcx,rdi lea rsi,[rsi+r10*4] # advance next matrix A by 4 rows - lea rdi,[rdi+r12*(2*4)] # advance next matrix D by 4 rows + lea rdi,[rdi+r12*8] # advance next matrix D by 4 rows mov rbx,r8 # reload columns remaining sub rbx,16 jb .LCopyPackA.ProcessRemainingColumnsM4