onnxruntime/onnxruntime/contrib_ops
Yufeng Li 2ba637c558
Implement Scale function for quant gemm (#5632)
* Implement a Scale function for quantization

Quantized GEMM is always followed by Scaling (PerTensor Or PerColumn), and often need to be accumulated to an existing matrix. This PR implements a post-processor for quantized GEMM result and accumulate it to another matrix.
2020-11-10 23:34:38 -08:00
..
cpu Implement Scale function for quant gemm (#5632) 2020-11-10 23:34:38 -08:00
cuda Add GPU kernels for ROCm EP (#5655) 2020-11-06 16:11:06 -08:00
rocm Add GPU kernels for ROCm EP (#5655) 2020-11-06 16:11:06 -08:00