onnxruntime/onnxruntime/contrib_ops/cuda
Weixing Zhang fef7989866
Replacing CudaAsyncBuffer with TArray to improve perf (#3303)
* removing using CudaAsyncBuffer

* Keep CudaAsyncBuffer for these ops: non_max_suppression, cudnn_rnn_base, concat, split

* fix windows build error

* fix windows build error.

* fix build error

* fix windows build error

Co-authored-by: Weixing Zhang <wezhan@microsoft.com>
2020-03-24 12:13:27 -07:00
..
activation Replacing CudaAsyncBuffer with TArray to improve perf (#3303) 2020-03-24 12:13:27 -07:00
bert Add support for loading TensorProtos with external data from optimizer Initializer (#3045) 2020-02-28 13:19:16 -08:00
math merge training kernels to master (#2999) 2020-02-13 14:52:35 -08:00
tensor move all contrib ops to contrib ops namespace (#1190) 2019-06-24 10:19:01 -07:00
conv_transpose_with_dynamic_pads.cc
conv_transpose_with_dynamic_pads.h
layer_norm.cc Revert an op version change (#3026) 2020-02-18 09:43:18 -08:00
layer_norm.h Add layernorm operator (#1967) 2019-10-03 11:32:13 -07:00
layer_norm_impl.cu use cublasHgemm for Volta GPU (#2074) 2019-10-14 17:29:13 -07:00
layer_norm_impl.h Add layernorm operator (#1967) 2019-10-03 11:32:13 -07:00