|
GPU compute
bench.gpu.clpeak
|
OpenCL
Compute · Single precision
opencl_single_precision_compute
primary
|
26,537 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Compute · Double precision
opencl_double_precision_compute
|
472 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Compute · Integer
opencl_integer_compute
|
11,919 GOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Bandwidth · Global memory
opencl_global_memory_bandwidth
|
258 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Bandwidth · Local memory
opencl_local_memory_bandwidth
|
12,519 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Bandwidth · Image memory
opencl_image_memory_bandwidth
|
189 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Bandwidth · Host transfer
opencl_transfer_bandwidth
|
12.9 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
OpenCL
Latency · Kernel launch
opencl_kernel_launch_latency
|
17.4 us |
↓ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Single precision
cuda_single_precision_compute
|
25,326 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Double precision
cuda_double_precision_compute
|
473 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Half precision
cuda_half_precision_compute
|
29,941 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Mixed precision
cuda_mixed_precision_compute
|
20,985 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · bfloat16
cuda_bfloat16_compute
|
23,849 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Integer
cuda_integer_compute
|
11,865 GOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Compute · Integer, int8 dot product
cuda_integer_compute_int8_dp
|
31,650 GOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Bandwidth · Global memory
cuda_global_memory_bandwidth
|
247 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Bandwidth · Local memory
cuda_local_memory_bandwidth
|
12,011 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Bandwidth · Image memory
cuda_image_memory_bandwidth
|
188 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Bandwidth · Host transfer
cuda_transfer_bandwidth
|
13 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
CUDA
Latency · Kernel launch
cuda_kernel_launch_latency
|
7.14 us |
↓ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Single precision
vulkan_single_precision_compute
|
24,568 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Double precision
vulkan_double_precision_compute
|
469 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Half precision
vulkan_half_precision_compute
|
29,354 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Mixed precision
vulkan_mixed_precision_compute
|
24,550 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · bfloat16
vulkan_bfloat16_compute
|
21,106 GFLOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Integer
vulkan_integer_compute
|
8,064 GOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Compute · Integer, int8 dot product
vulkan_integer_compute_int8_dp
|
8,405 GOPS |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Bandwidth · Global memory
vulkan_global_memory_bandwidth
|
247 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Bandwidth · Local memory
vulkan_local_memory_bandwidth
|
11,490 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Bandwidth · Image memory
vulkan_image_memory_bandwidth
|
226 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Bandwidth · Host transfer
vulkan_transfer_bandwidth
|
12.9 GB/s |
↑ better |
|
GPU compute
bench.gpu.clpeak
|
Vulkan
Latency · Kernel launch
vulkan_kernel_launch_latency
|
130 us |
↓ better |
|
GPU transfer
bench.gpu.cuda-bandwidth
|
device_to_device
|
107 GiB/s |
↑ better |
|
GPU transfer
bench.gpu.cuda-bandwidth
|
device_to_host
|
12 GiB/s |
↑ better |
|
GPU transfer
bench.gpu.cuda-bandwidth
|
host_to_device
primary
|
11.2 GiB/s |
↑ better |