CUDA内存操作函数
刚刚接触cuda编程,涉及Nvidia的GPU编程模式,主要第一步要考虑GPU与CPU的内存交互与操作。下面简单介绍一下主要的几个CPU与GPU函数分析:
介绍一个常用称呼,CPU上面的一般称作Host,GPU称作Device设备的名词。下面我们分别看一下Host与Device拷贝函数的源码:
malloc()与cudaMalloc()函数
cudaMalloc()函数负责向设备device申请分配一定字节的线性内存,并以devPtr的指针返回该内存首地址。使用法则几乎与C语言中的malloc()函数一样,只是在GPU里面分配内存。
/*
_cudaError_t cudaMalloc ( void** devPtr, size_t size );
Allocate memory on the device.
Parameters
devPtr
- Pointer to allocated device memory
size
- Requested allocation size in bytes
*/
使用方法:当然下面的cudaMalloc()会返回是否分配内存成功标志,通过cudaError_t看是否返回cudaSuccess的标志。
memcpy()与cudaMemcpy()、cudaMemcpyAsync()函数
cudaMemcpy()函数负责主机和设备之间的数据传输,就是将主机数据拷贝至设备,或者设备数据拷贝至主机。其中该函数会以同步方式执行,即在数据拷贝操作未完成时候应用程序是阻塞的。
/*
cudaError_t cudaMemcpy ( void* dst, const void* src, size_t count, cudaMemcpyKind kind )
Copies data between host and device.
Parameters
dst
- Destination memory address // 目的存储指针
src
- Source memory address // 数据源指针
count
- Size in bytes to copy // 数据大小
kind
- Type of transfer // 设备拷贝数据
*/
host与device的内存拷贝主要是从host拷贝到device或者是device拷贝到host上面,这个参数是在cudaMemcpy()中的kind来进行确定。
// kind:
cudaMemcpyHostToDevice // 从host拷贝至host
cudaMemcpyHostToDevice // 从host拷贝至device
cudaMemcpyDeviceToHost // 从device拷贝至host
cudaMemcpyDeviceToDevice // 从host拷贝至device
cudaMemcpyAsync()与cudaMemcpy()区别在于它是异步的,而cudaMemcpy()是同步的,异步的操作最常见的就是在device上面进行拷贝操作。cudaMemcpyDeviceToDevice就是kind最常设置的参数变量。
/*
__host____device__cudaError_t cudaMemcpyAsync ( void* dst, const void* src, size_t count, cudaMemcpyKind kind, cudaStream_t stream = 0 )
Copies data between host and device.
Parameters
dst
- Destination memory address // 目的指针
src
- Source memory address // 数据源指针
count
- Size in bytes to copy // 拷贝大小
kind
- Type of transfer // 设备迁移
stream
- Stream identifier // 默认streams还是指定streams
*/
memset()与cudaMemset()函数
谈及memset()函数与cudaMemset()时候,记住初始化的时候千万别直接使用memset()或者cudaMemset()进行初始化,除非你初始化的内存里面每个元素为0。不然,建议你先在CPU里面进行初始化,然后将数据考入cuda内存里面。
/*
_cudaError_t cudaMemset ( void* devPtr, int value, size_t count )
Initializes or sets device memory to a value.
Parameters
devPtr
- Pointer to device memory
value
- Value to set for each byte of specified memory
count
- Size in bytes to set
*/
| 标准的C函数 | CUDA C函数 |
|---|---|
| malloc | cudaMalloc |
| memcpy | cudaMemcpy |
| memset | cudaMemset |
| free | cudaFree |
下面例举一个最简单的小例子:两个内存数据进行相加操作,分别通过在CPU与GPU上操作来简单实用一下关于CUDA的相关内存分配、内存拷贝、内存释放的函数。以此来加深使用的印象。
#include <cuda_runtime.h>
#include <stdio.h>
// 判断cuda相关函数是否执行成功
#define CHECK(call) \
{ \
const cudaError_t error = call; \
if (error != cudaSuccess) \
{ \
fprintf(stderr, "Error: %s:%d, ", __FILE__, __LINE__); \
fprintf(stderr, "code: %d, reason: %s\n", error, \
cudaGetErrorString(error)); \
exit(1); \
}

本文主要介绍了CUDA内存操作函数,包括malloc()与cudaMalloc()、memcpy()与cudaMemcpy()、cudaMemcpyAsync()、memset()与cudaMemset()。详细说明了各函数的功能,如数据分配、传输、初始化等,还指出这些函数有隐式阻塞功能,能实现主机与设备间的数据传递。

8934

被折叠的 条评论
为什么被折叠?



