【CUDA入门教程】系列之内存操作函数介绍

本文主要介绍了CUDA内存操作函数,包括malloc()与cudaMalloc()、memcpy()与cudaMemcpy()、cudaMemcpyAsync()、memset()与cudaMemset()。详细说明了各函数的功能,如数据分配、传输、初始化等,还指出这些函数有隐式阻塞功能,能实现主机与设备间的数据传递。
CUDA内存操作函数

  刚刚接触cuda编程,涉及NvidiaGPU编程模式,主要第一步要考虑GPUCPU的内存交互与操作。下面简单介绍一下主要的几个CPUGPU函数分析:

  介绍一个常用称呼,CPU上面的一般称作HostGPU称作Device设备的名词。下面我们分别看一下HostDevice拷贝函数的源码:

malloc()与cudaMalloc()函数

  cudaMalloc()函数负责向设备device申请分配一定字节的线性内存,并以devPtr的指针返回该内存首地址。使用法则几乎与C语言中的malloc()函数一样,只是在GPU里面分配内存。

/*
_​cudaError_t cudaMalloc ( void** devPtr, size_t size );

Allocate memory on the device.

Parameters
devPtr
- Pointer to allocated device memory
size
- Requested allocation size in bytes
*/

  使用方法:当然下面的cudaMalloc()会返回是否分配内存成功标志,通过cudaError_t看是否返回cudaSuccess的标志。

memcpy()与cudaMemcpy()、cudaMemcpyAsync()函数

  cudaMemcpy()函数负责主机和设备之间的数据传输,就是将主机数据拷贝至设备,或者设备数据拷贝至主机。其中该函数会以同步方式执行,即在数据拷贝操作未完成时候应用程序是阻塞的。


/*
​cudaError_t cudaMemcpy ( void* dst, const void* src, size_t count, cudaMemcpyKind kind )

Copies data between host and device.
Parameters
dst
- Destination memory address // 目的存储指针
src
- Source memory address // 数据源指针
count
- Size in bytes to copy // 数据大小
kind
- Type of transfer // 设备拷贝数据
*/

  hostdevice的内存拷贝主要是从host拷贝到device或者是device拷贝到host上面,这个参数是在cudaMemcpy()中的kind来进行确定。

// kind:  
       cudaMemcpyHostToDevice   // 从host拷贝至host
       cudaMemcpyHostToDevice   // 从host拷贝至device 
       cudaMemcpyDeviceToHost   // 从device拷贝至host
       cudaMemcpyDeviceToDevice   // 从host拷贝至device 

cudaMemcpyAsync()cudaMemcpy()区别在于它是异步的,而cudaMemcpy()是同步的,异步的操作最常见的就是在device上面进行拷贝操作。cudaMemcpyDeviceToDevice就是kind最常设置的参数变量。


/*
__host__​__device__​cudaError_t cudaMemcpyAsync ( void* dst, const void* src, size_t count, cudaMemcpyKind kind, cudaStream_t stream = 0 )

Copies data between host and device.
Parameters
dst
- Destination memory address // 目的指针
src
- Source memory address // 数据源指针
count
- Size in bytes to copy // 拷贝大小
kind
- Type of transfer // 设备迁移
stream
- Stream identifier // 默认streams还是指定streams
*/
memset()与cudaMemset()函数

  谈及memset()函数与cudaMemset()时候,记住初始化的时候千万别直接使用memset()或者cudaMemset()进行初始化,除非你初始化的内存里面每个元素为0。不然,建议你先在CPU里面进行初始化,然后将数据考入cuda内存里面。


/*
_​cudaError_t cudaMemset ( void* devPtr, int  value, size_t count )

Initializes or sets device memory to a value.
Parameters
devPtr
- Pointer to device memory
value
- Value to set for each byte of specified memory
count
- Size in bytes to set
*/
标准的C函数 CUDA C函数
malloc cudaMalloc
memcpy cudaMemcpy
memset cudaMemset
free cudaFree

  下面例举一个最简单的小例子:两个内存数据进行相加操作,分别通过在CPUGPU上操作来简单实用一下关于CUDA的相关内存分配、内存拷贝、内存释放的函数。以此来加深使用的印象。

#include <cuda_runtime.h>
#include <stdio.h>
// 判断cuda相关函数是否执行成功
#define CHECK(call)                                                            \
{                                                                              \
    const cudaError_t error = call;                                            \
    if (error != cudaSuccess)                                                  \
    {                                                                          \
        fprintf(stderr, "Error: %s:%d, ", __FILE__, __LINE__);                 \
        fprintf(stderr, "code: %d, reason: %s\n", error,                       \
                cudaGetErrorString(error));                                    \
        exit(1);                                                               \
    }                         
评论 1
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值