求一个完整的代码

fannyqiq 2012-12-26 02:39:36
求哪位大侠给一个完整的代码,要求很简单,实现:
两个矩阵相加。(矩阵就4×4的吧)
包括主机端和设备端的空间开辟、主机端两个矩阵的初始化、主机端与设备端的数据拷贝、Kernel、计算结果传回主机端、输出结果。
本人菜鸟。

...全文
268 12 打赏 收藏 转发到动态 举报
写回复
用AI写文章
12 条回复
切换为时间正序
请发表友善的回复…
发表回复
cai_niao_yi_zhi 2013-01-06
  • 打赏
  • 举报
回复
引用 9 楼 cai_niao_yi_zhi 的回复:
这是一个二维矩阵相乘的代码,你看看,原理是一样的: // includes, system #include <stdlib.h> #include <stdio.h> #include <string.h> #include <math.h> #define BLOCK_SIZE 2 typedef struct { size_t widt……
设备端代码有点错误,应该是这样: ///////////////////////////设备端代码////////////////////////////// __global__ void MatMulKernel(Matrix A, Matrix B, Matrix C) { float Cvalue = 0; unsigned int row = blockIdx.y * blockDim.y + threadIdx.y; unsigned int col = blockIdx.x * blockDim.x + threadIdx.x; float *rowA = (float*)((char*)A.element + row*A.pitch); float *rowC = (float*)((char*)C.element + row*C.pitch); if(row<C.height && col<C.width) { for(unsigned int i=0; i<A.width; i++) { float *rowB = (float*)((char*)B.element + i*B.pitch); Cvalue += rowA[i]*rowB[col]; rowC[col] = Cvalue; } } }
cai_niao_yi_zhi 2013-01-06
  • 打赏
  • 举报
回复
引用 7 楼 fannyqiq 的回复:
对了 ,for(int i=0; i<N; i++) d_C[i] = 0.0f;好像不对的,设备端不需要初始化,只要开辟空间就好了~
嗯 这里确实错了,主机端不能访问设备端内存,而且也不用初始化。呵呵,多谢指出错误啊!
cai_niao_yi_zhi 2013-01-06
  • 打赏
  • 举报
回复
这是一个二维矩阵相乘的代码,你看看,原理是一样的: // includes, system #include <stdlib.h> #include <stdio.h> #include <string.h> #include <math.h> #define BLOCK_SIZE 2 typedef struct { size_t width; size_t height; size_t pitch; float *element; }Matrix; ///////////////////////////设备端代码////////////////////////////// __global__ void MatMulKernel(Matrix A, Matrix B, Matrix C) { float Cvalue = 0; unsigned int row = blockIdx.y * blockDim.y + threadIdx.y; unsigned int col = blockIdx.x * blockDim.x + threadIdx.x; if(row<C.height && col<C.width) { for(int i=0; i<A.width; i++) { Cvalue += A.element[row*C.pitch/sizeof(float)+i]*B.element[i*B.pitch/sizeof(float)+col]; C.element[row*C.pitch/sizeof(float)+col] = Cvalue; } } } ///////////////////////////主机端代码////////////////////////////// //定义矩阵相乘函数 void MatMul(const Matrix A, const Matrix B, Matrix C) { //设备端分配内存 Matrix d_A; d_A.width = A.width; d_A.height = A.height; cudaMallocPitch((void**)&d_A.element, &d_A.pitch, A.width*sizeof(float), A.height); cudaMemcpy2D(d_A.element, d_A.pitch, A.element, A.pitch, A.width*sizeof(float), A.height, cudaMemcpyHostToDevice); Matrix d_B; d_B.width = B.width; d_B.height = B.height; cudaMallocPitch((void**)&d_B.element, &d_B.pitch, B.width*sizeof(float), B.height); cudaMemcpy2D(d_B.element, d_B.pitch, B.element, B.pitch, B.width*sizeof(float), B.height, cudaMemcpyHostToDevice); Matrix d_C; d_C.width = C.width; d_C.height = C.height; cudaMallocPitch((void**)&d_C.element, &d_C.pitch, C.width*sizeof(float), C.height); //定义网格形状 dim3 dimBlock(BLOCK_SIZE, BLOCK_SIZE, 1); dim3 dimGrid((C.width-1+dimBlock.x)/dimBlock.x, (C.height-1+dimBlock.y)/dimBlock.y, 1); //调用内核函数 MatMulKernel<<<dimGrid, dimBlock>>>(d_A, d_B, d_C); //将结果从显存拷贝到内存 cudaMemcpy2D(C.element, C.pitch, d_C.element, d_C.pitch, C.width*sizeof(float), C.height, cudaMemcpyDeviceToHost); //打印结果 for(unsigned int i=0; i<C.height; i++) { for(unsigned int j=0; j<C.width; j++) printf("%8.2f", C.element[i*C.width+j]); printf("\n"); } //释放设备端内存 cudaFree(d_A.element); cudaFree(d_B.element); cudaFree(d_C.element); } int main() { //定义三个矩阵结构体 Matrix h_A, h_B, h_C; //h_A矩阵结构体初始化 h_A.width = 4; h_A.height = 6; h_A.element = (float*)malloc(h_A.width*h_A.height*sizeof(float)); h_A.pitch = h_A.width*sizeof(float); for(unsigned int i=0; i<h_A.height; i++) for(unsigned int j=0; j<h_A.width; j++) h_A.element[i*h_A.width+j] = float(i*h_A.width+j); //h_B矩阵结构体初始化 h_B.width = 6; h_B.height = 4; h_B.element = (float*)malloc(h_B.width*h_B.height*sizeof(float)); h_B.pitch = h_B.width*sizeof(float); for(unsigned int i=0; i<h_B.height; i++) for(unsigned int j=0; j<h_B.width; j++) h_B.element[i*h_B.width+j] = float(i*h_B.width+j); //h_C矩阵结构体初始化 h_C.width = h_B.width; h_C.height = h_A.height; h_C.element = (float*)malloc(h_C.width*h_C.height*sizeof(float)); h_C.pitch = h_C.width*sizeof(float); //调用矩阵相乘函数进行计算,并输出结果 MatMul(h_A, h_B, h_C); //释放主机端内存 free(h_A.element); free(h_B.element); free(h_C.element); return 0; }
fannyqiq 2013-01-06
  • 打赏
  • 举报
回复
求矩阵相加代码
fannyqiq 2013-01-06
  • 打赏
  • 举报
回复
对了 ,for(int i=0; i<N; i++) d_C[i] = 0.0f;好像不对的,设备端不需要初始化,只要开辟空间就好了~
fannyqiq 2013-01-06
  • 打赏
  • 举报
回复
好复杂的样子,我看看,谢谢!
cai_niao_yi_zhi 2012-12-31
  • 打赏
  • 举报
回复
#ifndef _VECADD_KERNEL_H_ #define _VECADD_KERNEL_H_ 是为了防止多次包含! 2维矩阵的我得思考下,我也是初学者!
fannyqiq 2012-12-31
  • 打赏
  • 举报
回复
要是可以,就麻烦再给个矩阵的呗
fannyqiq 2012-12-31
  • 打赏
  • 举报
回复
要求的是2维的矩阵相加,跟一维的向量在分配空间、BlocksPerGrid和ThreadsPerBlock的确定细节上还是有区别的。还是谢谢你~
fannyqiq 2012-12-31
  • 打赏
  • 举报
回复
谢谢! 请问设备端代码开始的 #ifndef _VECADD_KERNEL_H_ #define _VECADD_KERNEL_H_ 是什么用途?
cai_niao_yi_zhi 2012-12-30
  • 打赏
  • 举报
回复
//////////////////主机端代码///////////////// // includes, system #include <stdlib.h> #include <stdio.h> #include <math.h> // includes, kernels #include <VecAdd_kernel.cu> int main() { const unsigned int N = 10; //内存中分配向量空间,并赋初值 float h_A[N], h_B[N], h_C[N]; for(int i=0; i<N; i++) { h_A[i] = i*1.0f; h_B[i] = (N-i)*1.0f; } //显存中分配向量空间 size_t size = N * sizeof(float); float *d_A; cudaMalloc((void**)&d_A, size); float *d_B; cudaMalloc((void**)&d_B, size); float *d_C; cudaMalloc((void**)&d_C, size); for(int i=0; i<N; i++) d_C[i] = 0.0f; //从内存向显存拷贝向量 cudaMemcpy(d_A, h_A, size, cudaMemcpyHostToDevice); cudaMemcpy(d_B, h_B, size, cudaMemcpyHostToDevice); //启动kernel int threadsPerBlock = 5; int blocksPerGrid = (N + threadsPerBlock - 1)/threadsPerBlock; VecAdd<<<blocksPerGrid, threadsPerBlock>>>(d_A, d_B, d_C, N); //从显存向内存拷回结果 cudaMemcpy(h_C, d_C, size, cudaMemcpyDeviceToHost); //释放显存空间 cudaFree(d_A); cudaFree(d_B); cudaFree(d_C); //打印结果 for(int i=0; i<N; i++) { printf("%5.0f\n", h_C[i]); } return 0; } ///////////////////设备端代码/////////////////// #ifndef _VECADD_KERNEL_H_ #define _VECADD_KERNEL_H_ __global__ void VecAdd(float *A, float *B, float *C, unsigned int N) { int i = blockDim.x * blockIdx.x + threadIdx.x; if(i < N) C[i] = A[i] + B[i]; } #endif // #ifndef _VECADD_KERNEL_H_
fannyqiq 2012-12-27
  • 打赏
  • 举报
回复
咋就没有人呢,不难的啊,自己写的就是各种小问题。求高手们不惜指教啊~
内容概要:本文针对传统三电平并网逆变器存在的谐波含量高、电网不平衡工况适应性差及动态响应滞后等问题,提出了一种基于有源中点箝位(ANPC)三电平逆变器的高性能并网控制策略。该策略融合了双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术和电网电压前馈控制,构建了“精准同步-扰动补偿-优质调制”的一体化控制体系。通过Simulink搭建仿真模型,在稳态对称、电网不平衡及动态扰动等多种工况下进行验证,结果表明该复合控制策略能显著降低并网电流谐波,提升锁相精度,有效抑制功率波动,并大幅缩短系统动态调节时间,增强了逆变器在复杂电网环境下的稳定性与适应性。; 适合人群:从事电力电子、新能源并网、智能电网等相关领域的科研人员及工程技术人员,尤其适合具备一定MATLAB/Simulink仿真基础、专注于并网逆变器控制策略研究的研发人员; 使用场景及目标:①用于提升大功率并网逆变器在电网电压不平衡、骤升骤降等非理想工况下的运行性能;②为ANPC拓扑结构与先进控制算法(如DPWMA、前馈-反馈复合控制)的协同优化提供仿真依据和技术参考;③适用于新能源发电系统、工业变流装置等对电能质量和动态响应要较高的应用场景; 阅读建议:建议读者结合文中提出的控制架构图与仿真模型逐步复现,重点关注DPWMA调制实现、正负序分离锁相环设计及前馈补偿环节的参数整定,同时通过多工况仿真对比分析各项性能指标,深入理解各模块间的协同作用机制。
内容概要:本文以ANPC三电平并网逆变器为研究对象,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相与电网电压前馈控制的高性能并网控制策略。通过对ANPC拓扑结构的分析,阐明其在开关损耗均衡、中点电位稳定和低输出谐波方面的硬件优势,为高质量并网奠定基础。在此基础上,DPWMA调制策略有效提升输出波形的等效开关频率,显著降低谐波含量;正负序分离锁相技术可精准提取电网正序分量,克服电网不平衡导致的锁相失真与电流不对称问题;电网电压前馈控制则增强系统对动态扰动的响应能力,缩短调节时间。文章构建了“信号采集—核心控制—调制驱动”的三层协同控制架构,并通过多工况仿真验证了该策略在稳态、不平衡及动态扰动条件下的优越性能,结果表明系统具备优异的电能质量、运行稳定性与抗扰能力。; 适合人群:电力电子、新能源并网、自动控制等相关领域的科研人员、研究生及从事逆变器设计与控制的工程技术人员。; 使用场景及目标:① 提升大功率并网逆变器在复杂电网环境下的运行稳定性与电能质量;② 解决电网电压不平衡、谐波畸变、电压骤变等工况下的锁相失真与电流不对称问题;③ 优化动态响应性能,应用于新能源发电、工业变流器等高可靠性要场景; 阅读建议:建议结合Matlab/Simulink仿真平台,复现文中控制策略与仿真模型,重点理解DPWMA调制实现方法、正负序分离锁相环设计及前馈-反馈复合控制结构的协同机制,并通过不同扰动工况测试系统鲁棒性。
内容概要:本文研究了基于Q-Learning自适应强化学习的PID控制器在自主水下航行器(AUV)运动控制中的应用,旨在提升水下机器人在复杂、非线性及动态变化海洋环境中的控制精度与自适应能力。通过将强化学习算法与传统PID控制深度融合,构建了一种能够在线自主调整PID参数的智能控制框架,有效克服了传统PID控制器在面对模型不确定性、外部干扰和时变系统特性时适应性不足的问题。研究详细阐述了AUV的动力学建模过程,并精心设计了Q-Learning算法的状态空间、动作空间与奖励函数,使其能在Matlab仿真环境中通过不断的交互试错进行学习与优化,最终实现对航向角、深度等关键运动姿态的高精度、强鲁棒性控制。仿真结果充分验证了该方法在响应速度、稳态精度和抗干扰性能方面相较于传统方法的显著优越性,为智能水下装备的自主决策与控制提供了重要的理论依据和技术路径。; 适合人群:具备自动控制理论基础、强化学习初步知识及MATLAB编程能力的研究生、科研人员及从事智能机器人、无人系统控制开发的工程师。; 使用场景及目标:①应用于水下机器人、无人潜航器等复杂动态系统的智能控制设计;②解决传统PID控制器参数整定困难、环境适应性差和鲁棒性不足的关键问题;③推动强化学习等人工智能技术在实际工程控制系统中的落地应用、性能优化与可靠性验证。; 阅读建议:建议读者结合提供的Matlab代码进行仿真实践,重点关注Q-Learning与PID的耦合机制、状态量与奖励函数的设计原则,深入理解智能控制策略的训练收敛过程、超参数敏感性及其在不同工况下的性能表现。

231

社区成员

发帖
与我相关
我的任务
社区描述
CUDA on Windows XP
社区管理员
  • CUDA on Windows XP社区
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧