哪位大神给看看这个矩阵向量乘法的CUDA程序为什么不对,里面Nd的大小是随意设的。大神帮帮忙,非常感谢。

huiyuan770 2016-09-04 04:01:21
__global__ void matXvector_kernel(const float * Md, const float * Vd, float* Pd, int colsize, int pitchItem)
{
/*
参数: (矩阵指针,向量指针,结果向量指针,矩阵的列数,矩阵行主元的个数)
*/
__shared__ float Mds[TILE_WIDTH][TILE_WIDTH];
__shared__ float Vds[TILE_WIDTH];
float Nd[2000][2000] = {0};
int bx = blockIdx.x; int by = blockIdx.y;
int tx = threadIdx.x; int ty = threadIdx.y;
int Row = by*blockDim.y + ty;
float Pvalue = 0.0;
if ((by*blockDim.y + ty) < pitchItem && (bx*blockDim.x + tx) < colsize){
Mds[ty][tx] = Md[(by*blockDim.y + ty)*colsize + bx*blockDim.x + tx];
Vds[tx] = Vd[bx*blockDim.x + tx];
}
else
{
Mds[ty][tx] = 0;
Vds[tx] = 0;
}
__syncthreads();
for (int k = 0; k < blockDim.x; ++k)
{
Nd[Row][bx] += Mds[ty][k] * Vds[k];
}
__syncthreads();
if (Row < pitchItem && tx < 1)
{
for (int k = 0; k < gridDim.x; ++k)
{
Pd[Row] += Nd[Row][k];
}
}
}
...全文
414 1 打赏 收藏 转发到动态 举报
写回复
用AI写文章
1 条回复
切换为时间正序
请发表友善的回复…
发表回复
huiyuan770 2016-09-04
  • 打赏
  • 举报
回复
上面的程序和cpu的计算结果进行了比较,就是算不对,大神帮忙看看。如果哪位大神有较好的矩阵向量相乘的程序给一份也非常的感谢!

353

社区成员

发帖
与我相关
我的任务
社区描述
CUDA高性能计算讨论
社区管理员
  • CUDA高性能计算讨论社区
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧