社区
CUDA
CUDA on Win
帖子详情
在核函数中定义的局部变量,打印其地址都是相同的?
zsef_val
2023-07-18 18:30:01
代码如下:
输出结果:
请教一下啊,难道每个线程都访问相同的显存地址,并给地址赋值,这不会数据冲突吗?
...全文
1018
1
打赏
收藏
在核函数中定义的局部变量,打印其地址都是相同的?
代码如下: 输出结果: 请教一下啊,难道每个线程都访问相同的显存地址,并给地址赋值,这不会数据冲突吗?
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
1 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
CSDN-Ada助手
2023-07-18
精选
打赏
举报
回复
您的问题已经帮您同步至问答, 链接:
https://ask.csdn.net/questions/7979480
, 请您保持关注, 如果回答有帮助解决此问题, 麻烦您动动小手给相关的回答点赞, Ada会在评论区为您更新结题状态
CUDA编程入门:从.cu文件结构到并行计算实战
本文系统介绍CUDA编程基础,重点解析.cu文件结构、执行空间限定符(__global__、__device__、__host__)、GPU内存模型(全局内存、共享内存、常量内存)及线程层次结构(Grid/Block/Thread)。深入探讨内存合并访问、共享内存优化、占用率调控等性能关键点,并以向量点积归约实战为例,体现并行计算设计思想。内容覆盖开发环境搭建、常见错误调试及Nsight性能分析工具使用。
GPU矩阵乘法GEMM优化:从分块策略到Tensor Core实战
本文系统阐述GPU上通用矩阵乘法(GEMM)的高性能优化方法,聚焦内存层次适配与计算资源协同。核心涵盖分块(Tiling)策略原理与代码实现、共享内存与寄存器优化、双缓冲与向量化访问;深入解析Tensor Core在Volta及后续架构
中
的WMMA编程模型、异步拷贝与Shared Memory Bank冲突规避;并介绍Cutlass库与自动调优实践。结合Nsight性能剖析工具,提供从正确性验证到瓶颈定位的完整调试路径。
CANN asc-tools昇腾算子调优工具链快速上手手把手实战:昇腾NPU Profiler数据采集、算子耗时分析与优化建议的完整可复现流程——从环境准备到AI Core算子时间线可视化的步步操作指
本文系统介绍CANN asc-tools工具链在昇腾NPU算子开发
中
的核心应用:CPU Debug实现孪生调试与gdb断点分析;NPU Check检测内存越界、同步错误及资源泄漏;msobjdump解析ELF元数据;show_kernel_debug_data离线解码Kernel调试信息;optype_collector识别OpType命名冲突。覆盖环境部署、全流程调试、性能瓶颈定位与问题排查,支撑Ascend C算子全生命周期调优。
CPU与GPU异构计算原理与CUDA编程实战:从架构差异到性能优化
本文深入解析CPU与GPU在架构设计上的根本差异:CPU追求低延迟,擅长串行逻辑控制;GPU追求高吞吐量,依托海量核心与SIMT架构实现大规模并行。重点阐述CUDA编程模型
中
的线程层次结构(网格/块/线程)、内存模型(全局/共享/寄存器)及数据搬运代价,并通过向量加法、矩阵乘法等实例展示性能优化关键路径,包括合并访问、共享内存复用、减少分支发散等核心技术。
C++ 知识补充
本文系统梳理C++核心语言特性,涵盖面向对象三大特性(封装、继承、多态)、虚函数与纯虚函数机制、析构函数虚化原理;深入解析内存管理(栈/堆/常量区、智能指针、RAII)、STL容器(vector/map/unordered_map)、多线程同步与IPC机制;详述C++11及以上新特性(auto、move、lambda、constexpr、智能指针)、模板、设计模式(单例、工厂)、类型转换(static_cast/reinterpret_cast/dynamic_cast)及编译链接原理(静态/动态库、预处理-编译-汇编-链接流程)。
CUDA
591
社区成员
2,925
社区内容
发帖
与我相关
我的任务
CUDA
CUDA™是一种由NVIDIA推出的通用并行计算架构,该架构使GPU能够解决复杂的计算问题。 它包含了CUDA指令集架构(ISA)以及GPU内部的并行计算引擎。
复制链接
扫一扫
分享
社区描述
CUDA™是一种由NVIDIA推出的通用并行计算架构,该架构使GPU能够解决复杂的计算问题。 它包含了CUDA指令集架构(ISA)以及GPU内部的并行计算引擎。
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章