NVIDIA 技术博客:使用最新的 Nsight Compute 进行高级内核评测

nvdev 2022-10-21 10:53:40

这篇文章最初发表在 NVIDIA 技术博客上。有关此类的更多内容,请参阅最新的 概括 新闻和教程。

NVIDIA Nsight Compute 是用于 CUDA 应用程序的交互式内核分析器。它通过用户界面和命令行工具提供详细的性能指标和 API 调试。 Nsight Compute 2022.1 更新了数据收集模式,为性能分析提供了新的用例和选项。

立即下载>>

有什么新鲜事吗

距离重播

Nsight Compute 的这一版本扩展了现有的重播模式,提供了范围重播的高要求功能。 Range Replay 捕获并重放分析应用程序中 CUDA API 调用和内核启动的完整范围。度量与整个范围相关联,而不是单个内核。这允许该工具在不序列化的情况下执行内核,并支持出于正确性或性能原因而需要并发运行的评测内核。范围由起点和终点标记组成;并包括所有 CUDA API 调用和从任何 CPU 线程在这些标记之间启动的内核。

范围标记可以使用以下任一方法定义:

  • 分析器启动/停止 API
  • NVTX 系列

有关完整的详细信息,请参阅 Nsight Compute 的内核评测指南 中的“重播”部分。

This is a flowchart diagram of how the Range Replay feature Nsight Compute captures a range of CUDA API calls and collects performance information to display for the profiled application.This is a flowchart diagram of how the Range Replay feature Nsight Compute captures a range of CUDA API calls and collects performance information to display for the profiled application.图 1 。范围回放可视化:捕获范围后,每个过程都会收集整个范围的性能信息。

记忆分析

在 A100 上评测时,内存分析部分中的一个新二级缓存收回策略表可以帮助您了解各种 缓存逐出策略 的访问次数和达到的命中率。在同一部分中,二级缓存表现在有一个新的 ECC 行,用于显示通过在 GPU 上启用硬件纠错代码而创建的流量。

This is a screenshot of Nsight Compute showing tables with ECC and L2 cache eviction policy information using the Memory Workload Analysis feature. This is a screenshot of Nsight Compute showing tables with ECC and L2 cache eviction policy information using the Memory Workload Analysis feature. 图 2 。内存工作负载分析表的改进: ECC 和二级缓存逐出策略信息。

引导分析

Nsight Compute 现在通过在打开报表时在摘要和详细信息页面之间动态选择,可以更轻松地在多结果集合中选择初始分析目标。规则被扩展以检测非融合浮点指令作为优化机会。最后,但并非最不重要的一点是,当触发未恢复的内存访问规则时,它们会显示一个包含五个最有价值实例的表,从而更容易在源页面上检查和解决它们。

This figure is a screen capture Nsight Compute showing a summary page of multiresult reports, with the ability to sort and optimize the order of presentation.This figure is a screen capture Nsight Compute showing a summary page of multiresult reports, with the ability to sort and optimize the order of presentation.图 3 。打开多结果报告现在会显示摘要页面,允许您对结果进行排序并决定优化顺序。

This is a screen capture of Nsight Compute displaying how the two Uncoalesced Memory Access rules are better presented in a concise and sorted format.This is a screen capture of Nsight Compute displaying how the two Uncoalesced Memory Access rules are better presented in a concise and sorted format.图 4 。这两种未恢复的内存访问规则都以更简洁、更有序的格式呈现结果。

其他改进

进一步的改进包括 Occupancy Calculator 自动更新。源页面中 Register Dependency 列还有一个新的“执行的线程指令”度量和注册名工具提示,以及 NVLink 更新。

在十一月的 GTC ,我们发布了展示 NVIEW 工具能力的有洞察力的资产:

资源

阅读原文

...全文
2193 回复 打赏 收藏 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
内容概要:本文提供了电力系统潮流计算与风能、光伏、水电等多类型分布式电源接入IEEE33节点配电网系统的Matlab代码实现方案,系统涵盖了含分布式电源(DG)的潮流建模、多能源出力特性模拟、无功优化、分布式电源选址定容、储能配置及经济调度等关键技术环节。通过构建标准化IEEE33节点测试系统,实现了高比例可再生能源接入下的潮流分析与优化调度仿真,并结合遗传算法、粒子群优化等智能优化算法,解决配电网中的电压越限、网损增加、功率波动等问题,提升系统的运行稳定性、经济性与清洁能源消纳能力。文中还包含多场景仿真分析与数据可视化,为综合能源系统与智能配电网研究提供完整的算法支持与技术路径。; 适合人群:具备电力系统分析基础和Matlab编程能力的高校研究生、科研人员,以及从事新能源并网、配电网规划与优化、智能电网运行等相关工作的工程技术人员。; 使用场景及目标:①用于教学与科研中对含高渗透率可再生能源的配电网潮流特性进行仿真分析与验证;②支撑毕业设计、科研课题或工程项目中对分布式电源接入影响的评估与优化策略开发;③为无功优化、可靠性提升、低碳调度等实际工程问题提供算法验证与仿真平台。; 阅读建议:建议读者结合IEEE33标准节点系统拓扑图进行代码调试与参数设置,重点关注潮流计算模块与优化算法的接口逻辑设计,同时可借助YALMIP、CPLEX等优化工具包增强建模能力,并通过调整电源接入位置、负荷水平与天气场景,拓展至不同运行工况与更大规模系统的仿真研究。

1,420

社区成员

发帖
与我相关
我的任务
社区描述
NVIDIA 开发者技术交流
人工智能 企业社区
社区管理员
  • nvdev
  • 活动通知
  • AI_CUDA_Training
加入社区
  • 近7日
  • 近30日
  • 至今

试试用AI创作助手写篇文章吧