社区
CUDA on Windows XP
帖子详情
cuCtxDestroy return value 1: CUDA_ERROR_INVALID_VALUE
lapidarylee
2010-03-24 02:31:26
請教
在加入一段調用global函數之後,在程式最後的 cuCtxDestroy回傳值從CUDA_SUCCESS變為CUDA_ERROR_INVALID_VALUE
且雖然最後得到的數值答案看似是對的,但運算速度明顯不如預期,且 cpu usage會爆增...
可能是哪兒出了問題呢?!
謝謝
...全文
248
5
打赏
收藏
cuCtxDestroy return value 1: CUDA_ERROR_INVALID_VALUE
請教 在加入一段調用global函數之後,在程式最後的 cuCtxDestroy回傳值從CUDA_SUCCESS變為CUDA_ERROR_INVALID_VALUE 且雖然最後得到的數值答案看似是對的,但運算速度明顯不如預期,且 cpu usage會爆增... 可能是哪兒出了問題呢?! 謝謝
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
5 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
无心人_过过小日子
2010-03-26
打赏
举报
回复
还有b是如何定义的?
无心人_过过小日子
2010-03-25
打赏
举报
回复
size多大?
lapidarylee
2010-03-25
打赏
举报
回复
一開始發現在function內做下列三行時:
cudaMalloc((void**) &b, Size);
Test<<<grid, block>>>();
cudaThreadSynchronize();
會return CUDA_ERROR_INVALID
在mark掉另外二行,只保留cudaMalloc時
cudaMalloc((void**) &b, Size);
//Test<<<grid, block>>>();
//cudaThreadSynchronize();
一樣得到 CUDA_ERROR_INVALID
然而,將runtime api cudaMalloc換置成 driver api cuMemAlloc如下
cuMemAlloc(&b, Size);
//Test<<<grid, block>>>();
//cudaThreadSynchronize();
時卻可得 CUDA_SUCCESS
但launch空的kernel function
cuMemAlloc(&b, Size);
Test<<<grid, block>>>();
//cudaThreadSynchronize();
時又得到了 CUDA_ERROR_INVALID
且打開cudaThreadSynchronize
cuMemAlloc(&b, Size);
//Test<<<grid, block>>>();
cudaThreadSynchronize();
後也從CUDA_SUCCESS變為CUDA_ERROR_INVALID
還是搞不清楚究竟問點題在何處,有請前輩們指引方向
謝謝
无心人_过过小日子
2010-03-24
打赏
举报
回复
可能主机内存访问有问题.或则,cuda调用(cuda的api)的参数没有设置正确.
Ollama多模型热切换失效真相:GPU上下文残留、
CUDA
Context泄漏与模型句柄泄露的深度溯源报告
揭秘Ollama多模型热切换失效根因,提供GPU上下文清理、
CUDA
Context重置与模型句柄回收方案,适用于高频切换场景。基于实测验证的系统级修复策略,显著提升Ollama多模型管理稳定性与资源利用率,值得收藏。
llama.cpp中batch与ubatch核心机制深度解析
在大语言模型本地推理中,批处理(batch)与解包批处理(ubatch)是影响KV Cache复用效率、长上下文支持及GPU利用率的基础机制。其本质并非简单‘一次处理多少token’,而是分别对应CPU端序列调度粒度与GPU内核级token切片尺寸,共同支撑chunked prefill这一关键优化技术。理解二者协同逻辑,对实现高吞吐文本嵌入、多用户API服务及Windows+
CUDA
环境下的稳定部署至关重要。本文聚焦llama.cpp底层张量调度与kv_cache管理,揭示batch和ubatch在内存布
C++结合OpenCV与NVIDIA SDK实现MP4视频GPU硬解码全流程详解
视频解码是多媒体处理的基础环节,其核心原理是将压缩编码的视频数据流还原为原始像素帧。传统CPU软解码在处理高分辨率、高帧率视频时面临巨大计算压力,难以满足实时分析、视频转码及AI推理前处理等高吞吐量场景的需求。GPU硬解码技术通过调用显卡专用的解码硬件单元(如NVIDIA的NVDEC),将解码任务从CPU卸载至GPU,能显著提升解码效率并降低CPU占用,是实现高性能视频处理管线的关键技术。在工程实践中,开发者常利用NVIDIA Video Codec SDK直接操作底层硬件,并结合OpenCV进行高效的图像
office2010使用手册
office2010使用手册
政府科技管理部门如何提升科技成果转化效率?.docx
政府科技管理部门如何提升科技成果转化效率?
CUDA on Windows XP
231
社区成员
423
社区内容
发帖
与我相关
我的任务
CUDA on Windows XP
CUDA on Windows XP
复制链接
扫一扫
分享
社区描述
CUDA on Windows XP
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章