社区
下载资源悬赏专区
帖子详情
Sparse Kernels Methods下载
weixin_39820835
2019-07-21 02:00:17
Sparse Kernels Methods是SVM对于一些大数据量进行优化比较好的东西
相关下载链接:
//download.csdn.net/download/wangxing456123/3553399?utm_source=bbsseo
...全文
40
回复
打赏
收藏
Sparse Kernels Methods下载
Sparse Kernels Methods是SVM对于一些大数据量进行优化比较好的东西 相关下载链接://download.csdn.net/download/wangxing456123/3553399?utm_source=bbsseo
复制链接
扫一扫
分享
举报
写回复
配置赞助广告
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
DeepSpeed 加速器抽象接口(Accelerator Abstraction Interface):编写与迁移硬件无关模型的全指南
本文系统介绍DeepSpeed Accelerator Abstraction Interface,涵盖硬件无关模型编写与迁移的四步法:运行时调用、设备名、Tensor操作及通信后端的标准化替换;解析抽象接口全景(Device/RNG/Streams/Memory/Tensor/Op Builder等分组);说明多硬件(CUDA/XPU/NPU/MPS/HPU)运行配置与自动探测机制;并指导如何实现新加速器扩展,包括Accelerator类、Op Builder、
Kernel
s注册与测试验证。
LLaMA-Factory NPU 融合算子指南:RMSNorm、SwiGLU、RoPE 与 MoE 的硬件加速实现
本文详解LLaMA-Factory在Ascend NPU上对RMSNorm、SwiGLU、RoPE和MoE四大核心算子的硬件加速融合实现。涵盖算子注册机制、apply_
kernel
使能流程,以及各算子在残差归一化、门控激活、位置编码下沉和专家并行计算中的NPU接口调用、模型适配映射与自定义扩展方法,强调数值等价性与性能优化平衡。
SGLang Dual-Chunk Flash Attention 后端测试覆盖矩阵与能力边界解析
本文系统解析SGLang中Dual-Chunk Flash Attention(DCA)后端的测试覆盖矩阵、硬件门槛(SM8.x/9.x支持,SM10.x需定制wheel)、生产侧明确拒绝的输入类型、稀疏注意力三类路径(全列/子窗口/阈值门控)、CUDA Graph元数据缺失导致的blocked状态,以及GQA、分页布局、多chunk语义等关键配置覆盖情况,聚焦其作为非稠密后端替代的独特设计与能力边界。
SciPy 1.2.2 发布说明深度解读:Bug 修复清单与 OpenBLAS SkylakeX 兼容性修复
SciPy 1.2.2 是纯 Bug 修复版本,核心包括:修复 Kendall tau 在完美单调向量下的 p-value 溢出问题;禁止原地修改用户输入数组以消除副作用;确保 MapWrapper 上下文退出时正确终止进程池;修正稀疏矩阵 nnz 属性文档歧义;构建层切换至 OpenBLAS 0.3.7.dev 以解决 SkylakeX 平台 AVX512 内核引发的数值稳定性问题;并增强 CI 对最低 NumPy 版本的覆盖。所有修复均附带回归测试与源码验证。
下载资源悬赏专区
13,652
社区成员
12,568,740
社区内容
发帖
与我相关
我的任务
下载资源悬赏专区
CSDN 下载资源悬赏专区
复制链接
扫一扫
分享
社区描述
CSDN 下载资源悬赏专区
其他
技术论坛(原bbs)
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章