社区
下载资源悬赏专区
帖子详情
35kV箱变技术要求.pdf下载
weixin_39820535
2023-11-21 09:31:09
35kV箱变技术要求.pdf , 相关下载链接:
https://download.csdn.net/download/a66889999/88505462?utm_source=bbsseo
...全文
47
回复
打赏
收藏
35kV箱变技术要求.pdf下载
35kV箱变技术要求.pdf , 相关下载链接:https://download.csdn.net/download/a66889999/88505462?utm_source=bbsseo
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
TurboQuant KV缓存压缩:让Qwen3.5-35B推理速度提升14%的秘密
本文介绍TurboQuant KV缓存压缩
技术
,通过APEX自适应量化方案(含Quality/Balanced/Compact等配置),在Qwen3.5-35B模型上实现14%推理速度提升。核心
技术
包括KV缓存专用压缩、分层自适应精度调整与混合量化策略,在保持困惑度等关键指标前提下显著降低内存占用,适用于边缘部署、高并发API及实时交互场景。
DeepSeek V4动态稀疏注意力与分层KV缓存
技术
解析
本文深入解析DeepSeek V4的三大核心
技术
:动态稀疏注意力(DSA),通过三级相关性过滤与指令感知重加权实现计算高效与语义精准;分层KV缓存压缩(HKCC),按热/温/冷三层对KV cache进行精度与存储策略差异化管理,显著降低显存占用并提升SM利用率;指令感知token重加权机制(IATR),基于自监督聚类构建MoE式语义路由,支持多专家协同处理复杂指令。实测表明,V4可在单A100上稳定运行128K上下文,显存节省35%,关键召回率提升,幻觉率减半。
8G显存跑Qwen35B:llama.cpp+GGUF本地无限Token实战指南
本文详解如何在仅8GB显存的消费级GPU(如RTX 3070)上,通过llama.cpp+GGUF
技术
栈成功部署Qwen 3.6-35B大模型,实现稳定、低延迟、无限上下文长度的本地推理。核心涵盖GGUF量化选型(Q4_K_M)、显存精算与分层卸载(n-gpu-layers=32)、Windows 11+CUDA 12.4环境配置、Qwen专属grammar语法修复、投机解码加速、KV Cache持久化及常见问题排查(如只输出reason、显存泄漏、LM Studio版本错配等),所有方案均经实测验证。
Qwen3.5-35B-A3B本地部署实战:35B大模型离线推理全链路指南
本文详解Qwen3.5-35B-A3B大模型在消费级硬件(如双卡4090)上的离线部署全流程,聚焦vLLM 0.6.4 + FlashAttention-3 + HuggingFace Transformers协同方案。重点解决显存优化(A3B量化、PagedAttention、kv_cache_dtype)、中文Tokenizer适配、32K上下文扩展、position id溢出及生产级服务加固等关键
技术
问题,覆盖环境构建、参数调优、排障技巧与成本优化,适用于数据隔离、可审计、低延迟的工业级AI应用。
DualPath如何破解AI Agent推理的KV-Cache带宽瓶颈
DualPath是一种面向AI Agent推理的系统级优化方案,核心解决KV-Cache加载过程中的存储网络带宽瓶颈问题。它通过双路径KV-Cache加载、硬件级流量隔离(基于DPU)和全局动态调度器三大设计,复用闲置SNIC与计算网络带宽,实现KV数据预取与低延迟传输。实测在128K上下文、100并发下,Prefill等待时间降低76.6%,首token延迟下降61.3%。该方案不修改模型结构,专注基础设施层资源协同,适用于A100/H100等主流GPU集群。
下载资源悬赏专区
13,653
社区成员
12,569,884
社区内容
发帖
与我相关
我的任务
下载资源悬赏专区
CSDN 下载资源悬赏专区
复制链接
扫一扫
分享
社区描述
CSDN 下载资源悬赏专区
其他
技术论坛(原bbs)
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章