上下文缓存与 KV Cache——长对话性能的关键

davidwang456 2026-06-26 09:15:05

课时名称课时知识点
上下文缓存与 KV Cache——长对话性能的关键**定位**:深入理解多轮对话为何会越来越慢,以及如何优化。 **核心内容**: - Transformer 推理中的 KV Cache 直觉解释 - 上下文复用、截断和缓存命中 - 长上下文对显存、内存和延迟的影响 - 多用户会话下的缓存污染与隔离 - `kvcache/` 相关实现阅读路线 **实战目标**:构造不同上下文长度的压测用例,观察 TTFT、tokens/s 和资源占用变化,并输出优化建议。
...全文
29 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

1

社区成员

发帖
与我相关
我的任务
社区管理员
  • davidwang456
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧