1
社区成员
发帖
与我相关
我的任务
分享| 课时名称 | 课时知识点 |
|---|---|
| 上下文缓存与 KV Cache——长对话性能的关键 | **定位**:深入理解多轮对话为何会越来越慢,以及如何优化。 **核心内容**: - Transformer 推理中的 KV Cache 直觉解释 - 上下文复用、截断和缓存命中 - 长上下文对显存、内存和延迟的影响 - 多用户会话下的缓存污染与隔离 - `kvcache/` 相关实现阅读路线 **实战目标**:构造不同上下文长度的压测用例,观察 TTFT、tokens/s 和资源占用变化,并输出优化建议。 |