7,729
社区成员
发帖
与我相关
我的任务
分享骁龙 AI PC 本地部署 LLM,开启 HTP burst 模式可以提升 token 生成速度,该参数如何配置,开启后需要关注哪些日志指标?
HTP burst 模式用于优化 LLM 解码阶段的批量推理,提升 token 吞吐,默认不会自动开启,需要在 QNN HTP 自定义配置项手动打开。配置开启后,日志会打印Set HTP performance mode: 2,同时 INFO 级别日志量会明显减少。 常见现象:未开启 burst 模式时,解码速度卡在较低 token/s,大量冗余日志输出;开启后 token 生成速率提升。调试时重点监控 token/s 吞吐、NPU 占用率,同时观察温度与功耗变化。部分模型结构对 burst 模式支持有限,需要做端侧实测验证。参考文档:https://dragonwingdocs.qualcomm.com/tutorials/gemma-litert-lm-on-iq8