骁龙 AI PC 本地部署 LLM,开启 HTP burst 模式可以提升 token 生成速度,该参数如何配置,开启后需要关注哪些日志指标?

weixin_32171271 2026-09-23 14:52:41

骁龙 AI PC 本地部署 LLM,开启 HTP burst 模式可以提升 token 生成速度,该参数如何配置,开启后需要关注哪些日志指标?
 

...全文
55 1 打赏 收藏 举报
写回复
用AI写文章
1 条回复
切换为时间正序
请发表友善的回复…
发表回复
weixin_38498942 09-24 13:48
  • 打赏
  • 举报
回复

HTP burst 模式用于优化 LLM 解码阶段的批量推理,提升 token 吞吐,默认不会自动开启,需要在 QNN HTP 自定义配置项手动打开。配置开启后,日志会打印Set HTP performance mode: 2,同时 INFO 级别日志量会明显减少。 常见现象:未开启 burst 模式时,解码速度卡在较低 token/s,大量冗余日志输出;开启后 token 生成速率提升。调试时重点监控 token/s 吞吐、NPU 占用率,同时观察温度与功耗变化。部分模型结构对 burst 模式支持有限,需要做端侧实测验证。参考文档:https://dragonwingdocs.qualcomm.com/tutorials/gemma-litert-lm-on-iq8

7,729

社区成员

发帖
与我相关
我的任务
社区描述
本论坛以AI、IoT、PC 、XR、Auto等核心板块组成,为开发者提供便捷及高效的学习和交流平台。 高通开发者专区主页:https://qualcomm.csdn.net/
物联网人工智能开源 企业社区 北京·东城区
社区管理员
  • csdnsqst0050
  • chipseeker
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧