7,720
社区成员
发帖
与我相关
我的任务
分享在骁龙 AI PC Windows on Snapdragon 平台,如何通过 QAI AppBuilder Python API 调用 NPU 运行本地小语言模型,有哪些常见环境坑点?
QAI AppBuilder 提供 GenieContext Python 接口,可直接调度骁龙 X 系列 NPU 完成本地 LLM 推理,不需要手动编写底层 QNN 调用代码。 极简调用示例:
from qai_appbuilder import GenieContext
ctx = GenieContext(model_path="local_slm.bin")
resp = ctx.generate(prompt="简单介绍高通QNN", max_new_tokens=128)
print(resp.text)
常见坑点:1. 必须使用 ARM64 版本 Python,x86 Python 无法加载 NPU runtime;2. 模型编译时的 QNN SDK 版本,必须和设备运行时版本保持一致,版本不匹配会报 context 创建失败;3. 内存不足会导致模型加载失败,需要控制模型参数量,使用 INT4 量化。参考文档:https://docs.qualcomm.com/doc/80-94755-1/80-94755-1_REV_AA_QAI_AppBuilder_-_WoS.pdf