7,652
社区成员
发帖
与我相关
我的任务
分享骁龙 AI PC 上开发本地对话应用时,如何实现流式输出并降低首 Token 延迟?
可以通过日志、工具命令和代码埋点确认模型运行目标硬件。
qnn-onnx-converter \--input_network model.onnx \--output_path model.dlc \--backend htp
如果出现大量算子 fallback 警告,说明部分算子没有完全运行在 NPU 上。
2. 运行时日志
设置日志级别后查看执行设备:
bash
export QNN_LOG_LEVEL=DEBUG
./inference_app
日志中通常会显示算子是否运行在 HTP、GPU 或 CPU 上。
3. 对比推理耗时
同一模型在 NPU 上通常比 CPU 快很多。可以做一次简单对比:
cpp
运行
auto t1 = now();run_inference();auto t2 = now();
std::cout << "infer ms: " << diff_ms(t1, t2) << std::endl;
如果开启 NPU 后耗时没有明显下降,就需要检查模型是否真正使用了硬件加速。