7,720
社区成员
发帖
与我相关
我的任务
分享骁龙 AI PC 上,用 llama.cpp 调用 Adreno GPU 跑本地 LLM,需要提前准备哪些依赖,编译时要开启什么编译选项?
llama.cpp 已经原生支持 Adreno GPU OpenCL 后端。环境依赖:Visual Studio 2022、CMake、Ninja、LLVM,并且安装 OpenCL ICD loader 与 OpenCL 头文件。 编译命令示例:
cmake -B build -DLLAMA_OPENCL=ON
cmake --build build --config Release
编译完成后,运行时会自动识别 Adreno GPU 并将模型算子卸载到 GPU。开发注意事项:Adreno OpenCL 显存容量有限,大模型要启用分片加载;可以对比 GPU 与 NPU 两条链路的 token 吞吐,NPU 更适合长文本持续生成场景。参考高通开发者博客:https://www.qualcomm.com/developer/blog/2024/11/introducing-new-opn-cl-gpu-backend-llama-cpp-for-qualcomm-adreno-gpu