Ubuntu22.04 + MTT S80,上游 llama.cpp 主线开启 GGML_MUSA 编译持续报错,无法启用 GPU 推理

老牛马宏 2026-07-21 17:54:31

硬件:摩尔线程 MTT S80 系统:Ubuntu 22.04 x86_64 驱动 / MUSA SDK:官方稳定 RC 版本 需求:使用 llama.cpp 加载 GGUF 大模型,通过 MUSA 后端 GPU 加速推理

当前遇到的问题:

  1. 使用上游原版 ggml-org/llama.cpp(gitcode 国内镜像拉取主线代码),CMake 配置 -DGGML_MUSA=ON 进行编译;
  2. 编译过程在 ggml/src/ggml-musa/ 编译环节失败,报错文件: argsort.cubinbcast.cu,提示 cuda 移植代码存在语法 / 内核编译错误(mp_21 目标编译失败);
  3. 多次更换 gcc-12 编译环境,问题依旧;上游主线自带的 ggml-musa 移植代码存在兼容性 Bug,无法正常编译。

尝试过的解决方案与障碍:

  1. 尝试使用摩尔线程官方 fork 仓库 mthreads/llama.cpp: 国内网络环境无法 clone GitHub 仓库,各类 ghproxy 代理全部超时 / 403,无法在线拉取源码;
  2. 尝试官方 server-musa Docker 镜像: 宿主机已经完整安装 MT Container Toolkit,/etc/docker/daemon.json runtime 配置书写正确,但 docker info 始终识别不到mthreads runtime,容器启动提示unknown runtime name:mthreads
  3. 尝试 mthreads/musa SDK 开发容器镜像: Docker Hub 国内网络连接超时,镜像无法拉取;

当前现状

只能编译 GGML_MUSA=OFF 的纯 CPU 版本 llama-server,CPU 算力不足以支撑业务并发; 想要启用 S80 GPU 加速推理,但缺少可直接编译通过的源码渠道。

咨询两点:

① 是否可以提供 mthreads/llama.cpp 修复 MUSA 编译问题源码的国内下载地址 / Gitee 镜像 / 离线压缩包
 除了官方 fork 仓库外,有无其他方式在当前环境编译出可用带 MUSA 后端的 llama.cpp。

恳请官方的技术大牛或者其他专家支援指导。谢谢!

 

...全文
70 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

283

社区成员

发帖
与我相关
我的任务
社区描述
摩尔线程成立于 2020 年 10 月,以全功能 GPU 为核心,致力于向全球提供加速计算的基础设施和一站式解决方案,为各行各业的数智化转型提供强大的 AI 计算支持。 我们的目标是成为具备国际竞争力的 GPU 领军企业,为融合人工智能和数字孪生的数智世界打造先进的加速计算平台。我们的愿景是为美好世界加速。
企业社区
社区管理员
  • 摩尔线程
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧