283
社区成员
发帖
与我相关
我的任务
分享硬件:摩尔线程 MTT S80 系统:Ubuntu 22.04 x86_64 驱动 / MUSA SDK:官方稳定 RC 版本 需求:使用 llama.cpp 加载 GGUF 大模型,通过 MUSA 后端 GPU 加速推理
ggml-org/llama.cpp(gitcode 国内镜像拉取主线代码),CMake 配置 -DGGML_MUSA=ON 进行编译;ggml/src/ggml-musa/ 编译环节失败,报错文件: argsort.cu、binbcast.cu,提示 cuda 移植代码存在语法 / 内核编译错误(mp_21 目标编译失败);mthreads/llama.cpp: 国内网络环境无法 clone GitHub 仓库,各类 ghproxy 代理全部超时 / 403,无法在线拉取源码;server-musa Docker 镜像: 宿主机已经完整安装 MT Container Toolkit,/etc/docker/daemon.json runtime 配置书写正确,但 docker info 始终识别不到mthreads runtime,容器启动提示unknown runtime name:mthreads;mthreads/musa SDK 开发容器镜像: Docker Hub 国内网络连接超时,镜像无法拉取;只能编译 GGML_MUSA=OFF 的纯 CPU 版本 llama-server,CPU 算力不足以支撑业务并发; 想要启用 S80 GPU 加速推理,但缺少可直接编译通过的源码渠道。
① 是否可以提供 mthreads/llama.cpp 修复 MUSA 编译问题源码的国内下载地址 / Gitee 镜像 / 离线压缩包;
除了官方 fork 仓库外,有无其他方式在当前环境编译出可用带 MUSA 后端的 llama.cpp。
恳请官方的技术大牛或者其他专家支援指导。谢谢!