生成式 AI 模型部署在高通 AI Edge Box,想要实现多租户隔离推理,不同客户的模型互不抢占 NPU 资源,有哪些部署架构方案?

芒果佩佩奇 2026-08-06 11:58:25

生成式 AI 模型部署在高通 AI Edge Box,想要实现多租户隔离推理,不同客户的模型互不抢占 NPU 资源,有哪些部署架构方案?
 

...全文
29 1 打赏 收藏 转发到动态 举报
写回复
用AI写文章
1 条回复
切换为时间正序
请发表友善的回复…
发表回复
老杨261 08-06 20:41
  • 打赏
  • 举报
回复

方案一:NPU 时间片轮转调度(通用方案)
在边缘系统层搭建调度服务,划分时间片分给各个租户,同一时间段只允许一位租户占用 Hexagon NPU,其余租户请求进入排队队列,实现硬件隔离。
方案二:硬件分区部署(高配 Edge Box 适用)
高端 QCS 平台支持 HTP NPU 算力分片,将 NPU 划分为多个独立算力分区,每个租户独占一块分区并行推理,真正物理隔离。
方案三:容器隔离部署
利用 Linux 容器给每个租户创建独立容器,各自加载专属模型,搭配调度锁管控 NPU 访问权限。
时间片调度简易实现代码
python
运行
import time
from threading import Lock

tenant_lock = Lock()
time_slice_ms = 200

def tenant_infer(tenant_id, prompt):
with tenant_lock:
start = time.time()
result = qnn_llm_infer(prompt)
used_ms = (time.time() - start) * 1000
# 超出分配时间片直接终止推理,保障租户公平
if used_ms > time_slice_ms:
terminate_infer_task()
return "推理超时,请缩短生成内容"
return result

7,651

社区成员

发帖
与我相关
我的任务
社区描述
本论坛以AI、WoS 、XR、IoT、Auto、生成式AI等核心板块组成,为开发者提供便捷及高效的学习和交流平台。 高通开发者专区主页:https://qualcomm.csdn.net/
人工智能物联网机器学习 技术论坛(原bbs) 北京·东城区
社区管理员
  • csdnsqst0050
  • chipseeker
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧