7,651
社区成员
发帖
与我相关
我的任务
分享生成式 AI 模型部署在高通 AI Edge Box,想要实现多租户隔离推理,不同客户的模型互不抢占 NPU 资源,有哪些部署架构方案?
方案一:NPU 时间片轮转调度(通用方案)
在边缘系统层搭建调度服务,划分时间片分给各个租户,同一时间段只允许一位租户占用 Hexagon NPU,其余租户请求进入排队队列,实现硬件隔离。
方案二:硬件分区部署(高配 Edge Box 适用)
高端 QCS 平台支持 HTP NPU 算力分片,将 NPU 划分为多个独立算力分区,每个租户独占一块分区并行推理,真正物理隔离。
方案三:容器隔离部署
利用 Linux 容器给每个租户创建独立容器,各自加载专属模型,搭配调度锁管控 NPU 访问权限。
时间片调度简易实现代码
python
运行
import time
from threading import Lock
tenant_lock = Lock()
time_slice_ms = 200
def tenant_infer(tenant_id, prompt):
with tenant_lock:
start = time.time()
result = qnn_llm_infer(prompt)
used_ms = (time.time() - start) * 1000
# 超出分配时间片直接终止推理,保障租户公平
if used_ms > time_slice_ms:
terminate_infer_task()
return "推理超时,请缩短生成内容"
return result