vLLM部署指南:昇腾910B-A2上Embedding/Reranker跑不了的真相

vLLM昇腾910B-A2Embedding
于 2026-08-28 03:55:51 修改
·本内容遵循CC 4.0 BY-SA版权协议

“昇腾910B-A2服务器上不能通过vllm启动embedding向量和reranker模型吗”——这是我在搜索后台经常看到的真实问题,也是很多团队第一次接触 vLLM 时的典型卡壳现场。

表面上,这是一个“安装失败”或“算子不支持”的问题。但往深一层看,它真正暴露的是很多人对 vLLM 的定位理解偏差:以为它是一个“能启动大模型的通用工具”,装完就能把各种模型都丢进去跑。实际上,vLLM 天生是奔着文本生成模型的高吞吐服务化去设计的。 Embedding、Reranker 这类非自回归模型,并不天然在它的舒适区里。

这篇文章不打算复述官方文档,而是从我看到的高频问题出发,把 vLLM 的适用边界、部署流程、关键参数和工程化路径一起捋清楚。尤其是,当“Inferact vLLM creators are hiring”这样的标题出现在社区里时,我更想聊一个问题:为什么一个推理框架的创作者会需要长期招人?答案其实就藏在这类框架的复杂度里。

1. 先搞清楚 vLLM 到底解决哪一类问题

1.1 不要把它当成一个“启动大模型的万能命令”

很多教程会告诉你,安装 vLLM 之后,一行命令就能启动一个 OpenAI 兼容的服务:

BASH
vllm serve <模型路径或名称>

这句话没有错,但它让很多新手产生了一个误会:凡是模型,都能用 vLLM 启动;凡是显存问题,都能被 vLLM 解决。

真实情况要偏技术得多。vLLM 最大的贡献,是解决了自回归式 LLM 在推理服务阶段的显存管理和调度效率问题。它把 PagedAttention、Continuous Batching 这类底层的调度机制,做成了开箱即用能力,让同一块 GPU 上能容纳更多并发请求,吞吐量也明显好于直接用 Hugging Face Transformers 写推理脚本。

这套机制有效的前提是:目标模型是“逐 token 自回归生成”的大语言模型。只有这类模型的推理过程,才能从显存分页、连续批处理、KV Cache 复用里获得巨大收益。

所以,vLLM 真正解决的是:高并发文本生成场景下的吞吐和显存效率问题

1.2 它适合的场景,都有明显共性

如果你的业务属于下面这几类,vLLM 的价值会非常明显:

  • 对话机器人、智能助手服务,需要同时服务大量用户;
  • 内容生成类 API,需要把模型部署成标准化的 HTTP 服务;
  • Agent 应用,在一次任务里多次调用 LLM,需要低调度开销;
  • 离线批量生成,需要尽可能吃满 GPU 算力,缩短整体耗时。

这些场景都有一个共性:请求多、并发高、生成的是文本。vLLM 的连续批处理,本质上就是让 GPU 在“排队干活”的效率上接近极限。它对短请求、长请求混跑的场景尤其友好,因为调度器可以在 token 级别做切换。

相比早期“一个请求占满整卡”的做法,vLLM 把单卡利用率提升了一个量级。这也是它能在开源社区快速获得认可的核心原因。

1.3 但也有它不合适的地方:embedding、reranker 和一切非自回归模型

搜索引擎里那些关于“昇腾 910B-A2 上跑不了 embedding/reranker”的问题,正好撞上了这个边界。

Embedding 模型的任务,是把文本编码成向量;Reranker 模型的任务,是给查询和候选文档对打分。它们不是逐 token 生成文本,而是基于 encoder 模型做一次前向计算。显存分页和 KV Cache 的收益非常有限,连续批处理的调度逻辑也未必能直接套用。

vLLM 对这类模型的支持,取决于模型结构是否在它的支持列表里。即使支持,性能和稳定性也不一定比专用于向量推理的引擎更好。

判断方法很简单:如果你的模型输出是文本序列,vLLM 大概率适用;如果输出是向量或分数,先确认官方支持的模型列表,再决定是否使用。

2. 昇腾 9

最低 0.47元/天 开通会员,解锁全文
left
成为会员后, 你将解锁
right
benefits 下载资源随意下
benefits 优质VIP博文免费学
benefits 优质文库回答免费看
benefits 付费资源9折优惠
vllm部署qwen-embedding-0.6B
本文主要讨论了如何使用vLLM框架部署Qwen-Embedding-0.6B模型。首先,我们确认了vLLM主要针对文本生成模型,而Qwen-Embedding-0.6B是一个嵌入模型,可能不完全兼容。接着,我们尝试了vLLM部署步骤,并提供了替代方案,如使用Hugging Face Transformers直接服务模型。最后,我们给出了相关问题的解答。
上班不动产
vllm部署BAAI/bge-reranker-v2-m3的API
本文介绍了如何部署BAAI/bge-reranker-v2-m3模型的vLLM API。首先安装了必要的依赖库,然后加载了模型和分词器。接着设置了采样参数,构建了输入数据,并调用了推理接口进行预测。最后,文章提醒了硬件要求、优化选项和错误调试的重要性。
夜深人静写代码☞
Qwen3-Reranker-4B部署教程国产昇腾910B芯片适配vLLM加速方案
不吃酸菜的小贱人
昇腾vllm部署大模型
本文介绍了如何在昇腾AI平台上使用Ascend VLLM框架部署大型语言模型(LLM)。首先,确保系统环境支持Ascend VLLM运行所需的依赖库和驱动。然后,将原始模型转换为适配Ascend硬件的格式,并进行模型量化和编译。最后,启动服务并通过HTTP API发送推理请求,同时提供性能调优建议。
来杯金桔柠檬fly
Qwen3-Reranker-8B部署教程[代码]
整体而言,通过本教程,读者将不仅可以学会如何在WSL2环境中成功部署Qwen3-Reranker-8B模型,还能掌握将这一强大的文本重排序模型集成到实际应用中的方法。
算法笑匠
14
Qwen3-Reranker-8B 部署
本文提供了Qwen3-Reranker-8B模型的详细部署步骤,包括环境准备、软件依赖、数据准备、具体部署操作以及常见问题的解决方法。部署过程涉及硬件环境、软件依赖确认、数据格式准备、镜像拉取、容器启动、模型加载和测试推理等关键步骤。
haha2017813
Qwen3-Reranker-8B部署案例国产昇腾910B平台适配与性能调优
腐国喵小姐
Qwen3-Reranker-0.6B部署教程国产昇腾910B平台适配与性能实测报告
Liu Baihua
零基础实战用 Docker 和 vLLM 本地部署 bge-reranker-v2-m3 重排序模型.pdf
为了解决这一问题,文章建议从modelscope下载BAAI/bge-reranker-v2-m3,并对脚本进行适当调整以适应本地需求。
比特魔法师
392
模型发布“踩刹车”不可怕,开发者如何保障稳定与可回退?
本文聚焦大模型发布过程中的稳定性保障与可回退机制,剖析‘紧急踩刹车’本质为灰度发布与安全回滚策略;指出工具链(如Codex CLI、config.toml)在模型更新后易成故障点;详解vllm昇腾平台部署embedding/reranker模型的四层排查法;强调命名混淆与模型焦虑下的理性决策,并给出开发者三条核心建议视模型更新为发布事件、保留可回退版本、将报错信息作为第一手排查依据。
weixin_34218579
415
RAG与Transformer工程实践从原理到业务落地的AI技术复盘
本文深入剖析RAG与Transformer在真实业务场景中的工程本质RAG核心是动态知识缓存层,需关注检索质量全链路控制(Embedding选型、语义Chunk、重排序)及运维衰减治理;Transformer注意力本质是构建token间条件关系图,编码器-解码器架构适配信息不对称任务,多头机制提供冗余容错;机器学习优化须将损失函数映射业务决策成本,优化器选择需兼顾硬件与收敛质量;LLM评估必须超越Accuracy,构建三级业务导向评估体系并实现流式质量监控。
weixin_33912453
362
通义千问3.0开源深度解析中文语义压缩与工业级落地实践
本文深度解析通义千问3.0开源版本的核心技术,聚焦其中文语料脏数据驯化、Qwen-Quant-MS动态语义压缩量化、Tongyi-Tool-Align中文意图对齐协议三大工业级设计。详述GitHub仓库结构、百炼平台非标配置、Docker部署避坑、vLLM高并发API搭建及政务RAG特化改造,并覆盖中文标点静默失败、OSS权限、中文乱码等实操痛点。强调其在中小企业降本、开源协议升级、国产芯片适配与政企国产化替代中的真实影响。
weixin_30800987
322
开源AI落地七道生死关从可运行到生产就绪的工程实践
本文系统梳理开源AI从可运行到生产就绪必须跨越的七道工程关卡模型瘦身需分层量化、推理加速须匹配硬件与架构、提示词工程应转为可测试代码、安全护栏需三级防御体系、可观测性要覆盖AI专属指标、持续训练依赖数据飞轮机制、灾备切换要求多级降级通道。内容基于47个真实落地项目,聚焦模型可审计性、本地化推理、量化精度、推理框架选型、安全合规等关键技术实践,强调开源AI的本质是全栈可控的Model-as-Infrastructure。
weixin_30861797
330
RAG技术原理与实战解决大模型幻觉与知识滞后问题
本文系统阐述RAG(检索增强生成)如何解决大模型幻觉与知识滞后问题,涵盖知识库构建、语义检索、重排序、生成范式四大核心模块,并提供企业级落地实践路径,包括中文嵌入模型选型、Qdrant向量数据库部署、动态上下文压缩、图谱辅助关系检索等关键技术细节,强调业务相关性评估与可溯源生成的重要性。
diandingyin9417
350