骁龙 AI PC 开发离线文档问答应用,如何实现文档分片、向量检索与本地大模型推理整套流程打通?

美滋滋的 2026-08-18 10:03:18

骁龙 AI PC 开发离线文档问答应用,如何实现文档分片、向量检索与本地大模型推理整套流程打通?
 

...全文
58 1 打赏 收藏 转发到动态 举报
写回复
用AI写文章
1 条回复
切换为时间正序
请发表友善的回复…
发表回复
weixin_38498942 08-19 10:35
  • 打赏
  • 举报
回复

整套离线 RAG 流程分为文档处理、向量库、检索、大模型推理四个环节,全部可在骁龙 AI PC 本地运行,无需联网。完整流程:
文档解析,按照固定长度切分文本块;
运行轻量嵌入模型生成文本向量,构建本地向量索引;
用户提问后生成查询向量,检索相似度最高的文档片段;
将检索片段拼接进 Prompt 送入 NPU 加速大模型生成答案。
简易流程代码:
python
运行

from local_embedding import EmbeddingRunner
from qai.runtime import QaiRuntime

embedding_model = EmbeddingRunner()
llm_model = QaiRuntime()# 文档分片
chunks = split_document_to_chunk(file_path, chunk_size=512)# 构建向量库
vec_index = build_index([embedding_model.encode(c) for c in chunks])# 问答流程
user_query = "文档核心结论是什么"
query_vec = embedding_model.encode(user_query)
top_chunks = vec_index.search(query_vec, top_k=3)
prompt = build_rag_prompt(user_query, top_chunks)
answer = llm_model.chat(prompt)

优化要点:嵌入模型同样使用 QNN 部署至 Hexagon NPU,实现全链路硬件加速。

7,666

社区成员

发帖
与我相关
我的任务
社区描述
本论坛以AI、WoS 、XR、IoT、Auto、生成式AI等核心板块组成,为开发者提供便捷及高效的学习和交流平台。 高通开发者专区主页:https://qualcomm.csdn.net/
人工智能物联网机器学习 技术论坛(原bbs) 北京·东城区
社区管理员
  • csdnsqst0050
  • chipseeker
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧