7,666
社区成员
发帖
与我相关
我的任务
分享骁龙 AI PC 开发离线文档问答应用,如何实现文档分片、向量检索与本地大模型推理整套流程打通?
整套离线 RAG 流程分为文档处理、向量库、检索、大模型推理四个环节,全部可在骁龙 AI PC 本地运行,无需联网。完整流程:
文档解析,按照固定长度切分文本块;
运行轻量嵌入模型生成文本向量,构建本地向量索引;
用户提问后生成查询向量,检索相似度最高的文档片段;
将检索片段拼接进 Prompt 送入 NPU 加速大模型生成答案。
简易流程代码:
python
运行
from local_embedding import EmbeddingRunner
from qai.runtime import QaiRuntime
embedding_model = EmbeddingRunner()
llm_model = QaiRuntime()# 文档分片
chunks = split_document_to_chunk(file_path, chunk_size=512)# 构建向量库
vec_index = build_index([embedding_model.encode(c) for c in chunks])# 问答流程
user_query = "文档核心结论是什么"
query_vec = embedding_model.encode(user_query)
top_chunks = vec_index.search(query_vec, top_k=3)
prompt = build_rag_prompt(user_query, top_chunks)
answer = llm_model.chat(prompt)
优化要点:嵌入模型同样使用 QNN 部署至 Hexagon NPU,实现全链路硬件加速。