骁龙 AI PC 上本地大模型回复很慢,可能有哪些原因?
回复慢通常不是单一原因,建议从模型大小、硬件加速、系统负载、推理参数四个方向排查。
ollama pull model-name:1.5b-q4_K_M
top
prompt = prompt[:4096]
model.generate(prompt, max_tokens=512)
7,666
社区成员
6,446
社区内容
加载中
试试用AI创作助手写篇文章吧