后端工程师的 AI 转型第一课:Ollama 与私有化大模型实战
社区首页 (3675)
请编写您的帖子内容
社区频道(7)
显示侧栏
卡片版式
后端工程师的 AI 转型第一课:Ollama 与私有化大模型实战
Milvus向量数据库实战修炼:从 0 到 1 精通向量检索与生产落地
python入门:Rquests从菜鸟脚本到企业级SDK的网络实战圣经
MongoDB 实战进阶与内核修炼
Python 3实战精进:从脚本到高并发订单引擎
Redis 8 实战精讲:从 CRUD 到源码,构建高可用缓存系统
NumPy 从入门到生产落地:全链路实战指南(科学计算/向量化)
最新发布
最新回复
标题
阅读量
内容评分
精选

216
评分
回复
后端工程师的 AI 转型第一课:Ollama 与私有化大模型实战
课程名称适应人群后端工程师的 AI 转型第一课:Ollama 与私有化大模型实战新人开发 / 测试工程师:想快速入门本地大模型运行与 API 调用,搭建第一个 AI 应用 1. AI 应用开发工程师:需要将大模型接入业务系统,构建 RAG、工具调用、
复制链接 扫一扫
分享

20
评分
回复
Kubernetes 部署——从单机到集群资源治理
课时名称课时知识点Kubernetes 部署——从单机到集群资源治理**定位**:进入云原生部署与资源隔离场景。 **核心内容**: Deployment、Service、Ingress 与持久化存储 GPU 节点调度与资源请求 模型文件分发与启动预
复制链接 扫一扫
分享

28
评分
回复
二次开发与插件化扩展——把 Ollama 嵌进企业平台
课时名称课时知识点二次开发与插件化扩展——把 Ollama 嵌进企业平台**定位**:从使用 Ollama 到改造 Ollama。 **核心内容**: 适合二次开发的边界:API、鉴权、审计、模型仓库、策略层 不建议直接侵入的边界:推理核心、模型格式
复制链接 扫一扫
分享

28
评分
回复
模型转换与导入——从外部权重到 Ollama 可运行模型
课时名称课时知识点模型转换与导入——从外部权重到 Ollama 可运行模型**定位**:打通模型来源与 Ollama 运行环境。 **核心内容**: - 常见模型格式与 Ollama 可运行格式的关系 - `convert/` 目录阅读路线 - to
复制链接 扫一扫
分享

22
评分
回复
Modelfile 解析与模型构建源码
课时名称课时知识点Modelfile 解析与模型构建源码**定位**:从源码层面理解定制模型如何生成。 **核心内容**: - Modelfile 解析流程与指令映射 - FROM、SYSTEM、PARAMETER、TEMPLATE 的内部表示 -
复制链接 扫一扫
分享

28
评分
回复
API 路由源码剖析——Generate 与 Chat 的请求生命周期
课时名称课时知识点API 路由源码剖析——Generate 与 Chat 的请求生命周期**定位**:理解 Ollama 对外接口背后的真实执行链路。 **核心内容**: HTTP 路由注册与 Handler 分发 Generate、Chat、Emb
复制链接 扫一扫
分享

28
评分
回复
【中级篇综合实战】构建企业内部 AI 助手平台
课时名称课时知识点【中级篇综合实战】构建企业内部 AI 助手平台**定位**:综合服务化、RAG、安全、监控和评测能力。 **核心内容**: - 场景:为研发、测试、运维提供统一 AI 助手入口 - 功能需求:多模型路由、知识库问答、工具调用、权限控
复制链接 扫一扫
分享

29
评分
回复
上下文缓存与 KV Cache——长对话性能的关键
课时名称课时知识点上下文缓存与 KV Cache——长对话性能的关键**定位**:深入理解多轮对话为何会越来越慢,以及如何优化。 **核心内容**: - Transformer 推理中的 KV Cache 直觉解释 - 上下文复用、截断和缓存命中 -
复制链接 扫一扫
分享

28
评分
回复
模型文件与清单管理源码——Manifest、Blob 与 Tag
课时名称课时知识点模型文件与清单管理源码——Manifest、Blob 与 Tag**定位**:弄清楚模型为什么能复用、迁移和删除。 **核心内容**: - 模型引用与标签解析 - manifest 与 blob 的存储关系 - 模型拉取、校验、断点
复制链接 扫一扫
分享

22
评分
回复
【高级篇综合实战】生产级私有 AI 推理平台落地
课时名称课时知识点【高级篇综合实战】生产级私有 AI 推理平台落地**定位**:融会贯通高级篇知识,完成可上线的架构方案和演练。 **核心内容**: - 场景:为金融/制造/政企客户建设私有化 AI 推理平台 - 架构设计:Ollama 集群 + 网
复制链接 扫一扫
分享

27
评分
回复
极端性能优化——火焰图、瓶颈定位与资源配额
课时名称课时知识点极端性能优化——火焰图、瓶颈定位与资源配额**定位**:面向高并发和高成本场景做系统化优化。 **核心内容**: - 性能剖析方法:pprof、perf、GPU 监控、系统指标 - 首 token 慢、生成慢、排队慢的定位路径 -
复制链接 扫一扫
分享

27
评分
回复
Runner 与推理进程管理——模型如何被加载和卸载
课时名称课时知识点Runner 与推理进程管理——模型如何被加载和卸载**定位**:理解 Ollama 运行时最关键的生命周期管理。 **核心内容**: - Runner 的职责:加载模型、接收请求、执行推理、返回 token - 模型实例复用、空闲
复制链接 扫一扫
分享

25
评分
回复
源码目录与启动流程——Ollama 如何跑起来
课时名称课时知识点源码目录与启动流程——Ollama 如何跑起来**定位**:从使用者进入源码读者视角。 **核心内容**: - 源码目录全景:命令行、服务端、API 类型、模型、推理、转换工具 - 启动入口:CLI 命令到服务进程 - 配置、环境变
复制链接 扫一扫
分享

28
评分
回复
评测体系建设——模型效果如何量化
课时名称课时知识点评测体系建设——模型效果如何量化**定位**:让模型选型和 Prompt 改动有数据依据。 **核心内容**: - 评测集设计:事实问答、业务流程、代码任务、拒答样例 - 自动评分与人工评分结合 - LLM-as-judge 的风险
复制链接 扫一扫
分享

25
评分
回复
大文件与长文档处理——从摘要到问答
课时名称课时知识点大文件与长文档处理——从摘要到问答**定位**:解决真实文档远超上下文窗口的问题。 **核心内容**: - 长文档处理策略:分段摘要、层级摘要、Map-Reduce - PDF、Word、Markdown 的解析差异 - 表格、代码
复制链接 扫一扫
分享

24
评分
回复
安全与权限——私有化 AI 服务的边界
课时名称课时知识点安全与权限——私有化 AI 服务的边界**定位**:避免本地大模型服务成为新的数据泄露入口。 **核心内容**: - 本地服务暴露风险:无鉴权、局域网访问、端口扫描 - API Key、用户身份、配额和审计 - Prompt 注入与
复制链接 扫一扫
分享

34
评分
回复
RAG 进阶——切分、召回、重排与答案校验
课时名称课时知识点RAG 进阶——切分、召回、重排与答案校验**定位**:提升知识库问答的稳定性和可信度。 **核心内容**: - 切分策略:固定长度、标题层级、语义切分 - 混合检索:关键词 + 向量 - 重排模型与交叉编码器思路 - 答案引用、置
复制链接 扫一扫
分享

26
评分
回复
并发请求治理——排队、取消与超时控制
课时名称课时知识点并发请求治理——排队、取消与超时控制**定位**:解决多人同时使用时的卡顿和雪崩。 **核心内容**: - 并发推理的资源瓶颈:CPU、GPU、内存、上下文长度 - 应用侧队列与优先级 - 超时、取消、重试的正确边界 - 流式请求中
复制链接 扫一扫
分享

28
评分
回复
基础故障排查——模型为什么慢、卡、答错
课时名称课时知识点基础故障排查——模型为什么慢、卡、答错**定位**:帮助读者从能跑进入能排查。 **核心内容**: 下载慢、模型拉取失败、磁盘不足 首次响应慢与模型加载时间 内存/显存不足、进程退出、模型被卸载 回答质量差:模型选型、Prompt、
复制链接 扫一扫
分享

26
评分
回复
容器化部署——Docker 中运行 Ollama
课时名称课时知识点容器化部署——Docker 中运行 Ollama**定位**:把本地实验转成可迁移的部署单元。 **核心内容**: Ollama Docker 镜像与数据卷挂载 模型目录持久化与镜像体积控制 GPU 容器运行基础 容器内服务端口、权
复制链接 扫一扫
分享

39
评分
回复
多模型路由——为不同任务选择不同模型
课时名称课时知识点多模型路由——为不同任务选择不同模型**定位**:避免所有任务都压到一个模型上。 **核心内容**: - 模型路由维度:任务类型、上下文长度、成本、延迟、语言、代码能力 - 快模型兜底与强模型精答 - 动态路由策略:规则、分类器、评
复制链接 扫一扫
分享
为您搜索到以下结果: