社区
李世保的课程社区_NO_1
C++实战AI算法:从基础到自动微分与矩阵封装
帖子详情
课时41:c++自动微积分代码案例讲解(3):实现forward前向计算和backward反向求导
飞翔的佩奇
2025-02-22 10:54:51
课时名称
课时知识点
课时41:c++自动微积分代码案例讲解(3):实现forward前向计算和backward反向求导
通过实际案例演示自动微分的应用效果及代码优化。
...全文
79
回复
打赏
收藏
课时41:c++自动微积分代码案例讲解(3):实现forward前向计算和backward反向求导
课时名称课时知识点课时41:c++自动微积分代码案例讲解(3):实现forward前向计算和backward反向求导通过实际案例演示自动微分的应用效果及代码优化。
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
机器学习工程师的三大数学支柱:线性代数、
微积分
与概率论实战指南
本文面向机器学习工程师,系统阐释线性代数、
微积分
与概率论在工业实践中的核心作用:线性代数支撑数据表征与模型结构(如SVD压缩、特征向量降维);
微积分
驱动优化过程(梯度
计算
、链式法则
反向
传播、Hessian近似优化);概率论提供不确定性建模基础(贝叶斯推断、KL散度、MLE统一框架)。结合电商搜索排序等端到端
案例
,揭示三者协同机制,并指出数值不稳定、梯度异常、分布偏差等关键工程陷阱。
显存爆炸解决方法之梯度累积:是什么、为什么、怎么做?从数学原理到
代码
落地的全流程指南
本文系统阐述梯度累积技术的数学原理、
实现
机制与工程实践。核心在于通过小批次分时
前向
反向
、梯度累加并配合Loss除以累积步数,等效模拟大批次训练,解决显存爆炸问题。重点解析Loss缩放必要性(因PyTorch默认mean reduction导致梯度∝1/BatchSize)、梯度累积与BN层兼容性、混合TF/FR训练中的Loss归一化策略,并给出显存受限下的优化组合拳:序列截断→混合精度→梯度累积→梯度检查点。
Policy Gradient PyTorch实战:从张量形状到梯度更新的完整链路
本文聚焦策略梯度(Policy Gradient)在PyTorch中的端到端
实现
,深入解析从轨迹采样、对数导数技巧、优势函数
计算
到张量形状对齐、梯度更新的完整工程链路。重点涵盖蒙特卡洛估计下的梯度无偏性保障、Baseline设计原理、Actor-Critic架构中Policy与Value网络的协同训练机制,以及常见梯度爆炸/消失、CUDA内存溢出等实战问题的定位与优化方法。
神经网络概念解码:从黑箱到可理解、可调试、可迁移的AI建模能力
本文提出‘概念切片’方法论,从物理、认知、演化三个正交维度解构神经网络核心概念,强调可理解、可调试、可迁移的建模能力。通过动态
计算
图可视化、梯度流完整性测试、概念漂移监测等实操工具,将抽象概念转化为可测量、可干预的工程指标。重点涵盖激活函数的动态范围压缩比与梯度稳定性窗口、损失函数的业务约束映射、优化器的有效学习率调度,以及跨域概念迁移与个人概念知识库构建。
【十万字拆解】从零开始
实现
GPT-2(完整版)
本博客系统性地从零开始
实现
GPT-2(124M)模型,涵盖Bigram语言模型基础、Transformer解码器架构构建(含自注意力、多头注意力、前馈网络、残差连接、层归一化、Dropout)、GPT-2 tokenizer
实现
(BPE、tiktoken、sentencepiece)、工业级训练流程(AdamW优化器、混合精度、FlashAttention、梯度裁剪、学习率衰减、权重衰减、梯度累加、硬件对齐、分布式训练DDP),以及基于fineweb-edu数据集的训练与HellaSwag评估。
李世保的课程社区_NO_1
1
社区成员
498
社区内容
发帖
与我相关
我的任务
李世保的课程社区_NO_1
it 男
复制链接
扫一扫
分享
社区描述
it 男
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章