社区
非技术区
帖子详情
终于升到两星了,散分(2)
drugon
2005-02-24 02:55:00
升到两星了,高兴,散分,来者有分,呵呵。。。。。。
...全文
434
107
打赏
收藏
终于升到两星了,散分(2)
升到两星了,高兴,散分,来者有分,呵呵。。。。。。
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
107 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
tantj
2005-02-28
打赏
举报
回复
接分
amorcupt
2005-02-28
打赏
举报
回复
恭喜,快给我分
HuangQQ
2005-02-28
打赏
举报
回复
GX,JF
jywyjjywyj
2005-02-28
打赏
举报
回复
:)
askhappy
2005-02-28
打赏
举报
回复
jf :)
vcvj
2005-02-28
打赏
举报
回复
up
satangf
2005-02-28
打赏
举报
回复
恭喜,接分
shan1119
2005-02-28
打赏
举报
回复
ff
programeyonger
2005-02-28
打赏
举报
回复
继续努力! jf
joyaga
2005-02-28
打赏
举报
回复
继续努力! jf
SInoyew
2005-02-28
打赏
举报
回复
祝贺!
feicuishen
2005-02-28
打赏
举报
回复
恭喜,不知道我什么时候升。
天下有雪
2005-02-28
打赏
举报
回复
恭喜,顺便接分
时光888
2005-02-27
打赏
举报
回复
我,我
楼主恭喜
RockyGo
2005-02-27
打赏
举报
回复
i am coming!
eureka0891
2005-02-27
打赏
举报
回复
接分
hubo2003hq
2005-02-27
打赏
举报
回复
good!!!
zgw
2005-02-27
打赏
举报
回复
接分
zhoulinjulian
2005-02-27
打赏
举报
回复
恭喜楼主!我接分!
wadsunglow
2005-02-27
打赏
举报
回复
哇!!!!!!!!楼主恭喜你啊!
我接,我接,我接接接!
哈哈
加载更多回复(87)
变分贝叶斯估计:KL散度及变分自由能
这可以通过最小化KL散度来找到最优的变分分布,从而近似真实的后验分布。它是变分推断中的一个目标函数,通过最小化变分自由能,可以找到一个近似分布,使其尽可能接近真实的后验分布。变分自由能与最大化证据下界是等价的,因为最大化 ELBO 的过程等价于最小化其负值,即最小化变分自由能,且通常通过迭代的方式进行。通过最小化变分自由能,我们在近似分布的选择中取得了折中,同时考虑了与真实后验的接近度和模型对观测数据的拟合。其中,Q 是我们希望找到的近似分布,P 是真实的后验分布,X 是观测数据,Z 是未知的潜在变量。
DL:RBM学习算法——Gibbs采样、变分方法、对比散度、模拟退火
RBM学习方法 当前在对RBM 的研究中,典型的学习方法有Gibbs 采样(Gibbs sampling)算法,变分近似方法(variational approach),对比散度(contrastive divergence,CD)算法,模拟退火(simulate annealing) 算法等。下面对这些方法进行对比。 1、Gibbs采样算法 (1)简介 G
正向KL散度与反向KL散度
KL散度的公式是 KL[p(x)∣∣q(x)]=∫xp(x)logp(x)q(x)dx KL[p(x)||q(x)] = \int_{x}p(x)log{p(x) \over q(x)}dx KL[p(x)∣∣q(x)]=∫xp(x)logq(x)p(x)dx 假设真实分布为p(x)p(x)p(x),我们想用分布q(x)q(x)q(x)去近似p(x)p(x)p(x),我们很容易想到用最小化KL散度来求,但由于KL散度是不对称的,所以并不是真正意义上的距离,那么我们是应该用KL[p∣∣q]KL[p||q]
大模型知识蒸馏(Qwen2.5系列模型KL散度蒸馏)
结合公式来看,当p增大时,为了使得kl散度小,则q也需要增大,但是当p趋于0时,无论q取任何值,kl散度都比较小,因为此时p(x)log((p(x)/q(x)))的大小主要受p(x)控制,这样起不到优化q分布的效果,可能会使q分布高估p分布中概率低的位置。p为教师模型的概率分布,q为学生模型的概率分布,当p趋于零时,为了使kl散度小,q也需趋于0。将待压缩的模型作为教师模型,将体积更小的模型作为学生模型,让学生模型在教师模型的监督下进行优化,将学生模型学习到教师模型的概率分布,然后通过。
Jensen-Shannon散度(JS散度)
Jensen-Shannon散度是一种改进的、对称的概率分布相似性度量,能够有效克服KL散度的局限性。它具有非负性、对称性和有界性等良好性质,广泛应用于机器学习、自然语言处理、生物信息学和信息论等领域。JS散度的直观含义是通过比较两个分布与它们的中间分布的差异,来量化两个分布之间的相似性。
非技术区
23,404
社区成员
70,512
社区内容
发帖
与我相关
我的任务
非技术区
Java 非技术区
复制链接
扫一扫
分享
社区描述
Java 非技术区
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章