社区
今天深度学习了吗
论文
帖子详情
CogVideoX - 大规模基于扩散Transformer的文字到视频生成模型
怪侠说不说
优质创作者: 编程框架技术领域
领域专家: C/C++技术领域
2024-10-14 10:09:44
CogVideoX - 大规模基于扩散Transformer的文字到视频生成模型
...全文
64
回复
打赏
收藏
CogVideoX - 大规模基于扩散Transformer的文字到视频生成模型
CogVideoX - 大规模基于扩散Transformer的文字到视频生成模型
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
Cog
Video
X: Text-to-
Video
Diffusion Models with An Exp
er
t
Transform
er
论文精读
本文介绍
Cog
Video
X,一种基于
扩散
Transform
er
的
大规模
文本到
视频
生成
模型
。通过3D因果VAE压缩时空信息,结合专家自适应Lay
er
Norm和3D全注意力机制,有效提升文本-
视频
对齐与长时连贯性。采用渐进式训练策略支持多分辨率与时长输入,显著增强
生成
质量与动态表现力。
【202503】Wan:开放且先进的
大规模
视频
生成
模型
【1.3B、14B】【支持对无限长度
视频
进行稳定的Inf
er
ence】【Wan中的主要计算开销来自注意力机制】
Wan是阿里巴巴推出的开源
大规模
视频
生成
模型
系列,包含1.3B和14B两个参数规模版本,基于Diffusion
Transform
er
架构,创新性引入时空变分自编码器(VAE)、可扩展预训练策略与自动化评估指标。支持图像到
视频
、指令驱动编辑、个性化
生成
及中英文视觉文本
生成
,1.3B
模型
仅需8.19GB显存即可在消费级GPU运行,14B
模型
在多基准测试中显著超越现有开源及商业方案。
Wan:基于DiT与时空VAE的多模态
视频
生成
模型
实战解析
Wan是一款开源多模态
视频
生成
模型
,融合Diffusion
Transform
er
(DiT)与自研时空VAE,实现高效
视频
压缩与高质量
生成
。其核心技术包括因果结构的3D时空VAE、基于Flow Matching的DiT主干、三重过滤数据流水线及多维并行训练策略。推理端支持
扩散
缓存、FP8/INT8量化与Stream
er
流式架构,并提出面向动态性、图像质量与指令遵循的Wan-Bench评估体系。
视频
生成
模型
赋能机器人预演操作,微软
Video
VLA系统解析
微软
Video
VLA系统将
视频
生成
模型
用于机器人控制,通过双重预测机制(动作规划+视觉结果
生成
)实现任务前“脑内预演”。系统基于
扩散
变换器架构,融合T5文本编码与3D-causal VAE视觉编码,在仿真与真实环境中展现出强泛化能力与跨机器人技能迁移能力。其核心依赖
视频
生成
模型
隐含的物理世界理解,但受限于推理速度(~3Hz)及复杂长期任务处理能力。
VLA-2025-03:GR00T N1【骨架:Eagle-2;端到端双系统VLA:S2 VLM+S1 DiT+FM;数据:单/双臂+人形,机器人+人类+仿真+神经共592.9M帧/8375.7小时】
GR00T N1是一个面向通用人形机器人的开放视觉-语言-动作(VLA)基础
模型
,采用双系统端到端架构:System 2为10Hz视觉语言模块(VLM),负责环境理解与任务解析;System 1为
扩散
Transform
er
模块,基于动作流匹配
生成
实时运动指令。
模型
融合真实机器人轨迹、人类
视频
及合成数据(共592.9M帧),支持跨具身泛化,在RoboCasa、DexMG等仿真基准及GR-1真实机器人上验证了语言条件双手操作的高效性。
今天深度学习了吗
37,482
社区成员
157
社区内容
发帖
与我相关
我的任务
今天深度学习了吗
深度学习相关博客和资源~
复制链接
扫一扫
分享
社区描述
深度学习相关博客和资源~
人工智能
图像处理
深度学习
个人社区
浙江省·杭州市
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章