数据仓库针对事实表的历史数据变更处理方式

z184931481 2018-03-06 03:06:35
环境用的是SQL Server做物理存储,ETL用的是Kettle,通常在会对业务数据进行抽取做事实表,但业务数据每一天都会有变更(新增,修改,删除),想准备对这张事实表上的字段做对比,然后将变化的字段作为异动记录存储到另一个事实表中,请问如果是这种做法应该怎么做,还有其他更好的解决方法吗?
...全文
4075 3 打赏 收藏 转发到动态 举报
写回复
用AI写文章
3 条回复
切换为时间正序
请发表友善的回复…
发表回复
xphDeV 2018-03-23
  • 打赏
  • 举报
回复
可以考虑拉链表的做法,
好难取名 2018-03-14
  • 打赏
  • 举报
回复
你不对原始表做修改,那么你只抓增量,在旧表中存在的不就是变更数据么。变更的你直接存在另一张表就行了啊
z184931481 2018-03-07
  • 打赏
  • 举报
回复
顶一个没人回答吗
阿⾥巴巴⼤数据之路-⼤数据领域建模综述 阿⾥巴巴⼤数据之道-⼤数据领域建模综述 为什么要数据建模? Linux 的创始⼈ Torvalds 有⼀段关于"什么才是优秀程序员"的话:"烂程序员关⼼的是代码,好程序员关⼼的 是数据 结构和它们之间的关系。" 数据建模的好处 性能 :良好的数据模型能帮助我们快速查询所需要的数据,减少 数据的 110 吞吐。 成本 : 良好的数据模型能极⼤地减少不必要的数据冗余,也能实 现计算结果复⽤,极⼤地降低⼤数据系统中的存储和计算成本。 效率 :良好的数据模型能极⼤地改善⽤户使⽤数据的体验,提⾼ 使⽤数据的效率。 质量 : 良好的数据模型能改善数据统计⼝径的不⼀致性,减少数 据计算错误的可能性。 OLTP 和 OLAP 建模区别 OLTP 主要数据操作是随机读写 主要采⽤满⾜ 3NF 的实体关系模型存储数据 在事务处理中解决数据的冗余和⼀ 致性问题 OLAP 主要数据操作是批量读写 事务处理中 的⼀致性不是 OLAP 所关注的 关注数据的整合,以及在⼀次性 的复杂⼤数据查询和处理中的性能 建模⽅法论 ER模型 简述 数据仓库之⽗ Bill lnmon 提出的建模⽅法是从全企业的⾼度设计⼀ 个 3NF 模型,⽤实体关系( Entity Relationship, ER)模型 描述企业业 务,在范式理论上符合 3NF。数据仓库中的 3NF 与 OLTP 系统中的 3NF 的区别在于,它是站在企业⾓度⾯向主题 的抽象,⽽不是针对某个具体 业务流程的实体对象关系的抽象。 特点 需要全⾯了解企业业务和数据。 实施周期⾮常长。 对建模⼈员的能⼒要求⾮常⾼。 建模步骤 ⾼层模型 ⼀个⾼度抽象的模型,描述主要的主题以及主题间的 关系,⽤于描述企业的业务总体概况。 中层模型 在⾼层模型的基础上,细化主题的数据项。 物理模型(也叫底层模型) 在中层模型的基础上,考虑物理存 储,同时基于性能和平台特点进⾏物理属性的设计,也可能做⼀ 些表的合并、分区的设计 等。 维度模型 简述 维度模型是数据仓库领域的 Ralph Kimball ⼤师所倡导的,他的 The Data 阳rehouse 岛olkit-The Complete Guide to Dimensional Modeling 是 数据仓库⼯程领域最流⾏的数据仓库建模的经典。 特点 从分析决策的需求出发构建模型,为分析需求服务 具有较好的⼤规模复 杂查询的响应性能 其典型的代表是星形模型,以及在⼀些特殊场景下 使⽤的雪花模型 模型分类 雪花模型 星型模型 星座模型 建模步骤 选择需要进⾏分析决策的业务过程 业务过程可以是单个业务事 件,⽐如交易的⽀付、退款等;也可以是某个事件的状态,⽐如 当前的账户余额等;还可以是⼀ 系列相关业务事件组成的业务流 程,具体需要看我们分析的是某些事件发⽣情况,还是当前状态, 或是事件流转效率。 选择粒度 在事件分析中,我们要预判所有分析需要细分的程度,从⽽决定选择的粒度。粒度是维度的⼀个组合。 识别维表 选择好粒度之后,就需要基于此粒度设计维表,包括 维度属性,⽤于分析时进⾏分组和筛选。 选择事实 确定分析需要衡量的指标。 Data Vault 模型 简述 Data Vault 是 Dan Linstedt 发起创建的⼀种模型,它是 ER 模型的衍 ⽣,其设计的出发点也是为了实现数据的整合,但不能直 接⽤于数据分 析决策。 特点 可审计的基础数据层 数据的历史 性、可追溯性和原⼦ ⽽不要求对数据进⾏过度的⼀致性处理和整合 基于主题概念将企业数据进⾏结构化组织 组成部分 Hub 是企业的核⼼业务实体,由实体 key、数据仓库序列代理 键、装载时间、数据来源组成。 Link 代表 Hub 之间的关系。这⾥与 ER 模型最⼤的区别是将关 系作为⼀个独⽴的单元抽象,可以提升模型的扩展性。它可以直 接描述 1 : 1 、 l :n 和 n:n 的关系,⽽不需要做任何变更。它由 Hub 的代理键、装载时间、数据来源组成。 Satellite 是 Hub 的详细描述内容, ⼀个 Hub 可以有多个 Satellite。 它由 Hub 的代理键、装载时间、来源类型、详细的 Hub 描述 信 息组成。 模型实例 Anchor 模型 简介 Anchor 对 Data Vault 模型做了进⼀步规范化处理, Lars. Ri:innback 的初衷是设计⼀个⾼度可扩展的模型,其核⼼思想是所有 的扩展只是添 加⽽不是修改,因此将模型规范到 6NF,基本变成了 k-v 结构化模型。 组成部分 Anchors 类似于 Data Vault 的 Hub ,代表业务实体,且只有主键。 Attributes 功能类似于 Data Vault 的 Satellite

7,388

社区成员

发帖
与我相关
我的任务
社区描述
其他数据库开发 数据仓库
社区管理员
  • 数据仓库
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧