业务数据是数据仓库的重要数据来源,我们需要每日定时从业务数据库中抽取数据,传输到数据仓库中,之后再对数据进行分析统计。
为保证统计结果的正确性,需要保证数据仓库中的数据与业务数据库是同步的,离线数仓的计算周期通常为天,所以数据同步周期也通常为天,即每天同步一次即可。
数据的同步策略有全量同步和增量同步。
二、全量同步全量同步,就是每天都将业务数据库中的全部数据同步一份到数据仓库,这是保证两侧数据同步的最简单的方式。
三、增量同步增量同步,就是每天只将业务数据中的新增及变化数据同步到数据仓库。采用每日增量同步的表,通常需要在首日先进行一次全量同步。
四、策略对比同步策略
优点
缺点
全量同步
逻辑简单
在某些情况下效率较低。例如某张表数据量较大,但是每天数据的变化比例很低,若对其采用每日全量同步,则会重复同步和存储大量相同的数据。
增量同步
效率高,无需同步和存储重复数据
逻辑复杂,需要将每日的新增及变化数据同原来的数据进行整合,才能使用
工具
DataX/Sqoop
Maxwell/Canal
对数据库的要求
原理是基于查询,故若想通过select查询获取新增及变化数据,就要求数据表中存在create_time、update_time等字段,然后根据这些字段获取变更数据。
要求数据库记录变更 *** 作,例如MySQL需开启binlog。
数据的中间状态
由于是离线批量同步,故若一条数据在一天中变化多次,该方案只能获取最后一个状态,中间状态无法获取。
由于是实时获取所有的数据变更 *** 作,所以可以获取变更数据的所有中间状态。
DataX/Sqoop适用于全量同步,Maxwell/Canal适用于增量同步
欢迎分享,转载请注明来源:内存溢出
评论列表(0条)