阿里出品otter-同步数据量6亿涉及200+个数据库实例之间的同步_sql

otter已在阿里云推出商业化版本数据传输服务DTS，开通即用，免去部署维护的昂贵使用成本。DTS针对阿里云RDS、DRDS等产品进行了适配，解决了Binlog日志回收，主备切换、VPC网络切换等场景下的同步高可用问题。同时，针对RDS进行了针对性的性能优化。出于稳定性、性能及成本的考虑，强烈推荐阿里云用户使用DTS产品。DTS产品使用文档

阿里巴巴B2B公司，因为业务的特性，卖家主要集中在国内，买家主要集中在国外，所以衍生出了杭州和美国异地机房的需求，同时为了提升用户体验，整个机房的架构为双A，两边均可写，由此诞生了otter这样一个产品。

otter第一版本可追溯到04~05年，此次外部开源的版本为第4版，开发时间从2011年7月份一直持续到现在，目前阿里巴巴B2B内部的本地/异地机房的同步需求基本全上了otte4。

名称：otter ['ɒtə(r)]

译意：水獭，数据搬运工

语言：纯java开发

定位：基于数据库增量日志解析，准实时同步到本机房或异地机房的mysql/oracle数据库. 一个分布式数据库同步系统

原理描述：

1. 基于Canal开源产品，获取数据库增量日志数据。什么是Canal, 请点击

2. 典型管理系统架构，manager(web管理)+node(工作节点)

a. manager运行时推送同步配置到node节点

b. node节点将同步状态反馈到manager上

3. 基于zookeeper，解决分布式状态调度的，允许多node节点之间协同工作.

上层的是分布式数据库分表分库中间件，负责和上层应用打交道，对应用可表现为一个独立的数据库，而屏蔽底层复杂的系统细节。分布式数据库中间件除了基本的分表分库功能，还可以丰富一下，比如讲读写分离或者水平扩容功能集成在一起，或者比如读写分离本身也可以作为一个独立的中间件。（Cobar, MyCAT, TDDL, DRDS, DDB）

增量数据订阅和消费，用户对数据库 *** 作，比如DML, DCL, DDL等，这些 *** 作会产生增量数据，下层应用可以通过监测这些增量数据进行相应的处理。典型代表Canal，根据MySQL的binlog实现。也有针对Oracle(redolog)的增量数据订阅与消费的中间件。（Canal, Erosa）

数据库同步中间件涉及数据库之间的同步 *** 作，可以实现跨（同）机房同步以及异地容灾备份、分流等功能。可以涉及多种数据库，处理之后的数据也可以以多种形式存储。（Otter, JingoBus, DRC）

数据库与数据库之间会有数据迁移（同步）的动作，同款数据同步原理比较简单，比如MySQL主备同步，只要在数据库层进行相应的配置既可，但是跨数据库同步就比较复杂了，比如Oracle->MySQL. 数据迁移一般包括三个步骤：全量复制，将原数据库的数据全量迁移到新数据库，在这迁移的过程中也会有新的数据产生；增量同步，对新产生的数据进行同步，并持续一段时间以保证数据同步；原库停写，切换新库。将“跨数据库”这个含义扩大一下——“跨数据源”，比如HDFS, HBase, FTP等都可以相互同步。（yugong, DataX）

otter和itour两种一般情况下otter准确一点。

一般来说，我们对于数据库最主要的要求就是：数据不丢。

不管是主从复制，还是使用类似otter+canal这样的数据库同步方案，我们最基本的需求是，在数据不丢失的前提下，尽可能的保证系统的高可用，也就是在某个节点挂掉，或者数据库发生主从切换等情况下，我们的数据同步系统依然能够发挥它的作用_数据同步。

通过阅读文档和源码，我们可以知道，对于一个canalserver，基础的框架包括以下几个部分：MetaManager、EventParser、EventSink和EventStore。其中EventParser的作用就是发送dump命令，从mysql数据库获取binlog文件。发送dump命令，可以指定时间戳或者position，从指定的时间或者位置开始dump。

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/sjk/6926167.html

阿里出品otter-同步数据量6亿涉及200+个数据库实例之间的同步

发表评论

评论列表（0条）