百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

增量数据同步工具Debezium介绍

moboyou 2025-04-07 17:42 7 浏览

Debezium能做什么

RedHat开源的Debezium是一个将多种数据源实时变更数据捕获,形成数据流输出的开源工具。
它是一种CDC(Change Data Capture)工具,工作原理类似大家所熟知的Canal, DataBus, Maxwell等,是通过抽取数据库日志来获取变更的。
官方介绍为:

Debezium is an open source distributed platform for change data capture. Start it up, point it at your databases, and your apps can start responding to all of the inserts, updates, and deletes that other apps commit to your databases. Debezium is durable and fast, so your apps can respond quickly and never miss an event, even when things go wrong

为什么选择Debezium

笔者所在公司以PostgreSQL为源的实时同步需求较多。在对比各项同步工具之前,先来看看具体业务。

业务场景1:系统去O
要求使用PostgreSQL替换Oracle,使用GoldenGate搭建Oracle到PostgreSQL正向实时同步链路,待数据追平,将业务切换到PostgreSQL库,达成去O目的。若系统切换到PostgreSQL后存在问题,需要工具搭建PostgreSQL到Oracle的回退链路

业务场景2:不同BU子系统之间协作
数据库均为Postgres,系统B需要系统A的业务数据,但是由于网络拓扑复杂,库体积较大,如果以接口的形式提供数据,不仅需要增加额外的开发,同时会对A库造成一定压力,系统A无法接受,此时需要工具搭建不同BU之间PostgreSQL之间的同步,并要求对源库影响较小

业务场景3:OLAP、数仓
需要将PostgreSQL数据接入大数据平台,接入点为Kafka,消费逻辑由下游应用自行实现

因此,对于不支持PostgreSQL的工具,我们没有采用。
是否采用抽取日志这种实时同步的方式,取决于同步表变更数据量÷整库总变更数据量的比例,比例越高,非同步表的大事务越少,越推荐采用。否则,采用业务时间戳或触发器等准实时同步手段进行同步。
本文仅讨论抽取日志实时同步的工具。
我们对比了4种CDC工具,其中GoldenGate简称ogg,Debezium简称dbz,DataPipeline简称dp。对比如下:


支持的数据源、目标类型

对比项

GoldenGate

Debezium

DataPipeline

Pglogical

Mysql

源/目标

源/目标

/

Oracle

源/目标

源(不成熟)

源/目标

/

PostgreSQL

目标

源/目标

源/目标

Kafka

目标

目标

目标

/

SQLServer

目标

目标

/

MongoDB

目标


/

Hive/HBase/Hdfs

目标

/

目标

/

主要功能对比

对比项

GoldenGate

Debezium

DataPipeline

Pglogical

license

商业收费,oracle原厂支持

开源免费,非常活跃,迭代速度极快

商业收费,原厂支持

开源免费,迭代速度较快

DDL同步

MySQL,Oracle

MySQL,SQLServer

有限支持

PostgreSQL

双向同步

Y

N

有限支持

N

主键/唯一约束冲突处理

Y

需消费端自行实现

Y

Y

要求与源库装在同一台机器,目标库版本不低于源库

必须

初始化批量同步

initial load

snapshot

支持

copy

web界面

N

N

Y

N

数据幂等性

Y

需消费端自行实现

Y

Y

监控策略

命令行/monitor

http接口

web界面

命令行

调优策略

修改配置

较复杂

修改配置

修改配置

结构迁移

N

N

Y

N

通过对比综合考虑,我们最终决定
PostgreSQL->PostgreSQL的同步,目标库版本不低于源库版本,使用开源工具Pglogical
PostgreSQL->非PostgreSQL的同步,或高版本PostgreSQL->低版本PostgreSQL,使用Debezium + Kafka + 自行开发消费端

目前我们共有9条链路,2600多张表,通过Debezium进行同步。当然,此过程中碰到许多问题,笔者在后续文章中也会挑选一些有代表性的问题来阐述。

Debezium抽取原理



PostgreSQL在9.4版本推出了logical decoding功能,使得外部应用抽取并解析数据库的wal日志成为可能,我们称作逻辑流复制:

https://www.postgresql.org/docs/9.4/logicaldecoding.html

若想使用此功能,首先需要在数据库安装logical decoding插件,例如wal2json:

https://github.com/eulerto/wal2json

然后,以java应用为例,应用需使用PostgreSQL JDBC驱动包的逻辑流API,来获取logical decoding插件传输过来的events。相对于普通应用无法解析物理流复制而言,逻辑流复制的events是可以解析的,Debezium也正是利用了这一点,做到抽取的。
Debezium抽取并解析这些events之后,将其序列化存储到kafka,供下游消费程序使用。



作者:nchuxyz
链接:
https://www.jianshu.com/p/61e604299b5e

来源:简书
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。

相关推荐

一种直扩MSK信号的二维联合捕获方法

袁美娟,蒋芸茹,施镇峰,孙红磊,鲍昱蒙,蔡雨琦(南京理工大学电子工程与光电技术学院,江苏南京210094)摘要:针对直扩MSK信号的特殊性以及高动态环境下载波多普勒频偏对伪码捕获的影响,提出了一...

基于动态分块阈值与双重VAD检测的时频域自适应去噪算法

基于动态分块阈值与双重VAD检测的时频域自适应去噪算法(MATLAB)动态分块阈值:采用SURE准则优化块尺寸与阈值双重VAD检测:粗精两级语音活动检测提升噪声估计精度时频域自适应:结合IMCRA噪声...

JECE审稿意见太狠如何回复?

期刊关键参数ISSN2213-1388|IF=5.2|Q1区版面费2200美元|年发文1200+结构化应对框架回复信三要素:1.致谢+总结改进(例:"感谢指出模型验证不足,已补充三组对比实...

三维基因组: SELFISH 差异分析

引言本系列主要讲解3D-Genome(Hi-C)系列的分析,主要涉及三维基因组分析中的数据处理,重复性评估,Compartment/TAD/Loop检测,差异分析等,欢迎关注!SELFISHS...

电力EI会议,高录用技巧公开!

【推荐会议】IEEE电力与能源协会年会(PESGM)会议号:IEEEConference#PE-2026截稿时间:2026年1月15日举办时间与地点:2026年7月26日-30日·美国丹...

浅谈船舶交流电网在线绝缘监测装置研究

摘要:针对船舶供电系统电缆的绝缘状态问题,设计了一款电缆绝缘在线监测装置。装置采用低频交流注入法,在IT系统的中心点注入低频的交流信号,通过取样电路和A/D量化检测注入信号在电路中的响应,采用FIR滤...

使用Simulink学习STM32-(1)点亮一颗LED实验

本次实验系统环境Matlab版本:2021b系统环境:Win10专业版硬件平台:YF-STM32-ALPHA1R4模型与原理图simulink模型如图5.1所示,实验现象为PB8以0.5S周期反...

利用Proteus仿真STM32实现DHT11温湿度检测

1.前言Proteus是英国著名的EDA工具(仿真软件),从原理图布图、代码调试到单片机与外围电路协同仿真,一键切换到PCB设计,真正实现了从概念到产品的完整设计。是世界上唯一将电路仿真软件、PC...

使用ADSP-CM408F ADC控制器的电机控制反馈采样时序

简介本应用笔记介绍ADSP-CM408F模数转换器控制器(ADCC)模块的主要特性,重点讨论该产品在高性能电机控制应用的电流反馈系统中的相关性与可用性。本应用笔记的目的是为了强调模数转换器(DAC)模...

基于DSP的主动降噪系统设计与实现

摘要:针对发动机等工作时产生的周期噪声,进行主动降噪系统设计与实现。主要工作为降噪程序的设计和基于DSP的硬件实现。其中降噪程序采用自适应算法中的反馈滤波-X-最小均方算法,对此算法进行了简要讲解...

怎样消除薄膜收放卷上的静电

》收放卷常见静电危害!收放卷应用贯穿所有行业,无论是塑料薄膜、纸张、还是纺织品。而在快速收放卷的过程中,物料与辊之间会产生大量的摩擦、剥离、挤压,使物体表面积聚不同电性的静电荷,且随速度增加和时长增加...

电力EI会议,这些刊慎投!

推荐优质会议:ICPEET2025(电力工程与智能技术国际会议)会议号:IEEE-CPS#0123截稿时间:2025年4月30日召开时间/地点:2025年8月15-17日·成都论文集上...

电工布线现场工程图,简直就是手工艺术品展览

今天我们就来分享一波电工布线图,简直是一道道手工艺术品展览!电工布线是被很多人忽略的一个项目,其实这也是个技术活,因地制宜地设计布线方案、而且要同时注重美观和实用,同时要求具有一定的可扩展性。更多电工...

基于FPGA的伪随机序列发生器设计

基于FPGA的伪随机序列发生器设计1基本概念与应用1)LFSR:线性反馈移位寄存器(linearfeedbackshiftregister,LFSR)是指给定前一状态的输出,将该输出的线性...

五种算法(DBO、LO、SWO、COA、LSO、KOA、GRO)路径规划MATLAB

五种算法(DBO、LO、SWO、COA、LSO、KOA、GRO)求解无人机路径规划MATLAB