我要提问
BIG DATA TRACK

大数据开发

覆盖数据采集、存储、计算与可视化全链路,从离线批处理到实时流计算,构建完整的数据工程能力。

CORE DIRECTIONS

大数据 四大核心方向

从数据进来到数据用出去,每个方向都有清晰的工程链路与典型组件。

数据采集与同步链路

DIRECTION / 01

数据采集与同步

用 Flume、Filebeat、Canal 与 CDC 工具把日志、数据库变更统一汇入 Kafka,构建可重放、可扩展的数据入口层。

FlumeCanalKafkaCDC

DIRECTION / 02

离线批处理

基于 Hive 数仓分层与 Spark 批计算,构建 T+1 离线指标体系,理解 Shuffle 调优与数据倾斜治理。

HiveSpark数仓分层Shuffle
离线批处理数仓分层
实时流计算链路

DIRECTION / 03

实时流计算

用 Flink 实现 window、状态计算与 exactly-once,结合水位线处理乱序事件,构建秒级延迟的实时指标。

FlinkWatermarkStateexactly-once

DIRECTION / 04

数据服务与可视化

用 ClickHouse、StarRocks 提供 OLAP 查询,配合 BI 看板把数据交付到业务决策环节,闭环数据价值。

ClickHouseStarRocksOLAPBI
数据服务与可视化看板
SELECTED ARTICLES

大数据精选 深度文章

从计算引擎到数据湖,覆盖数据工程高频实战议题。