工作职责:
1、架构设计:负责海量数据集成平台的 ETL/ELT 流水线设计与开发,确保数据从源端到湖仓的高效流转。
2、数仓建模:深度参与数据仓库体系建设,负责 ODS、DWD、DWS、ADS 各层级的逻辑建模与规范落地。
3、性能调优:通过 SQL 深度优化、Spark/Flink 参数调优,解决计算倾斜、数据延迟等核心技术瓶颈。
4、质量保障:构建全链路数据质量监控体系,编写自动化校验脚本,确保数据的准确性、完整性与一致性。
5、任务管理:负责 Airflow/DolphinScheduler 等调度平台的任务编排与生产保障,维护集群稳定运行。
任职要求:
1、核心功底:计算机相关专业本科,3 年以上数据开发经验;精通 SQL(具备复杂的存储过程编写与执行计划调优能力)。
2、编程能力:熟练掌握 Python、Java 或 Scala 其中一种,能编写高性能的数据处理脚本。
3、大数据技术:熟悉 Hive、Spark、Flink 等组件及其底层原理,具备处理 PB 级数据的实战经验。
4、建模理论:深刻理解 Kimball 或 Inmon 数仓建模理论,掌握主数据管理(MDM)与元数据管理。
5、加分项:
实时场景:有 Kafka + Flink 实时流计算开发经验者优先。
前沿技术:熟悉 Iceberg、Hudi 等数据湖技术或云原生湖仓一体架构。
行业背景:具有 汽车工业营销、复杂潜客线索处理 或大型互联网高并发数据经验者优先。