大数据开发工程师 东莞 职能部门类 本科及以上 3-5 年 职位描述 (1)大数据开发1、负责大数据离线开发,使用Sqoop等组件开发每日离线数据采集任务,使用Hive/Spark SQL编写ETL作业过程,处理各种复杂的业务逻辑,根据业务逻辑配置合理的调度顺序;2、负责大数据实时开发,使用Flink/Spark实时计算引擎开发实时流作业,读取接口/文本/数据库日志/消息队列中间件等数据源,经过业务逻辑加工处理后写入大数据平台;3、保障数据产出时效稳定,每天监控数据产出时间,采取调度链路优化,作业优化,SQL优化等手段,提升数据产出效率。(2)集团数据资产建设1、根据各个业务领域项目推进过程中沉淀的数据分析体系,维护成可方便检索,查找和应用的数据资产,包含业务口径,出数频率,数据样例等关键业务和技术元数据;2、根据数据分析师提供的数据质量规则,开发相应的数据校验程序,确保跑数完成后即刻校验,确保高质量的数据资产;3、生成相应的数据服务接口,可供前端应用,BI工具和业务系统调用。(3)数据仓库模型设计1、根据业务领域数据特征以及维度建模的方法,横向划分数据仓库分析主题域,纵向划分层次,达成数据重复利用率高且能快速开发数据需求的目的;2、定义各个数仓分层,考虑数据写入和查询的性能,提升作业的运行速度,报表查询数据时的高复用性和易扩展性;3、通过合理的数据模型设计,提高数据的查询性能和分析效率,降低维护成本。(4)制定规范1、制定公司数据仓库架构设计原则,输出数据仓库模型设计的基本原则;2、制定公司数据开发的开发规范。 职位要求 (1)教育程度:本科毕业3年以上,计算机,信息工程,数学等相关专业毕业;(2)相关经验:具有3年以上大数据开发相关经验;(3)专业能力:1.具备数据仓库架构和设计能力,熟悉维度建模的方法;2.良好的沟通和逻辑思维能力,能够对业务需求进行抽象并据此进行架构设计;3.有过数据资产目录建设和维护的经验;4.熟悉大数据离线和实时开发使用的组件,Hive、Spark、Flink等,熟悉分布式计算和存储的相关原理及高可用机制原理,并可独立排查故障问题;5.熟练使用Dataworks,DolphiScheduler,kettle或其它数据开发工具中的一种;6.熟悉SQL的执行原理,具备优化复杂SQL的能力;7.掌握shell,python,java等编程语言中的一种;8.具有很好的沟通表达能力,勤奋好学,具有很好的团队合作意识。 职位信息 部门: 集团IT部 招聘数量: 1 投递...
数据仓库工程师 深圳 社招 全职 职位描述 1、负责企业级数据仓库及业务数据集市的架构规划、分层设计(ODS/DWD/DWS/ADS)与落地实施,确保架构的先进性、可扩展性与高性能。2、主导核心业务域的数据建模工作,精通维度建模等方法论,设计通用灵活的数据模型与宽表,保障数据的一致性、完整性与复用性。3、设计并实现高效的ETL/ELT数据集成方案,负责数据提取、转换、加载全流程的开发、调度与优化,解决大规模数据处理中的性能瓶颈。4、推进数据治理体系建设,包括数据质量监控、元数据管理、数据血缘追踪、指标体系标准化等,提升整体数据质量与数据资产价值。5、负责数据仓库的日常运维与故障排查,保障数据服务SLA达标,及时响应并解决数据延迟、数据错误等线上问题,确保数据链路稳定可靠。6、深入理解业务需求,与数据分析、业务部门紧密协作,提供高质量的数据支持与解决方案,支撑业务决策、数据产品迭代及精细化运营。 职位要求 一、基础要求1、本科及以上学历,计算机科学、数据科学、信息技术等相关专业。2、3-7年及以上数据仓库设计与开发经验,有完整的企业级数据仓库建设项目经验优先。3、具备强烈的责任心、严谨的逻辑思维、良好的沟通协调能力及团队协作精神,对数据敏感,重视数据质量。二、 技术能力1、精通数据仓库理论体系,深入理解分层架构、主题域建模、维度建模等方法论,能结合业务场景设计合理的数据模型。2、精通SQL/HQL/Spark SQL开发及优化,能高效处理TB/PB级大规模数据集,具备复杂查询性能调优实战经验。3、熟悉大数据生态技术栈,具备Hadoop、Hive、Spark、Flink、Kafka等组件的实战应用经验;了解MPP数据库(ClickHouse、Doris)、OLAP引擎(Kylin、Presto)者优先。4、掌握Java/Python/Scala中的至少一种编程语言,具备良好的代码规范与工程化能力;熟悉ETL工具(DataX、Airflow、Kettle)及任务调度系统者优先。5、具备数据治理相关经验,熟悉数据质量监控、元数据管理、数据血缘分析等工具(如Apache Atlas、Griffin)的使用者优先。三、加分项1、有互联网、金融、电商等行业数据仓库建设经验者优先。2、有数据字典、指标管理体系从0到1搭建经验者优先。 投递...
负责企业数据仓库的设计、开发、维护与优化,搭建符合业务需求的数仓架构,实现多源数据的整合、清洗、转换与加载(ETL),保障数据的准确性、完整性和时效性,支撑企业数据资产沉淀与治理工作。 负责BI报表全流程开发,包括需求梳理、指标定义、数据提取、可视化制作,设计交互式仪表盘、常规报表及专项分析报表,满足业务部门的数据分析与决策支持需求,将 raw 数据转化为可落地的业务洞察。 运用Python或Java语言进行数据开发、脚本编写,优化数据处理流程,提升数据开发效率与系统性能,解决数据开发及BI报表制作过程中的技术难题。 配合业务部门梳理数据需求,提供数据咨询与技术支持,推动数据驱动业务决策,参与数据质量监控与优化,建立数据校验机制,处理数据异常问题。 参与跨部门协作项目,使用英语作为工作语言开展沟通,包括对接海外团队、查阅英文技术文档、撰写英文技术报告等,确保跨区域、跨团队的数据相关工作顺畅推进。 关注行业数据技术发展趋势,引入合适的技术与方法,持续优化数仓架构、ETL流程及BI报表体系,提升数据服务能力。 Requirements 本科及以上学历,计算机、数据科学、统计学、信息管理等相关专业优先; 具备5年及以上数据BI开发与数据仓库开发相关工作经验,有完整的数仓搭建与BI报表全流程开发实战经验,熟悉数仓分层建模(ODS、DW、DM层)方法论者优先。 精通SQL,熟练使用主流数据库(如MySQL、Oracle、Hive等),具备复杂SQL编写、优化及数据库性能调优能力; 熟悉Python或Java编程语言,能够运用其进行数据处理、脚本开发、ETL流程优化,有相关项目实战经验; 熟练掌握BI工具(如Tableau、Power BI、FineBI等),能够独立完成从数据提取、清洗到可视化报表制作、仪表盘设计的全流程工作,了解可视化设计最佳实践者优先; 熟悉ETL工具(如Kettle、Informatica等),掌握数据抽取、转换、加载的核心逻辑与优化方法,能够处理复杂数据集成场景; 具备良好的业务理解能力,能够快速梳理业务需求,将业务需求转化为数据开发与BI报表需求,具备指标体系构建能力者优先; 熟悉Big query生态者更佳。 英语可作为工作语言,能够熟练阅读英文技术文档,具备良好的英语听说读写能力,可独立使用英语开展跨部门、跨区域沟通,完成英文邮件、技术报告撰写及会议沟通等工作。...