Refine Reset All
Sort by
Skills
Job Type
Employer/Recruiter
Salary Estimate
Date Posted
Skills
Job Type
Employer/Recruiter
Salary Estimate
All Filters

Python Spark Jobs In 深圳 - 14 Job Positions Available

1 – 13 of 14 jobs
HKEX jobs

Location:CN-Shenzhen-HyQ Shift:Standard - 40 Hours (China) Scheduled Weekly Hours:40 Worker Type:Permanent Job Summary:Lead the design and delivery of LME market data platforms that consolidate multiple real-time and historical market data sources into scalable enterprise data assets

HKEX  20 days ago
HKEX jobs

Location:CN-Shenzhen-HyQ Shift:Standard - 40 Hours (China) Scheduled Weekly Hours:40 Worker Type:Permanent Job Summary:This role is a critical part of the Enterprise data team involved in the replacement of legacy ETL (Informatica) tool by providing key data

HKEX  20 days ago
HKEX jobs

Location:CN-Shenzhen-HyQ Shift:Standard - 40 Hours (China) Scheduled Weekly Hours:40 Worker Type:Permanent Job Summary:Lead the design and delivery of LME market data platforms that consolidate multiple real-time and historical market data sources into scalable enterprise data assets

HKEX  20 days ago
Bambu Lab jobs

高级安全技术开发工程师(大数据) 深圳 全职 研发 职位描述 1. SOC大数据后端架构设计与开发: - 主导自研SOC系统的架构:设计分布式数据管道(事件摄入、存储、查询)、分析引擎(规则匹配、关联分析),实现实时/异步威胁检测与自动化响应。 - 构建数据湖/仓库:开发高性能数据处理服务,支持日志聚合(多源格式如JSON/Syslog)、ETL管道,确保数据一致性与低延迟索引。 - 集成业界安全能力:开发适配层,将EDR(端点事件流、原始日志)、DLP(敏感数据事件)、遥测工具(eBPF/Osquery)接入SOC,支持零信任底座的数据馈送(如访问策略日志)。 2. 大数据处理与安全分析集成: - 处理海量安全数据:优化实时/批处理管道(Kafka流处理、Flink/Spark计算),支持TB级日志分析(如全球分支EDR事件、产线RFID访问遥测、物理门禁日志)。 - 开发威胁狩猎与响应模块:基于图数据库(Neo4j)实现关联分析(如杀伤链追踪)、异常检测引擎;集成DLP规则引擎。 3. SOC系统快速迭代与优化: - 独立响应安全运营需求:从需求到部署的全栈开发(如新警报规则引擎、仪表盘API),目标快速交付,支持敏捷SOC演进。 - 构建可扩展数据框架:开发统一API(gRPC/REST)与插件系统,便于未来集成新数据源(如CTI威胁情报、UEBA用户行为);确保架构弹性(K8s容器化、水平扩展)。 - 系统性能运维:监控数据吞吐(ELK栈集成)、成本优化(数据压缩/分区),保障99.99%+可用性;处理全球数据合规(如数据驻留、匿名化)。 4. AI辅助大数据开发与智能提升: - 能够充分利用AI工具加速开发。 - 探索AI在SOC中的应用:集成机器学习引擎(如TensorFlow/Go bindings)实现智能告警(异常基线学习)、自动化响应(AI驱动隔离决策)、自然语言查询(LLM解析日志),提升威胁响应效率。 5. 跨团队协作与文档维护: -

Premium Full-time
Bambu Lab  19 days ago
Bambu Lab jobs

数据算法工程师 深圳 全职 研发 职位描述 职位描述1. 负责文本、语音、图像、视频等多类型数据的全生命周期管理,包括数据收集、清洗、标注、格式化等核心工作。搭建标准化、高效的数据处理流程,保障数据输出质量,为模型训练、推理及算法迭代提供稳定的数据支撑;2. 应用前沿的计算机视觉模型、多模态模型、大语言模型技术,优化数据标注流程,提升标注效率与精准度,降低标注成本;3. 基于业务场景构建专业的算法测试集体系,确保测试集能够真实反映算法实际应用场景的表现,输出客观的算法效果评估结果;基于测试集反馈,优化数据策略,持续提升模型性能。 职位要求 职位要求1. 精通数据清洗、标注、存储、管理全流程技术,具备实际的数据处理流程搭建或优化经验;2. 熟悉Linux操作系统环境,熟练掌握Python编程语言,能独立编写数据处理脚本;3. 具备极高的数据质量意识和严谨的工作态度,能够敏锐发现数据异常、标注偏差等问题,并推动问题落地解决;4. 具备良好的逻辑分析能力和沟通协作能力,能够跨团队对齐数据标准与需求。加分项1. 熟悉计算机视觉模型训练全流程,深刻理解数据质量、数据分布对模型训练效果的影响,有相关数据优化实践经验;2. 了解Spark、Flink等分布式数据处理框架,具备分布式数据处理项目落地经验优先;3. 熟悉LabelImg、LabelMe、LabelStudio等数据标注工具;4. 具备多模态数据处理经验,或有算法测试集构建、迭代优化相关经验者优先。 投递...

Premium Full-time
Bambu Lab  19 days ago
RayNeo jobs

AI数据研发工程师 深圳 全职 互联网 / 电子 / 网游 职位描述 1、负责用户context信息采集体系的搭建、优化与落地,设计多源数据采集方案(涵盖用户行为、设备信息、交互轨迹等),对接前后端业务模块,制定采集标准,保障采集数据的完整性、准确性和实时性。2、主导数据平台全流程搭建与运维,负责音频、视频等全天候数据的接收、解析、转码、存储及流转管理,搭建高可用、高可靠的数据链路,处理海量音视频及3、结构化数据,保障平台7×24小时稳定运行,支撑业务正常运转及数据供给。优化数据处理管道,针对音视频数据体积大、处理效率低等特性,制定优化方案,提升数据处理时效与存储利用率,输出标准化、高质量的数据,为大模型训练提供合规、可用的训练语料(音视频、用户行为相关数据等)。4、负责数据平台监控体系搭建与维护,配置关键指标(数据采集量、处理延迟、存储占用、链路稳定性)监控告警,快速响应并排查数据丢失、传输异常、系统卡顿等故障,保障数据供给不中断。5、协同业务团队、算法团队,梳理业务数据需求及大模型训练数据需求,优化数据筛选、脱敏、标注流程,输出贴合需求的数据解决方案,支撑业务决策与大模型迭代训练。6、负责数据平台架构迭代优化,引入合适的技术框架,提升平台扩展性、可维护性,适配业务增长及大模型训练的数据量级提升需求,保障数据安全合规。 职位要求 1、学历要求:本科及以上学历,计算机、大数据、软件工程等相关专业,1-3年及以上数据平台相关工作经验。2、技术能力:精通Flume、Logstash、Kafka等数据采集工具,熟练掌握Hadoop、Spark、Flink等大数据框架,具备音视频数据处理、用户context信息采集相关经验。3、运维能力:熟悉Docker、K8s容器化部署,具备全天候数据平台运维、性能优化及故障排查能力,能快速响应线上问题,保障平台高可用。4、存储与安全:熟悉HDFS、HBase、MySQL、MongoDB等存储方案,掌握数据脱敏、备份与恢复方法,了解数据安全合规相关要求,能保障数据安全。语言与工具:熟练使用Java、Python、Scala其中一种及以上编程语言,掌握Shell脚本编写,熟悉Prometheus、Grafana等监控工具者优先。5、业务理解:具备良好的业务敏感度,能快速理解数据平台对业务支撑、大模型训练的核心价值,具备较强的跨团队沟通协作能力和问题解决能力。6、加分项:有大模型训练数据供给、音视频全天候数据平台搭建相关经验者优先;熟悉数据分层设计、数据治理相关工作者优先。 投递...

Premium Full-time
RayNeo  16 days ago
Fastlane jobs

数据开发工程师 12-20KCNY/月 深圳 正式 互联网 / 电子 / 网游 职位描述 为什么这个职位与众不同? 传统的初级数据工程师,往往要在沉闷的数仓里写 3-5 年枯燥的 SQL 和 ETL 脚本才能出头 。但在这里,我们希望你作为真正的 AI 原住民,丢弃“人工路径依赖” ,熟练挥舞 Claude Code、Cursor、GitHub Copilot 等 AI Coding 魔法棒,把传统数据开发的效率直接拉升 3-5 倍 。在这里,你是没有历史包袱的 AI 生产力放大器,也将是我们未来数据工程专家的王牌蓄水池 。 你将要“折腾”什么?(岗位职责)1.

Premium Full-time ETL DTC BigQuery Python AI 240,000 CNY
Fastlane  13 days ago
智元创新(上海)科技有限公司 jobs

AI Infra工程师-灵犀业务部 深圳 正式 职位描述 灵犀是智元半尺寸人形机器人的核心产品线,也是智元最年轻、最具创新活力的团队之一。我们打造了智元首个爆款产品灵犀X2,累计销量超6000台。这里技术大牛汇聚、工程师文化浓厚,你将深度参与从技术创新、产品定义到规模化落地的全过程,与顶尖团队共同定义下一代人形智能交互服务终端。1、负责感知导航团队 AI 基础设施建设,支撑大规模端到端模型的数据、训练与推理全链路高效运转。2、数据管线:构建机器人多模态数据(图像、点云、轨迹、语言指令等)的采集、清洗、标注、存储与管理平台,打造高效的数据闭环。3、训练基建:搭建并优化大规模分布式训练框架,支持多机多卡训练、混合精度、并行策略(DP / TP / PP / FSDP),提升训练吞吐与资源利用率。4、推理基建:负责模型在机端 / 边缘 / 云端的高性能部署,实现模型量化、剪枝、蒸馏、算子优化与推理引擎集成(TensorRT / ONNX / TVM 等)。5、建设实验管理、模型版本管理与 CI/CD 流程,提升算法团队整体研发效率。 职位要求 1、2027 届本科及以上学历,计算机科学与技术、软件工程、电子信息等相关专业。2、扎实的计算机系统、数据结构与算法基础,熟悉 Linux 开发环境与分布式系统原理。3、熟悉以下至少一个方向并有实际经验:(1)大规模数据处理(Spark / Ray / 数据湖 / 流式处理);(2)分布式训练(PyTorch DDP

智元创新(上海)科技有限公司  10 days ago
Insta360 jobs

数据湖开发工程师 深圳 社招 全职 职位描述 1、负责企业级数据湖平台的设计、开发与运维,支撑海量数据存储与分析。2、基于 Iceberg/Lance 构建湖仓一体架构,提升数据管理能力。3、设计并实现数据全生命周期的加密方案(静态加密、传输加密、字段级加密),落地脱敏、分级分类、权限管控等安全机制,确保合规(GDPR / 等保 / 个保法)。4、参与数据治理体系建设,包括不限于数据质量、数据血缘、数据生命周期等能力建设。5、优化数据存储、计算性能及资源成本,保障平台稳定运行。6、推动数据湖与 AI、数据分析等业务场景结合落地。 职位要求 1、本科及以上学历,计算机/软件/数据相关专业,3年以上大数据/数据平台研发经验。2、熟练掌握 Java/Scala/Python 中至少一种开发语言。3、熟悉 Spark、Flink 等分布式计算框架及其运行原理。4、熟悉 Iceberg、Hudi等数据湖技术中的至少一种,有生产实践经验。5、熟悉 Kafka 等消息中间件及实时数据处理架构。6、熟悉分布式存储、对象存储及数据湖存储架构。7、熟悉 Docker、Kubernetes 等云原生技术优先。8、有完整的数据治理实践经验,熟悉 Atlas / DataHub / Amundsen 等元数据与血缘工具,了解 DAMA、DCMM 等方法论。9、熟悉数据加密与安全:对称/非对称加密、KMS、TDE、字段级加密、Tokenization、动态脱敏;了解 Ranger / Sentry 等权限框架。10、熟悉向量检索相关技术:主流向量数据库( Milvus /

Insta360  8 days ago
Insta360 jobs

数据仓库工程师 深圳 社招 全职 职位描述 1、负责企业级数据仓库及业务数据集市的架构规划、分层设计(ODS/DWD/DWS/ADS)与落地实施,确保架构的先进性、可扩展性与高性能。2、主导核心业务域的数据建模工作,精通维度建模等方法论,设计通用灵活的数据模型与宽表,保障数据的一致性、完整性与复用性。3、设计并实现高效的ETL/ELT数据集成方案,负责数据提取、转换、加载全流程的开发、调度与优化,解决大规模数据处理中的性能瓶颈。4、推进数据治理体系建设,包括数据质量监控、元数据管理、数据血缘追踪、指标体系标准化等,提升整体数据质量与数据资产价值。5、负责数据仓库的日常运维与故障排查,保障数据服务SLA达标,及时响应并解决数据延迟、数据错误等线上问题,确保数据链路稳定可靠。6、深入理解业务需求,与数据分析、业务部门紧密协作,提供高质量的数据支持与解决方案,支撑业务决策、数据产品迭代及精细化运营。 职位要求 一、基础要求1、本科及以上学历,计算机科学、数据科学、信息技术等相关专业。2、3-7年及以上数据仓库设计与开发经验,有完整的企业级数据仓库建设项目经验优先。3、具备强烈的责任心、严谨的逻辑思维、良好的沟通协调能力及团队协作精神,对数据敏感,重视数据质量。二、 技术能力1、精通数据仓库理论体系,深入理解分层架构、主题域建模、维度建模等方法论,能结合业务场景设计合理的数据模型。2、精通SQL/HQL/Spark SQL开发及优化,能高效处理TB/PB级大规模数据集,具备复杂查询性能调优实战经验。3、熟悉大数据生态技术栈,具备Hadoop、Hive、Spark、Flink、Kafka等组件的实战应用经验;了解MPP数据库(ClickHouse、Doris)、OLAP引擎(Kylin、Presto)者优先。4、掌握Java/Python/Scala中的至少一种编程语言,具备良好的代码规范与工程化能力;熟悉ETL工具(DataX、Airflow、Kettle)及任务调度系统者优先。5、具备数据治理相关经验,熟悉数据质量监控、元数据管理、数据血缘分析等工具(如Apache Atlas、Griffin)的使用者优先。三、加分项1、有互联网、金融、电商等行业数据仓库建设经验者优先。2、有数据字典、指标管理体系从0到1搭建经验者优先。 投递...

Premium Full-time
Insta360  8 days ago
Anker Innovations jobs

大数据开发工程师 深圳、长沙 社招 全职 互联网 / 电子 / 网游 职位描述 1.承担数据应用的开发和治理等工作,负责数据需求整体解决方案的设计,包括数据采集、数据集成、数据建模、资产发布等;2.研究相关大数据前沿技术,结合业务需求,进行大数据平台组件的架构、优化,推动技术沉淀;负责对外技术沟通,提升数据研发能力;3.制定大数据技术规范,发布白皮书,负责建立团队内部以及团队之间的技术分享、协作和评审的流程和机制;4.负责大数据能力在业务上的落地。 职位要求 1.统招本科以上学历,3年以上大数据经验;2.熟悉大规模数据处理、分布式存储计算、数据建模,了解大数据前沿技术;具备2个以上大数据平台项目完整实践经验;深入理解常用的数据建模理论,有数据仓库模型建设经验优先;3.精通Sql、Hadoop、Hive、Spark、Flink、Kafka、Impala、Yarn、Zookeeper、OLAP技术等,熟悉Linux系统、Java或scala语言、Shell、 Python;4.有电商领域的大数据项目经验优先,有数据中台、技术中台建设等技术背景者优先,有Databricks和 aws技术栈的使用经验优先;5.有很强的学习、分析和解决问题能力、良好的团队意识和协作精神,有较强的内外沟通能力;6.喜欢和业务打交道,喜欢站在业务视角上去看技术问题,理解技术是为业务服务的;7.客户服务意识强,积极乐观坚韧,有较强的抗压能力。 投递...

Premium Full-time
Anker Innovations  1 day ago
Insta360 jobs

数据工程师-2027校招 深圳 校招 正式 职位描述 1、负责公司数据仓库建设与ETL开发,参与数仓分层建模、数据清洗、指标体系搭建;2、基于Hive/Spark SQL完成离线数据开发,协助实时数仓链路迭代,保障数据准时、稳定产出;3、承接业务数据分析、报表、看板数据需求,统一业务指标口径;4、参与数据治理、数据质量监控、异常排查,提升公司数据规范性与可用性。 职位要求 1、统招本科及以上,计算机、大数据、统计、软件工程等相关专业;2、SQL基础扎实,熟练关联查询、窗口函数、复杂统计,有SQL调优意识;3、了解数据仓库分层、维度建模基本思想;4、掌握Python基础,熟悉Linux常用命令;5、踏实好学、逻辑清晰,对大数据和数据业务感兴趣。 投递...

Premium Full-time
Insta360  1 day ago
正浩 EcoFlow jobs

AI算法工程师 深圳 正式 能源 / 矿产 / 环保 / 农林牧渔 研发 职位描述 1、能源场景数据分析:处理多源异构数据(如传感器数据、用电日志、气象数据等),挖掘能源发-储-配-用规律;2、储能AI算法研发:开发能源需求预测、需求响应、多设备调控算法,构建智慧化能源管理;3、智能交互算法研发:研发面向端、边、云的多模态(图像、语音、文本等)人机交互算法,构建个性化交互体验;4、参与建立AI辅助编程的标准化及基于dify/Aily构建自动化工作流建设;5、AI模型优化与部署:参与面向端-边-云各场景的模型性能失代,参与AI模型部署;6、跨团队协作与创新落地:推动AI算法与硬件的高效集成,参与家庭储能新功能概念验证及产品导入。 职位要求 1、2027届获得硕士及以上学历,计算机、数学或统计学等相关专业优先;2、在机器学习、深度学习、统计分析、大数据处理等领域有深入学习和一定个人实践;3、优秀的算法应用能力,包括特征提取、模型建立、效果评估、应用部署以及优化选代等环节;4、优秀的编程能力,至少熟悉一门常用语言及相关的算法库,如java、python、R等;5、对时间序列建模和营销场景推荐、效果预估、效果分析等领域有一定的经验优先;会使用spark、hadoop、hive等分布式计算优先;6、较强的业务敏感度,数据敏感度的优先。 投递...

Premium Full-time
正浩 EcoFlow  17 hours ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

python spark jobs in 深圳

You also might be interested in:

ETL

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Job Type
Employer/Recruiter
Salary Estimate