Java数据平台开发 上海 全职 平台类 职位描述 1. 参与叠纸大数据平台和数据中台建设;2. 参与构建流批一体的数据自助分析平台,支持业务方自助进行数据的快速定位和分析;3. 在传统大数据开发和数仓建模的基础上,探索创新的方案,构建自动化、智能化的建模引擎;4. 保证大数据平台相关服务的稳定性、高可用性,不断优化服务性能。 职位要求 1. 计算机相关专业本科以上学历,5年以上Java相关工作经验;2. 熟练使用常用的JAVA技术框架,并对JAVA Web的各种主流框架如Spring、SpringBoot、MyBatis、Kafka等有深入的应用和优化经验,掌握它的原理和机制;3. 熟练掌握微服务开发和架构设计,有大型复杂业务系统架构设计经验者优先;4. 熟悉一种或多种大数据相关组件者优先,比如:Flink,Spark,Hive,元数据管理等,对组件的原理有深入的了解;5. 具有良好的学习能力、团队协助以及沟通能力,执行力强,对工作有责任心,具备良好的规划、沟通以及协调能力;6. 有数据类产品落地交付经验者优先。加分项:1. 了解python语言,有爬虫、pandas等开发经验更佳;2. 有阿里云平台DataWorks、Hologres、MaxCompute、ADB使用经验;3. 有DataX/HDFS/HIVE等开源工具实际生产使用经验者优先,熟悉源码实现者更佳;4. 有用skills提高开发效率落地场景的经验更佳。 投递...
大数据开发(数据挖掘、数据测试、java) 保定 全职 研发 - 大数据 职位 ID:A193587 职位描述 1.负责把传统数据库 MySQL 中的数据通过 Sqoop 工具把数据同步到大数据平台。2.负责创建 kafka 的 topic 以及数据落地等。3.负责根据数据,建库建表,接入数据,权限分配等。4.负责根据原始数据提取出来更为细分的、更容易理解的、偏向于业务层面的数据。5.负责后期的集群中数据的维护以及数据报表的展示6.负责售后业务的数据分析,搭建并迭代业务数据体系,实现了售后KPI看板的上线,监控其业务的流畅性和完整度,发现问题并推动解决。7.通过数据挖掘业务的优化点,全程和业务梳理业务逻辑,共同讨论业务优化方向,并且配合系统研发和系统产品做系统数据埋点,8.推动优化方案的有效落地,迭代售后系统提高系统对人力的替代率,提高业务的工作效率9.统计分析后台数据,并制作成统计图、波形趋势图等各种图表,并以日报、周报、月报、季度、年度报表,根据数据总结分析业务发展趋势,给业务发展提出建议 职位要求 1. 基于自动驾驶大数据处理平台(例如Hadoop/Spark),利用数据挖掘、机器学习等相关算法,解决自动驾驶业务需求,为自动驾驶评测、功能迭代,运营决策提供数据分析依据2. 与产品、系统等团队配合,分析和挖掘自动驾驶功能的体验痛点、表征原因、内在规律等,例如自动驾驶功能潜在风险与事故的数据分析与规律等4. 负责自动驾驶领域的数据探索,从场景,评价,用户,运营等多个维度挖掘数据价值,发现数据和业务背后规律,应用于产品研发、用户运营、商业等各种领域 投递...
风控Java研发工程师 北京 全职 金融 职位描述 期待拥有开放心态、拥抱持续进化的你成为易宝的事业伙伴,共绘 “一群人的浪漫”。1、负责支付风控中台核心子系统的设计与开发,包括但不限于规则引擎、实时决策引擎、变量平台、名单管理系统、人工审核工作流等,支撑每秒万级的高并发实时风控请求。2、与风控策略团队紧密配合,将复杂的反欺诈、反洗钱、反盗刷业务逻辑转化为高效、可维护的技术实现,支持策略的快速上线与A/B测试。3、基于Flink/Spark等大数据技术建设实时特征计算平台,为风控模型与策略提供准实时的指标支持;参与数据清洗、标签体系建设。4、攻克支付场景下的业务技术难题,如防重放、幂等性设计、分布式事务,以及对突发流量(如大促场景) 的弹性伸缩与限流降级。 职位要求 1、本科及以上学历,计算机相关专业,3-5年Java开发经验,其中至少1年以上风控、金融、支付或安全领域研发经验;2、扎实的JAVA基础,熟悉JAVA核心原理,熟练掌握多线程开发,有JVM调优经验优先;3、熟悉分布式系统设计与开发,熟悉Spring等主流框架,熟悉Redis、ES、Sqoop、Kafka、Hive其中的一种或几种中间件4、理解支付/信贷业务中常见的风险类型(盗刷、套现、薅羊毛、商户二清等),了解基本的反欺诈规则(如设备指纹、IP画像、行为序列)。5、有对接三方风控产品经验(如Sift Science、Forter、同盾、邦盛)或自建规则引擎(Drools/EasyRule/Aviator)深度优化经验。 投递...
知识平台算法专家(RAG & 知识图谱方向) 上海 社招 全职 数字技术 本科及以上 5-7 年 职位描述 岗位核心使命深度融合 LLM 与知识图谱技术,构建企业级 GraphRAG 架构。通过本体建模与高精度检索技术,解决大模型在复杂专业领域下的幻觉问题,打造工业级的知识服务引擎。主要职责RAG 架构优化:负责企业级 RAG(检索增强生成)系统的全链路研发。针对长文本及复杂知识,优化文档切片 (Chunking) 策略、多路召回 (Retrieval) 及 重排序 (Reranking) 算法,提升问答的准确性与归因能力。知识中枢建设:负责领域本体论 (Ontology) 建模,设计高扩展性的 Schema;利用 LLM 实现自动化知识抽取(实体、属性、三元组),构建高质量结构化知识库。底层存储与检索:负责基于 Milvus/Zilliz 的向量数据库与 Elasticsearch 的全文检索集成,设计向量-标量混合检索方案,优化海量数据的检索延迟与相关性。推理与应用落地:探索图增强检索(GraphRAG)、多步推理链(CoT)在知识平台中的应用,负责从非结构化数据到结构化知识转化的全流程算法迭代。 职位要求 1.
数据仓库工程师 上海 社招 全职 职能与支持 - 数据分析 本科及以上 3-5 年 职位描述 1. 调研现有系统数据情况,并根据业务模块和需求,参与数据仓库设计与研发,建设电驱/电池工业化核心数据资产;2. 负责从多个系统及数据源进行数据获取,并根据数据标准同步至数据湖,保证数据的完整性和准确性;3. 负责不同技术场景下的数据获取和使用开发方案落地(实时、离线);4. 负责数据治理体系的完善和实施,打造稳定可靠的数据服务和保障体系;5. 与业务团队、算法团队、产品团队紧密合作,参与数据产品和应用的数据研发,与产品一起打造极致体验的数据产品。6. 负责数据化运营,沉淀算法和数据分析思路,协作并推动数据化运营项目落地; 职位要求 1. 计算机、软件工程、自动化等相关专业本科及以上;2. 3-7年大数据工程实施经验,数据仓库建模和开发,了解目前主流大数据技术,如流批一体、数据湖等;3. 熟练掌握hive、spark等大数据工具,具备海量数据加工处理(ETL)相关经验,具备丰富的优化经验。熟练使用Java、Python等语言,熟悉hive UDF开发;4. 能独立负责业务域数据仓库开发及维护、数据仓库模型、数据报表等工作内容;熟悉数据仓库模型设计,掌握常用数据建模方法;5. 熟悉数据治理方法论、具备一定的数据治理经验;6. 较好的业务理解和数据洞察能力,能直接和业务对话,快速进行需求的理解和落地;7. 具有良好的团队合作和沟通能力,有很强的自驱力,能主动为结果负责; 投递...
We are seeking an experienced Senior Data Engineer to design, implement, and maintain our data infrastructure and pipelines. The ideal candidate will have a strong background in data engineering, big data technologies, and cloud platforms. You
About Man Group Man Group is a global alternative investment management firm focused on pursuing outperformance for sophisticated clients via our Systematic, Discretionary and Solutions offerings. Powered by talent and advanced technology, our single and multi-manager
具身智能数据工程师 北京 全职 互联网 / 电子 / 网游 职位描述 负责具身智能方向的数据平台建设,支撑机器人、多模态感知、语言理解、动作决策、任务规划等场景的数据生产、管理、流转与分析。设计并建设大规模多模态数据处理平台,覆盖视频、图像、语音、文本指令、传感器数据、机器人操作轨迹、环境状态、任务执行日志等数据类型。负责数据采集、清洗、标注、质检、版本管理、样本检索、数据回流等核心链路的平台化能力建设。建设面向模型训练的数据集管理能力,包括数据集构建、切分、去重、质量评估、元数据管理、血缘追踪与可复现训练数据交付。参与搭建具身智能数据闭环系统,支持模型训练、评测、仿真、真实机器人执行后的数据回收与持续迭代。与算法、机器人、仿真、标注、产品等团队协作,抽象共性数据需求,沉淀稳定、高效、可扩展的平台工具。负责数据平台的性能优化、稳定性建设、权限治理、成本优化和工程规范落地。 职位要求 本科及以上学历,计算机、软件工程、人工智能、自动化、机器人、电子信息等相关专业优先。具备扎实的数据工程或后端平台开发经验,熟悉 Python / Java / Go / Scala 中至少一种语言。熟悉大规模数据处理链路,了解 Spark、Flink、Kafka、Airflow、Ray、Hadoop、Hive、ClickHouse、ElasticSearch 等技术中的一种或多种。熟悉数据库、对象存储、消息队列、任务调度、数据湖或数据仓库等平台基础组件。有良好的平台化思维,能够将复杂业务流程抽象为稳定的数据模型、任务系统、服务接口和工具链。具备较强的数据质量意识,理解数据清洗、标注质检、样本治理、版本管理、数据血缘、权限控制等工程问题。有多模态数据、机器人数据、视频理解数据、仿真数据或大规模模型训练数据平台经验者优先。熟悉 Kubernetes、Docker、云原生架构、分布式任务调度或高性能计算平台者优先。具备良好的沟通协作能力,能够与算法、工程、产品和运营团队高效配合,推动复杂系统落地。有具身智能、机器人学习、VLA / VLM / 多模态大模型相关数据平台经验优先。有数据标注平台、数据闭环平台、模型训练数据平台、仿真数据平台建设经验优先。熟悉 ROS、机器人日志格式、传感器数据、轨迹数据、仿真环境或模型评测链路优先。有从 0 到 1 搭建数据平台或核心数据链路的经验优先。 投递...
反作弊算法工程师 北京 社招 全职 技术 - 算法 职位 ID:A117785 职位描述 支持爱奇艺全域流量及推广渠道的反作弊体系。通过技术手段实现对虚假流量的检测和过滤,保障爱奇艺站内数据的真实性和渠道营销的可靠性。核心职责 :-风险识别:利用机器学习、深度学习、大模型等技术,构建针对流量异常和渠道作弊的识别模型-反作弊策略制定:通过分析作弊目标(渠道、分账、广告分成)和作弊手段(如代理 IP、模拟器、云手机),制定并落地覆盖全链路的反作弊规则策略-反作弊效果评估:搭建完善的反作弊效果评估体系,评估其在流量和渠道方向的 ROI,并根据效果推进其在业务层面进行整改-反作弊能力建设:构建完善的反作弊特征库,利用离线和实时处理技术支持实时反作弊和离线反作弊,提升识别的实时性和准确率 职位要求 -教育背景:计算机、信息类等相关专业硕士及以上-开发技能:熟练掌握 Java、Python、SQL/Hive 等计算机语言,熟悉 Hive、Spark、Flink 等 Hadoop 生态,具备大规模海量数据处理能力,有实时计算经验者优先-算法能力:熟练掌握基础的机器学习算法,如:LR、RF、GBDT、XGBoost等,有使用异常检测算法、图分析、深度学习等优先;-综合素质:具备高度的数据洞察和逻辑推理能力,能够从海量数据中捕捉到细微的数据异常并分析数据异常的原因,具备高效的沟通能力,能与各业务方沟通解决业务对反作弊的核心述求并推进实施;-反作弊经验:了解广告生态和归因逻辑,了解常见的作弊手段,了解黑产供应链者优先。 投递...
AI算法工程师 上海 全职 互联网 / 电子 / 网游 职位描述 职位描述1. 专注游戏场景下的算法研发工作,深耕用户增长、因果推断、归因分析、个性化体验流设计及商业化活动/道具智能推荐等方向,驱动产品核心指标提升;2. 基于业务数据洞察,结合游戏生态特性定义可量化的算法优化目标,设计高落地性方案并推动实施,为项目创造显著商业价值;3. 持续关注AI领域前沿技术动态,探索其在游戏场景的创新应用,推动技术成果转化与工程化落地;4. 深度联动产品、运营团队,通过玩家行为建模与多维度分析,制定精细化算法策略,构建快速迭代机制以持续优化效果。 任职要求1. 计算机、数学、统计学等相关专业本科及以上学历,3年以上算法研发经验,具备独立负责项目的能力;2. 精通Python编程,具备扎实的代码功底与工程实现能力,掌握C/C++或Java者优先;3. 对游戏行业有浓厚兴趣,具备敏锐的业务洞察力,拥有游戏算法成功落地经验者优先;4. 在机器学习、深度学习、数据挖掘、自然语言处理或多模态技术等领域有深入研究,需提供相关项目案例及成果说明;5. 熟悉分布式数据处理框架,对流式计算有实践经验,熟练运用Hadoop/Spark/Flink等大数据工具进行数据建模与分析优先考虑。我们秉承“BE WILD. BE FREE.”的品牌主张,坚持始终创业、简单务实、开放包容、勇于担当的文化理念。在这里——【态度】我们讲求自驱,不设边界,没有人能定义你的舞台和天花板;【氛围】内部真·扁平,新人的意见、不同的观点都有可能成为波克前行的关键;【成长】入职即有指导人和成长伙伴双cover,内部分享+外聘大神助你突破自我;【生活】一日三餐下午茶,房补公寓任你选,节日社团境外游.让游戏不只是工作,更是你的生活! 投递...
【集团】大数据开发-平台开发 上海 全职 职位描述 1.参与建设大数据基础设施:数据平台层面构建包括数据集成、ETL、质量与治理等中台能力,提升数据研发的工作效率;数据架构层面规划设计业务领域核心模型,探索落地另类数据的架构,包括不限于数仓一体、云数据库等;2. 参与建设升级公司数据体系,支撑公司整体数据体系需求,构建高效,稳定的数据通道,推动数据智能化和自动化体系的建设; 职位要求 1.熟悉大数据生态数据技术,了解Flink、Spark、HDFS、 Hive、Odps等主流大数据计算/存储引擎,了解 hbase、 lindorm等OLAP、OLTP引擎及相关数据应用场景,解决方案;2. 有大数据研发、治理等相关平台建设经验者优先,对数据仓库,数据湖熟悉者优先,有数据思维、数学思维者优先;3.知识与能力: 1)扎实的Java编程基础,熟悉JVM、类加载机制、多线程以及性能优化等; 2)精通SpringCloud微服务技术体系springboot、eureka、nacos、apollo、rabbitmq、kafka、rocketmq等等,熟悉相关技术原理,对框架源码有一定研究。 投递...
【集团】大数据开发高级工程师(数据驾舱-研发) 上海 全职 职位描述 1、本科及以上学历,3年及以上大数据相关开发经验;2、熟悉Oracle,对hdfs、flink、spark等有深入理解;3、有flink,数据库,sql查询优化,性能优化相关经验者优先;4、优秀的业务理解能力、逻辑性和沟通能力,能跨部门合作沟通; 职位要求 1、深入理解流式sql原理及应用场景,并实现完备的流式sql功能;2、负责流式sql查询优化、运行时优化、问题诊断及分析等;3、负责流计算引擎flink的调度优化、执行优化,支撑高吞吐、大状态作业的稳定运行;4、负责实时计算在业务上的应用,如实时多维分析、实时异常监控排查等;5、负责业务线实时数仓的规划、设计以及建设;6、熟练掌握至少一种编程语言(如Java、Scala)。 投递...
【集团】大数据开发工程师(数据驾舱) 上海 全职 职位描述 1、本科及以上学历,3年及以上大数据相关开发经验;2、熟悉Oracle,对hdfs、flink、spark等有深入理解;3、有flink,数据库,sql查询优化,性能优化相关经验者优先;4、优秀的业务理解能力、逻辑性和沟通能力,能跨部门合作沟通; 职位要求 1、深入理解流式sql原理及应用场景,并实现完备的流式sql功能;2、负责流式sql查询优化、运行时优化、问题诊断及分析等;3、负责流计算引擎flink的调度优化、执行优化,支撑高吞吐、大状态作业的稳定运行;4、负责实时计算在业务上的应用,如实时多维分析、实时异常监控排查等;5、负责业务线实时数仓的规划、设计以及建设;6、熟练掌握至少一种编程语言(如Java、Scala)。 投递...
【集团】大数据测试工程师-兔集 上海 全职 职位描述 主要职责:1.大数据产品质量保障(核心职责):设计和执行复杂的数据测试用例,包括:功能正确性、数据准确性、完整性、一致性测试,以及数据转换逻辑的验证。2.自动化测试:设计、开发并维护高效的自动化脚本,以提升测试覆盖率和执行效率。3.测试策略与流程:参与制定和优化大数据项目的测试策略、测试计划和测试流程。深入理解业务和数据逻辑,设计高效的数据构造和数据模拟方案。 职位要求 任职要求1.测试专业能力:具备2年以上软件测试经验,其中至少1年以上大数据领域测试经验。掌握功能测试、集成测试、性能测试等方法论,能独立设计测试用例和测试数据。对质量保障体系有深入理解,具备敏锐的缺陷洞察力和分析能力。2.大数据技术栈:具备大数据平台(如 Hadoop、Spark、Flink、Hive、Kafka 等)的测试经验。精通 SQL,能够编写复杂的查询语句进行数据验证和探查。理解数据仓库分层模型(如 ODS, DWD, DWS, ADS)。3. 工具开发能力:熟练掌握至少一门编程语言,如 Python、Java ,并具备良好的编码习惯。4.个人素质:具备出色的逻辑思维能力、分析问题和解决问题的能力。拥有强烈的技术热情、自驱力和团队合作精神。乐于分享,能够将技术方案清晰地传达给团队成员。 投递...
资深大数据开发 上海 全职 平台类 职位描述 1、负责离线和实时数据仓库的搭建与优化,保障数据的准确、完整和高效可用;2、根据业务需求设计合理的数据模型,开发高效ETL流程,进行数据分层与数据治理;3、跟进数据产品在业务场景中的落地,开发数据应用和分析工具,提升数据服务的易用性和价值;4、负责大数据平台和任务的性能调优、解决各类技术难题,保障系统的稳定与高效运行;5、深入理解游戏业务,对接业务部门,制定并实现复杂业务的数据解决方案;6、持续跟踪大语言模型等前沿技术发展,将数据开发能力转化为可落地的智能化实践经验。 职位要求 1、本科及以上学历,计算机、软件工程、数据分析或相关专业,5年以上大数据开发经验;2、精通Java、Python等至少一门编程语言,扎实的代码功底和算法能力;3、熟练掌握Hadoop、Hive、Spark、Flink、Kafka等大数据生态组件,有阿里云Maxcompute、ADB开发经验者优先;4、熟悉数据仓库理论体系,分层设计与维度建模,有PB级数据处理经验者优先;5、业务理解能力强,能够独立对接复杂业务需求,善于沟通和团队协作;6、逻辑思维强,有良好的技术敏感度和学习驱动力,抗压能力强,有责任心和团队合作精神;7、熟悉大语言模型等前沿技术,具备大语言模型等前沿技术应用能力。 投递...
具身大模型数据架构师 深圳、上海、北京 全职 智能机器人板块 职位描述 岗位职责1、负责具身智能多模态数据体系建设,围绕视频、图像、音频、传感器、状态流、日志等海量异构数据,设计可扩展的数据接入、存储、组织、检索与消费架构;2、参与构建面向原始数据管理、训练评测集管理等的数据湖仓与数据管线,推动数据在采集、解析、切分、对齐、清洗、标注、入湖、索引、回放和回溯等环节的工程化落地;3、联合算法团队建设高质量训练数据集、评测集和数据闭环机制,支撑具身大模型的数据生产、问题定位、效果分析和持续迭代;4、参与多模态数据标准和中间结构设计,提升不同来源、不同格式数据之间的兼容性、复用性和可治理性;5、 构建 Data Agent,实现智能检索、数据分析、数据洞察等能力,持续提升数据生产效率与研发效率。 职位要求 任职要求1、计算机、数学、统计、自动化、电子、机器人等专业;2.、具备 AI 算法开发、数据工程、分布式系统、模型调优或系统工程优化相关经验之一;3、具备海量多模态异构数据的架构设计能力,能够从业务目标出发设计数据分层、数据模型、存储布局、索引组织与读写链路;4、熟悉 Python/Java/ go中至少一门语言,具备扎实的数据处理和工程实现能力;5、熟悉 Iceberg、Lance 等面向大规模分析或多模态数据场景的数据格式与存储方案,理解 Parquet、Arrow、对象存储、元数据管理等核心机制;6、熟悉 LanceDB、Milvus、Elasticsearch、ClickHouse 等检索/分析系统,或有多模态样本库建设经验;7、熟悉 Spark、Flink、Ray、Kafka 等大数据或分布式计算框架中的一项或多项,理解批处理、流处理、批流一体及任务编排;8、熟悉向量检索、特征索引、样本检索、数据切片、时间戳对齐、多模态关联等一种或多种能力,能够支撑训练数据构建和问题追溯;9、对数据闭环、具身智能和大模型方向有强烈兴趣,具备自驱力、学习能力和跨团队协作意识。加分项1、有机器人、自动驾驶、大模型行业等行业的多模态海量数据架构实践经验;2、有数据湖、湖仓一体、元数据平台、数据质量平台或数据检索平台建设经验;3、有顶会/期刊论文、开源项目、数据竞赛成果,或在数据基础设施方向有系统性产出。 投递...
全栈云端计算平台工程师 广州 全职 通用智能板块 职位描述 职位描述1. 负责小鹏集团计算平台的架构设计与研发落地,构建云端模型开发,训练基础设施以及大规模数据生产基础设施;2. 设计并实现高性能数据编排与加载系统,支撑 PB 级多模态数据(文本、图像、视频、点云、传感器等)的高效处理、缓存加速,支持批式与流式数据生产;深度集成AI Coding Agent与 Data Pipeline,实现数据准备、清洗、标注、版本管理的自动化与智能化闭环;3. 负责云原生基础设施层的开发与优化,包括 GPU集群调度、弹性资源管理、容器化训练/推理工作负载编排,持续提升资源利用率与系统吞吐;4. 可以承担全栈职责,包括前端管理控制台到后端分布式服务的开发。职位要求1. 计算机 / 软件工程 / 数学 / 自动化等相关专业硕士及以上学历,或具备同等技术能力;3 年及以上后端/基础设施开发经验,其中 2 年及以上大规模 AI 平台或分布式系统研发经验;2. 精通Python,具备出色的工程化能力;熟练使用 Golang/Java/C++ 中至少一门语言进行系统性开发;3. 熟悉 AI Coding / AI
分布式计算与存储软件工程师 广州 全职 通用智能板块 职位描述 职位描述1. 负责小鹏汽车“扶摇”AI平台数据处理相关的软件开发工作,包括数据加载工具(XDataLoader)和数据集管理平台(XDataset),提供统一的数据加载、转换、缓存与预取能力;目标解决大规模数据加载过程中出现的性能瓶颈、数据一致性、系统稳定性等问题,服务AI大模型的训练和推理;2. 开发并维护高性能 DataLoader SDK,支持自定义采样、并行读取、缓存预取与数据增强等功能,优化多线程/进程流水线,降低I/O与预处理延迟,简化算法团队接入并提升加载效率;3. 搭建通用Dataset管理系统,实现多源异构数据(图片、视频、点云、传感器等)的统一接入、解析与格式化;4. 协同算法团队及其他技术团队,深入理解业务需求,快速响应并落地实现。 职位要求 1. 计算机 / 软件工程硕士或同等经验,3年及以上大规模数据处理经验;有大规模模型训练与推理场景支持经验者优先;2. 精通 Python,具备扎实软件工程基础,良好编程规范和代码质量意识;3. 有以下至少一项实际项目经验;两项及以上者优先: a. 大规模数据加载机制(如 PyTorch DataLoader、NVIDIA DALI、TensorFlow Dataset、Hugging Face Datasets) b. Parquet/ORC 等列式存储格式及相关生态(如Petastorm),能设计高效的分区、压缩与向量化读取流程,优化批量数据访问性能。 c. Linux文件系统与网络I/O,能针对NFS、对象存储等场景进行性能调优;有云存储系统(如阿里云OSS、CPFS、火山引擎vePFS)相关经验。4. 具备关系型数据库(MySQL/PostgreSQL)与NoSQL(Redis/MongoDB等)相关经验,了解元数据与缓存管理;5. 具备大规模分布式数据处理、性能优化与问题排查经验,能定位并高效解决复杂的性能问题;熟悉Apache Ray、Kubeflow/Airflow、Prometheus等开源项目者优先;6.
数据挖掘工程师/专家 北京、上海 社招 全职 研发 - 算法 职位描述 1. 基于自动驾驶海量数据,利用机器学习、深度学习和数据挖掘方法,负责相关数据挖掘、场景发现、数据筛选与价值挖掘工作,研发适用于实际业务场景的 AI 模型、算法和工具。2. 负责机器学习/深度学习领域的算法研究与工程落地,包括但不限于图学习、生成学习、迁移学习、强化学习、多模态学习以及各类优化方法的实践与创新。3. 面向自动驾驶感知、预测、规划、仿真、数据闭环等业务场景,探索前沿算法问题,设计并实现可落地的技术解决方案,推动数据驱动的模型迭代和业务发展。4. 建设数据挖掘与智能分析能力,包括规则挖掘、Embedding 检索、向量数据库、图搜索、文搜图/图搜图、多模态理解等能力,提升数据生产、质检、评测和交付效率。5. 结合业务需求,沉淀可复用的数据挖掘工具链和算法平台,支持大规模数据分析、样本召回、长尾场景挖掘、难例发现和数据质量提升。 职位要求 1. 数学、计算机、统计学、通信、电子、自动化等相关专业本科以上学历;具备 3 年及以上机器学习、深度学习或数据挖掘相关研究或工程经验。2. 熟悉 Python、Java、C/C++、Scala 等至少一门编程语言,具备良好的工程实现能力,有大规模数据处理、算法系统开发或模型训练经验者优先。3. 熟悉至少一种深度学习框架,如 PyTorch、TensorFlow、MindSpore 等;熟悉常见机器学习/深度学习模型和算法,包括但不限于 GBDT、RF、CNN、RNN、Transformer、CLIP、多模态模型、Embedding 模型等。4. 具备较强的数据分析和数据建模能力,熟悉常见数据挖掘方法,如聚类、分类、召回、排序、异常检测、相似度检索、特征工程、样本筛选等。5. 有自动驾驶、机器人、智能交通、地图、推荐系统、搜索广告、多模态理解、大规模数据挖掘等相关经验者优先。熟悉大数据处理工具或平台者优先,如 Spark、Flink、Hadoop、Hive、ClickHouse、Doris、Elasticsearch、Milvus、Faiss 等。6. 具备良好的问题抽象能力、技术判断力和沟通协作能力,能够结合业务场景快速定位问题,并推动算法方案落地。加分项1. 有自动驾驶数据闭环、长尾场景挖掘、感知数据挖掘、仿真数据挖掘、数据质检或模型评测经验。2. 有多模态大模型、VLM、CLIP、Qwen-VL、Embedding 检索、向量数据库、RAG、Agent
数据研发工程师 北京 全职 研发 - 大数据 职位描述 1、负责掌阅集团企业级数据建设(涵盖流量、内容、用户、商业化等业务方向),提供通用、稳定、丰富、高效的公共数据能力,提升数据支持业务的效率,探索数据增量价值;2、面向流量、内容、用户、商业化等业务方向,建设专题数据,提供丰富易用的数据服务,直接支持公司业务决策分析,赋能业务;3、建设企业级数据治理和管理体系,结合业务+元数据+技术,推进资源成本的优化,提高数据服务质量,保障数据产出的稳定性和准确性;4、参与公司级别商业化相关系统数据设计、研发以及保障。 职位要求 1、精通分布式文件系统hdfs常用命令以及底层原理。2、精通yarn,datax,sqoop,hbase 等hadoop生态常用工具3、精通数仓常用计算引擎,hive/spark/kylin/impala/starrocks 至少两种以上。4、精通常用数据库3种以上。mysql/redis/hbase/es5、对数仓之上的衍生产品(例:投放,BI,DMP,数据分析平台,监控平台,调度平台等)有丰富经验,有过大厂经验最好,。6、熟悉linux常用命令,熟悉至少一种脚本语言。shell/python7、熟悉Kafka、Flink、Scala、Java技术栈, 熟练运用流计算窗口、状态、算子、并发、调优技术8、对自己使用过的组件看过源码者优先考虑。强加分项:1.有明确的广告投放系统经验,对广告投放术语、指标例如 cpm/cpc/cps/wau/uv/pv/ltv/apru/roi等等有相对深刻得了理解,并参与实践2.对计算广告服务基本流程架构(dsp/adx/dmp/ssp等等)、核心概念例如RTA/RTB等等有相对深刻的了解甚至实际参与研发3.对于用户画像-用户标签-用户分群的数据体系建设有实践经验 投递...