Infra基础设施工程师 北京 正式 职位描述 -参与公司核心基础设施平台的设计、开发与持续优化,包括计算、存储、算法训练框架等-负责高性能分布式系统的研发与性能调优,支撑业务端大规模数据生产、模型训练、仿真、交付等关键场景-支持研发团队在本地集群、云平台或混合架构上的工程效率提升,保障系统稳定性及自动化能力 职位要求 -计算机、软件工程、信息安全、电子工程、自动化等相关专业,本科及以上学历-扎实的计算机基础:数据结构、操作系统、计算机网络、分布式系统原理-熟练掌握至少一种后端开发语言:Go / C++ / Rust / Java / Python-熟悉 Linux 环境编程与系统调优,有 Shell / Python 等脚本能力优先-对云原生技术栈、分布式存储系统、算法训练框架等任意一个方向深入者优先-加分项 有真实工程项目或实习经验,如:大规模分布式计算、存储系统、容器调度系统开发、算法训练框架等 参与或维护开源项目(例如 K8s、JuiceFS、ClickHouse、PyTorch等) 在技术博客、GitHub、比赛/竞赛中有可验证成果(如 ACM、Kaggle、Hackathon) 投递...
Who Are We? RZR is an AI-native advertising platform built for the next era of performance marketing. We operate at the intersection of machine learning, programmatic media, and full-funnel mobile growth, powering campaigns for some of
数据平台负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 1. 负责具身智能数据平台团队整体管理,带领数据运营、数据工程、数据算法三个方向;2. 对数据平台核心结果负责,包括: - 原始数据采集产能 - 有效训练数据产能 - 数据质量与数据可用率 - 数据处理链路效率与稳定性3. 建立从数据需求 → 采集 → 标注 → 清洗 → 质检 → 挖掘 → 数据集交付 → 训练反馈的完整数据闭环;4. 负责数据运营体系建设,包括采集/标注
云端训推优化负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 负责云端训练与推理优化团队整体建设和管理,对模型训推效率负责;负责大模型、VLM / VLA、机器人模型等训练任务的性能优化,包括:训练吞吐、GPU 利用率、Tensor Core 利用率、显存利用率、多机多卡扩展效率负责分布式训练优化,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP / ZeRO 等方案设计与落地;负责模型推理优化,包括算子优化、KV Cache、Batching、量化、并行推理及服务化性能优化;针对模型结构和训练流程进行 Profiling,定位通信、计算、显存、IO 等性能瓶颈,并推动系统性优化;负责训练/推理框架和基础组件建设,沉淀可复用的性能优化能力;与模型算法团队协作,在保证模型效果的前提下优化模型结构、训练策略和推理方案;与智算平台团队协作,提升 GPU 集群整体资源利用率,降低单位训练与推理成本;建立训推性能指标体系和 Benchmark,持续跟踪不同模型、硬件和框架下的性能表现。 职位要求 5 年以上深度学习系统、训练加速、推理优化、AI Infra 或相关工作经验,有团队管理经验;熟悉 PyTorch 及主流深度学习训练框架,理解计算图、Autograd、CUDA 执行模型;熟悉大规模分布式训练,有 NCCL、FSDP、DeepSpeed、Megatron-LM
具身平台研发工程师 北京、深圳 全职 职位描述 1. 主导具身智能采训推一体化研发平台的架构设计与核心系统建设,贯通数据版本、模型训练、评测、量化和发布链路,推动算法成果高效进入机器人产品;2. 建设统一门户、CLI/API/SDK、项目空间与权限体系,将底层数据、训练和推理能力沉淀为标准化、可配置、可复用的自助服务;3. 设计端到端工作流控制面,支持 DAG 编排、任务依赖、资源调度、审批、重试、通知和回滚,降低复杂研发流程的使用与维护成本;4. 建立代码、数据、镜像、配置、Checkpoint、模型、推理引擎和评测报告的版本、制品与血缘体系,保障全链路可追溯、可复现和可审计;5. 建设平台级可靠性与可观测体系,覆盖任务状态、日志、指标、链路追踪、告警、容量和成本治理,持续提升平台稳定性、资源利用率与跨团队交付效率。 职位要求 1. 本科及以上学历,计算机、软件工程等相关专业,具备 3 年以上后端、分布式平台或 AI Infra 研发经验;2. 精通 Go、Python、Java 或 C++ 中至少一种语言,具备扎实的系统设计、工程实现和复杂问题定位能力;3. 深入理解分布式系统、数据库、消息队列、对象存储和微服务架构,能够设计高可用、可扩展的平台服务;4. 熟悉 Kubernetes、Docker、工作流引擎、资源调度及可观测性体系,有生产环境性能与稳定性治理经验;5. 理解机器学习研发全生命周期及 MLOps 核心概念,熟悉数据、训练、评测、模型管理或推理平台中的一个或多个方向;6. 有大规模 AI 平台、多集群调度、模型制品与血缘系统建设经验,或参与过相关开源项目者优先。 投递...