Refine Reset All
Sort by
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Python Infra Jobs In Beijing (Peking) - 5 Job Positions Available

1 – 5 of 5 jobs
CARIZON jobs

Infra基础设施工程师 北京 正式 职位描述 -参与公司核心基础设施平台的设计、开发与持续优化,包括计算、存储、算法训练框架等-负责高性能分布式系统的研发与性能调优,支撑业务端大规模数据生产、模型训练、仿真、交付等关键场景-支持研发团队在本地集群、云平台或混合架构上的工程效率提升,保障系统稳定性及自动化能力 职位要求 -计算机、软件工程、信息安全、电子工程、自动化等相关专业,本科及以上学历-扎实的计算机基础:数据结构、操作系统、计算机网络、分布式系统原理-熟练掌握至少一种后端开发语言:Go / C++ / Rust / Java / Python-熟悉 Linux 环境编程与系统调优,有 Shell / Python 等脚本能力优先-对云原生技术栈、分布式存储系统、算法训练框架等任意一个方向深入者优先-加分项 有真实工程项目或实习经验,如:大规模分布式计算、存储系统、容器调度系统开发、算法训练框架等 参与或维护开源项目(例如 K8s、JuiceFS、ClickHouse、PyTorch等) 在技术博客、GitHub、比赛/竞赛中有可验证成果(如 ACM、Kaggle、Hackathon) 投递...

CARIZON  25 days ago
RZR Global Inc. jobs

Who Are We? RZR is an AI-native advertising platform built for the next era of performance marketing. We operate at the intersection of machine learning, programmatic media, and full-funnel mobile growth, powering campaigns for some of

RZR Global Inc.  17 days ago
RoboScience jobs

数据平台负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 1. 负责具身智能数据平台团队整体管理,带领数据运营、数据工程、数据算法三个方向;2. 对数据平台核心结果负责,包括: - 原始数据采集产能 - 有效训练数据产能 - 数据质量与数据可用率 - 数据处理链路效率与稳定性3. 建立从数据需求 → 采集 → 标注 → 清洗 → 质检 → 挖掘 → 数据集交付 → 训练反馈的完整数据闭环;4. 负责数据运营体系建设,包括采集/标注

RoboScience  16 days ago
RoboScience jobs

云端训推优化负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 负责云端训练与推理优化团队整体建设和管理,对模型训推效率负责;负责大模型、VLM / VLA、机器人模型等训练任务的性能优化,包括:训练吞吐、GPU 利用率、Tensor Core 利用率、显存利用率、多机多卡扩展效率负责分布式训练优化,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP / ZeRO 等方案设计与落地;负责模型推理优化,包括算子优化、KV Cache、Batching、量化、并行推理及服务化性能优化;针对模型结构和训练流程进行 Profiling,定位通信、计算、显存、IO 等性能瓶颈,并推动系统性优化;负责训练/推理框架和基础组件建设,沉淀可复用的性能优化能力;与模型算法团队协作,在保证模型效果的前提下优化模型结构、训练策略和推理方案;与智算平台团队协作,提升 GPU 集群整体资源利用率,降低单位训练与推理成本;建立训推性能指标体系和 Benchmark,持续跟踪不同模型、硬件和框架下的性能表现。 职位要求 5 年以上深度学习系统、训练加速、推理优化、AI Infra 或相关工作经验,有团队管理经验;熟悉 PyTorch 及主流深度学习训练框架,理解计算图、Autograd、CUDA 执行模型;熟悉大规模分布式训练,有 NCCL、FSDP、DeepSpeed、Megatron-LM

RoboScience  15 days ago
AGIBOT jobs

具身平台研发工程师 北京、深圳 全职 职位描述 1. 主导具身智能采训推一体化研发平台的架构设计与核心系统建设,贯通数据版本、模型训练、评测、量化和发布链路,推动算法成果高效进入机器人产品;2. 建设统一门户、CLI/API/SDK、项目空间与权限体系,将底层数据、训练和推理能力沉淀为标准化、可配置、可复用的自助服务;3. 设计端到端工作流控制面,支持 DAG 编排、任务依赖、资源调度、审批、重试、通知和回滚,降低复杂研发流程的使用与维护成本;4. 建立代码、数据、镜像、配置、Checkpoint、模型、推理引擎和评测报告的版本、制品与血缘体系,保障全链路可追溯、可复现和可审计;5. 建设平台级可靠性与可观测体系,覆盖任务状态、日志、指标、链路追踪、告警、容量和成本治理,持续提升平台稳定性、资源利用率与跨团队交付效率。 职位要求 1. 本科及以上学历,计算机、软件工程等相关专业,具备 3 年以上后端、分布式平台或 AI Infra 研发经验;2. 精通 Go、Python、Java 或 C++ 中至少一种语言,具备扎实的系统设计、工程实现和复杂问题定位能力;3. 深入理解分布式系统、数据库、消息队列、对象存储和微服务架构,能够设计高可用、可扩展的平台服务;4. 熟悉 Kubernetes、Docker、工作流引擎、资源调度及可观测性体系,有生产环境性能与稳定性治理经验;5. 理解机器学习研发全生命周期及 MLOps 核心概念,熟悉数据、训练、评测、模型管理或推理平台中的一个或多个方向;6. 有大规模 AI 平台、多集群调度、模型制品与血缘系统建设经验,或参与过相关开源项目者优先。 投递...

Premium Full-time C++ AI
AGIBOT  1 day ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

python infra jobs in beijing

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Type
Employer/Recruiter