Refine Reset All
Sort by
Job Title
Location
Job Type
Employer/Recruiter
Date Posted
Job Title
Location
Job Type
Employer/Recruiter
All Filters

Python Infra Jobs In China - 46 Job Positions Available

Top Cities:
1 – 20 of 46 jobs
MiniMax jobs

系统研发实习生- AI infra 北京、上海 校招 实习 研发 - 基础架构 2028届实习生招聘 职位描述 加入AI基础设施团队,你将在导师指导下参与核心平台系统的学习和实践:1. 参与平台建设: 协助开发与维护CMDB、工单系统、流程引擎等AI Infra关键平台。2. 开发实践: 参与功能模块开发、测试及基础性能调优,提升代码质量。3. 数据链路学习: 协助整合资源编排、调度平台与CMDB/工单等系统数据流。4. 支持资源管理: 开发辅助工具,支持AI平台对底层资源(GPU/CPU)的基础获取与监控。5. 协作体验: 与算法、调度、运维团队协作,了解需求对接流程。你将收获:1. 深度参与工业级AI Infra项目实践(CMDB、工单、资源管理等)。2. 在导师指导下,提升Go/Java/Python开发及微服务架构能力。3. 了解AI训练平台、资源调度等前沿技术,为未来职业奠基。 职位要求 1. 在读学生: 2027届及以后本科/硕士,计算机、软件工程等相关专业。2. 编程基础: 熟练掌握 Go/Java/Python 至少一门,具备良好编码习惯。3. 技术热情: 对微服务、中间件、数据库及平台系统(CMDB/工单等)有浓厚兴趣。4. 核心素质: 学习能力强、动手实践积极、沟通协作良好。加分项 (非必需):1. 有项目/开源经验(Web开发、系统设计、自动化工具)。2.

Premium Full-time AI
MiniMax  29 days ago
MiniMax jobs

系统研发工程师- AI infra-2027届 北京、上海 校招 正式 研发 - 后端开发 2027届校园招聘 职位描述 加入AI基础设施团队,你将在导师指导下参与核心平台系统的学习和实践:1. 参与平台建设: 协助开发与维护CMDB、工单系统、流程引擎等AI Infra关键平台。2. 开发实践: 参与功能模块开发、测试及基础性能调优,提升代码质量。3. 数据链路学习: 协助整合资源编排、调度平台与CMDB/工单等系统数据流。4. 支持资源管理: 开发辅助工具,支持AI平台对底层资源(GPU/CPU)的基础获取与监控。5. 协作体验: 与算法、调度、运维团队协作,了解需求对接流程。你将收获:1. 深度参与工业级AI Infra项目实践(CMDB、工单、资源管理等)。2. 在导师指导下,提升Go/Java/Python开发及微服务架构能力。3. 了解AI训练平台、资源调度等前沿技术,为未来职业奠基。 职位要求 1. 在读学生: 2027届以后本科/硕士,计算机、软件工程等相关专业。2. 编程基础: 熟练掌握 Go/Java/Python 至少一门,具备良好编码习惯。3. 技术热情: 对微服务、中间件、数据库及平台系统(CMDB/工单等)有浓厚兴趣。4. 核心素质: 学习能力强、动手实践积极、沟通协作良好。加分项 (非必需):1. 有项目/开源经验(Web开发、系统设计、自动化工具)。2.

Premium Full-time AI
MiniMax  29 days ago
MiniMax jobs

系统研发实习生—AI Infra(工单智能化方向) 上海 校招 实习 研发 - 后端开发 日常实习 职位描述 加入 AI 基础设施团队,你将在导师指导下参与工单系统的迁移、建设与智能化升级,并逐步承担系统的日常研发和维护工作。1、工单迁移与数据治理: 参与历史工单及相关流程从旧系统向新系统迁移,完成数据清洗、字段映射、校验、回滚方案和迁移工具开发,保障数据完整性与业务连续性;2、工单系统建设: 参与工单系统前后端功能、流程引擎、权限、通知及数据看板等模块的开发、测试、上线和维护,持续改善稳定性与使用体验;3、工单智能化: 基于历史和新增工单,参与数据集构建、知识整理、模型评测,并探索小模型、RAG 或 Agent 在工单分类、摘要、分派、相似案例检索、解决方案推荐和自动跟进等场景的应用;4、工作流优化: 分析工单流转数据和实际处理过程,识别重复操作与效率瓶颈,将有效方案沉淀为可配置、可观测、可持续迭代的自动化工作流;5、系统长期负责: 在导师和团队支持下,逐步负责工单系统的需求对接、技术方案、开发交付、监控告警、问题排查和文档沉淀,建立对系统全生命周期的理解;6、跨团队协作: 与算法、调度、运维及其他基础设施团队协作,理解 AI Infra 场景中的资源与服务流程,推动实际需求落地。你将收获:1、完整参与工业级工单系统从数据迁移、功能建设到智能化升级的全过程,而不只是完成单一功能;2、在真实业务数据和场景中实践 LLM、小模型、RAG、Agent 与评测体系,理解 AI 能力如何可靠地进入生产工作流;3、提升 Go / Python / TypeScript 等工程能力,并积累微服务、数据库、数据治理、可观测性和系统稳定性经验;4、在导师指导下逐步建立系统 owner 意识,锻炼需求分析、方案设计、项目推进和跨团队协作能力。 职位要求 1、在读学生:

MiniMax  29 days ago
MiniMax jobs

AI Infra 资源调度研发实习生 北京、上海 校招 实习 研发 - 基础架构 2028届实习生招聘 职位描述 我们致力于建设面向 AI 训练、推理和 Agent 等场景的 AI Infra 资源管理与调度平台,在保障大规模集群稳定性的同时,极致优化资源分配率与资源利用效率。你将参与:- 调度与资源编排:参与 Kubernetes 调度编排,结合 CPU、GPU、NUMA、PCIe、NVLink / NVSwitch、RDMA 等硬件特性与拓扑感知,探索更加合理的资源编排策略。- 资源效率优化:分析 GPU / CPU / Memory 等资源使用与碎片问题,通过丰富的调度策略、混部、超卖、负载感知等技术持续提升集群资源使用效率。- 大规模集群稳定性:参与 APIServer、Scheduler、etcd、Kubelet 等 Kubernetes 核心组件的性能优化、稳定性建设、故障自愈。-

MiniMax  27 days ago
CARIZON jobs

Infra基础设施工程师 北京 正式 职位描述 -参与公司核心基础设施平台的设计、开发与持续优化,包括计算、存储、算法训练框架等-负责高性能分布式系统的研发与性能调优,支撑业务端大规模数据生产、模型训练、仿真、交付等关键场景-支持研发团队在本地集群、云平台或混合架构上的工程效率提升,保障系统稳定性及自动化能力 职位要求 -计算机、软件工程、信息安全、电子工程、自动化等相关专业,本科及以上学历-扎实的计算机基础:数据结构、操作系统、计算机网络、分布式系统原理-熟练掌握至少一种后端开发语言:Go / C++ / Rust / Java / Python-熟悉 Linux 环境编程与系统调优,有 Shell / Python 等脚本能力优先-对云原生技术栈、分布式存储系统、算法训练框架等任意一个方向深入者优先-加分项 有真实工程项目或实习经验,如:大规模分布式计算、存储系统、容器调度系统开发、算法训练框架等 参与或维护开源项目(例如 K8s、JuiceFS、ClickHouse、PyTorch等) 在技术博客、GitHub、比赛/竞赛中有可验证成果(如 ACM、Kaggle、Hackathon) 投递...

CARIZON  24 days ago
RZR Global Inc. jobs

Who Are We? RZR is an AI-native advertising platform built for the next era of performance marketing. We operate at the intersection of machine learning, programmatic media, and full-funnel mobile growth, powering campaigns for some of

RZR Global Inc.  16 days ago
Automatically Get Matched to python infra Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
NIO jobs

端到端模型infra专家/工程师 AD内推 蔚来自动驾驶研发团队 上海、北京 社招 全职 数字技术 本科及以上 3-5 年 职位描述 职位描述:打造面向端到端模型量产的算法研发框架,包括但不限于:1.建设与维护基础的模型训练、推理框架,推进前沿高效的大模型infra工作落地2.制定规范、高效的数据、研发、发版流程,提升发版效率3.提升端到端模型的训练效率与业务使用效率,突破数据、算法、通信等层面的性能瓶颈4.与平台、端侧研发工程师合作,共同提升驾驶研发全链路的自动化水平 职位要求 职位要求:1.本科及以上学历,计算机 / 软件工程 / 人工智能等相关专业。2.3 年以上相关工作经验,优秀者可降低年限要求。3.良好的 Python / C++ 编程基础和工程规范。4.熟悉 PyTorch / TensorFlow 等深度学习框架的使用。5.对驾驶行业有浓厚兴趣。 投递...

NIO  17 days ago
极佳科技 GigaAI jobs

具身INFRA专家 北京、杭州、上海 全职 互联网 / 电子 / 网游 职位描述 Base地点:北京/上海/杭州1. 参与设计具身智能VLA(Vision-Language-Action,视觉-语言-动作)多模态训练框架,针对语言输入、视觉信息、动作决策及其他模态输入完成协同建模;2. 设计并优化高效分布式训练框架,支持万小时级数据的高效训练,优化训练过程中计算、显存等资源消耗,提升整体资源利用率;3. 构建高性能推理部署系统,提升模型推理性能;支持模型快速部署至不同机型,并保障部署后模型效果与训练态对齐;4. 持续跟进业界技术进展,调研新的训练优化方向,将前沿技术集成到训练框架中并验证落地效果;5. 与算法工程团队深度协作,针对项目实际问题进行定制化优化,保障框架稳定性与性能。 职位要求 1. 扎实的Python/C++工程开发能力,具备良好的编码规范,能够独立完成复杂系统的设计、开发、调试与维护;2. 精通PyTorch等主流训练框架,深入理解框架核心模块(如分布式训练、自动微分、显存优化等)的实现细节,有训练框架开发/维护的实际项目经验;3. 深入理解VLM(Vision-Language Model,视觉语言模型)/VLA技术原理,具备VLA多模态框架的实际开发或落地经验;4. 具备良好的沟通协作能力、快速学习能力,有钻研复杂技术问题的意愿和能力。【加分项】1. 有VLM/VLA/世界模型等方向的研究或工程落地经验;2. 具备具身机器人、自动驾驶等领域的工程研发经验;3. 在ICRA/IROS/CORL/CVPR等机器人/计算机视觉顶会有论文发表经历;4. 熟悉主流机器人仿真平台(如Gazebo、Webots、Isaac Sim等)或实际机器人/机械臂开发调试经验;5. 有大规模分布式训练、多模态模型推理部署的实战经验。 投递...

Premium Full-time
极佳科技 GigaAI  9 days ago
极佳科技 GigaAI jobs

视频生成Infra专家 北京、上海 全职 互联网 / 电子 / 网游 职位描述 岗位职责:1、负责千卡级GPU集群上视频生成(VideoGen)/VLM多模态大模型的分布式训练架构设计与性能优化,提升训练吞吐与稳定性;2、攻克大规模训练中的通信/显存/计算瓶颈,优化数据并行、模型并行、流水线并行等策略,支撑超长视频训练;3、搭建千万小时级海量视频/多模态数据的高效存储、索引与加载流水线(streaming pipeline),设计高性能dataloader与多级缓存机制,消除IO瓶颈;4、建立训练任务的全链路监控、profiling与自动故障恢复体系,保障长时间训练任务的连续性与资源利用率;5、持续跟进业界前沿的分布式训练与数据调度技术,推动基础设施架构演进。 职位要求 任职要求:1、统招硕士及以上学历,计算机相关专业,5年以上AI训练基础设施/高性能计算相关经验;2、有千卡级以上大规模分布式训练实战优化经验,深入理解分布式并行策略及底层通信/存储原理;3、熟悉PyTorch分布式训练底层实现,有框架/通信库二次优化经验者加分;4、有千万小时级视频或多模态数据的存储、索引、预处理及高性能加载实战经验,熟悉cached dataloader/streaming pipeline设计;5、精通集群资源管理与任务调度,熟练使用性能profiling工具定位系统瓶颈;6、工程能力强,Python/C++扎实,系统设计功底好;7、有视频生成、世界模型、多模态预训练核心Infra背景者优先。加分项:有千卡级训练稳定性优化/故障自动恢复体系建设经验;熟悉Ray、SLURM、Kubernetes等调度系统;有FasterTransformer/vLLM/Triton等推理/训练加速库经验。团队亮点:核心方向,算力资源充足,技术挑战大;与顶尖算法团队紧密配合,技术影响力广;发展空间大 投递...

Premium Full-time
极佳科技 GigaAI  9 days ago
Beyondsoft Consulting jobs

Overview WHO WE ARE: Beyondsoft is a leading mid-sized business IT and consulting company that combines modern technologies and proven methodologies to tailor solutions that move your business forward.Our global head office is based in Singapore,

Beyondsoft Consulting  7 days ago
Z.ai jobs

AI院-训练Infra工程师 北京、上海 全职 互联网 / 电子 / 网游 职位描述 1、负责大规模预训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率2、分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性3、跟进业界技术进展,不断同步与集成最新训练优化策略 职位要求 1、对自然语言处理、计算机视觉和多模态算法有深入理解,熟悉主流的 LLM 和 VLM 模型架构,有分布式训练经验2、精通 Python 编程语言,熟悉 PyTorch 深度学习框架和 Megatron 分布式训练框架3、有大规模预训练优化 / MoE 训练优化经验的优先考虑加分项:1、在ACM、NOI、IOI、超算比赛中有获奖经历者优先2、具有 cuda 算子优化/profiling 能力者优先 投递...

Z.ai  6 days ago
Z.ai jobs

AI院-推理Infra工程师(量化算法研究/推理框架优化/GPU优化) 北京、上海 全职 互联网 / 电子 / 网游 职位描述 【方向一】量化算法研究员-职位描述通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。-工作内容1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。-职位要求1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。【方向二】推理框架优化工程师-职位描述1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术集成与应用:研究并应用业界前沿的优化技术(如模型量化QAT/PTQ、算子融合、动态形状支持、FlashAttention等),并将其集成至推理/训练引擎。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。【方向三】GPU优化工程师-职位描述利用对 cuda 生态软件和底层体系结构的了解,帮助团队优化训练和推理的计算效率。-工作内容1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率、多流并行协同等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术选型:对 GPU 领域相关的 DSL/编译器(例如 triton/cuteDSL/tilelang)等进行尝试和了解,确定团队内的 DSL/编译器的技术选型,为未来的迭代做好技术储备。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。 职位要求 -

Premium Full-time CUDA GLM
Z.ai  6 days ago
VAST jobs

AI Infrastructure EngineerAI基础设施工程师/架构师(Infra&GPU Computing) Shanghai, Beijing Experienced Full-time Responsibilities Job DescriptionWhat We Are Building1.TripoAI is building a world-leading generative AI platform for 3D content creation. Behind our product, thousands of high-performance GPUs run complex inference computations around

VAST  6 days ago
XPENG jobs

【27届校招】AI Infra工程师(大模型推理优化方向) 北京、上海、广州 正式 互联网 / 电子 / 网游 职位描述 1、负责小鹏大模型推理技术在物理AI场景下的工程搭建及落地,包括但不限于自动驾驶,舱驾融合,机器人等场景2、负责小鹏大模型推理引擎XLLM的核心特性开发,包括但不限于kv cache管理,FlashAttention设计及优化,投机解码3、负责小鹏大模型推理引擎XLLM的加速优化,包括模型结构优化(MoE,Diffusion)及底层计算加速(INT4、INT8)。4、负责小鹏大模型压缩技术探索,涵盖量化(QAT/PTQ)、剪枝、蒸馏、稀疏化、NAS等 职位要求 1、硕士研究生及以上学历,计算机及相关专业;2、有扎实的数据结构与算法基础,熟悉python或C/C++。3、熟悉并掌握主流模型压缩技术,如量化(GPTQ/AWQ/SmoothQuant)、剪枝(Sheared-LLaMa)、蒸馏及NAS。4、熟悉LLM推理框架(如vLLM,SGLang,TensorRT-LLM)及优化加速技术(如Flashattention、KV Cache Management,Speculative-Decoding)。5、具备LLM推理优化和加速技术的实践经验。6、拥有深入研究精神、创新能力及持续学习意愿。加分项:1、熟悉GPU/NPU硬件架构,能使用CUDA、CUTLASS进行编程优化。2、有异构计算加速或芯片级性能调优经验。 投递...

Premium Full-time
XPENG  2 days ago
XPENG jobs

【27届校招】AI Infra工程师(大模型推理优化方向) 北京、上海、广州 正式 互联网 / 电子 / 网游 通用智能板块 职位描述 1、负责小鹏大模型推理技术在物理AI场景下的工程搭建及落地,包括但不限于自动驾驶,舱驾融合,机器人等场景2、负责小鹏大模型推理引擎XLLM的核心特性开发,包括但不限于kv cache管理,FlashAttention设计及优化,投机解码3、负责小鹏大模型推理引擎XLLM的加速优化,包括模型结构优化(MoE,Diffusion)及底层计算加速(INT4、INT8)。4、负责小鹏大模型压缩技术探索,涵盖量化(QAT/PTQ)、剪枝、蒸馏、稀疏化、NAS等 职位要求 1、硕士研究生及以上学历,计算机及相关专业;2、有扎实的数据结构与算法基础,熟悉python或C/C++。3、熟悉并掌握主流模型压缩技术,如量化(GPTQ/AWQ/SmoothQuant)、剪枝(Sheared-LLaMa)、蒸馏及NAS。4、熟悉LLM推理框架(如vLLM,SGLang,TensorRT-LLM)及优化加速技术(如Flashattention、KV Cache Management,Speculative-Decoding)。5、具备LLM推理优化和加速技术的实践经验。6、拥有深入研究精神、创新能力及持续学习意愿。加分项:1、熟悉GPU/NPU硬件架构,能使用CUDA、CUTLASS进行编程优化。2、有异构计算加速或芯片级性能调优经验。 投递...

Premium Full-time
XPENG  21 hours ago
XPENG jobs

AI Infra Engineer(Agentic Runtime) 深圳、北京、上海 全职 智能机器人板块 职位描述 参与从 0 到 1 建设具身学习基础设施平台,为机器人大模型的强化学习后训练、评测与自迭代提供统一的环境服务与策略推理能力。以仿真环境和策略推理为切入点,通过资源调度、系统性能优化和运行保障,提高有效样本产出,降低实验等待与资源成本,并逐步扩展至端侧和真机执行场景。【职位描述】1. 环境与 Rollout 服务平台建设:建设共享 Sandbox 资源池与执行服务,实现环境申请、初始化、隔离、重置、回收与运行观测;对接强化学习训练框架,支撑真实具身模型训练与评测任务;2. 策略推理集成与优化:集成和优化 vLLM、SGLang 等推理引擎,建设策略服务部署、路由与资源管理能力;结合业务负载优化批处理、缓存、多模态处理与模型执行效率,保障权重更新与模型版本关联的正确性;3. 资源画像与动态调度:根据任务类型、环境资产和实际资源用量建立资源画像,设计预热、资产亲和、配额管理与动态扩缩容策略,通过运行反馈持续优化资源申请规格、并发配置与调度效率;4. 端到端性能分析:分析环境准备、仿真执行、观测传输、策略推理及权重同步等阶段的瓶颈,建立可复现的性能基线,以有效 Rollout 吞吐、端到端时延和资源成本验证优化收益;5. 稳定性与执行正确性保障:完善故障检测、超时处理、背压、恢复与资源清理机制,支持长时间无人值守运行;建立任务、环境、轨迹、Reward 与 Policy 版本的关联追溯,保障执行隔离与样本正确性;6. 标准化接入与架构演进:设计可扩展的任务与 Runtime 接口,支持 Isaac Sim、Unity 等仿真环境,以及强化训练、评测、Replay 等业务复用平台能力,为后续边缘节点、台架和机器人接入奠定基础。 职位要求

XPENG  17 hours ago
XPENG jobs

AI Infra Engineer(Agentic RL 训练框架) 深圳、北京、上海 全职 智能机器人板块 职位描述 参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。【职位描述】1. 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口;2. 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入;3. 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 CI 回归体系,理解不同训练场景的运行特征,定位影响端到端效率与资源利用率的关键瓶颈,结合真实业务负载开展优化并推动成果落地;4. 业务训练闭环:与算法团队协作完成具身模型 RL 后训练等真实业务的训练闭环,参与训练需求分析、技术方案设计与联调验证,支持新训练方法的接入与工程化落地;5. 自动化与研发效能:完善任务配置、实验追溯、排障诊断与模型交付工具及文档,降低实验配置、管理与排障成本,提升框架使用体验与算法研发效率。 职位要求 1. 扎实的 Python 编程与软件工程能力,熟悉 Linux 开发环境,具备良好的代码设计、调试和维护能力;2. 熟悉 PyTorch,理解大模型训练与推理的基本流程,具有相关框架或基础设施的实际研发经验;3. 具备分布式训练或推理系统经验,熟悉 FSDP、Megatron、vLLM、SGLang 等框架中的至少一种,能够理解其执行机制并定位实际问题;4.

XPENG  17 hours ago
XPENG jobs

AI Infra Engineer(预训练框架与性能优化) 深圳、北京、上海 全职 智能机器人板块 职位描述 面向 VLA 与 World Action Model(视频生成与多模态模型)的预训练需求,参与自研训练框架的开发与演进。通过训练性能分析、分布式执行优化、训练稳定性治理与算法工程协作,提升训练效率与资源利用率,降低训练成本,逐步推动预训练、微调、蒸馏与强化学习共用核心基础能力,支撑不同模型和业务场景的持续扩展。【职位描述】1. 训练框架研发:负责预训练框架核心模块的设计、开发与迭代,支持模型、数据、优化器与训练策略的灵活接入;建设统一的训练执行与状态管理机制,完善 checkpoint 保存恢复、指标记录与评测接口,保障训练正确性、可复现性与兼容性;2. 端到端性能优化:建立性能分析与评测体系,定位数据处理、计算、显存和通信等环节的瓶颈;优化数据加载与预处理流水线、模型计算与显存使用,评估算子优化、编译、低精度等技术的收益,提升 GPU 有效利用率与训练吞吐;3. 分布式训练与规模扩展:优化并行策略、通信与计算重叠及负载均衡;开展 NCCL 集合通信性能分析与优化,结合 GPU 互联和网络拓扑定位带宽、时延和慢节点问题,完成百卡到千卡规模的扩展验证与容量规划;4. 训练可靠性与工程效能:建设训练监控、日志、告警与诊断能力,定位并解决 OOM、NaN、卡死等稳定性问题;完善训练状态保存、故障恢复和重试机制,开展故障演练与复盘,降低长任务中断与人工干预;5. 公共训练能力沉淀:推进分布式执行、资源管理、保存恢复与性能分析等公共能力的抽象与复用,支持预训练与强化学习框架的融合,使视频模型预训练与现有 RL 任务共用核心基础能力。 职位要求 1. 扎实的 Python 编程与软件工程能力,熟悉 PyTorch,能够独立完成模块设计、开发、调试与验证;2. 具有大模型训练框架或分布式训练系统研发经验,熟悉 FSDP、Megatron、DeepSpeed 等框架中的至少一种;3.

XPENG  17 hours ago
MiniMax jobs

可观测平台研发工程师-2027届 北京、上海 校招 正式 研发 - 后端开发 2027届校园招聘 职位描述 1. 参与 MiniMax 面向大模型训练、推理和 Agent 场景的新一代可观测平台建设。2. 参与指标、日志、Trace、事件等数据采集、存储、查询和分析链路开发。3. 建设硬件、网络、存储、训练作业、推理服务等多层信号的统一观测能力。4. 参与故障归因、异常检测、成本分析、链路回放等 AI Infra 可观测能力建设。 职位要求 1. 2027届本科及以上学历,计算机、软件工程、人工智能、自动化等相关专业优先。2. 熟悉操作系统、网络、数据库或分布式系统基础,对复杂系统问题定位有兴趣。3. 熟悉 Prometheus、Grafana、OpenTelemetry、ClickHouse、ElasticSearch 等任一技术优先。4. 具备良好工程能力,熟悉 Go / Python / Java / C++ 中至少一种语言。5. 对大模型训练、推理服务、Agent

MiniMax  29 days ago
MiniMax jobs

高性能服务研发实习生-2027 届 北京、上海 校招 实习 研发 - 后端开发 2027届校园招聘 职位描述 1. 参与 大模型推理系统 的研发与优化,涵盖执行引擎、批处理调度、缓存与动态并发策略;2. 优化推理路径性能,提升 吞吐率、延迟与稳定性,探索算力与响应速度的平衡;3. 设计并实现 推理加速机制(如图计算优化、KV 缓存、高效张量调度等);4. 参与构建面向 多模态与 Agentic 系统 的推理框架,支撑智能体在真实场景中的快速决策与反馈;5. 跟踪推理服务的前沿趋势(Speculative Decoding、Context Caching、Dynamic Routing 等),验证其在工程中的落地。 职位要求 1. 计算机及相关专业,2027 年及以后毕业;2. 熟悉 Python / C++,具备良好的系统设计与性能分析能力;3.

Premium Full-time AI Python
MiniMax  29 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

python infra

You also might be interested in:

实习生

AI

Engineer

PyTorch

C++

Latency

Kubernetes

Automation

CUDA

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Location
Job Type
Employer/Recruiter