数据Infra 后端开发工程师 深圳、上海、北京 全职 智能机器人板块 职位描述 1、负责机器人/具身智能场景下数据接入、解析、切分、清洗、质检、入湖、归档等数据管线能力建设,支撑多源异构数据稳定流转;2、设计并实现可扩展的数据处理 pipeline、算子编排、任务调度、运行监控和失败重试机制,提升数据生产链路的稳定性和效率;3、参与建设元数据管理、数据血缘、数据质量、数据版本管理等平台能力,支撑训练集、评测集和问题回溯流程;4、与算法、采集、运营、平台产品等团队协作,推动数据标准、处理规范和工程流程落地;5、参与数据平台服务化建设,包括接口设计、权限控制、资源调度、可观测性和 CI/CD 发布体系。 职位要求 1、计算机相关专业本科及以上学历,具备扎实的数据结构、系统设计和工程实现能力;2、熟练掌握 Python、Go、Java、C++ 中至少一门语言,有复杂后端系统或数据平台开发经验;3、熟悉 Spark、Flink、Ray、Kafka、Airflow、Argo、DolphinScheduler 等批处理、流处理或任务编排框架中的一项或多项;4、熟悉对象存储、Parquet、Arrow、Iceberg、Paimon、Hive Metastore 等数据湖/湖仓相关技术者优先;5、有良好的工程质量意识,熟悉监控告警、日志追踪、故障排查、性能优化和稳定性建设;6、具备较强的跨团队沟通能力,能够从业务目标出发拆解平台能力并推动落地。加分项1、有机器人、自动驾驶、大模型、多模态数据平台相关经验;2、有数据质量、数据血缘、元数据平台、训练/评测数据集管理平台建设经验;3、有大规模视频、图像、传感器、日志、状态流等异构数据处理经验。 投递...
AI Infra工程师 上海 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 1. 负责团队内 神经渲染、3D 视觉、视频生成等方向模型的预训练/后训练与推理工程化落地,将算法原型转化为稳定、高效、可维护的生产级系统2. 参与大规模分布式训练与推理平台建设,优化数据处理、模型管理与评测流程,提升研发迭代效率3. 基于 C++/CUDA 进行核心算子与热点路径性能优化,针对大规模多模态场景做显存与吞吐优化4. 参与推理服务搭建与部署,包括模型导出、加速优化、批处理与并发调度,保障服务稳定性与可观测性5. 开发内部工程工具链,包括实验管理、性能评测、自动化测试与 CI/CD 集成,推动工程质量持续提升6. 与算法团队紧密协作,响应训练集群与线上服务的性能与稳定性问题 职位要求 1. 计算机、软件工程、电子信息、自动化等相关专业本科及以上学历2. 工程实现能力强,熟练掌握 C/C++、Python,代码风格良好,有完整项目或实习工程经验3. 熟悉 PyTorch 训练与推理流程,了解 Linux 开发环境、Git、Docker,有 GPU 集群使用经验4. 满足以下方向之一:有 CUDA/GPU 性能优化经验;有分布式训练或多机部署经验;有推理服务或高并发系统开发经验5.
【27届校招】具身数据infra工程师 深圳、上海、北京 正式 研发 - 算法 智能机器人板块 职位描述 岗位职责负责机器人数据采集链路及数据平台相关系统研发,覆盖采集任务下发、设备接入、数据上传、处理、管理、查询和展示等环节。根据个人技术专长承担 Web 前端、数据可视化、后端服务、开放接口或业务流程开发,推动功能从需求分析到上线交付。参与多模态数据的接入与管理,支持视频、图像、传感器、状态流和日志等数据的解析、组织、检索及使用。参与元数据、标签、数据质量、数据集管理和数据版本等能力建设,提升数据的可管理性、可检索性和可追溯性。建设面向数据生产与运营的任务管理、状态监控、异常处理和数据看板,提升数据流转效率和使用体验。参与 AI Agent 与数据能力的结合,探索数据查询、智能分析、工具调用和工作流编排等应用。 职位要求 任职要求计算机相关专业本科及以上学历,具备3年及以上前端、后端、全栈或数据平台相关开发经验。熟练掌握 React、Vue、TypeScript 或 Go、Java、Python、Node.js 中至少一个技术方向,具备良好的工程实现能力。熟悉 SQL、数据库、对象存储及常见数据处理方式,理解数据接入、清洗、质量校验、检索和消费等基本流程。具备接口设计、任务处理、权限控制、异常恢复和问题排查经验,能够独立承担功能或模块交付。对数据产品和数据使用场景有一定理解,能够将数据管理、检索、质量或分析需求转化为系统能力。熟练使用 AI Coding Agent 等 Vibe Coding 工具辅助方案设计、编码、测试和调试,并能审查和验证生成代码。具备良好的业务理解、沟通协作和自主推进能力。 投递...
We are now looking for Senior Software Engineer of AV Infrastructure and MLOps team! NVIDIA is playing a significant role in AI and Autonomous Vehicles industry with its powerful GPU products, high-performance DRIVE platform and a
Infra开发工程师 上海 全职 职位描述 - 负责公司级AI Infra平台建设,为智能驾驶场景提供数据闭环、算力平台、AIOps等基础能力支持。 - 负责数据闭环的构建,建立高效的数据流转设施,搭建稳定的数据闭环链路 - 负责AI平台的设计与研发,建设GPU及异构加速卡的资源池化、任务调度与虚拟化能力。 - 负责向量检索、图数据库等AI基础能力的构建与性能优化。 - 探索并落地面向智能汽车行业的前沿AI Infra技术演进方案。 职位要求 - 具有计算机、人工智能、软件工程、电子信息等相关学科本科/硕士学历。 - 具备以下一项或多项经验: 1. 具备数据闭环、数据链路的开发经验;2. 大规模分布式训练/推理系统、AI平台、资源调度系统、向量检索或图数据库的设计与研发经验;3. 熟悉Linux环境下的Python与C++语言,具备良好的工程与代码规范;4. 熟悉PyTorch/TensorFlow等深度学习框架,具备底层优化或二次开发经验; - 具有良好的工作态度、团队合作精神、主观能动性和跨团队沟通能力。符合以下条件者优先: - 熟悉LLM、图像、多模态或VLA/VLM等模型的训练与推理优化; - 具备自动驾驶、机器人或智能汽车相关领域软件系统开发经验; - 有大模型预训练、RL训练或高性能推理引擎(如vLLM、TensorRT-LLM)的实战经验; - 具备高性能网络、分布式存储或集群调度系统经验。 投递...
【27届校招】AI Infra部署工程师 广州、北京、上海 正式 研发 - 算法 职位描述 职位描述:设计、实现与维护自动驾驶软件系统框架,优化系统的性能、延时、稳定性与算法工程师合作,完成端到端大模型的转换与部署,以及模型的预处理/后处理等开发工作负责模型的KPI评测与对齐工作负责功能开发完成后的实车联调、测试及迭代优化等工作 职位要求 岗位要求:计算机、电子信息等相关专业的硕士或博士精通C++、Python,具有良好的代码书写规范和文档编写能力熟悉多线程编程,深入理解计算机体系结构和高性能计算有Linux系统性能优化经验,熟悉常用调试工具具备优秀的问题分析、沟通及协作能力 加分项:熟悉 CUDA 内核与 TensorRT有实际的深度学习模型部署、性能优化经验有自动驾驶或机器人行业相关经验 投递...
【27届校招】AI Infra工程师(深度学习优化方向) 广州、北京、上海 正式 研发 - 算法 职位描述 职位描述:我们正在寻找一名专注于模型推理与模型优化的机器学习工程师。你将从模型结构和算法层面出发,对大规模深度学习模型进行优化,使其能够高效部署在小鹏定制的 AI 加速器上。我们通过数据驱动的模型压缩与结构改造,在保证精度的前提下显著降低推理延迟和内存占用。从模型和算法层面对深度学习模型进行推理优化,支持其在小鹏定制 AI 加速器上的高效部署我们的使命是解决自动驾驶,具身职能这一世界级难题。你将与机器学习工程师、编译器工程师和研究科学家紧密合作,将前沿的大模型研究成果转化为可落地的工程方案。 职位要求 职位要求:CS/CE/EE硕士学位,或同等学历,行业经验精通 Python 和 PyTorch,具备良好的研究型和工程型代码能力。对大模型结构(如 Transformer 及其变体)有深入理解。对模型推理框架和工具(onnx,TensorRT, TRT-LLM等)有深入了解。扎实的深度学习基础和推理流程认知。具备模型优化经验,如量化、剪枝、稀疏化、蒸馏等。具备较强的自主学习和论文阅读能力,能够独立推动问题解决。对挑战性和不确定性问题有好奇心,责任感和执行力。 投递...
AI 训练 Infra 工程师 上海 全职 互联网 / 电子 / 网游 职位描述 关于职位:致力于构建高性能、高可靠的分布式训练基础设施,通过优化底层框架与计算效率,支撑大规模视觉及语言模型的稳定训练。本岗位聚焦于生产级工程实践,旨在与模型及算法团队嵌入式协作,实现可量化的训练性能提升与集群效能保障。核心职责:— 维护并持续演进分布式训练框架的版本迭代、功能增强与系统稳定性。— 执行分布式训练性能剖析与瓶颈定位,优化通信开销与训练吞吐,保障大规模集群的稳定运行与容错处理。— 优化数据 IO 管线性能,涵盖数据拉取和到 GPU 的数据传输等。— 应用编译优化技术进行计算图捕获、算子融合及执行调度优化,提升整体执行效率。— 跟踪前沿技术并实现新的优化器与训练算法,负责已有论文或开源实现的复现与框架集成。 职位要求 — 计算机科学或相关领域学士及以上学历。— 深入理解分布式训练原理,包括数据并行、张量并行、流水线并行、序列并行及集体通信语义。— 具备训练性能剖析与瓶颈定位能力,能够熟练使用 profiling 工具进行系统分析。— 扎实的 Python 与系统级编程能力,熟悉 Linux 环境及并行/分布式计算基础。优先条件:— 有主流分布式训练框架内核级开发或源码贡献经验者优先。— 有大规模多节点集群训练实战与故障排查经验者优先。— 有 CUDA/Triton
AI Infra算法工程师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位描述 1. 负责AI算法训练和推理框架的开发和深度优化,支持智驾相关业务快速高效迭代;2. 负责云端智驾领域数据预刷相关标注和生成式模型的训练和推理等工程优化;3. 负责车端模型包括Float和QAT量化等阶段模型训练的性能优化和框架建设;4. 负责开源AI大模型的私有化部署和服务化,支持AI Coding和Agent等应用领域落地。 职位要求 1. 熟悉Python/C++等编程语言,扎实的代码能力、数据结构与算法基础,具有较强的软件架构设计能力;2. 对算法工程包括Pytorch框架、训推工具等有基本的了解,有相关使用经验;3. 熟悉PyTorch、vLLM和SGLang等深度学习训练推理框架,熟练掌握深度学习性能加速技术优先;4. 熟悉NVIDIA GPU架构及编程模型,掌握CUDA核函数优化、显存管理、多流并发等技术,有实际性能调优(profiler/nsys/ncu)经验优先。 投递...
视频生成Infra专家 北京、上海 全职 互联网 / 电子 / 网游 职位描述 岗位职责:1、负责千卡级GPU集群上视频生成(VideoGen)/VLM多模态大模型的分布式训练架构设计与性能优化,提升训练吞吐与稳定性;2、攻克大规模训练中的通信/显存/计算瓶颈,优化数据并行、模型并行、流水线并行等策略,支撑超长视频训练;3、搭建千万小时级海量视频/多模态数据的高效存储、索引与加载流水线(streaming pipeline),设计高性能dataloader与多级缓存机制,消除IO瓶颈;4、建立训练任务的全链路监控、profiling与自动故障恢复体系,保障长时间训练任务的连续性与资源利用率;5、持续跟进业界前沿的分布式训练与数据调度技术,推动基础设施架构演进。 职位要求 任职要求:1、统招硕士及以上学历,计算机相关专业,5年以上AI训练基础设施/高性能计算相关经验;2、有千卡级以上大规模分布式训练实战优化经验,深入理解分布式并行策略及底层通信/存储原理;3、熟悉PyTorch分布式训练底层实现,有框架/通信库二次优化经验者加分;4、有千万小时级视频或多模态数据的存储、索引、预处理及高性能加载实战经验,熟悉cached dataloader/streaming pipeline设计;5、精通集群资源管理与任务调度,熟练使用性能profiling工具定位系统瓶颈;6、工程能力强,Python/C++扎实,系统设计功底好;7、有视频生成、世界模型、多模态预训练核心Infra背景者优先。加分项:有千卡级训练稳定性优化/故障自动恢复体系建设经验;熟悉Ray、SLURM、Kubernetes等调度系统;有FasterTransformer/vLLM/Triton等推理/训练加速库经验。团队亮点:核心方向,算力资源充足,技术挑战大;与顶尖算法团队紧密配合,技术影响力广;发展空间大 投递...
系统研发实习生- AI infra 北京、上海 校招 实习 研发 - 基础架构 2028届实习生招聘 职位描述 加入AI基础设施团队,你将在导师指导下参与核心平台系统的学习和实践:1. 参与平台建设: 协助开发与维护CMDB、工单系统、流程引擎等AI Infra关键平台。2. 开发实践: 参与功能模块开发、测试及基础性能调优,提升代码质量。3. 数据链路学习: 协助整合资源编排、调度平台与CMDB/工单等系统数据流。4. 支持资源管理: 开发辅助工具,支持AI平台对底层资源(GPU/CPU)的基础获取与监控。5. 协作体验: 与算法、调度、运维团队协作,了解需求对接流程。你将收获:1. 深度参与工业级AI Infra项目实践(CMDB、工单、资源管理等)。2. 在导师指导下,提升Go/Java/Python开发及微服务架构能力。3. 了解AI训练平台、资源调度等前沿技术,为未来职业奠基。 职位要求 1. 在读学生: 2027届及以后本科/硕士,计算机、软件工程等相关专业。2. 编程基础: 熟练掌握 Go/Java/Python 至少一门,具备良好编码习惯。3. 技术热情: 对微服务、中间件、数据库及平台系统(CMDB/工单等)有浓厚兴趣。4. 核心素质: 学习能力强、动手实践积极、沟通协作良好。加分项 (非必需):1. 有项目/开源经验(Web开发、系统设计、自动化工具)。2.
系统研发工程师- AI infra-2027届 北京、上海 校招 正式 研发 - 后端开发 2027届校园招聘 职位描述 加入AI基础设施团队,你将在导师指导下参与核心平台系统的学习和实践:1. 参与平台建设: 协助开发与维护CMDB、工单系统、流程引擎等AI Infra关键平台。2. 开发实践: 参与功能模块开发、测试及基础性能调优,提升代码质量。3. 数据链路学习: 协助整合资源编排、调度平台与CMDB/工单等系统数据流。4. 支持资源管理: 开发辅助工具,支持AI平台对底层资源(GPU/CPU)的基础获取与监控。5. 协作体验: 与算法、调度、运维团队协作,了解需求对接流程。你将收获:1. 深度参与工业级AI Infra项目实践(CMDB、工单、资源管理等)。2. 在导师指导下,提升Go/Java/Python开发及微服务架构能力。3. 了解AI训练平台、资源调度等前沿技术,为未来职业奠基。 职位要求 1. 在读学生: 2027届以后本科/硕士,计算机、软件工程等相关专业。2. 编程基础: 熟练掌握 Go/Java/Python 至少一门,具备良好编码习惯。3. 技术热情: 对微服务、中间件、数据库及平台系统(CMDB/工单等)有浓厚兴趣。4. 核心素质: 学习能力强、动手实践积极、沟通协作良好。加分项 (非必需):1. 有项目/开源经验(Web开发、系统设计、自动化工具)。2.
系统研发实习生—AI Infra(工单智能化方向) 上海 校招 实习 研发 - 后端开发 日常实习 职位描述 加入 AI 基础设施团队,你将在导师指导下参与工单系统的迁移、建设与智能化升级,并逐步承担系统的日常研发和维护工作。1、工单迁移与数据治理: 参与历史工单及相关流程从旧系统向新系统迁移,完成数据清洗、字段映射、校验、回滚方案和迁移工具开发,保障数据完整性与业务连续性;2、工单系统建设: 参与工单系统前后端功能、流程引擎、权限、通知及数据看板等模块的开发、测试、上线和维护,持续改善稳定性与使用体验;3、工单智能化: 基于历史和新增工单,参与数据集构建、知识整理、模型评测,并探索小模型、RAG 或 Agent 在工单分类、摘要、分派、相似案例检索、解决方案推荐和自动跟进等场景的应用;4、工作流优化: 分析工单流转数据和实际处理过程,识别重复操作与效率瓶颈,将有效方案沉淀为可配置、可观测、可持续迭代的自动化工作流;5、系统长期负责: 在导师和团队支持下,逐步负责工单系统的需求对接、技术方案、开发交付、监控告警、问题排查和文档沉淀,建立对系统全生命周期的理解;6、跨团队协作: 与算法、调度、运维及其他基础设施团队协作,理解 AI Infra 场景中的资源与服务流程,推动实际需求落地。你将收获:1、完整参与工业级工单系统从数据迁移、功能建设到智能化升级的全过程,而不只是完成单一功能;2、在真实业务数据和场景中实践 LLM、小模型、RAG、Agent 与评测体系,理解 AI 能力如何可靠地进入生产工作流;3、提升 Go / Python / TypeScript 等工程能力,并积累微服务、数据库、数据治理、可观测性和系统稳定性经验;4、在导师指导下逐步建立系统 owner 意识,锻炼需求分析、方案设计、项目推进和跨团队协作能力。 职位要求 1、在读学生:
As a Senior GPU & AI Infra Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving GPU/AI Infra technical strategy, system-level solution optimization,
大模型算法工程师-2028届实习 北京、上海 校招 实习 研发 - 算法 2027届校园招聘 职位描述 - LLM / MLLM 的预训练、后训练、对齐和能力增强;- 围绕推理、代码、agent、长上下文、多模态等方向,设计数据、训练和评测方案;- 分析模型能力变化,定位数据、训练策略、reward、推理策略等因素的影响;- 与算法、数据、评测、infra 团队协作,推动模型的极致迭代。 职位要求 - 计算机、人工智能、数学、电子信息等相关专业在读,学历不限;- 熟悉机器学习 / 深度学习基础,熟练使用 Python、PyTorch;- 具备良好的代码能力、实验分析能力和问题拆解能力;- 对 LLM / MLLM、多模态、推理、agent 等方向有兴趣;- 每周可实习 4 天及以上,连续实习 6 个月及以上优先。加分项- 有 LLM
可观测平台研发工程师-2027届 北京、上海 校招 正式 研发 - 后端开发 2027届校园招聘 职位描述 1. 参与 MiniMax 面向大模型训练、推理和 Agent 场景的新一代可观测平台建设。2. 参与指标、日志、Trace、事件等数据采集、存储、查询和分析链路开发。3. 建设硬件、网络、存储、训练作业、推理服务等多层信号的统一观测能力。4. 参与故障归因、异常检测、成本分析、链路回放等 AI Infra 可观测能力建设。 职位要求 1. 2027届本科及以上学历,计算机、软件工程、人工智能、自动化等相关专业优先。2. 熟悉操作系统、网络、数据库或分布式系统基础,对复杂系统问题定位有兴趣。3. 熟悉 Prometheus、Grafana、OpenTelemetry、ClickHouse、ElasticSearch 等任一技术优先。4. 具备良好工程能力,熟悉 Go / Python / Java / C++ 中至少一种语言。5. 对大模型训练、推理服务、Agent
高性能服务研发实习生-2027 届 北京、上海 校招 实习 研发 - 后端开发 2027届校园招聘 职位描述 1. 参与 大模型推理系统 的研发与优化,涵盖执行引擎、批处理调度、缓存与动态并发策略;2. 优化推理路径性能,提升 吞吐率、延迟与稳定性,探索算力与响应速度的平衡;3. 设计并实现 推理加速机制(如图计算优化、KV 缓存、高效张量调度等);4. 参与构建面向 多模态与 Agentic 系统 的推理框架,支撑智能体在真实场景中的快速决策与反馈;5. 跟踪推理服务的前沿趋势(Speculative Decoding、Context Caching、Dynamic Routing 等),验证其在工程中的落地。 职位要求 1. 计算机及相关专业,2027 年及以后毕业;2. 熟悉 Python / C++,具备良好的系统设计与性能分析能力;3.
Company Description About Grab and Our Workplace Grab is Southeast Asias leading superapp. From getting your favourite meals delivered to helping you manage your finances and getting around town hassle-free, weve got your back with everything.