具身算法引擎开发实习生 上海 实习 职位描述 1. 训练框架开发:参与VLA等大模型训练框架研发与优化,包括数据并行、模型并行、流水并行等分布式训练能力的建设,提升千卡规模的训练稳定性与资源利用率。2. 推理系统优化:参与VLA等大模型的推理引擎开发与性能优化,包括算子优化、KV Cache管理、Prefill/Decode优化、Batch调度、低延迟Serving等核心能力建设,提升推理吞吐与响应速度。3. 分布式系统优化:参与多机多卡训练与推理系统建设,优化NCCL通信、AllReduce效率及IB/RDMA网络性能,提升大规模集群运行效率。4. 稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。5. 平台工程建设:参与训练/推理平台工程化建设,包括模型部署、监控、自动化测试、性能Benchmark及稳定性保障。 职位要求 1. 本科及以上学历,计算机、人工智能、自动化、机器人等相关专业优先2. 熟悉Python或C++开发,具备良好的代码能力与工程习惯3. 精通 PyTorch 分布式训练机制(DDP/FSDP),熟悉 DeepSpeed、Megatron-LM 、vLLM、SGLang等大规模训练/推理框架的原理与使用4. 深入理解 3D 并行(Data Parallel / Tensor Parallel / Pipeline Parallel)的实现原理与适用场景,能够根据模型特点设计最优并行策略5. 熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈加分项:1.
全栈云端计算平台工程师 广州 全职 通用智能板块 职位描述 职位描述1. 负责小鹏集团计算平台的架构设计与研发落地,构建云端模型开发,训练基础设施以及大规模数据生产基础设施;2. 设计并实现高性能数据编排与加载系统,支撑 PB 级多模态数据(文本、图像、视频、点云、传感器等)的高效处理、缓存加速,支持批式与流式数据生产;深度集成AI Coding Agent与 Data Pipeline,实现数据准备、清洗、标注、版本管理的自动化与智能化闭环;3. 负责云原生基础设施层的开发与优化,包括 GPU集群调度、弹性资源管理、容器化训练/推理工作负载编排,持续提升资源利用率与系统吞吐;4. 可以承担全栈职责,包括前端管理控制台到后端分布式服务的开发。职位要求1. 计算机 / 软件工程 / 数学 / 自动化等相关专业硕士及以上学历,或具备同等技术能力;3 年及以上后端/基础设施开发经验,其中 2 年及以上大规模 AI 平台或分布式系统研发经验;2. 精通Python,具备出色的工程化能力;熟练使用 Golang/Java/C++ 中至少一门语言进行系统性开发;3. 熟悉 AI Coding /
Job Summary We are looking for a Order Administrator who will be responsible for order processing in Qingpu Plant for Pressure Management. The role will coordinate with partners, customers and project teams to engage, understand and
Introduction: Dyson began twenty one years ago with James Dyson and a handful of engineers questioning everyday products, thinking differently and making them better. We are now the worlds number one vacuum cleaner manufacturer in the
大模型训练工程专家-稳定性方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位为大模型「预训练 + 后训练」的基础设施稳定性与效率负总责的资深工程师——横向拉通 GPU 算力、RDMA 网络、通信库、高性能存储、集群调度、训练任务生命周期等多个技术域,确保大规模训练不中断 / 少中断,并持续把有效训练算力(MFU / ETTR)做上去。二、为什么这个岗位重要大模型训练是公司最核心、最烧算力的战役。训练稳定性直接决定旗舰模型能否按期炼成。这是一个端到端 Owner 岗,不是分工到某个组件的螺丝钉——你对训练能不能稳、跑得快不快这个结果负责,向上直面算法 / 训练团队的真实诉求。你将有从 0 到 1 搭建训练稳定性体系的空间:可观测、故障自愈、预案、效率工程,都还有大片可建设的地带。三、你将负责什么(职责)1. 训练全栈基础设施保障(横向拉通,核心)GPU 算力:GPU 机器交付与健康管理、坏卡 / 掉卡 / 降频的检测与自愈、节点池管理与快速置换。RDMA / 高性能网络:IB /
Riot Games was established in 2006 by entrepreneurial gamers who believe that player-focused game development can result in great games. In 2009, Riot released its debut title League of Legends to critical and player acclaim. As
SummaryImagine what you could do here. At Apple, quality isnt a checkpoint — its a mindset woven into every product, service, and experience we create. The people here dont just test software; they safeguard the customer experience
Schaeffler 是一家充满活力的全球性科技公司,其成功得益于企业家精神和悠久的家族企业历史。您觉得是否吸引到您?作为所有主要汽车制造商以及航空航天和工业领域重要企业的合作伙伴,我们可为您提供许多发展机会。 全球岗位名称 SQM Component Introduction Eng. (SQMC) SQM 元件导入工程师(SQMC) 主要职责 Participate in technical reviews, Risk Level Assessments (RLA), and sourcing decision meetings to ensure alignment and comprehensive evaluations. Lead and ensure the implementation of all
At AIA we’ve started an exciting movement to create a healthier, more sustainable future for everyone. As pioneering innovators for over 100 years, we’re now transforming our organisation to be faster, simpler and more connected. Because
Schaeffler 是一家充满活力的全球性科技公司,其成功得益于企业家精神和悠久的家族企业历史。您觉得是否吸引到您?作为所有主要汽车制造商以及航空航天和工业领域重要企业的合作伙伴,我们可为您提供许多发展机会。 全球岗位名称 SQM Component Introduction Eng. (SQMC) SQM 元件导入工程师(SQMC) 主要职责 Participate in technical reviews, Risk Level Assessments (RLA), and sourcing decision meetings to ensure alignment and comprehensive evaluations. Lead and ensure the implementation of all
训练AI Infra系统优化工程师 上海 校招 正式 技术族 - 软件类 职位 ID:A46765 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战; 投递...
大模型推理架构师 上海 社招 全职 互联网 / 电子 / 网游 职位描述 1. 参与 Soul 大模型、多模态模型、推荐模型等核心 AI 任务的训练与推理基础设施建设,提升模型从实验到线上部署的整体效率。2. 负责大规模分布式训练系统的性能优化,包括数据并行、张量并行、流水线并行、专家并行、参数/梯度/优化器状态切分、显存优化、通信调度等方向,提升 GPU/NPU 集群利用率。3. 参与高性能推理引擎建设,围绕大模型在线服务中的低延迟、高吞吐、弹性扩缩容、多租户隔离、KV Cache 管理、批处理调度、量化部署等问题进行系统优化。4. 针对 Soul 的实时社交、多模态内容理解、AIGC 互动等场景,设计和优化端到端 AI 系统架构,降低训练和推理成本,保障核心业务的稳定性和体验质量。5. 参与异构计算算子优化和计算图优化,包括 CUDA、Triton、CUTLASS、Ascend C、TileLang 等方向,针对 Attention、MoE、Embedding、推荐模型特征交互、多模态编码等关键模块进行性能调优。6. 参与 AI 编译器和模型编译优化相关工作,围绕
大模型后训练 TPM(技术项目管理)—— CQ 计划 上海 工程类 本科及以上 工作年限不限 职位描述 岗位定位Technical Project Manager 属于工程师序列,负责大模型后训练相关项目的技术推进与工程交付,协助项目负责人持续跟踪各研究方向的进展,推动数据、训练、评测和 Harness 验证形成闭环。这个岗位不是传统项目助理,也不是只负责排期、会议和信息同步的项目经理。候选人需要理解大模型后训练的基本技术链路,能够深入实验与工程现场,识别数据、算法、训练基础设施、评测和系统集成中的关键问题,并通过自动化工具、实验平台和工程流程推动项目落地。后训练不能脱离 Harness 单独优化。Harness 既是模型能力的应用载体和验证环境,也是训练信号的重要来源。模型在真实任务中的成功率、运行轨迹、工具调用、异常行为和失败案例,应当持续反哺数据构造、奖励设计、训练策略与评测体系。该岗位需要推动后训练与 Harness 协同演进,使模型能力提升最终能够转化为复杂任务中的稳定表现。核心职责- 协助项目负责人管理大模型后训练项目,维护各研究方向的负责人、技术目标、实验计划、依赖关系、里程碑和交付状态,持续识别阻塞项并推动解决。- 深入参与 SFT、偏好优化、强化学习、奖励模型、数据合成与数据治理等后训练工作,理解各研究点的技术假设、实验设计、资源需求和验证标准。- 建立并维护后训练项目的工程化管理体系,统一记录和管理实验配置、数据版本、代码版本、模型版本、训练任务、评测结果和关键技术决策,保证实验过程可追溯、结果可复现。- 监控训练与评测过程中的工程风险,包括数据质量、训练稳定性、指标漂移、评测污染、版本不一致、算力利用率和结果不可复现等问题。- 组织技术评审和阶段复盘,根据实验结果和工程证据判断研究方向是否继续、调整或停止,并推动有效方法沉淀为可复用的数据管线、训练组件、评测集和工程规范。- 在 AI 辅助下高效产出并维护实验看板、训练脚本、评测工具、技术方案、项目周报、风险清单和运行手册;我们不需要只转述进度、只组织会议的人。 职位要求 通用要求- 本科及以上学历,计算机、人工智能、软件工程、数据科学等相关专业优先;具备与岗位要求相匹配的工程实践经验者,可不受专业背景限制。- 理解大模型后训练的主要技术链路,包括数据构造与治理、SFT、偏好优化、强化学习、奖励设计、模型评测和版本迭代,能够与研究员和工程师使用同一套技术语言讨论问题。- 具备真实的机器学习、大模型训练或复杂技术项目推进经验,能够理解研究假设、实验设计、工程依赖和评测结果,并将其转化为清晰的项目计划与验收标准。- 熟悉基本的软件工程协作方式,包括 Git、代码评审、任务管理、版本管理、自动化测试和持续集成;能够推动实验流程和项目管理过程实现自动化与可追溯。-
【集团】-大数据开源组件研发工程师 上海 全职 职位描述 负责公司大数据基础架构核心组件的研发、优化和稳定性建设,重点参与流计算平台、海外云大数据平台以及开源大数据底座能力的持续演进。1. 参与 Hadoop、Spark、Flink、StarRocks 等开源组件的源码分析、问题定位、二次开发和版本升级;2. 重点负责 Flink / Spark Streaming 等流计算相关组件的性能优化、稳定性治理、任务调度优化和故障排查;3. 参与海外云环境下大数据平台的架构设计、成本优化、资源治理和稳定性建设,包括 Azure、Google Cloud、AWS 等云平台;4. 根据业务场景对实时计算、离线计算、存储、Shuffle、调度、查询等核心能力进行定制化改造;5. 参与流批一体、湖仓一体、存算分离、对象存储适配等方向的技术预研、方案设计和落地实施;6. 跟踪开源社区及海外云厂商大数据产品的发展,沉淀技术文档、最佳实践和平台化能力,提升团队整体研发效率。 职位要求 1. 计算机相关专业,本科及以上学历;2. 熟悉 Java / Scala / C++ / Go 中至少一种编程语言,具备良好的编码能力和工程实践能力;3. 熟悉 Hadoop、Spark、Flink、StarRocks 中至少一项,有源码阅读、问题排查或二次开发经验优先;4.
AI评测平台全栈开发工程师 北京 社招 全职 技术 - 开发 职位 ID:A26900 职位描述 岗位定位:负责公司级 AI 评测平台的架构设计、全栈研发与持续演进,建设覆盖自动化 Benchmark、人工体验评测、Judge Model 评测、榜单发布和模型晋级门禁的统一评测底座。该岗位需要把分散在算法、数据、训练、推理和产品团队中的评测流程平台化、标准化和可追溯化,支撑模型版本从 Checkpoint 产出到评测报告、Leaderboard 和发布决策的完整闭环。职责要点:1、设计并实现评测平台的核心领域模型和平台能力,包括 Benchmark Registry、评测集版本管理、Eval Job 编排、模型 / Checkpoint / 推理服务绑定、Judge Model 管理、人工体验反馈、结果解析归档、报告生成、榜单发布和模型晋级门禁;2、建设稳定可靠的异步评测任务系统,支持批量评测、任务优先级、资源配额、失败重试、幂等控制、运行日志、结果复现、失败诊断和成本统计;3、打通训练平台、推理平台、算力平台和数据平台等链路,实现训练产物自动评测、在线模型回归评测、评测数据集管理、算力资源申请和推理服务调用;4、建设评测结果分析能力,包括指标聚合、版本对比、维度切片、异常样本追踪、人工反馈闭环和可视化报表,帮助算法团队定位模型能力变化,并支撑模型晋级、回滚和对外展示决策。 职位要求 1、本科及以上学历,计算机、软件工程、人工智能、数据科学等相关专业优先;2、3 年以上全栈开发、平台研发、MLOps、评测系统或复杂业务系统研发经验,能够独立完成核心模块从需求抽象、技术设计到工程落地;3、熟悉 Python / Go / Java 等至少一种后端语言,并熟悉
About Ampd Energy Ampd Energy is transforming how cities build - cleaner, smarter, and more sustainably. We are trailblazers in making the construction industry emission-free. Our products are advanced, compact, and connected battery energy storage system
Career Area:Supply Chain and Logistics Job Description: Your Work Shapes the World at Caterpillar Inc. When you join Caterpillar, youre joining a global team who cares not just about the work we do – but also
26届校招-训练Infra工程师 北京 正式 互联网 / 电子 / 网游 职位描述 1. 参与训练框架研发与优化:协助团队进行大规模分布式训练框架的设计、实现与维护,支持复杂AI模型(如大语言模型、多模态模型)的高效训练。2. 性能调优与效率提升:在导师指导下,优化训练过程中的内存管理、计算资源调度和分布式通信效率,提升训练速度和资源利用率。3. 集成与适配先进技术:学习并应用业界前沿的训练加速技术(offload、动态分布式并行/流水线排布),确保框架的先进性和竞争力。4. 支持算法研发与交付:与算法工程师紧密配合,提高训练效率,降低研发成本,提升交付能力。 职位要求 1. 基础技能: - 熟练掌握 Python 和 C++ 编程语言,具备扎实的数据结构、算法和操作系统基础。 - 熟悉至少一种主流深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理和机制。 - 了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验。2. 专业知识: - 对 Transformer 架构及主流大模型(如GPT、Llama等)的训练特性有基本理解。 - 了解分布式训练的基本原理(如数据并行、模型并行、流水并行)和常见挑战。3.
AI 评测平台开发工程师(全栈) 北京 社招 全职 技术 - 开发 职位 ID:A54417 职位描述 岗位定位:负责公司级 AI 评测平台的架构设计、全栈研发与持续演进,建设覆盖自动化 Benchmark、人工体验评测、Judge Model 评测、榜单发布和模型晋级门禁的统一评测底座。该岗位需要把分散在算法、数据、训练、推理和产品团队中的评测流程平台化、标准化和可追溯化,支撑模型版本从 Checkpoint 产出到评测报告、Leaderboard 和发布决策的完整闭环。职责要点:设计并实现评测平台的核心领域模型和平台能力,包括 Benchmark Registry、评测集版本管理、Eval Job 编排、模型 / Checkpoint / 推理服务绑定、Judge Model 管理、人工体验反馈、结果解析归档、报告生成、榜单发布和模型晋级门禁;建设稳定可靠的异步评测任务系统,支持批量评测、任务优先级、资源配额、失败重试、幂等控制、运行日志、结果复现、失败诊断和成本统计;打通训练平台、推理平台、算力平台和数据平台等链路,实现训练产物自动评测、在线模型回归评测、评测数据集管理、算力资源申请和推理服务调用;建设评测结果分析能力,包括指标聚合、版本对比、维度切片、异常样本追踪、人工反馈闭环和可视化报表,帮助算法团队定位模型能力变化,并支撑模型晋级、回滚和对外展示决策。 职位要求 本科及以上学历,计算机、软件工程、人工智能、数据科学等相关专业优先;3 年以上全栈开发、平台研发、MLOps、评测系统或复杂业务系统研发经验,能够独立完成核心模块从需求抽象、技术设计到工程落地;熟悉 Python / Go / Java
Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to