Refine Reset All
Sort by
Job Title
Location
Job Type
Employer/Recruiter
Date Posted
Job Title
Skills
Location
Job Type
Employer/Recruiter
All Filters

Ppo Jobs In China - 64 Job Positions Available

Top Cities:
1 – 20 of 64 jobs
NIO jobs

智能辅助驾驶算法工程师(端到端模型 / 强化学习) AD内推 蔚来自动驾驶研发团队 北京 社招 全职 数字技术 - 算法 硕士及以上 3-5 年 职位描述 负责端到端智能辅助驾驶轨迹生成算法的研发与优化,重点方向包括但不限于:端到端模仿学习(如 VLA/世界模型、自回归生成、Diffusion Policy 等);强化学习(涵盖轨迹生成、闭环训练、世界模型等相关技术)。持续跟踪人工智能领域的前沿技术动态,推动先进算法在量产项目中的实际应用与落地。 职位要求 硕士及以上学历,计算机、软件工程、人工智能或相关专业;具备扎实的深度学习理论基础,熟悉常见深度学习与机器学习算法;熟练掌握至少一种主流深度学习框架,具有 TensorFlow 或 PyTorch 深度开发经验者优先。【加分项】①具备端到端路径/轨迹生成相关经验,熟悉以下任一方向者优先:主流模仿学习方法(如行为克隆);主流 BEV 任务(如动态/静态目标检测与跟踪等);时序建模方法(RNN/LSTM/GRU等)。②具备强化学习相关经验,熟悉以下任一方向者优先:主流 RL 算法(如 DQN、DDPG、SAC、PPO、GRPO 等);强化学习在轨迹预测、决策规划或仿真环境中的应用;世界模型(World Model)、模型预测控制(MPC)或基于强化学习的闭环仿真技术。③具备 VLA/VLN/世界模型等相关项目实践经验,熟悉以下任一方向者优先:主流 VLA 方法(如 OpenVLA、PAI0 等);主流世界模型方法(如

NIO  25 days ago
ZERON 零一汽车 jobs

高级智能驾驶算法工程师 - 强化学习(RL) 上海 全职 职位描述 -研发强化学习、模仿学习、人类反馈强化学习在智驾领域的融合方式,提升系统表现与安全性。-开发基于强化学习与生成式模型的闭环仿真算法和基础设施,实现大规模场景的闭环训练。 职位要求 -具有计算机视觉,机器学习,电子信息,机器人等相关学科硕士/博士学历,AI相关研究方向。-精通强化学习主流算法(PPO/SAC/GRPO等),有结合世界模型/神经渲染方法进行闭环训练的项目经验。-熟悉大规模分布式RL训练,在自动驾驶或机器人领域有完整的RL落地项目经验。-能够紧跟学术界和产业界技术动态,对新技术进行调研和原型验证。有相关领域顶会文章发表经历优先。-精通Python/C++编程,熟练掌握PyTorch等深度学习框架-具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...

Premium Full-time
ZERON 零一汽车  25 days ago
XPENG jobs

【27届校招】智能座舱算法工程师(仿真,北京) 北京 正式 研发 - 算法 职位描述 参与智能座舱仿真评测平台的核心算法研发工作,围绕评测 - 仿真 - 智能体三大方向,推动座舱交互体验的自动化评测与持续优化。具体工作内容包括但不限于:1、评测体系构建- 设计并构建智能座舱场景下的评测 Benchmark,覆盖多轮对话、多模态交互、任务完成度等维度- 研发评测 Reward Model,建立可量化、可迭代的自动化评分体系2、智能体(Agent)研发- 构建评测 Agent,实现对座舱对话系统的自动化、规模化测试- 设计用户行为仿真 Agent,模拟真实用户在座舱场景中的交互行为与意图模式3、仿真环境搭建- 参与座舱环境仿真系统的研发,构建可复现、可配置的虚拟测试环境- 参与感知仿真模块开发,模拟语音、视觉、手势等多模态输入信号 职位要求 1、扎实的编程能力,熟练掌握 Python,熟悉常用深度学习框架(PyTorch 等);2、了解大语言模型(LLM)的基本原理与应用,有 Prompt Engineering 或模型微调经验;3、具备以下至少一个方向的实际项目或研究经验:-大模型应用 / Agent 构建-强化学习(RLHF、PPO、Reward Modeling 等)-对话系统 / NLP-数据处理与分析-良好的自驱力与沟通能力,能独立推进研究课题【加分项】1、在

XPENG  28 days ago
XPENG jobs

【27届校招】多语言基座模型算法工程师 北京 正式 研发 - 算法 职位描述 1.负责多语言、多模态基座模型的研发与优化,重点面向多语言理解与生成、多轮对话,以及图文、视频、语音等多模态交互场景。 2.参与大规模多语言、多模态预训练体系建设,包括语料构建、数据清洗与配比、训练目标设计、模型结构优化及训练稳定性提升。 3.负责多模态模型后训练能力建设,包括 SFT、RL、偏好对齐、拒答与安全对齐、工具调用,以及复杂任务中的对话理解、推理和执行能力增强。 4.跟踪多语言大模型、多模态大模型、对话模型及强化学习对齐方向的前沿进展,推动关键算法复现、优化与落地。 职位要求 1.计算机、人工智能、电子信息、数学等相关专业本科及以上学历,硕士/博士优先。 2.熟悉 Transformer、大语言模型、多模态大模型或对话系统相关技术,具备基座模型研发经验者优先。 3.熟悉大规模预训练、SFT、RLHF/RLAIF、DPO、PPO、GRPO 等训练或对齐方法中的一种或多种。 4.具备大规模分布式训练经验,了解混合精度训练、数据并行、模型并行、DeepSpeed、Megatron-LM、FSDP 等技术者优先。 5.具备多语言模型、机器翻译、跨语言表示学习、语音语言模型或多语言对话系统经验者优先。 6.具备良好的论文阅读、问题分析、实验设计和工程实现能力,能够独立推动算法方案从调研到落地。 投递...

XPENG  28 days ago
XPENG jobs

【27届校招】多语言基座模型算法工程师 北京 正式 研发 - 算法 通用智能板块 职位描述 1.负责多语言、多模态基座模型的研发与优化,重点面向多语言理解与生成、多轮对话,以及图文、视频、语音等多模态交互场景。 2.参与大规模多语言、多模态预训练体系建设,包括语料构建、数据清洗与配比、训练目标设计、模型结构优化及训练稳定性提升。 3.负责多模态模型后训练能力建设,包括 SFT、RL、偏好对齐、拒答与安全对齐、工具调用,以及复杂任务中的对话理解、推理和执行能力增强。 4.跟踪多语言大模型、多模态大模型、对话模型及强化学习对齐方向的前沿进展,推动关键算法复现、优化与落地。 职位要求 1.计算机、人工智能、电子信息、数学等相关专业本科及以上学历,硕士/博士优先。 2.熟悉 Transformer、大语言模型、多模态大模型或对话系统相关技术,具备基座模型研发经验者优先。 3.熟悉大规模预训练、SFT、RLHF/RLAIF、DPO、PPO、GRPO 等训练或对齐方法中的一种或多种。 4.具备大规模分布式训练经验,了解混合精度训练、数据并行、模型并行、DeepSpeed、Megatron-LM、FSDP 等技术者优先。 5.具备多语言模型、机器翻译、跨语言表示学习、语音语言模型或多语言对话系统经验者优先。 6.具备良好的论文阅读、问题分析、实验设计和工程实现能力,能够独立推动算法方案从调研到落地。 投递...

XPENG  28 days ago
Maersk jobs

Job Purpose •Own end-to-end service delivery performance, ensuring operational excellence, customer experience, and alignment with Lead Logistics product standards. •Drive transformation through digital adoption, process standardization, and continuous improvement, embedding The Maersk Way into daily operations.

Maersk  23 days ago
NIO jobs

机器人运控算法工程师 上海、合肥 社招 全职 数字技术 - 算法 本科及以上 7-10 年 职位描述 1)负责工业机械臂运动学建模与轨迹规划,完成正逆解计算、关节/笛卡尔空间轨迹规划及插值算法开发,支撑抓取、放置、分拣、上料等动作执行。2)承接VLA与视觉算法下发的目标位姿,生成动态轨迹;针对无序抓取场景实现实时避障、运动平顺优化与启停缓冲,避免机械臂抖动、冲击工件或碰撞设备。3)研发抓取柔顺控制算法,优化末端力控参数,解决轻薄、易碎、异形物料抓取中的打滑与压损问题,保障产线连续稳定作业。4)负责机器人仿真环境搭建,完成Sim2Real策略迁移验证,缩短现场调试周期;配合VLA算法生成仿真数据,支撑大模型训练。5)负责真机运动算法部署、参数整定与现场调试,配合视觉及VLA工程师完成系统联调,优化运动节拍,匹配产线生产效率指标。 职位要求 1)硕士及以上学历,自动化、机器人、控制工程、机械电子等相关专业,2年以上工业机械臂运控算法研发落地经验。2)精通机器人正逆运动学与动力学,熟练掌握五次多项式、梯形/S曲线等轨迹规划与插值算法,具备轨迹优化实操经验。3)熟悉阻抗控制、力控等柔顺控制算法,有协作机器人力控抓取经验者优先。4)熟练使用Mujoco、Isaac Sim、CoppeliaSim等至少一款仿真平台,有Sim2Real迁移落地经验。5)熟练C++/Python开发,熟悉ROS及机械臂控制接口,有六轴协作臂真机调试与算法部署经验者优先。6)熟悉强化学习(如PPO等)在运动优化中应用者优先。7)具备工业现场意识,能配合现场完成调试迭代,了解分拣、上料产线业务流程者优先。 投递...

Premium Full-time
NIO  23 days ago
Apple jobs

SummaryJoin Apples Hardware Technology team in the Display PPO group, where we push the boundaries of TFT architecture and next-generation display technologies. As a Process & Integration Engineer, youll be at the forefront of innovation, working on

Apple  19 days ago
智元创新(上海)科技有限公司 jobs

运控算法工程师-酷拓子公司 深圳 校招 正式 技术族 - 算法类 职位 ID:A57704 职位描述 酷拓是智元旗下专注四足机器人的独资子公司,以全地形智能移动与作业平台为核心定位。依托智元“三智一体”技术底座,彻底打破传统机器人“腿长脑子空”的局限,将其升级为具备自主决策能力的AGI四足新物种。1. 负责基于强化学习的四足机器人运动控制算法的研发、优化与工程落地;2. 负责仿真环境(如Isaac Gym、MuJoCo等)的构建与策略训练,推进仿真到仿真(Sim2Sim)及仿真到现实(Sim2Real)的稳定部署,提升运控算法在实际环境中的鲁棒性;3. 深入分析机器人动力学特性与硬件限制(如关节迟滞、摩擦力、通信延迟等),推动算法在物理系统上的适应性改进;4. 跟进领域前沿技术,参与技术方案规划与核心模块设计,指导和协助团队成员开展研发工作。 职位要求 1. 自动化、机械电子、计算机、人工智能等相关专业硕士或博士学历,2年以上足式运控算法研发经验;2. 在足式机器人(四足/双足)强化学习领域有扎实的实践经验,熟悉ppo、amp、mimic等主流learning-based运控算法及其工程实现;3. 精通Python,熟练掌握PyTorch/TensorFlow等深度学习框架,具备扎实的算法实现与调试能力;4. 具备良好的团队协作与沟通能力,能独立承担项目关键模块的研发与推进。5. (加分项) 在ICRA、IROS、RSS等机器人顶级会议发表过相关论文。 投递...

Premium Full-time
智元创新(上海)科技有限公司  17 days ago
Xiaomi jobs

机器人强化学习算法工程师(技术预研方向) 北京 社招 全职 职位 ID:A141640 职位描述 1. 开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2. 负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3. 持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1. 硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2. 具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3. 掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4. 扎实的C++、python编程能力;5. 数学基础扎实,具有较强的学习与研究能力;6. 熟悉大模型理论者优先。 投递...

Premium Full-time
Xiaomi  17 days ago
Xiaomi jobs

大模型后训练实习生 上海 社招 全职 职位 ID:E6114 职位描述 1. 数据工程:构建和维护 RTL(Verilog)指令微调数据集,包括 spec→RTL 对齐、功能验证数据生成、DPO 偏好对构建;2. 模型微调:基于 MS-Swift / LLaMA-Factory 等框架,对 Qwen2.5-Coder 等开源代码模型进行 SFT / DPO / GRPO 后训练;3. 评估体系搭建:搭建和维护 GenBen、VerilogEval 等基准测试评估 pipeline,集成 Yosys 综合 + Verilator 仿真;4. 实验迭代:跟踪

Xiaomi  17 days ago
Xiaomi jobs

自动驾驶基座模型(强化学习方向) 北京 社招 全职 职位 ID:A204396 职位描述 负责强化学习的框架在自动驾驶场景中的前沿算法研究,;负责强化学习的框架在自动驾驶场景中的前沿算法研究,;参与大模型基座范式下(VLA+World Model)的强化学习框架搭建;负责将大模型(AD Agent)作为基础代理,利用 RL 技术优化其在复杂自动驾驶场景中的感知、推理和长期决策能力,涵盖场景理解、语义引导决策、时空建模等核心能力,并推动大模型与安全(Safety-Critical RL)及人类偏好(RLHF/DPO/PPO for AD)的深度对齐。 职位要求 教育背景:计算机科学、人工智能、机器人学、自动驾驶或相关领域的博士学位,或具备等效的研究经验;精通深度强化学习理论及其核心算法(如PPO, TD3, GRPO等系列)理论与实践能力:扎实的机器学习、深度学习理论基础,具有视觉理解、自然语言处理与行为决策的交叉领域研究背景;编程能力:熟练掌握Python及主流深度学习框架(如PyTorch、TensorFlow等),有高效模型训练与大规模数据处理经验;学术能力:具有在国际顶级会议(NeurIPS、ICLR、CVPR、ICCV等)上发表过论文的经验,或参与过具有影响力的学术竞赛(如COCO、Kitti、nuScenes等);跨学科能力:具备跨学科协作能力,能够有效将计算机视觉、自然语言处理与机器人学的知识融合,推动自动驾驶机器人领域的创新;加分项:熟悉自动驾驶系统(感知-预测-规划)架构,理解 World Model 如何支持基于 RL 的规划算法(如 MCTS)具有自动驾驶平台(如CARLA、Waymo、nuScenes等)上的实验经验。 投递...

Premium Full-time
Xiaomi  17 days ago
Xiaomi jobs

足式机器人运动控制算法工程师(强化学习) 北京 社招 全职 职位 ID:A200582 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略; 2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用; 4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等; 4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 具备足式机器人强化学习算法的实机调试和sim-to-real经验,有基于模型/优化等传统控制经验者优先; 6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

Xiaomi  17 days ago
ABB jobs

At ABB, we help industries run leaner and cleaner—and every person here makes that happen. You’ll be empowered to lead, supported to grow, and proud of the impact we create together. Join us and help run

ABB  17 days ago
Xiaomi jobs

具身智能算法工程师-模型 北京 社招 全职 职位 ID:A105241 职位描述 1. 负责面向机器人操作任务的端到端模型研发,探索 Vision-Language-Action(VLA)模型在灵巧操作、长序列任务规划中的应用,推动通用操作策略的落地;2. 开展 World Model 相关研究,构建面向机器人操作的环境预测与动态建模能力,提升策略的泛化性和样本效率;3. 研究基于强化学习的高自由度灵巧手控制方法,包括 PPO、SAC、IQL等主流 RL 方法,探索仿真到真实的 Sim-to-Real 迁移技术;4. 负责大规模模型的训练基础设施搭建与优化,包括分布式训练、混合精度、推理加速及部署上线;5. 持续跟踪具身智能、操作学习、基础模型等领域的前沿进展,推动技术复现、改进与工程化落地。 职位要求 1. 计算机、人工智能、自动化、机器人等相关专业,硕士及以上学历(博士优先);2. 具备扎实的深度学习理论基础,熟练掌握 PyTorch 等主流框架,有大模型训练与调优经验者优先;3. 熟悉Gr00t和PI等系列经典VLA操作模型相关工作,对 VLM 与机器人控制的结合有深入理解;4. 了解强化学习基本原理,熟悉 MuJoCo、Isaac Lab/Gym 等仿真平台,有 Sim-to-Real 实验经验者优先;5.

Xiaomi  17 days ago
Delart jobs

About the job Delart is home to a team of world-class engineers and project leaders dedicated to developing the next generation of advanced networking technologies, consumer devices, and innovative technology solutions. Trusted by some of the

Delart  15 days ago
NIO jobs

Super Sparks-校招-具身智能/机器人研究员(Embodied AI / Robotics Researcher) 上海 校招 正式 数字技术 - 算法 博士及以上 Super Sparks 招聘计划 职位 ID:A258152A 职位描述 -探索具身智能前沿技术,制定技术路线,统筹内部研发方向;-开发、微调视觉-语言-动作(VLA)大模型(如 RT-2、OpenVLA、Groot、pi0 等),实现环境理解、任务分解与动作生成;-设计基于 Transformer、Diffusion Policy 的抓取与运动规划算法,提升操作泛化性;-领导或参与核心算法研究,覆盖具身交互、感知、操作、仿真、训练等方向,提升具身能力与可靠性;-对特定场景使用仿真数据集或模型数据集强化训练,确保操作成功率;-在机器人平台部署 VLA 模型,通过模型量化、推理加速等方式提升整体执行效果;-推动相关工具建设,高效训练与验证部署,加快具身智能的产品化落地。 职位要求 -计算机/机器人/人工智能等相关领域硕士或博士;-精通 Python/C++,掌握 PyTorch/TensorFlow 框架;-深入理解强化学习基本原理与核心算法(PPO、SAC 等)及常用框架;-深入理解大模型(VLM、VLA)开发流程(训练、微调、部署),并有实际项目经历;-深入理解机器人学习算法,具备强化学习用于机器人领域的项目经验;-在顶会(CoRL、ICRA、IROS、CVPR、ICLR 等)发表具身智能或大模型相关论文优先;-具备 OpenVLA、Groot、pi0 等 VLA

NIO  16 days ago
NIO jobs

Super Sparks-校招-机器人仿真系统研究员/工程师 上海 校招 正式 数字技术 - 算法 博士及以上 Super Sparks 招聘计划 职位 ID:A221758 职位描述 构建高保真仿真环境,实现算法高效训练与低成本迁移。- 搭建机器人仿真环境,包括传感器、执行器、交互对象及周围环境,模拟真实物理特性;- 构建泛化动态交互场景,支持算法训练;- 机器人算法的训练和验证:评估提供合适强化学习训练框架(如PPO/SAC),并验证训练算法在模拟环境中的效果;- 支持SimtoReal调试,根据实际差异,优化仿真参数;- 持续追踪仿真最新算法和技术,开展机器人仿真技术规划、仿真工具链建设; 职位要求 - 计算机/机器人/人工智能等相关领域的硕士或博士;- 熟悉Issac Lab、Mujoco等主流仿真平台,具备基于上述平台的环境搭建与测试能力;- 熟悉C++、Python,熟悉ROS/ROS2;- 熟悉机器人运动学、动力学,熟悉传感器内外参标定;- 具备移动机器人、机械臂仿真开发训练经验优先;- 具备SimtoReal经验优先;- 有持续学习和创新精神,能自主、高效工作。 投递...

NIO  16 days ago
NIO jobs

提前批-大模型算法工程师(主动安全方向) 上海、北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A31065 职位描述 负责端到端决策模型算法的研发量产工作,主要聚焦于主动安全业务,重点方向包括但不限于。模仿学习(如自回归生成、Diffusion Policy 等)强化学习(涵盖轨迹生成、闭环训练、世界模型等相关技术)一段式端到端模型的研发构建高质量数据集,支持模型迭代优化持续跟踪人工智能领域的前沿技术动态,推动先进算法在量产项目中的实际应用与落地。 职位要求 硕士及以上学历,计算机 / 软件工程 / 人工智能等相关专业。扎实的深度学习算法基础,精通常见的深度学习和机器学习算法。面对未知的领域和问题,有非常强的自学能力,善于通过基本的研究方法对问题本身进行拆解,并找到每个步骤的解决办法。有着良好的团队合作精神,能够同公司内部的不同团队保持合作关系。加分项相关领域的博士研究生。具备端到端路径/轨迹生成相关经验,熟悉主流模仿学习方法,如diffusion,自回归等具备强化学习在轨迹预测、决策规划的相关经验,熟悉主流强化学习方法,如 DQN、DDPG、SAC、PPO、GRPO 等有过相关领域的顶级会议论文发表(CVPR、ICCV、ECCV等等)或在相关领域的学术竞赛(ImageNet、COCO、Kitti、Waymo等等)中取得较好成绩者优先 投递...

Premium Full-time
NIO  16 days ago
NIO jobs

提前批-端到端智能辅助驾驶大模型-后训练方向 上海、北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A215668 职位描述 1、负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法;2、构建仿真环境,设计奖励机制,训练并调优智能体策略;3、与产品和工程团队紧密合作,将RL算法落地到实际业务场景;4、跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率;5、撰写技术文档,参与代码评审,推动团队技术能力提升。 职位要求 1、计算机、人工智能、自动化、数学等相关专业硕士及以上学历;2、扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念;3、熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力;4、有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先;5、具备良好的问题分析能力、团队协作能力和技术沟通能力。 投递...

Premium Full-time
NIO  16 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

ppo

You also might be interested in:

实习生

Python

PyTorch

Harness

AI

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Location
Job Type
Employer/Recruiter