Refine Reset All
Sort by
Job Title
Job Type
Employer/Recruiter
Date Posted
Job Title
Location
Job Type
Employer/Recruiter
All Filters

Ppo Jobs In Beijing (Peking) - 17 Job Positions Available

Top Cities:
1 – 14 of 17 jobs
Xiaomi jobs

机器人强化学习算法工程师(技术预研方向) 北京 社招 全职 职位 ID:A141640 职位描述 1. 开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2. 负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3. 持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1. 硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2. 具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3. 掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4. 扎实的C++、python编程能力;5. 数学基础扎实,具有较强的学习与研究能力;6. 熟悉大模型理论者优先。 投递...

Premium Full-time
Xiaomi  22 days ago
Xiaomi jobs

自动驾驶基座模型(强化学习方向) 北京 社招 全职 职位 ID:A204396 职位描述 负责强化学习的框架在自动驾驶场景中的前沿算法研究,;负责强化学习的框架在自动驾驶场景中的前沿算法研究,;参与大模型基座范式下(VLA+World Model)的强化学习框架搭建;负责将大模型(AD Agent)作为基础代理,利用 RL 技术优化其在复杂自动驾驶场景中的感知、推理和长期决策能力,涵盖场景理解、语义引导决策、时空建模等核心能力,并推动大模型与安全(Safety-Critical RL)及人类偏好(RLHF/DPO/PPO for AD)的深度对齐。 职位要求 教育背景:计算机科学、人工智能、机器人学、自动驾驶或相关领域的博士学位,或具备等效的研究经验;精通深度强化学习理论及其核心算法(如PPO, TD3, GRPO等系列)理论与实践能力:扎实的机器学习、深度学习理论基础,具有视觉理解、自然语言处理与行为决策的交叉领域研究背景;编程能力:熟练掌握Python及主流深度学习框架(如PyTorch、TensorFlow等),有高效模型训练与大规模数据处理经验;学术能力:具有在国际顶级会议(NeurIPS、ICLR、CVPR、ICCV等)上发表过论文的经验,或参与过具有影响力的学术竞赛(如COCO、Kitti、nuScenes等);跨学科能力:具备跨学科协作能力,能够有效将计算机视觉、自然语言处理与机器人学的知识融合,推动自动驾驶机器人领域的创新;加分项:熟悉自动驾驶系统(感知-预测-规划)架构,理解 World Model 如何支持基于 RL 的规划算法(如 MCTS)具有自动驾驶平台(如CARLA、Waymo、nuScenes等)上的实验经验。 投递...

Premium Full-time
Xiaomi  22 days ago
Xiaomi jobs

足式机器人运动控制算法工程师(强化学习) 北京 社招 全职 职位 ID:A200582 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略; 2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用; 4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等; 4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 具备足式机器人强化学习算法的实机调试和sim-to-real经验,有基于模型/优化等传统控制经验者优先; 6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

Xiaomi  22 days ago
NIO jobs

端到端算法工程师 北京 实习 数字技术 - 算法 职位 ID:A72815 职位描述 - 参与深度学习、强化学习等相关算法的研究与实现;- 在实际场景中开展强化学习(如 PPO、SAC、GRPO/DPO 等)的实验与改进;- 支持智能辅助驾驶或RL闭环仿真等前沿应用方向的研发工作;- 撰写技术文档,参与团队技术分享与学术交流。- 支持团队完成数据处理、模型训练与实验分析。 职位要求 在读硕士或博士,计算机、人工智能、自动化、电子工程或相关专业,距离毕业 1 年及以上;- 熟悉深度学习主流模型与架构(Transformer、Diffusion);- 对强化学习方法有一定理解,熟悉以下任一方向: - 主流 RL 算法(DQN、DDPG、SAC、PPO、GRPO 等); - 强化学习在轨迹预测、决策规划或模拟环境中的应用; - 世界模型(World Model)、3DGS 或基于 RL 的闭环仿真;- 有视觉感知 /

Premium Full-time SLAM
NIO  15 days ago
NIO jobs

大规模仿真强化学习实习生 北京 实习 数字技术 - 算法 职位 ID:A236840 职位描述 参与大规模自博弈强化学习训练实验,设计和构建大规模、高吞吐量的批处理仿真器,十亿级仿真训练吞吐的驾驶经验生成 ;并改进 PPO 等高效的在策略(On-Policy)强化学习算法进行大规模训练 。辅助算法的鲁棒性与泛化性验证。参与攻坚仿真到现实的迁移 (Sim2Real),参与研究和评估策略的Sim2Real迁移性能,探索域随机化(Domain Randomization)、系统辨识(System ID)等技术,以提升策略对真实世界变化的适应能力。协助团队将训练好的策略部署到真实世界的车辆平台上进行验证。 职位要求 (必要条件)教育背景: 计算机科学、人工智能、机器人学或相关领域的在读27届及之后毕业的博士/硕士研究生/优秀本科生。 对以下至少两个领域有扎实的知识基础和相关的项目/研究经验:强化学习: 熟悉多智能体RL、自博弈、PPO、SAC等主流算法。生成式模型: 熟悉 Diffusion 模型、GANs 等,并有相关实践经验。Sim2Real: 对仿真到现实的迁移问题有了解或实践经验。编程与系统能力:精通 Python 和 PyTorch/Jax,具备训练和调试复杂强化学习算法的能力。拥有构建或使用高性能、批处理仿真环境(如 Isaac Gym/Lab)的经验 。具备优秀的系统设计和性能优化能力,熟悉 GPU 编程者优先。算法知识: 精通 PPO 等主流深度强化学习算法,并理解其在大型分布式系统中的应用 。加分项(优先条件)对

NIO  15 days ago
NIO jobs

智能辅助驾驶算法实习生(视觉感知 / 端到端模型 / 强化学习) 北京 实习 数字技术 职位 ID:A36277 职位描述 1. 参与智能辅助驾驶相关算法的研发与验证,方向包括但不限于: - 视觉感知(目标检测、语义分割、跟踪、BEV 表征等); - 端到端模型(规划预测一体化、行为建模、多模态融合等); - 强化学习(轨迹生成、决策规划、闭环训练、世界模型等)。2. 支持团队完成数据处理、模型训练与实验分析; 职位要求 岗位要求1. 计算机、人工智能、自动化、电子工程等相关专业,硕士或博士在读,距离毕业 1 年及以上;2. 熟练掌握 Python / C++,具备扎实的算法与编程能力;3. 有 视觉感知 / 端到端模型 / 强化学习

NIO  15 days ago
小米科技 Xiaomi Technology jobs

机器人运动控制算法实习生 北京 校招 实习 软件研发类 职位描述 1、开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2、负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3、持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1、硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2、具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3、掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4、扎实的C++、python编程能力;5、数学基础扎实,具有较强的学习与研究能力;6、熟悉大模型理论者优先; 投递...

Premium Full-time
小米科技 Xiaomi Technology  13 days ago
小米科技 Xiaomi Technology jobs

足式机器人运动控制算法工程师实习生(强化学习) 北京 校招 实习 算法类 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略;2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用;4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等;4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 有足式机器人强化学习算法的实机调试和sim-to-real经验者优先,有基于模型/优化等传统控制经验者优先;6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

小米科技 Xiaomi Technology  13 days ago
小米科技 Xiaomi Technology jobs

能耗优化算法工程师-2027届 北京 校招 实习 算法类 职位描述 1. 负责整车热管理与能耗优化物理建模算法和AI建模算法研发2. 用机器学习算法对整车热管理与能耗进行优化、数据分析及可视化3. 负责能耗优化算法的端侧部署、性能与耗时优化;负责算法的实车验证,迭代优化;用户评价追踪。 职位要求 1.硕士及以上学历;车辆工程、自动化、能源与动力、统计学等相关专业优秀的软件工程素养,精通Python、C/C++程序设计;2. 熟悉C++/python等编程语言,熟悉PyTorch等深度学习框架;4、熟悉DDPG/GRPO/PPO/AC学习等强化学习算法加分项:1.良好的英语沟通能力;2.优化的物理/数学建模功底3.发表过SCI一区/二区,CCF-A类会议等高水平论文 投递...

Premium Full-time
小米科技 Xiaomi Technology  13 days ago
小米科技 Xiaomi Technology jobs

大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...

小米科技 Xiaomi Technology  13 days ago
XPENG jobs

【27届校招】大模型算法工程师 北京 正式 研发 - 算法 通用智能板块 职位描述 岗位简介:聚焦云端大模型算法研发,包括 VLM / VLA 大模型、世界动作模型(WAM)等,重点解决自动驾驶场景数据闭环体系及数据治理能力建设;利用语义标签、长时序描述及推理、向量化或隐空间表征等建立数据图谱,实现大规模数据分层治理。岗位职责:1、云端基座大模型研发:负责数据驱动的云端基座大模型算法研发,基于海量量产数据,研发无监督、自监督算法,持续提升大模型的场景语义理解与物理空间感知能力,进而提高云端大模型的时空感知、推理、预测、分析能力;2、空间推理产线建设:负责基于多传感器数据融合、时空信息融合的自动标注算法,构建具有精度高、场景泛化性强的时空数据生产产线,持续推动物理AI云端大模型研发;3、Scaling Law 驱动的算法研发:负责车云平台一体化大模型算法研发与优化,研发和设计基于数据驱动的感知迭代链路;构建高效的自训练感知流水线,提升数据闭环效率;4、强化学习研发:基于 PPO、DPO、GRPO、SAC 等主流强化学习算法,搭建长尾场景的后训练方案,完成奖励设计、分布式训练、模型调优,提升模型在复杂场景、恶劣天气、小众交通场景下的泛化能力与稳定性。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先。具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通 VLM / VLA 端到端自动驾驶模型原理与全链路研发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾或机器人大模型落地经验优先;3、强化学习能力:熟练掌握 PPO、DPO、GRPO 等算法,具备用强化学习解决问题的实战经验,有智驾或机器人项目量产落地经验;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用 PyTorch,掌握 Agent / Harness 等自动化工具;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。加分项1、参与过自动驾驶或机器人技术路线、算法体系标准搭建;2、深耕VLM/VLA预训练、后训练方向,有相关落地成果;3、拥有顶会论文、核心专利成果。 投递...

Premium Full-time Harness
XPENG  8 days ago
千寻智能(杭州)科技有限公司 jobs

【2027届校招】运控算法工程师 北京 正式 互联网 / 电子 / 网游 千寻智能2027届校招实习招聘项目 职位描述 岗位职责1. 基于强化学习的人形机器人(轮式/轮足/双足)运动控制算法研究与实现,包括行走、操作、跑步、跳跃等动态运动技能的训练与部署。2. 设计并优化Sim-to-Real迁移策略,解决仿真与真实机器人之间的动力学差异(domain gap),针对机器人本体特性提出算法与机电协同设计的改进建议。3. 构建强化学习训练框架(如Isaac Gym、Mujoco + RLlib等),探索强化学习与传统控制融合、大小脑算法融合。4. 参与机器人运动学、动力学模型的搭建与仿真环境构建,建立基于强化学习的运动性能评估标准,与传统控制方法性能做对比。5. 跟踪前沿强化学习算法(如PPO、SAC、TD3、Dropout Q-learning等)及机器人运动控制领域最新成果,进行技术文献调研与原型实现。 职位要求 职位要求1. 硕士及以上学历,有强化学习在实际机器人系统上的部署经验、有Sim-to-Real迁移(域随机化、系统辨识、教师-学生策略等)实际项目经验。2. 深入理解强化学习基础理论,熟悉MDP建模、策略梯度、价值函数估计、探索-利用权衡等核心概念。3. 熟练掌握至少一种主流强化学习框架(RLlib、Stable-Baselines3、Acme、TensorFlow Agents等),并有实际训练与调优经验。4. 熟悉机器人学与传统运控(运控规划、运动学、动力学等),与仿真环境(Mujoco、PyBullet、Isaac Gym等)进行交互,设计状态空间、动作空间与奖励函数。5. 熟悉ROS2框架,掌握最优化与数值计算方法,能够理解强化学习算法中的梯度估计、约束优化等问题。6. 熟悉NVIDIA Isaac Sim/Isaac Gym、MuJoCo等高性能仿真训练平台,熟练使用C++、Python,熟悉Eigen、NumPy等科学计算库,具备良好的工程化代码能力。7. 熟悉常用传感器(IMU、力矩/力传感器、编码器等)及其在强化学习观测空间中的建模方法,了解状态估计与滤波技术。8. 保持对具身智能前沿技术的持续关注,有技术热情和技术审美,敢于创新,追求卓越。优先条件1. 具有人形机器人、四足机器人或其他复杂多体系统的强化学习运动控制经验者优先。2.

Premium Full-time
千寻智能(杭州)科技有限公司  1 day ago
KAON jobs

算法工程师 - LLM后训练 Beijing Full-time R&D - Algorithm Responsibilities 参与公司AI算法相关工作,专注于提升大语言模型(LLM)的生成质量,推动技术创新和产品落地,具体职责包括但不限于:1. 监督微调:深入研究和实施大语言模型(LLM)的SFT、RFT等技术方案,优化AI的情感表达能力和剧情设计能力,突破长期记忆、行为一致性等技术难点2. 奖励模型:基于海量用户交互日志和反馈数据,深入挖掘真实用户偏好信号,构建高质量的偏好数据集;设计并实现包括生成式奖励模型(GRM)、过程奖励模型(PRM)等在内的多维度奖励函数3. 强化学习:深入理解PPO、DPO、GRPO等常用LLM强化学习方法,结合具体业务目标(如上下文一致性、逻辑正确性、OOC等),设计定制化的奖励组合与训练策略4. Agent:面向复杂、多步骤的业务场景,设计并实现基于大语言模型的Agent架构;集成工具调用(Tool Use)、记忆机制(Memory)、反思(Reflection)、多智能体协作等范式实现复杂任务的能力跃迁 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;3. 在虚拟角色生成、角色扮演、情感陪伴等方向有项目经验或论文成果者优先;4. 能系统性拆解角色类模型在生成一致性、长期记忆等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。 Apply...

KAON  18 hours ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential

Nvidia  4 hours ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

ppo jobs in beijing

You also might be interested in:

实习生

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Job Type
Employer/Recruiter