Refine Reset All
Sort by
Job Title
Job Type
Employer/Recruiter
Date Posted
Job Title
Location
Job Type
Employer/Recruiter
All Filters

Ppo Jobs In Beijing (Peking) - 21 Job Positions Available

Top Cities:
1 – 18 of 21 jobs
NIO jobs

智能辅助驾驶算法工程师(端到端模型 / 强化学习) AD内推 蔚来自动驾驶研发团队 北京 社招 全职 数字技术 - 算法 硕士及以上 3-5 年 职位描述 负责端到端智能辅助驾驶轨迹生成算法的研发与优化,重点方向包括但不限于:端到端模仿学习(如 VLA/世界模型、自回归生成、Diffusion Policy 等);强化学习(涵盖轨迹生成、闭环训练、世界模型等相关技术)。持续跟踪人工智能领域的前沿技术动态,推动先进算法在量产项目中的实际应用与落地。 职位要求 硕士及以上学历,计算机、软件工程、人工智能或相关专业;具备扎实的深度学习理论基础,熟悉常见深度学习与机器学习算法;熟练掌握至少一种主流深度学习框架,具有 TensorFlow 或 PyTorch 深度开发经验者优先。【加分项】①具备端到端路径/轨迹生成相关经验,熟悉以下任一方向者优先:主流模仿学习方法(如行为克隆);主流 BEV 任务(如动态/静态目标检测与跟踪等);时序建模方法(RNN/LSTM/GRU等)。②具备强化学习相关经验,熟悉以下任一方向者优先:主流 RL 算法(如 DQN、DDPG、SAC、PPO、GRPO 等);强化学习在轨迹预测、决策规划或仿真环境中的应用;世界模型(World Model)、模型预测控制(MPC)或基于强化学习的闭环仿真技术。③具备 VLA/VLN/世界模型等相关项目实践经验,熟悉以下任一方向者优先:主流 VLA 方法(如 OpenVLA、PAI0 等);主流世界模型方法(如

NIO  22 days ago
XPENG jobs

VLA自动驾驶算法高级/资深工程师 北京 全职 通用智能板块 职位描述 岗位简介:聚焦端到端自动驾驶 VLM/VLA 大模型研发,重点解决模型海外跨地域泛化难题,攻克海内外路况、交规、驾驶习惯、气候地貌差异导致的域偏移、鲁棒性差、长尾场景失效等核心问题,负责算法研发、迭代优化与海外量产落地。主要职责1、VLA大模型海外泛化研发:负责自动驾驶VLA/VLM端到端算法设计与迭代,针对海外多地域场景差异,优化模型环境认知、障碍物识别、行为预测与轨迹生成能力,解决跨域适配、认知偏差等核心问题。2、强化学习跨域优化落地:基于PPO、DPO、GRPO、SAC等主流强化学习算法,搭建海外场景专属训练方案,完成跨域奖励设计、分布式训练、模型调优,提升模型海外复杂场景、恶劣天气、小众交通场景的泛化能力与稳定性。3、全流程量产落地:主导算法从海外数据闭环、仿真适配、模型验证到实车测试、部署迭代的全流程工作,攻克海外样本稀疏、域迁移难、推理不稳定等工程问题,支撑业务规模化出海。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先,具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通VLM/VLA端到端自动驾驶模型原理与全栈开发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾大模型落地经验优先;3、强化学习能力:熟练掌握PPO、DPO、GRPO等算法,具备用强化学习解决问题的实战经验,有智驾/机器人项目量产落地经历;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用PyTorch,掌握分布式训练、模型优化、车载部署等工程能力;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。加分项1、有智驾VLA模型海外泛化、全球化适配、出海量产核心项目经验;2、深耕跨域泛化、迁移学习、稀疏场景补齐方向,有相关落地成果;3、参与过自动驾驶全球化技术路线、算法体系标准搭建;4、拥有顶会论文、核心技术专利成果。 投递...

Premium Full-time
XPENG  28 days ago
XPENG jobs

【27届校招】智能座舱算法工程师(仿真,北京) 北京 正式 研发 - 算法 职位描述 参与智能座舱仿真评测平台的核心算法研发工作,围绕评测 - 仿真 - 智能体三大方向,推动座舱交互体验的自动化评测与持续优化。具体工作内容包括但不限于:1、评测体系构建- 设计并构建智能座舱场景下的评测 Benchmark,覆盖多轮对话、多模态交互、任务完成度等维度- 研发评测 Reward Model,建立可量化、可迭代的自动化评分体系2、智能体(Agent)研发- 构建评测 Agent,实现对座舱对话系统的自动化、规模化测试- 设计用户行为仿真 Agent,模拟真实用户在座舱场景中的交互行为与意图模式3、仿真环境搭建- 参与座舱环境仿真系统的研发,构建可复现、可配置的虚拟测试环境- 参与感知仿真模块开发,模拟语音、视觉、手势等多模态输入信号 职位要求 1、扎实的编程能力,熟练掌握 Python,熟悉常用深度学习框架(PyTorch 等);2、了解大语言模型(LLM)的基本原理与应用,有 Prompt Engineering 或模型微调经验;3、具备以下至少一个方向的实际项目或研究经验:-大模型应用 / Agent 构建-强化学习(RLHF、PPO、Reward Modeling 等)-对话系统 / NLP-数据处理与分析-良好的自驱力与沟通能力,能独立推进研究课题【加分项】1、在

XPENG  26 days ago
XPENG jobs

【27届校招】多语言基座模型算法工程师 北京 正式 研发 - 算法 职位描述 1.负责多语言、多模态基座模型的研发与优化,重点面向多语言理解与生成、多轮对话,以及图文、视频、语音等多模态交互场景。 2.参与大规模多语言、多模态预训练体系建设,包括语料构建、数据清洗与配比、训练目标设计、模型结构优化及训练稳定性提升。 3.负责多模态模型后训练能力建设,包括 SFT、RL、偏好对齐、拒答与安全对齐、工具调用,以及复杂任务中的对话理解、推理和执行能力增强。 4.跟踪多语言大模型、多模态大模型、对话模型及强化学习对齐方向的前沿进展,推动关键算法复现、优化与落地。 职位要求 1.计算机、人工智能、电子信息、数学等相关专业本科及以上学历,硕士/博士优先。 2.熟悉 Transformer、大语言模型、多模态大模型或对话系统相关技术,具备基座模型研发经验者优先。 3.熟悉大规模预训练、SFT、RLHF/RLAIF、DPO、PPO、GRPO 等训练或对齐方法中的一种或多种。 4.具备大规模分布式训练经验,了解混合精度训练、数据并行、模型并行、DeepSpeed、Megatron-LM、FSDP 等技术者优先。 5.具备多语言模型、机器翻译、跨语言表示学习、语音语言模型或多语言对话系统经验者优先。 6.具备良好的论文阅读、问题分析、实验设计和工程实现能力,能够独立推动算法方案从调研到落地。 投递...

XPENG  26 days ago
XPENG jobs

【27届校招】多语言基座模型算法工程师 北京 正式 研发 - 算法 通用智能板块 职位描述 1.负责多语言、多模态基座模型的研发与优化,重点面向多语言理解与生成、多轮对话,以及图文、视频、语音等多模态交互场景。 2.参与大规模多语言、多模态预训练体系建设,包括语料构建、数据清洗与配比、训练目标设计、模型结构优化及训练稳定性提升。 3.负责多模态模型后训练能力建设,包括 SFT、RL、偏好对齐、拒答与安全对齐、工具调用,以及复杂任务中的对话理解、推理和执行能力增强。 4.跟踪多语言大模型、多模态大模型、对话模型及强化学习对齐方向的前沿进展,推动关键算法复现、优化与落地。 职位要求 1.计算机、人工智能、电子信息、数学等相关专业本科及以上学历,硕士/博士优先。 2.熟悉 Transformer、大语言模型、多模态大模型或对话系统相关技术,具备基座模型研发经验者优先。 3.熟悉大规模预训练、SFT、RLHF/RLAIF、DPO、PPO、GRPO 等训练或对齐方法中的一种或多种。 4.具备大规模分布式训练经验,了解混合精度训练、数据并行、模型并行、DeepSpeed、Megatron-LM、FSDP 等技术者优先。 5.具备多语言模型、机器翻译、跨语言表示学习、语音语言模型或多语言对话系统经验者优先。 6.具备良好的论文阅读、问题分析、实验设计和工程实现能力,能够独立推动算法方案从调研到落地。 投递...

XPENG  26 days ago
Xiaomi jobs

机器人强化学习算法工程师(技术预研方向) 北京 社招 全职 职位 ID:A141640 职位描述 1. 开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2. 负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3. 持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1. 硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2. 具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3. 掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4. 扎实的C++、python编程能力;5. 数学基础扎实,具有较强的学习与研究能力;6. 熟悉大模型理论者优先。 投递...

Premium Full-time
Xiaomi  14 days ago
Xiaomi jobs

自动驾驶基座模型(强化学习方向) 北京 社招 全职 职位 ID:A204396 职位描述 负责强化学习的框架在自动驾驶场景中的前沿算法研究,;负责强化学习的框架在自动驾驶场景中的前沿算法研究,;参与大模型基座范式下(VLA+World Model)的强化学习框架搭建;负责将大模型(AD Agent)作为基础代理,利用 RL 技术优化其在复杂自动驾驶场景中的感知、推理和长期决策能力,涵盖场景理解、语义引导决策、时空建模等核心能力,并推动大模型与安全(Safety-Critical RL)及人类偏好(RLHF/DPO/PPO for AD)的深度对齐。 职位要求 教育背景:计算机科学、人工智能、机器人学、自动驾驶或相关领域的博士学位,或具备等效的研究经验;精通深度强化学习理论及其核心算法(如PPO, TD3, GRPO等系列)理论与实践能力:扎实的机器学习、深度学习理论基础,具有视觉理解、自然语言处理与行为决策的交叉领域研究背景;编程能力:熟练掌握Python及主流深度学习框架(如PyTorch、TensorFlow等),有高效模型训练与大规模数据处理经验;学术能力:具有在国际顶级会议(NeurIPS、ICLR、CVPR、ICCV等)上发表过论文的经验,或参与过具有影响力的学术竞赛(如COCO、Kitti、nuScenes等);跨学科能力:具备跨学科协作能力,能够有效将计算机视觉、自然语言处理与机器人学的知识融合,推动自动驾驶机器人领域的创新;加分项:熟悉自动驾驶系统(感知-预测-规划)架构,理解 World Model 如何支持基于 RL 的规划算法(如 MCTS)具有自动驾驶平台(如CARLA、Waymo、nuScenes等)上的实验经验。 投递...

Premium Full-time
Xiaomi  14 days ago
Xiaomi jobs

足式机器人运动控制算法工程师(强化学习) 北京 社招 全职 职位 ID:A200582 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略; 2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用; 4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等; 4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 具备足式机器人强化学习算法的实机调试和sim-to-real经验,有基于模型/优化等传统控制经验者优先; 6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

Xiaomi  14 days ago
Xiaomi jobs

具身智能算法工程师-模型 北京 社招 全职 职位 ID:A105241 职位描述 1. 负责面向机器人操作任务的端到端模型研发,探索 Vision-Language-Action(VLA)模型在灵巧操作、长序列任务规划中的应用,推动通用操作策略的落地;2. 开展 World Model 相关研究,构建面向机器人操作的环境预测与动态建模能力,提升策略的泛化性和样本效率;3. 研究基于强化学习的高自由度灵巧手控制方法,包括 PPO、SAC、IQL等主流 RL 方法,探索仿真到真实的 Sim-to-Real 迁移技术;4. 负责大规模模型的训练基础设施搭建与优化,包括分布式训练、混合精度、推理加速及部署上线;5. 持续跟踪具身智能、操作学习、基础模型等领域的前沿进展,推动技术复现、改进与工程化落地。 职位要求 1. 计算机、人工智能、自动化、机器人等相关专业,硕士及以上学历(博士优先);2. 具备扎实的深度学习理论基础,熟练掌握 PyTorch 等主流框架,有大模型训练与调优经验者优先;3. 熟悉Gr00t和PI等系列经典VLA操作模型相关工作,对 VLM 与机器人控制的结合有深入理解;4. 了解强化学习基本原理,熟悉 MuJoCo、Isaac Lab/Gym 等仿真平台,有 Sim-to-Real 实验经验者优先;5.

Xiaomi  14 days ago
NIO jobs

端到端算法工程师 北京 实习 数字技术 - 算法 职位 ID:A72815 职位描述 - 参与深度学习、强化学习等相关算法的研究与实现;- 在实际场景中开展强化学习(如 PPO、SAC、GRPO/DPO 等)的实验与改进;- 支持智能辅助驾驶或RL闭环仿真等前沿应用方向的研发工作;- 撰写技术文档,参与团队技术分享与学术交流。- 支持团队完成数据处理、模型训练与实验分析。 职位要求 在读硕士或博士,计算机、人工智能、自动化、电子工程或相关专业,距离毕业 1 年及以上;- 熟悉深度学习主流模型与架构(Transformer、Diffusion);- 对强化学习方法有一定理解,熟悉以下任一方向: - 主流 RL 算法(DQN、DDPG、SAC、PPO、GRPO 等); - 强化学习在轨迹预测、决策规划或模拟环境中的应用; - 世界模型(World Model)、3DGS 或基于 RL 的闭环仿真;- 有视觉感知 /

Premium Full-time SLAM
NIO  8 days ago
NIO jobs

大规模仿真强化学习实习生 北京 实习 数字技术 - 算法 职位 ID:A236840 职位描述 参与大规模自博弈强化学习训练实验,设计和构建大规模、高吞吐量的批处理仿真器,十亿级仿真训练吞吐的驾驶经验生成 ;并改进 PPO 等高效的在策略(On-Policy)强化学习算法进行大规模训练 。辅助算法的鲁棒性与泛化性验证。参与攻坚仿真到现实的迁移 (Sim2Real),参与研究和评估策略的Sim2Real迁移性能,探索域随机化(Domain Randomization)、系统辨识(System ID)等技术,以提升策略对真实世界变化的适应能力。协助团队将训练好的策略部署到真实世界的车辆平台上进行验证。 职位要求 (必要条件)教育背景: 计算机科学、人工智能、机器人学或相关领域的在读27届及之后毕业的博士/硕士研究生/优秀本科生。 对以下至少两个领域有扎实的知识基础和相关的项目/研究经验:强化学习: 熟悉多智能体RL、自博弈、PPO、SAC等主流算法。生成式模型: 熟悉 Diffusion 模型、GANs 等,并有相关实践经验。Sim2Real: 对仿真到现实的迁移问题有了解或实践经验。编程与系统能力:精通 Python 和 PyTorch/Jax,具备训练和调试复杂强化学习算法的能力。拥有构建或使用高性能、批处理仿真环境(如 Isaac Gym/Lab)的经验 。具备优秀的系统设计和性能优化能力,熟悉 GPU 编程者优先。算法知识: 精通 PPO 等主流深度强化学习算法,并理解其在大型分布式系统中的应用 。加分项(优先条件)对

NIO  8 days ago
NIO jobs

智能辅助驾驶算法实习生(视觉感知 / 端到端模型 / 强化学习) 北京 实习 数字技术 职位 ID:A36277 职位描述 1. 参与智能辅助驾驶相关算法的研发与验证,方向包括但不限于: - 视觉感知(目标检测、语义分割、跟踪、BEV 表征等); - 端到端模型(规划预测一体化、行为建模、多模态融合等); - 强化学习(轨迹生成、决策规划、闭环训练、世界模型等)。2. 支持团队完成数据处理、模型训练与实验分析; 职位要求 岗位要求1. 计算机、人工智能、自动化、电子工程等相关专业,硕士或博士在读,距离毕业 1 年及以上;2. 熟练掌握 Python / C++,具备扎实的算法与编程能力;3. 有 视觉感知 / 端到端模型 / 强化学习

NIO  8 days ago
小米科技 Xiaomi Technology jobs

机器人运动控制算法实习生 北京 校招 实习 软件研发类 职位描述 1、开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2、负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3、持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1、硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2、具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3、掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4、扎实的C++、python编程能力;5、数学基础扎实,具有较强的学习与研究能力;6、熟悉大模型理论者优先; 投递...

Premium Full-time
小米科技 Xiaomi Technology  6 days ago
小米科技 Xiaomi Technology jobs

足式机器人运动控制算法工程师实习生(强化学习) 北京 校招 实习 算法类 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略;2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用;4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等;4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 有足式机器人强化学习算法的实机调试和sim-to-real经验者优先,有基于模型/优化等传统控制经验者优先;6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

小米科技 Xiaomi Technology  6 days ago
小米科技 Xiaomi Technology jobs

能耗优化算法工程师-2027届 北京 校招 实习 算法类 职位描述 1. 负责整车热管理与能耗优化物理建模算法和AI建模算法研发2. 用机器学习算法对整车热管理与能耗进行优化、数据分析及可视化3. 负责能耗优化算法的端侧部署、性能与耗时优化;负责算法的实车验证,迭代优化;用户评价追踪。 职位要求 1.硕士及以上学历;车辆工程、自动化、能源与动力、统计学等相关专业优秀的软件工程素养,精通Python、C/C++程序设计;2. 熟悉C++/python等编程语言,熟悉PyTorch等深度学习框架;4、熟悉DDPG/GRPO/PPO/AC学习等强化学习算法加分项:1.良好的英语沟通能力;2.优化的物理/数学建模功底3.发表过SCI一区/二区,CCF-A类会议等高水平论文 投递...

Premium Full-time
小米科技 Xiaomi Technology  6 days ago
小米科技 Xiaomi Technology jobs

大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...

小米科技 Xiaomi Technology  6 days ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential

Nvidia  5 days ago
XPENG jobs

【27届校招】大模型算法工程师 北京 正式 研发 - 算法 通用智能板块 职位描述 岗位简介:聚焦云端大模型算法研发,包括 VLM / VLA 大模型、世界动作模型(WAM)等,重点解决自动驾驶场景数据闭环体系及数据治理能力建设;利用语义标签、长时序描述及推理、向量化或隐空间表征等建立数据图谱,实现大规模数据分层治理。岗位职责:1、云端基座大模型研发:负责数据驱动的云端基座大模型算法研发,基于海量量产数据,研发无监督、自监督算法,持续提升大模型的场景语义理解与物理空间感知能力,进而提高云端大模型的时空感知、推理、预测、分析能力;2、空间推理产线建设:负责基于多传感器数据融合、时空信息融合的自动标注算法,构建具有精度高、场景泛化性强的时空数据生产产线,持续推动物理AI云端大模型研发;3、Scaling Law 驱动的算法研发:负责车云平台一体化大模型算法研发与优化,研发和设计基于数据驱动的感知迭代链路;构建高效的自训练感知流水线,提升数据闭环效率;4、强化学习研发:基于 PPO、DPO、GRPO、SAC 等主流强化学习算法,搭建长尾场景的后训练方案,完成奖励设计、分布式训练、模型调优,提升模型在复杂场景、恶劣天气、小众交通场景下的泛化能力与稳定性。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先。具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通 VLM / VLA 端到端自动驾驶模型原理与全链路研发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾或机器人大模型落地经验优先;3、强化学习能力:熟练掌握 PPO、DPO、GRPO 等算法,具备用强化学习解决问题的实战经验,有智驾或机器人项目量产落地经验;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用 PyTorch,掌握 Agent / Harness 等自动化工具;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。加分项1、参与过自动驾驶或机器人技术路线、算法体系标准搭建;2、深耕VLM/VLA预训练、后训练方向,有相关落地成果;3、拥有顶会论文、核心专利成果。 投递...

Premium Full-time Harness
XPENG  1 day ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

ppo jobs in beijing

You also might be interested in:

实习生

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Job Type
Employer/Recruiter