强化学习工程师(真机操作方向) 上海 全职 职位描述 1. 负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整 RL pipeline,解决 Sim2Real 迁移中的核心挑战2. 研发高效的 RL 训练方案,提升样本效率,使复杂灵巧操作任务能在有限训练时间内收敛到高成功率3. 搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计、渐进式自主等策略,降低真机训练成本4. 构建分布式 RL 训练基础设施,对接多仿真器后端与真机环境,支持多算法并行实验与大规模数据采集5. 跟踪真机 RL 与机器人操作领域前沿进展(如 SERL 等代表性工作),快速验证并落地到产品 职位要求 任职要求1. 硕士及以上,计算机 / 机器人 / 自动化等相关专业2. 具备真机强化学习的完整项目经验,熟悉从仿真训练到真机策略部署的全流程,了解 Sim2Real 迁移的关键技术(域随机化、阻抗控制、自动重置等)3. 精通主流 RL 算法(SAC / PPO
具身智能操作模型算法工程师-深圳 深圳 校招 正式 智能制造 / 工业互联网 / 工业自动化 职位描述 你将参与:1. 参与具身操作模型的 SFT 和 RL 训练,包括数据格式设计、训练配置与效果评估;2. 在真实机器人平台上设计并实施 RL 训练方案,提升模型泛化能力与鲁棒性;3. 参与通用奖励模型设计与训练,实现长程任务下的高效真机强化学习;4. 跟踪具身智能前沿论文,探索基础模型与 RL 结合的新技术;5. 编写技术文档,沉淀训练-部署最佳实践。 职位要求 1. 2027届毕业生,本科及以上学历及以上,、计算机、人工智能、机器人、自动化等相关专业。2. 理解 PPO/SAC 等 RL 核心算法,熟悉 VA/VLA/WAM 等具身操作大模型;3. 扎实的机器人运动学与动力学基础,能处理真机延迟、噪声等非线性问题;4. 精通 Python
具身智能运动控制算法工程师-深圳 深圳 校招 正式 智能制造 / 工业互联网 / 工业自动化 职位描述 你将参与:1. 研发四足、人形机器人(腿足/机械臂)相关强化学习和模仿学习的运动控制算法,基于 IsaacSim/MuJoCo 等仿真平台搭建大规模并行训练环境,实现动作轨迹跟踪、全身协调控制及力控策略,自适应多种地形环境;2. 参与 Sim-to-Real 迁移全流程,系统性分析并解决电驱、结构、传感器相关 gap ,结合系统辨识、状态估计、域随机化等技术提升真机部署鲁棒性;3. 实现运控系统端侧高效部署,与认知大模型、空间/语义感知模型构建分层端到端架构,完成从环境感知、高层决策到底层运动执行的跨模型协同;4. 对齐 Scaling Law 驱动的运动智能前沿,探索动作基模、世界模型驱动运控、多模态具身大模型等新范式,构建面向通用运动能力的统一架构与训练体系; 职位要求 1. 2027届毕业生,硕士及以上学历及以上,控制科学、计算机科学、机械电子、机器人等相关专业。2. 掌握机器人运动学/动力学基础,了解多刚体动力学建模、正逆运动学等核心算法;3. 具备强化学习理论基础,熟悉 PPO、SAC 等主流算法,有实际项目或课题经验;4. 熟练使用 Python,熟悉 PyTorch 深度学习框架,具备良好的代码规范和工程能力;5. 具备至少一种仿真工具(MuJoCo/Isaac Gym/PyBullet/Gazebo)的使用经验;6.
强化学习实习生(真机操作)(R12185) 上海 实习 职位描述 岗位JD(含岗位职责和岗位要求)岗位职责1. 参与真机 RL 训练 pipeline 的搭建与调试,涵盖仿真环境搭建、策略训练、真机联调2. 参与人机协作训练实验:遥操作数据采集、奖励函数设计、策略调优3. 复现前沿论文算法,沉淀可复用的实验方案与技术文档任职要求1. 计算机 / 机器人 / 自动化等相关专业在读硕博(优秀本科亦可)2. 掌握 RL 基础理论,熟悉 SAC / PPO 等主流算法;熟练使用 Python,了解 PyTorch 或 JAX3. 对真机 RL 或机器人操作方向有浓厚兴趣,阅读过 SERL 等相关论文者优先4. 每周 ≥4 天,连续 ≥6
具身算法工程师(VLA+RL)-通用业务部 上海 校招 正式 技术 - 算法类 职位 ID:A121738 职位描述 VLA 端到端模型研发: 设计并训练端到端视觉-语言-动作模型(如 RT-2、OpenVLA、π0、Diffusion Policy、3D Diffusion Actor 等),实现从视觉输入与语言指令到机器人低维动作空间的直接映射。研究动作表示与生成机制: 动作 Token 化(Action Tokenization)、隐动作量化(Latent Action Quantization, LAPA)、扩散式动作生成(Diffusion Policy)、流匹配(Flow Matching)等前沿方案。探索 RL 与模仿学习(IL)的混合训练范式:利用人类演示数据初始化策略,再通过 RL 进行微调和鲁棒性增强。强化学习运控与策略优化: 包括 PPO、SAC、RLHF(Human Feedback for Robotics)、DAPG 等算法在关节级/任务级控制中的应用。模型部署与实时性优化:
优才-具身基座大模型算法研究员-具身研究中心 上海、北京 校招 正式 技术 - 研究类 职位 ID:A47457 职位描述 - 参与具身智能基础模型研发,覆盖 VLM/VLA/VideoGen 预训练、后训练与强化学习等关键环节,打造可跨不同机器人平台泛化的通用模型。- 设计多模态模型结构与训练策略,融合图像/视频/语言/触觉/动作等信息,提升理解、推理与执行能力。- 探索具身领域的数据配方与 scaling law,沉淀可复用的训练范式与评测结论。- 面向复杂任务与长时序任务,构建训练—评测—迭代闭环,持续提升成功率、稳定性与鲁棒性。- 与数据/系统/仿真/硬件团队协作,推进模型训练、验证、部署与迭代落地。- 撰写技术文档和学术论文,分享研究成果并在技术社区中展示创新技术。 职位要求 - 硕士及以上学历,计算机/机器人/AI 等相关方向。- 熟悉大模型训练体系,有预训练或后训练经验,对 LLM/VLM/VLA/VideoGen 有较深理解。- 具备强化学习相关经验(PPO/SAC 等),有 Online RL / Offline RL类训练实践经验者优先。。- 熟悉或跟进过主流 VLA
机器人强化学习工程师/专家 合肥、上海、北京 社招 全职 数字技术 - 算法 硕士及以上 3-5 年 职位描述 1、负责机器人灵巧操作、移动操作等任务中的强化学习与模仿学习算法设计、开发与迭代;2、负责强化学习模型全生命周期管理,包括仿真环境构建、状态空间与动作空间设计、奖励函数设计、训练策略优化、模型部署与效果评估;3、搭建高效、逼真的机器人仿真训练环境,结合机器人力学特性,支持虚拟场景到真实物理世界的迁移学习,降低实机训练成本与部署风险;4、研发适用于机器人实际任务的强化学习与模仿学习算法,提升策略在真实场景中的泛化性、鲁棒性、样本效率与动作性能;5、针对机器人实际控制问题,优化深度强化学习算法,如 PPO、SAC、TD3、DDPG 等,并结合模仿学习、离线强化学习等方法提升训练效果;6、推动 Sim2Real 迁移落地,设计域随机化、系统辨识、自适应控制等方法,缩小仿真与真实系统之间的差异;7、与机械结构、硬件控制、感知、算法工程等团队紧密协作,将强化学习模型与机器人控制系统深度融合,完成真实机器人部署、系统级验证与迭代优化; 8、跟踪强化学习、机器人学习、具身智能等领域前沿技术,结合业务场景进行技术创新与工程落地。 职位要求 1、计算机科学与技术、人工智能、机器人、自动化、电子工程等相关专业硕士及以上学历,具备扎实的数学、优化、控制与算法基础;2、具备 3 年以上强化学习、机器人学习或相关算法研发经验,有人形机器人、机械臂、移动机器人或复杂动态系统强化学习训练项目经验者优先;3、熟悉常用强化学习算法,如 DQN、PPO、A2C、SAC、TD3、DDPG 等,具备扎实的算法实现、调优和工程部署经验;4、熟练掌握 C++ / Python,熟悉 PyTorch、TensorFlow、JAX 等至少一种深度学习框架,具备高效模型开发与调试能力;5、具备机器人学基础,熟悉运动学、动力学建模、运动控制原理,能够结合实际机器人任务设计合理的训练方案;6、具备仿真环境搭建经验,熟悉 MuJoCo、PyBullet、Isaac Sim、Gazebo、ROS 等工具者优先;7、具备大规模强化学习训练、分布式训练、虚实结合训练、Sim2Real 迁移经验者优先;8、具备良好的团队协作、跨团队沟通与工程落地能力,对机器人技术、具身智能和强化学习方向有强烈兴趣与自驱力。 投递...
运动控制算法实习生(强化学习方向) 深圳、北京、上海 实习 研发 - 算法 职位描述 【关于我们】小鹏机器人中心致力于研发先进的人形机器人技术,覆盖机器人行走、灵巧操作、智能导航,以及在大语言模型支持下的人机交互等方向。我们的软硬件研发团队分布于深圳、上海、广州、北京及北美,汇聚跨学科的一流人才。加入我们,你将参与把人工智能真正落地到物理世界的核心工作,与控制、感知、规划、硬件等多领域工程师紧密协作,攻克前沿科研与工程难题,并推动人形机器人关键能力的持续演进。【工作职责】1、参与机器人的强化学习训练,优化机器人运动规划与控制策略,与传统控制方法形成互补,提升整体运动性能;2、参与机器人数据重映射(retargeting / remapping)与位置/姿态跟踪算法的开发与优化;3、将先进运动控制与机器学习方法应用于我们的自研人形机器人,推动算法从离线验证到真机闭环;4、研究和复现前沿强化学习算法,探索相关领域学术和工程问题。 职位要求 【岗位要求】1、本科及以上在读,数学、计算机、人工智能、自动化、机器人等相关专业优先;2、至少 1 年强化学习相关项目或研究经验,熟悉足式机器人运动学和动力学;3、熟练使用基于 Pytorch 的深度学习框架,掌握 PPO、DQN、SAC 等主流强化学习算法,以及 MuJoCo、Isaac Gym/Sim 等主流仿真工具;4、热爱机器人行业,有相关期刊或会议论文发表经历,或实际强化学习项目落地经验者优先。【你将获得】1、深度参与最前沿的具身智能算法研发,专注于双足机器人运动规划与控制,以及从仿真到实机的迁移;2、行业内资深专家的指导,对于优秀成果,我们将全力支持发表学术论文或申请专利;3、完备的实验室支持,包括充足的计算资源、稳定的机器人平台和强大的软硬件团队;4、明确的成长路径:实习生是公司的重要储备人才,对于即将毕业的优秀实习生,我们优先考虑其全职工作申请。 投递...
校招-大模型算法工程师(主动安全方向) 上海、北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-正式批 职位 ID:A64864 职位描述 负责端到端决策模型算法的研发量产工作,主要聚焦于主动安全业务,重点方向包括但不限于。模仿学习(如自回归生成、Diffusion Policy 等)强化学习(涵盖轨迹生成、闭环训练、世界模型等相关技术)一段式端到端模型的研发构建高质量数据集,支持模型迭代优化持续跟踪人工智能领域的前沿技术动态,推动先进算法在量产项目中的实际应用与落地。 职位要求 硕士及以上学历,计算机 / 软件工程 / 人工智能等相关专业。扎实的深度学习算法基础,精通常见的深度学习和机器学习算法。面对未知的领域和问题,有非常强的自学能力,善于通过基本的研究方法对问题本身进行拆解,并找到每个步骤的解决办法。有着良好的团队合作精神,能够同公司内部的不同团队保持合作关系。加分项相关领域的博士研究生。具备端到端路径/轨迹生成相关经验,熟悉主流模仿学习方法,如diffusion,自回归等具备强化学习在轨迹预测、决策规划的相关经验,熟悉主流强化学习方法,如 DQN、DDPG、SAC、PPO、GRPO 等有过相关领域的顶级会议论文发表(CVPR、ICCV、ECCV等等)或在相关领域的学术竞赛(ImageNet、COCO、Kitti、Waymo等等)中取得较好成绩者优先 投递...
强化学习算法工程师/专家 上海、北京 全职 算法类 职位描述 1.参与端到端自动驾驶系统的强化学习训练;2.构建高效稳定的大规模强化学习闭环训练框架,提升强化学习的数据效率、训练效率、稳定性、场景泛化性;3.持续推动强化学习算法在物理世界的落地应用; 职位要求 1.硕士及以上学历,计算机,自动化及电子信息等相关专业优先;2.掌握强化学习基础理论,熟悉主流强化学习算法(PPO、SAC、GRPO及其变种);3.具备扎实的强化学习工程能力和优秀的代码能力,能够独立负责算法研发和迭代。 投递...
具身智能-运动智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 【具身端到端规划算法工程师/资深/专家/TL】(深圳/上海/北京)岗位职责:1. 负责研发基于深度学习的四足/人形等机器人的全身状态规划控制,实现灵活自然的动态环境的避障和通过2. 设计实现鲁棒高效的 感知-规划-控制 端到端方案,实现鲁棒高效精准的机器人动作规划3. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建4. 应用模仿学习,在/离线强化学习进行模型训练提升模型性能,开发高效的模型评测方法提高迭代效率5. 解决模型评测/部署/真机测试中遇到的问题,满足项目交付指标要求6. 跟踪前沿技术方案,持续迭代升级方案 岗位要求:满足3条及以上1. 人工智能、计算机、机器人、自动驾驶、控制等相关专业硕士或博士学位2. 熟练掌握主流深度学习的时序规划方法如transformer,生成式方法 diffusion policy,掌握主流端到端架构方案如BEV-tranformer/diffusion架构。3. 熟悉基于采样/搜索/优化的决策规划算法,熟悉机器人全身控制。4. 具有模仿学习或强化学习训练经验,熟悉PPO/GRPO/DPO等5. 有实际的端到端系统开发经验,如智能驾驶的E2E。6. 熟练使用PyTorch/TensorFlow深度学习框架,熟练使用Python/C++语言编程,有实际项目开发经验7. 熟悉机器人常用开发环境Mojuco/NVIDIA Isaac/gazebo,有 ROS2/DDS下的开发经验,,能够在Linux环境下独立进行开发和调试; 加分项:8. 有智能驾驶/机器人领域的工程落地经验者优先9. 在机器人顶会(SR/IJRR/TRO/RSS/ICRA/IROS等)或AI顶会(CVPR/NeurIPS/ICML/ICLR等)发表论文者优先
具身智能-多模态强化学习算法专家 北京、上海 全职 互联网 / 电子 / 网游 职位描述 1、负责机器人具身操作任务的强化学习算法设计、开发和优化;2、研究多模态学习方法,结合视觉、触觉、力反馈提升机器人决策能力;3、优化从模拟到现实(Sim2Real)的迁移技术,提升算法鲁棒性;4、跟踪前沿技术,进行强化学习算法的调研、性能对比和评估;5、根据需求完成算法开发与代码维护,协助测试团队优化算法性能。 职位要求 1、硕士及以上学历,人工智能、计算机、机器人学等相关专业;2、掌握强化学习理论,熟悉 PPO、DQN、SAC 等主流算法;3、精通 Python,熟悉 PyTorch 等深度学习框架;4、熟悉 Mujoco、Isaac Sim、PyBullet、Genesis、Mani-Skill 等机器人仿真工具;5、熟悉LLM/VLM/VLA,了解RT-1/2、OpenVLA等多模态具身大模型经验者优先;6、在顶会发表论文或具备 机器人 项目经验者优先;7、工作积极主动,具备良好的团队合作与问题解决能力。 投递...
【人形机器人】双足运控算法工程师-强化学习 北京、上海 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 1、负责/主导双足机器人强化学习(RL)运控算法研发,覆盖行走/转向/起步停止/跑步、上下坡与台阶、抗外力扰动等核心能力,并实现真机稳定闭环。2、搭建并维护训练Pipeline:仿真环境构建(动力学、接触、执行器与传感器模型)、奖励函数与课程学习、并行采样与训练监控、实验可复现与版本管理。3、负责Sim2Real落地与鲁棒性提升:域随机化(质量/惯量/摩擦/延迟/噪声)、系统辨识、策略泛化与真机调参闭环。4、设计并实现策略与底层控制栈对接(PD/阻抗/WBC/状态机),处理控制频率、延迟、力矩/速度饱和、关节限位与安全保护等工程约束。5、构建并优化步态与接触切换稳定性(单/双支撑过渡、落脚冲击、滑移抑制),降低抖动与能耗,提升步态自然性与可控性。6、建立异常工况处理机制:跌倒检测、失稳恢复(fall recovery)、安全降级、故障注入测试与保护策略。7、制定并维护双足运控评测体系:成功率、速度范围、通过率(地形/扰动/摩擦)、稳定裕度、能耗/温升、恢复时间等,并推动自动化回归。8、支持真机联调与问题定位:策略崩溃、奖励投机、接触抖动、仿真偏差、传感器漂移、执行器带宽限制等问题分析与优化。 职位要求 1、机器人、控制、自动化、机械、计算机等相关专业,本科及以上学历。2、3年以上强化学习或机器人运动控制相关经验;具备足式/双足机器人真机落地经验者优先。3、熟悉主流RL算法与实现(PPO/SAC/TD3等),理解稳定训练要点(归一化、优势估计、探索、约束等)。4、具备扎实的动力学与控制基础:刚体动力学、接触与摩擦、步态稳定性、阻抗/力控、状态估计基础概念。5、熟练Python/C++,具备良好的工程实现与调试能力;熟悉Linux与常用开发/调试工具链。6、熟悉至少一种机器人仿真平台(MuJoCo/Isaac Gym/Isaac Sim/Gazebo等),能够独立完成模型、环境与传感器/执行器仿真开发。7、具备数据分析与系统化定位能力(日志、可视化、回归对比、消融实验),能推动问题闭环。8、具备良好沟通协作能力,能与硬件、全身控制、状态估计、测试团队高效配合。优先考虑条件:1、有复杂地形与强扰动鲁棒行走经验(台阶、碎石、低摩擦、推搡、载荷变化)。2、有WBC/QP/MPC与RL结合、或分层控制(技能/策略/控制器)工程经验。3、有系统辨识、执行器模型(电机/减速器/摩擦/带宽)建模与补偿经验。4、能阅读英文论文/技术文档并快速复现与落地。 投递...
Company Description Trainor Consulting is an international consulting firm specialized in heavy industry and energy projects, supporting clients across China and the APAC region. The company delivers high-value expertise in sectors such as oil & gas,
COMPAÑÍA HARD DISCOUNT SAC., empresa que fomenta y respeta en sus procesos de reclutamiento y selección, la igualdad de género, la inclusión y la diversidad, perteneciente al grupo Intercorp, líder en el rubro retail, se encuentra en