机器人真机强化学习算法实习生 上海 实习 职位描述 1.参与真机强化学习算法研发,在导师指导下完成 RL 算法的实现、训练与真机验证,协助开展数据配方、训练策略与评测实验。2.协助多模态建模与训练实验,涉及图像/视频/语言/触觉/动作等信息融合与能力评估。3.参与灵巧手/双臂等接触丰富(contact-rich)操作任务的策略学习探索。4.协助维护训练—评测—迭代闭环,参与真机实验与数据分析。5.跟踪 RL 与具身智能前沿进展,优秀成果可产出学术论文或开源项目。 职位要求 1.在读硕士/博士(优秀本科生亦可),计算机/机器人/自动化/AI 等相关专业。2.熟悉 PPO/SAC/TD3/GRPO 等主流RL算法,对offline/online RL等前沿方向有了解。3.熟练使用 Python 与 PyTorch,具备良好的代码能力。4.使用过 RLINF、VeRL 等 RL 训练框架者优先。5.有课程项目、竞赛或科研中的机器人真机训练部署经验,或对机器人操作、灵巧手等方向有浓厚兴趣者优先。6.有顶会论文、开源项目或竞赛获奖经历者优先。7.每周可到岗 4 天及以上,实习期 6 个月以上优先。 投递...
强化学习后训练算法工程师/专家-Genie业务部 上海 校招 正式 技术族 - 算法类 职位 ID:A105347 职位描述 1.负责真机强化学习算法研发,面向在线/离线场景设计高样本效率、稳定可靠的 RL 训练方案,持续提升任务成功率、稳定性与鲁棒性。2.构建 VLA 模型的 RL 后训练体系,探索具身领域的数据配方与 scaling law,沉淀可复用的训练范式与评测结论。3.探索灵巧手/双臂等接触丰富(contact-rich)操作任务的策略学习方法,融合触觉、力觉与视觉信息,提升抓取、调整、重抓(regrasp)与精细操作能力。4.面向复杂与长时序任务,构建训练—评测—迭代闭环,解决真机 RL 中的 reward 设计、自动 reset、安全探索等关键问题。5.与数据/系统/硬件团队协作,推进模型训练、验证、部署与迭代落地。6.跟踪 RL 与具身智能前沿进展,撰写技术文档和学术论文。 职位要求 1.硕士及以上学历,计算机/机器人/自动化/AI 等相关专业。2.具备扎实的深度学习、强化学习知识基础,熟悉 PPO/SAC/TD3 等主流算法,理解 online/offline RL 的差异与适用场景。3.对前沿 RL 算法有研究与实践经验,如 flow-matching/diffusion/离散
【27届校招】大模型算法工程师 北京 正式 研发 - 算法 通用智能板块 职位描述 岗位简介:聚焦云端大模型算法研发,包括 VLM / VLA 大模型、世界动作模型(WAM)等,重点解决自动驾驶场景数据闭环体系及数据治理能力建设;利用语义标签、长时序描述及推理、向量化或隐空间表征等建立数据图谱,实现大规模数据分层治理。岗位职责:1、云端基座大模型研发:负责数据驱动的云端基座大模型算法研发,基于海量量产数据,研发无监督、自监督算法,持续提升大模型的场景语义理解与物理空间感知能力,进而提高云端大模型的时空感知、推理、预测、分析能力;2、空间推理产线建设:负责基于多传感器数据融合、时空信息融合的自动标注算法,构建具有精度高、场景泛化性强的时空数据生产产线,持续推动物理AI云端大模型研发;3、Scaling Law 驱动的算法研发:负责车云平台一体化大模型算法研发与优化,研发和设计基于数据驱动的感知迭代链路;构建高效的自训练感知流水线,提升数据闭环效率;4、强化学习研发:基于 PPO、DPO、GRPO、SAC 等主流强化学习算法,搭建长尾场景的后训练方案,完成奖励设计、分布式训练、模型调优,提升模型在复杂场景、恶劣天气、小众交通场景下的泛化能力与稳定性。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先。具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通 VLM / VLA 端到端自动驾驶模型原理与全链路研发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾或机器人大模型落地经验优先;3、强化学习能力:熟练掌握 PPO、DPO、GRPO 等算法,具备用强化学习解决问题的实战经验,有智驾或机器人项目量产落地经验;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用 PyTorch,掌握 Agent / Harness 等自动化工具;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。加分项1、参与过自动驾驶或机器人技术路线、算法体系标准搭建;2、深耕VLM/VLA预训练、后训练方向,有相关落地成果;3、拥有顶会论文、核心专利成果。 投递...
机器人强化学习工程师/专家 合肥、上海、北京 社招 全职 数字技术 - 算法 硕士及以上 3-5 年 职位描述 1、负责机器人灵巧操作、移动操作等任务中的强化学习与模仿学习算法设计、开发与迭代;2、负责强化学习模型全生命周期管理,包括仿真环境构建、状态空间与动作空间设计、奖励函数设计、训练策略优化、模型部署与效果评估;3、搭建高效、逼真的机器人仿真训练环境,结合机器人力学特性,支持虚拟场景到真实物理世界的迁移学习,降低实机训练成本与部署风险;4、研发适用于机器人实际任务的强化学习与模仿学习算法,提升策略在真实场景中的泛化性、鲁棒性、样本效率与动作性能;5、针对机器人实际控制问题,优化深度强化学习算法,如 PPO、SAC、TD3、DDPG 等,并结合模仿学习、离线强化学习等方法提升训练效果;6、推动 Sim2Real 迁移落地,设计域随机化、系统辨识、自适应控制等方法,缩小仿真与真实系统之间的差异;7、与机械结构、硬件控制、感知、算法工程等团队紧密协作,将强化学习模型与机器人控制系统深度融合,完成真实机器人部署、系统级验证与迭代优化; 8、跟踪强化学习、机器人学习、具身智能等领域前沿技术,结合业务场景进行技术创新与工程落地。 职位要求 1、计算机科学与技术、人工智能、机器人、自动化、电子工程等相关专业硕士及以上学历,具备扎实的数学、优化、控制与算法基础;2、具备 3 年以上强化学习、机器人学习或相关算法研发经验,有人形机器人、机械臂、移动机器人或复杂动态系统强化学习训练项目经验者优先;3、熟悉常用强化学习算法,如 DQN、PPO、A2C、SAC、TD3、DDPG 等,具备扎实的算法实现、调优和工程部署经验;4、熟练掌握 C++ / Python,熟悉 PyTorch、TensorFlow、JAX 等至少一种深度学习框架,具备高效模型开发与调试能力;5、具备机器人学基础,熟悉运动学、动力学建模、运动控制原理,能够结合实际机器人任务设计合理的训练方案;6、具备仿真环境搭建经验,熟悉 MuJoCo、PyBullet、Isaac Sim、Gazebo、ROS 等工具者优先;7、具备大规模强化学习训练、分布式训练、虚实结合训练、Sim2Real 迁移经验者优先;8、具备良好的团队协作、跨团队沟通与工程落地能力,对机器人技术、具身智能和强化学习方向有强烈兴趣与自驱力。 投递...
【2027届校招】运控算法工程师 北京 正式 互联网 / 电子 / 网游 千寻智能2027届校招实习招聘项目 职位描述 岗位职责1. 基于强化学习的人形机器人(轮式/轮足/双足)运动控制算法研究与实现,包括行走、操作、跑步、跳跃等动态运动技能的训练与部署。2. 设计并优化Sim-to-Real迁移策略,解决仿真与真实机器人之间的动力学差异(domain gap),针对机器人本体特性提出算法与机电协同设计的改进建议。3. 构建强化学习训练框架(如Isaac Gym、Mujoco + RLlib等),探索强化学习与传统控制融合、大小脑算法融合。4. 参与机器人运动学、动力学模型的搭建与仿真环境构建,建立基于强化学习的运动性能评估标准,与传统控制方法性能做对比。5. 跟踪前沿强化学习算法(如PPO、SAC、TD3、Dropout Q-learning等)及机器人运动控制领域最新成果,进行技术文献调研与原型实现。 职位要求 职位要求1. 硕士及以上学历,有强化学习在实际机器人系统上的部署经验、有Sim-to-Real迁移(域随机化、系统辨识、教师-学生策略等)实际项目经验。2. 深入理解强化学习基础理论,熟悉MDP建模、策略梯度、价值函数估计、探索-利用权衡等核心概念。3. 熟练掌握至少一种主流强化学习框架(RLlib、Stable-Baselines3、Acme、TensorFlow Agents等),并有实际训练与调优经验。4. 熟悉机器人学与传统运控(运控规划、运动学、动力学等),与仿真环境(Mujoco、PyBullet、Isaac Gym等)进行交互,设计状态空间、动作空间与奖励函数。5. 熟悉ROS2框架,掌握最优化与数值计算方法,能够理解强化学习算法中的梯度估计、约束优化等问题。6. 熟悉NVIDIA Isaac Sim/Isaac Gym、MuJoCo等高性能仿真训练平台,熟练使用C++、Python,熟悉Eigen、NumPy等科学计算库,具备良好的工程化代码能力。7. 熟悉常用传感器(IMU、力矩/力传感器、编码器等)及其在强化学习观测空间中的建模方法,了解状态估计与滤波技术。8. 保持对具身智能前沿技术的持续关注,有技术热情和技术审美,敢于创新,追求卓越。优先条件1. 具有人形机器人、四足机器人或其他复杂多体系统的强化学习运动控制经验者优先。2.
具身智能-运动智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 【具身端到端规划算法工程师/资深/专家/TL】(深圳/上海/北京)岗位职责:1. 负责研发基于深度学习的四足/人形等机器人的全身状态规划控制,实现灵活自然的动态环境的避障和通过2. 设计实现鲁棒高效的 感知-规划-控制 端到端方案,实现鲁棒高效精准的机器人动作规划3. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建4. 应用模仿学习,在/离线强化学习进行模型训练提升模型性能,开发高效的模型评测方法提高迭代效率5. 解决模型评测/部署/真机测试中遇到的问题,满足项目交付指标要求6. 跟踪前沿技术方案,持续迭代升级方案 岗位要求:满足3条及以上1. 人工智能、计算机、机器人、自动驾驶、控制等相关专业硕士或博士学位2. 熟练掌握主流深度学习的时序规划方法如transformer,生成式方法 diffusion policy,掌握主流端到端架构方案如BEV-tranformer/diffusion架构。3. 熟悉基于采样/搜索/优化的决策规划算法,熟悉机器人全身控制。4. 具有模仿学习或强化学习训练经验,熟悉PPO/GRPO/DPO等5. 有实际的端到端系统开发经验,如智能驾驶的E2E。6. 熟练使用PyTorch/TensorFlow深度学习框架,熟练使用Python/C++语言编程,有实际项目开发经验7. 熟悉机器人常用开发环境Mojuco/NVIDIA Isaac/gazebo,有 ROS2/DDS下的开发经验,,能够在Linux环境下独立进行开发和调试; 加分项:8. 有智能驾驶/机器人领域的工程落地经验者优先9. 在机器人顶会(SR/IJRR/TRO/RSS/ICRA/IROS等)或AI顶会(CVPR/NeurIPS/ICML/ICLR等)发表论文者优先
运动控制算法专家(人形) 深圳 社招 全职 互联网 / 电子 / 网游 职位描述 岗位职责1. 核心算法研发 :主导 人形机器人 全身运动控制算法(如强化学习控制、基于优化的控制、力控/阻抗控制等)的设计与落地,深度攻关双足行走、全身协调控制、动态安全避障等技术难题,推动算法从0到1的工程化落地[1]。2. 仿真平台建设 :基于 Isaac Lab / Isaac Gym 构建高保真多地形训练环境(楼梯、斜坡、碎石、障碍物等),设计并维护自动化课程学习体系,持续提升训练效率与覆盖度。3. 前沿算法落地 :主导前沿方法(如Transformer、Diffusion Policy等生成式方法)的工程实现与性能优化,跟踪领域顶会最新进展并快速转化。4. 端到端规划 :设计实现鲁棒高效的感知-规划-控制端到端方案,规划灵活自然的姿态轨迹,实现动态环境的避障和通过。5. Sim-to-Real 迁移 :独立推进仿真到实物的完整部署流程,系统性分析 sim2real gap,设计域适应方案,保障算法在真机上的鲁棒性与泛化能力。6. 技术沉淀与团队协作 :输出高质量技术文档与代码规范,参与核心模块的代码评审。 职位要求
机械臂规控算法工程师/专家(强化学习)(具身) 惠州 全职 职位描述 1、设计、开发和优化用于机械臂运动规划、轨迹跟踪、抓取操作的强化学习算法;2、设计和开发强化学习微调算法;3、在仿真环境(如Isaac Gym、MuJoCo)和真实机械臂上进行算法的实现、测试与性能评估;4、与感知、平台等团队紧密合作,将算法集成到完整的机器人系统中。5、跟踪强化学习在机器人控制领域的前沿技术,并探索其工程化应用; 职位要求 1、熟练掌握强化学习算法(如PPO、SAC、DDPG)及其在机器人连续控制任务中的应用;2、熟练掌握常见深度学习框架,有实际的强化学习/模仿学习项目落地经验;3、理解机器人运动学、动力学及控制理论;4、计算机科学、自动化、机器人、控制工程或相关专业;5、有2-3年及以上实际机械臂运动规划与控制经验的候选人优先;6、有探索精神、积极主动。 投递...
强化学习算法工程师/专家 上海、北京 全职 算法类 职位描述 1.参与端到端自动驾驶系统的强化学习训练;2.构建高效稳定的大规模强化学习闭环训练框架,提升强化学习的数据效率、训练效率、稳定性、场景泛化性;3.持续推动强化学习算法在物理世界的落地应用; 职位要求 1.硕士及以上学历,计算机,自动化及电子信息等相关专业优先;2.掌握强化学习基础理论,熟悉主流强化学习算法(PPO、SAC、GRPO及其变种);3.具备扎实的强化学习工程能力和优秀的代码能力,能够独立负责算法研发和迭代。 投递...
规划算法工程师 上海 全职 职位描述 岗位职责:以自动泊车为核心场景,探索深度强化学习(DRL)在低速复杂环境轨迹规划中的应用范式,构建具备脱困与自主应变能力的规划策略研究 RL 与 Hybrid A* 等传统规划算法的混合架构方案,探索“边走边规划”的滚动时域决策策略,从根本上优化动态重规划能力与乘坐舒适性搭建或扩展公司已有泊车仿真训练环境,设计奖励函数与训练策略,完成模型训练、闭环测试及实车部署验证跟踪行业前沿技术演进,负责团队技术路线规划与人才培养 职位要求 必须项:硕士及以上学历,机器人学、人工智能、自动化等相关专业,博士优先 深入理解深度强化学习核心算法(PPO / SAC / DQN 等),有实际自动驾驶或机器人运动规划项目落地经验熟悉 Hybrid A*、RRT 等经典路径规划算法,清楚认知其局限性熟练使用 PyTorch / TensorFlow,精通 C++ / Python 加分项: 有 APA/AVP 量产项目经历 有嵌入式平台模型部署与推理优化经验 关注 CoRL / ICRA /
自动泊车规划算法专家(RL方向) 上海 全职 职位描述 岗位职责:以自动泊车为核心场景,探索深度强化学习(DRL)在低速复杂环境轨迹规划中的应用范式,构建具备脱困与自主应变能力的规划策略研究 RL 与 Hybrid A* 等传统规划算法的混合架构方案,探索“边走边规划”的滚动时域决策策略,从根本上优化动态重规划能力与乘坐舒适性搭建或扩展公司已有泊车仿真训练环境,设计奖励函数与训练策略,完成模型训练、闭环测试及实车部署验证跟踪行业前沿技术演进,负责团队技术路线规划与人才培养 职位要求 任职要求:必须项:硕士及以上学历,机器人学、人工智能、自动化等相关专业,博士优先深入理解深度强化学习核心算法(PPO / SAC / DQN 等),有实际自动驾驶或机器人运动规划项目落地经验熟悉 Hybrid A*、RRT 等经典路径规划算法,清楚认知其局限性熟练使用 PyTorch / TensorFlow,精通 C++ / Python加分项:有 APA/AVP 量产项目经历有嵌入式平台模型部署与推理优化经验关注 CoRL / ICRA / IROS 等顶会前沿成果有技术带队经验 投递...
REQ14921 Technician, Access Control (Open) POSITION SUMMARY: Technician, Access Control is responsible for the installation and maintenance of SAC equipment allocated to support Security, Surveillance and Gaming operations within the Casino environment. This position takes responsibility for
高级智能驾驶算法工程师 - 强化学习(RL) 上海 全职 职位描述 -研发强化学习、模仿学习、人类反馈强化学习在智驾领域的融合方式,提升系统表现与安全性。-开发基于强化学习与生成式模型的闭环仿真算法和基础设施,实现大规模场景的闭环训练。 职位要求 -具有计算机视觉,机器学习,电子信息,机器人等相关学科硕士/博士学历,AI相关研究方向。-精通强化学习主流算法(PPO/SAC/GRPO等),有结合世界模型/神经渲染方法进行闭环训练的项目经验。-熟悉大规模分布式RL训练,在自动驾驶或机器人领域有完整的RL落地项目经验。-能够紧跟学术界和产业界技术动态,对新技术进行调研和原型验证。有相关领域顶会文章发表经历优先。-精通Python/C++编程,熟练掌握PyTorch等深度学习框架-具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...
【人形机器人】双足运控算法工程师-强化学习 北京、上海 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 1、负责/主导双足机器人强化学习(RL)运控算法研发,覆盖行走/转向/起步停止/跑步、上下坡与台阶、抗外力扰动等核心能力,并实现真机稳定闭环。2、搭建并维护训练Pipeline:仿真环境构建(动力学、接触、执行器与传感器模型)、奖励函数与课程学习、并行采样与训练监控、实验可复现与版本管理。3、负责Sim2Real落地与鲁棒性提升:域随机化(质量/惯量/摩擦/延迟/噪声)、系统辨识、策略泛化与真机调参闭环。4、设计并实现策略与底层控制栈对接(PD/阻抗/WBC/状态机),处理控制频率、延迟、力矩/速度饱和、关节限位与安全保护等工程约束。5、构建并优化步态与接触切换稳定性(单/双支撑过渡、落脚冲击、滑移抑制),降低抖动与能耗,提升步态自然性与可控性。6、建立异常工况处理机制:跌倒检测、失稳恢复(fall recovery)、安全降级、故障注入测试与保护策略。7、制定并维护双足运控评测体系:成功率、速度范围、通过率(地形/扰动/摩擦)、稳定裕度、能耗/温升、恢复时间等,并推动自动化回归。8、支持真机联调与问题定位:策略崩溃、奖励投机、接触抖动、仿真偏差、传感器漂移、执行器带宽限制等问题分析与优化。 职位要求 1、机器人、控制、自动化、机械、计算机等相关专业,本科及以上学历。2、3年以上强化学习或机器人运动控制相关经验;具备足式/双足机器人真机落地经验者优先。3、熟悉主流RL算法与实现(PPO/SAC/TD3等),理解稳定训练要点(归一化、优势估计、探索、约束等)。4、具备扎实的动力学与控制基础:刚体动力学、接触与摩擦、步态稳定性、阻抗/力控、状态估计基础概念。5、熟练Python/C++,具备良好的工程实现与调试能力;熟悉Linux与常用开发/调试工具链。6、熟悉至少一种机器人仿真平台(MuJoCo/Isaac Gym/Isaac Sim/Gazebo等),能够独立完成模型、环境与传感器/执行器仿真开发。7、具备数据分析与系统化定位能力(日志、可视化、回归对比、消融实验),能推动问题闭环。8、具备良好沟通协作能力,能与硬件、全身控制、状态估计、测试团队高效配合。优先考虑条件:1、有复杂地形与强扰动鲁棒行走经验(台阶、碎石、低摩擦、推搡、载荷变化)。2、有WBC/QP/MPC与RL结合、或分层控制(技能/策略/控制器)工程经验。3、有系统辨识、执行器模型(电机/减速器/摩擦/带宽)建模与补偿经验。4、能阅读英文论文/技术文档并快速复现与落地。 投递...
运动控制算法实习生(强化学习方向) 深圳 实习 研发 - 算法 职位描述 【关于我们】小鹏机器人中心致力于研发先进的人形机器人技术,覆盖机器人行走、灵巧操作、智能导航,以及在大语言模型支持下的人机交互等方向。我们的软硬件研发团队分布于深圳、上海、广州、北京及北美,汇聚跨学科的一流人才。加入我们,你将参与把人工智能真正落地到物理世界的核心工作,与控制、感知、规划、硬件等多领域工程师紧密协作,攻克前沿科研与工程难题,并推动人形机器人关键能力的持续演进。【工作职责】1、参与机器人的强化学习训练,优化机器人运动规划与控制策略,与传统控制方法形成互补,提升整体运动性能;2、参与机器人数据重映射(retargeting / remapping)与位置/姿态跟踪算法的开发与优化;3、将先进运动控制与机器学习方法应用于我们的自研人形机器人,推动算法从离线验证到真机闭环;4、研究和复现前沿强化学习算法,探索相关领域学术和工程问题。 职位要求 【岗位要求】1、本科及以上在读,数学、计算机、人工智能、自动化、机器人等相关专业优先;2、至少 1 年强化学习相关项目或研究经验,熟悉足式机器人运动学和动力学;3、熟练使用基于 Pytorch 的深度学习框架,掌握 PPO、DQN、SAC 等主流强化学习算法,以及 MuJoCo、Isaac Gym/Sim 等主流仿真工具;4、热爱机器人行业,有相关期刊或会议论文发表经历,或实际强化学习项目落地经验者优先。【你将获得】1、深度参与最前沿的具身智能算法研发,专注于双足机器人运动规划与控制,以及从仿真到实机的迁移;2、行业内资深专家的指导,对于优秀成果,我们将全力支持发表学术论文或申请专利;3、完备的实验室支持,包括充足的计算资源、稳定的机器人平台和强大的软硬件团队;4、明确的成长路径:实习生是公司的重要储备人才,对于即将毕业的优秀实习生,我们优先考虑其全职工作申请。 投递...
【2027 届校招】强化学习运控算法工程师 北京、杭州 正式 互联网 / 电子 / 网游 - 研发 【千寻智能2027届秋季校园招聘】 职位描述 1. 基于强化学习的人形机器人(轮式/轮足/双足)运动控制算法研究与实现,包括行走、操作、跑步、跳跃等动态运动技能的训练与部署。2. 设计并优化Sim-to-Real迁移策略,解决仿真与真实机器人之间的动力学差异(domain gap),针对机器人本体特性提出算法与机电协同设计的改进建议。3. 构建强化学习训练框架(如Isaac Gym、Mujoco + RLlib等),探索强化学习与传统控制融合、大小脑算法融合。4. 参与机器人运动学、动力学模型的搭建与仿真环境构建,建立基于强化学习的运动性能评估标准,与传统控制方法性能做对比。5. 跟踪前沿强化学习算法(如PPO、SAC、TD3、Dropout Q-learning等)及机器人运动控制领域最新成果,进行技术文献调研与原型实现。 职位要求 1. 硕士及以上学历,有强化学习在实际机器人系统上的部署经验、有Sim-to-Real迁移(域随机化、系统辨识、教师-学生策略等)实际项目经验。2. 深入理解强化学习基础理论,熟悉MDP建模、策略梯度、价值函数估计、探索-利用权衡等核心概念。3. 熟练掌握至少一种主流强化学习框架(RLlib、Stable-Baselines3、Acme、TensorFlow Agents等),并有实际训练与调优经验。4. 熟悉机器人学与传统运控(运控规划、运动学、动力学等),与仿真环境(Mujoco、PyBullet、Isaac Gym等)进行交互,设计状态空间、动作空间与奖励函数。5. 熟悉ROS2框架,掌握最优化与数值计算方法,能够理解强化学习算法中的梯度估计、约束优化等问题。6. 熟悉NVIDIA Isaac Sim/Isaac Gym、MuJoCo等高性能仿真训练平台,熟练使用C++、Python,熟悉Eigen、NumPy等科学计算库,具备良好的工程化代码能力。7.
足式机器人运动控制算法工程师(强化学习) 北京 社招 全职 职位 ID:A200582 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略; 2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用; 4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等; 4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 具备足式机器人强化学习算法的实机调试和sim-to-real经验,有基于模型/优化等传统控制经验者优先; 6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...
机器人具身智能算法工程师 北京 社招 全职 职位 ID:A21181 职位描述 1、针对复合机器人平台(多模态、多自由度、动态环境适应等特性),主导通用具身算法设计,包括人机交互(意图理解、自然协作)与多技能运动和操作(物体抓取、精细操作、长程任务规划)等核心技术,提升机器人对未知环境的适应性与任务完成效率。2、研发机器人的通用算法和系统架构,包括- 数据层:设计多模态数据(视觉/触觉/语言等)的高效获取、清洗、标注与增强方案;- 算法层:研发运动控制策略(轨迹跟踪、全身协调控制、柔顺控制)、多任务决策、VLA模型(任务分解、意图推理)等核心算法;- 工程层:优化模型轻量化(蒸馏、压缩、量化)与部署适配(边缘端/云端),确保算法在真实机器人硬件上的实时性与鲁棒性;3、与机械设计、传感器、仿真等团队深度协作,推动算法在真实场景中的验证与迭代,支撑下一代具身智能系统的落地应用。 职位要求 职位要求1、计算机、人工智能或相关专业硕士及以上学历,具有深度学习、计算机视觉、多模态大模型等相关领域的科研或工程落地经验,熟悉机器人运动学、动力学基础。2、编程能力突出:熟练掌握Python/C++,精通PyTorch等框架,具备高效的算法实现与调试能力;3、具身智能核心技术储备:熟悉具身智能、多模态学习、强化学习(如PPO、SAC)、模仿学习等前沿方向,掌握运动控制(如DDP、MPC)、多模态融合(如VLM、视觉-语言-动作对齐)等算法原理与实践;4、有机器人(仿真或实体)算法调优经验优先,熟悉硬件适配(如ROS生态、嵌入式部署),解决复杂环境下的算法鲁棒性问题。5、在机器人/具身智能/多模态等方向顶会(如ICRA、IROS、RSS、NeurIPS、CVPR)发表过论文;或在算法竞赛(ACM-ICPC、Topcoder)中取得优异成绩者优先 投递...
机器人强化学习算法工程师(技术预研方向) 北京 社招 全职 职位 ID:A141640 职位描述 1. 开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2. 负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3. 持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1. 硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2. 具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3. 掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4. 扎实的C++、python编程能力;5. 数学基础扎实,具有较强的学习与研究能力;6. 熟悉大模型理论者优先。 投递...
强化学习工程师(真机操作方向) 上海 全职 职位描述 1. 负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整 RL pipeline,解决 Sim2Real 迁移中的核心挑战2. 研发高效的 RL 训练方案,提升样本效率,使复杂灵巧操作任务能在有限训练时间内收敛到高成功率3. 搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计、渐进式自主等策略,降低真机训练成本4. 构建分布式 RL 训练基础设施,对接多仿真器后端与真机环境,支持多算法并行实验与大规模数据采集5. 跟踪真机 RL 与机器人操作领域前沿进展(如 SERL 等代表性工作),快速验证并落地到产品 职位要求 任职要求1. 硕士及以上,计算机 / 机器人 / 自动化等相关专业2. 具备真机强化学习的完整项目经验,熟悉从仿真训练到真机策略部署的全流程,了解 Sim2Real 迁移的关键技术(域随机化、阻抗控制、自动重置等)3. 精通主流 RL 算法(SAC / PPO