高级智能驾驶算法工程师 - 强化学习(RL) 上海 全职 职位描述 -研发强化学习、模仿学习、人类反馈强化学习在智驾领域的融合方式,提升系统表现与安全性。-开发基于强化学习与生成式模型的闭环仿真算法和基础设施,实现大规模场景的闭环训练。 职位要求 -具有计算机视觉,机器学习,电子信息,机器人等相关学科硕士/博士学历,AI相关研究方向。-精通强化学习主流算法(PPO/SAC/GRPO等),有结合世界模型/神经渲染方法进行闭环训练的项目经验。-熟悉大规模分布式RL训练,在自动驾驶或机器人领域有完整的RL落地项目经验。-能够紧跟学术界和产业界技术动态,对新技术进行调研和原型验证。有相关领域顶会文章发表经历优先。-精通Python/C++编程,熟练掌握PyTorch等深度学习框架-具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...
【人形机器人】双足运控算法工程师-强化学习 北京、上海 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 1、负责/主导双足机器人强化学习(RL)运控算法研发,覆盖行走/转向/起步停止/跑步、上下坡与台阶、抗外力扰动等核心能力,并实现真机稳定闭环。2、搭建并维护训练Pipeline:仿真环境构建(动力学、接触、执行器与传感器模型)、奖励函数与课程学习、并行采样与训练监控、实验可复现与版本管理。3、负责Sim2Real落地与鲁棒性提升:域随机化(质量/惯量/摩擦/延迟/噪声)、系统辨识、策略泛化与真机调参闭环。4、设计并实现策略与底层控制栈对接(PD/阻抗/WBC/状态机),处理控制频率、延迟、力矩/速度饱和、关节限位与安全保护等工程约束。5、构建并优化步态与接触切换稳定性(单/双支撑过渡、落脚冲击、滑移抑制),降低抖动与能耗,提升步态自然性与可控性。6、建立异常工况处理机制:跌倒检测、失稳恢复(fall recovery)、安全降级、故障注入测试与保护策略。7、制定并维护双足运控评测体系:成功率、速度范围、通过率(地形/扰动/摩擦)、稳定裕度、能耗/温升、恢复时间等,并推动自动化回归。8、支持真机联调与问题定位:策略崩溃、奖励投机、接触抖动、仿真偏差、传感器漂移、执行器带宽限制等问题分析与优化。 职位要求 1、机器人、控制、自动化、机械、计算机等相关专业,本科及以上学历。2、3年以上强化学习或机器人运动控制相关经验;具备足式/双足机器人真机落地经验者优先。3、熟悉主流RL算法与实现(PPO/SAC/TD3等),理解稳定训练要点(归一化、优势估计、探索、约束等)。4、具备扎实的动力学与控制基础:刚体动力学、接触与摩擦、步态稳定性、阻抗/力控、状态估计基础概念。5、熟练Python/C++,具备良好的工程实现与调试能力;熟悉Linux与常用开发/调试工具链。6、熟悉至少一种机器人仿真平台(MuJoCo/Isaac Gym/Isaac Sim/Gazebo等),能够独立完成模型、环境与传感器/执行器仿真开发。7、具备数据分析与系统化定位能力(日志、可视化、回归对比、消融实验),能推动问题闭环。8、具备良好沟通协作能力,能与硬件、全身控制、状态估计、测试团队高效配合。优先考虑条件:1、有复杂地形与强扰动鲁棒行走经验(台阶、碎石、低摩擦、推搡、载荷变化)。2、有WBC/QP/MPC与RL结合、或分层控制(技能/策略/控制器)工程经验。3、有系统辨识、执行器模型(电机/减速器/摩擦/带宽)建模与补偿经验。4、能阅读英文论文/技术文档并快速复现与落地。 投递...
Company Description Do you want beneficial technologies being shaped by your ideas? Whether in the areas of mobility solutions, consumer goods, industrial technology or energy and building technology - with us, you will have the chance
运动控制算法实习生(强化学习方向) 深圳 实习 研发 - 算法 职位描述 【关于我们】小鹏机器人中心致力于研发先进的人形机器人技术,覆盖机器人行走、灵巧操作、智能导航,以及在大语言模型支持下的人机交互等方向。我们的软硬件研发团队分布于深圳、上海、广州、北京及北美,汇聚跨学科的一流人才。加入我们,你将参与把人工智能真正落地到物理世界的核心工作,与控制、感知、规划、硬件等多领域工程师紧密协作,攻克前沿科研与工程难题,并推动人形机器人关键能力的持续演进。【工作职责】1、参与机器人的强化学习训练,优化机器人运动规划与控制策略,与传统控制方法形成互补,提升整体运动性能;2、参与机器人数据重映射(retargeting / remapping)与位置/姿态跟踪算法的开发与优化;3、将先进运动控制与机器学习方法应用于我们的自研人形机器人,推动算法从离线验证到真机闭环;4、研究和复现前沿强化学习算法,探索相关领域学术和工程问题。 职位要求 【岗位要求】1、本科及以上在读,数学、计算机、人工智能、自动化、机器人等相关专业优先;2、至少 1 年强化学习相关项目或研究经验,熟悉足式机器人运动学和动力学;3、熟练使用基于 Pytorch 的深度学习框架,掌握 PPO、DQN、SAC 等主流强化学习算法,以及 MuJoCo、Isaac Gym/Sim 等主流仿真工具;4、热爱机器人行业,有相关期刊或会议论文发表经历,或实际强化学习项目落地经验者优先。【你将获得】1、深度参与最前沿的具身智能算法研发,专注于双足机器人运动规划与控制,以及从仿真到实机的迁移;2、行业内资深专家的指导,对于优秀成果,我们将全力支持发表学术论文或申请专利;3、完备的实验室支持,包括充足的计算资源、稳定的机器人平台和强大的软硬件团队;4、明确的成长路径:实习生是公司的重要储备人才,对于即将毕业的优秀实习生,我们优先考虑其全职工作申请。 投递...
About A1 There are over 5 billion users using basic applications today such email, notes, tasks that are not AI-native. Our mission is to build a proactive smart assistant for everyday users to bring intelligence to
【27届校招】智能座舱算法工程师(仿真,北京) 北京 正式 研发 - 算法 职位描述 参与智能座舱仿真评测平台的核心算法研发工作,围绕评测 - 仿真 - 智能体三大方向,推动座舱交互体验的自动化评测与持续优化。具体工作内容包括但不限于:1、评测体系构建- 设计并构建智能座舱场景下的评测 Benchmark,覆盖多轮对话、多模态交互、任务完成度等维度- 研发评测 Reward Model,建立可量化、可迭代的自动化评分体系2、智能体(Agent)研发- 构建评测 Agent,实现对座舱对话系统的自动化、规模化测试- 设计用户行为仿真 Agent,模拟真实用户在座舱场景中的交互行为与意图模式3、仿真环境搭建- 参与座舱环境仿真系统的研发,构建可复现、可配置的虚拟测试环境- 参与感知仿真模块开发,模拟语音、视觉、手势等多模态输入信号 职位要求 1、扎实的编程能力,熟练掌握 Python,熟悉常用深度学习框架(PyTorch 等);2、了解大语言模型(LLM)的基本原理与应用,有 Prompt Engineering 或模型微调经验;3、具备以下至少一个方向的实际项目或研究经验:-大模型应用 / Agent 构建-强化学习(RLHF、PPO、Reward Modeling 等)-对话系统 / NLP-数据处理与分析-良好的自驱力与沟通能力,能独立推进研究课题【加分项】1、在
【27届校招】大模型算法工程师 北京 正式 研发 - 算法 职位描述 岗位简介:聚焦云端大模型算法研发,包括 VLM / VLA 大模型、世界动作模型(WAM)等,重点解决自动驾驶场景数据闭环体系及数据治理能力建设;利用语义标签、长时序描述及推理、向量化或隐空间表征等建立数据图谱,实现大规模数据分层治理。岗位职责:1、云端基座大模型研发:负责数据驱动的云端基座大模型算法研发,基于海量量产数据,研发无监督、自监督算法,持续提升大模型的场景语义理解与物理空间感知能力,进而提高云端大模型的时空感知、推理、预测、分析能力;2、空间推理产线建设:负责基于多传感器数据融合、时空信息融合的自动标注算法,构建具有精度高、场景泛化性强的时空数据生产产线,持续推动物理AI云端大模型研发;3、Scaling Law 驱动的算法研发:负责车云平台一体化大模型算法研发与优化,研发和设计基于数据驱动的感知迭代链路;构建高效的自训练感知流水线,提升数据闭环效率;4、强化学习研发:基于 PPO、DPO、GRPO、SAC 等主流强化学习算法,搭建长尾场景的后训练方案,完成奖励设计、分布式训练、模型调优,提升模型在复杂场景、恶劣天气、小众交通场景下的泛化能力与稳定性。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先。具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通 VLM / VLA 端到端自动驾驶模型原理与全链路研发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾或机器人大模型落地经验优先;3、强化学习能力:熟练掌握 PPO、DPO、GRPO 等算法,具备用强化学习解决问题的实战经验,有智驾或机器人项目量产落地经验;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用 PyTorch,掌握 Agent / Harness 等自动化工具;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。加分项1、参与过自动驾驶或机器人技术路线、算法体系标准搭建;2、深耕VLM/VLA预训练、后训练方向,有相关落地成果;3、拥有顶会论文、核心专利成果。 投递...
【27届校招】VLA自动驾驶算法工程师 上海、广州、北京、深圳 正式 互联网 / 电子 / 网游 职位描述 业务方向:自动驾驶通用智能、海外出海量产岗位简介:聚焦端到端自动驾驶 VLM/VLA 大模型研发,重点解决模型海外跨地域泛化难题,攻克海内外路况、交规、驾驶习惯、气候地貌差异导致的域偏移、鲁棒性差、长尾场景失效等核心问题,负责算法研发、迭代优化与海外量产落地。一、主要职责1、VLA大模型海外泛化研发:负责自动驾驶VLA/VLM端到端算法设计与迭代,针对海外多地域场景差异,优化模型环境认知、障碍物识别、行为预测与轨迹生成能力,解决跨域适配、认知偏差等核心问题。2、强化学习跨域优化落地:基于PPO、DPO、GRPO等主流强化学习算法,搭建海外场景专属训练方案,完成跨域奖励设计、分布式训练、模型调优,提升模型海外复杂场景、恶劣天气、小众交通场景的泛化能力与稳定性。3、全流程量产落地:主导算法从海外数据闭环、仿真适配、模型验证到实车测试、部署迭代的全流程工作,攻克海外样本稀疏、域迁移难、推理不稳定等工程问题,支撑业务规模化出海。 职位要求 二、任职要求1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,具备扎实的深度学习与强化学习数理功底。2、大模型能力:精通VLM/VLA端到端自动驾驶模型原理与全栈开发,熟悉大模型跨域泛化、微调蒸馏技术,有智驾大模型落地经验优先。3、强化学习能力:熟练掌握PPO、DPO、GRPO等算法,具备用强化学习解决问题的实战经验,有智驾/机器人项目量产落地经历。4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知。5、工程与综合能力:熟练使用PyTorch,掌握分布式训练、模型优化、车载部署等工程能力;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。三、加分项1、有智驾VLA模型海外泛化、全球化适配、出海量产核心项目经验;2、深耕跨域泛化、迁移学习、稀疏场景补齐方向,有相关落地成果;3、参与过自动驾驶全球化技术路线、算法体系标准搭建;4、拥有顶会论文、核心技术专利成果。 投递...
【2027 届校招】强化学习运控算法工程师 北京、杭州 正式 互联网 / 电子 / 网游 - 研发 【千寻智能2027届秋季校园招聘】 职位描述 1. 基于强化学习的人形机器人(轮式/轮足/双足)运动控制算法研究与实现,包括行走、操作、跑步、跳跃等动态运动技能的训练与部署。2. 设计并优化Sim-to-Real迁移策略,解决仿真与真实机器人之间的动力学差异(domain gap),针对机器人本体特性提出算法与机电协同设计的改进建议。3. 构建强化学习训练框架(如Isaac Gym、Mujoco + RLlib等),探索强化学习与传统控制融合、大小脑算法融合。4. 参与机器人运动学、动力学模型的搭建与仿真环境构建,建立基于强化学习的运动性能评估标准,与传统控制方法性能做对比。5. 跟踪前沿强化学习算法(如PPO、SAC、TD3、Dropout Q-learning等)及机器人运动控制领域最新成果,进行技术文献调研与原型实现。 职位要求 1. 硕士及以上学历,有强化学习在实际机器人系统上的部署经验、有Sim-to-Real迁移(域随机化、系统辨识、教师-学生策略等)实际项目经验。2. 深入理解强化学习基础理论,熟悉MDP建模、策略梯度、价值函数估计、探索-利用权衡等核心概念。3. 熟练掌握至少一种主流强化学习框架(RLlib、Stable-Baselines3、Acme、TensorFlow Agents等),并有实际训练与调优经验。4. 熟悉机器人学与传统运控(运控规划、运动学、动力学等),与仿真环境(Mujoco、PyBullet、Isaac Gym等)进行交互,设计状态空间、动作空间与奖励函数。5. 熟悉ROS2框架,掌握最优化与数值计算方法,能够理解强化学习算法中的梯度估计、约束优化等问题。6. 熟悉NVIDIA Isaac Sim/Isaac Gym、MuJoCo等高性能仿真训练平台,熟练使用C++、Python,熟悉Eigen、NumPy等科学计算库,具备良好的工程化代码能力。7.
算法工程师 - Agent Beijing Full-time R&D - Algorithm Responsibilities 负责公司AI Agent方向的算法研究与落地工作,围绕个性化内容生成与长期记忆构建,将大模型训练技术(SFT、RL等)应用于Agent能力的持续提升,具体职责包括但不限于:1. Agent架构设计:面向个性化内容生成和角色交互场景,设计并实现基于大语言模型的Agent架构;定义Agent的编排流程、工具调用(Tool Use)、反思(Reflection)等核心范式,使Agent能够基于用户画像和历史交互生成高度个性化的内容与回复2. Agent训练与优化:运用SFT、RFT、PPO、DPO、GRPO等训练方法,针对Agent场景设计专项训练方案;构建Agent行为轨迹数据集,通过强化学习优化Agent的个性化生成质量、记忆调用准确性和多轮对话一致性3. 训练环境设计:构建Agent训练所需的真实可执行交互环境(工具调用沙箱、用户模拟器、多轮对话场景等),定义状态空间、动作空间和反馈信号,为Agent提供高质量的训练闭环4. 奖励建模:设计Agent专用的奖励函数与评估体系,针对个性化程度、内容一致性、记忆调用准确性、用户满意度等多维目标,结合过程奖励模型(PRM)、生成式奖励模型(GRM)以及个性化奖励模型(Personalized RM,基于用户偏好和交互历史动态调整奖励信号),实现对Agent行为链路的细粒度奖励,解决奖励稀疏、奖励欺骗等核心难题5. 记忆与个性化系统:构建可解释、可迁移、可控的Agent记忆架构,支持用户偏好的长期建模与动态更新;实现记忆的版本化管理,支持精确遗忘(通过token删除)和跨模型迁移,保障个性化体验的连续性与可控性6. 持续学习(Continual Learning):研究并实现Token Space下的持续学习机制,通过更新Agent的learned context(系统提示、记忆库、工具定义等)而非模型权重来实现Agent的持续进化;解决context poisoning(上下文污染)/ context rot(上下文退化)等有限上下文窗口下的记忆退化问题,在避免灾难性遗忘的前提下实现Agent知识的增量积累8. 快速实验与迭代闭环:具备从eval构建、数据准备、方案实现到结果评估的全链路快速实验能力;参与Agent的线上A/B实验设计,通过线上效果度量和用户反馈分析定位算法瓶颈,驱动下一轮训练与模型优化的方向 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP相关的算法和技术,具备大模型训练和RL算法的实践经验;3. 对LLM-based Agent系统有深入理解,具备Agent训练或Agent系统相关的项目经验;4. 能系统性拆解Agent在长期记忆管理、个性化内容生成、上下文窗口利用等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。加分项:1. 在Agent记忆机制、个性化生成、持续学习、上下文优化(如DSPy等prompt optimization方法)等方向有论文成果;2.
强化学习工程师(真机操作方向) 上海 全职 职位描述 1. 负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整 RL pipeline,解决 Sim2Real 迁移中的核心挑战2. 研发高效的 RL 训练方案,提升样本效率,使复杂灵巧操作任务能在有限训练时间内收敛到高成功率3. 搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计、渐进式自主等策略,降低真机训练成本4. 构建分布式 RL 训练基础设施,对接多仿真器后端与真机环境,支持多算法并行实验与大规模数据采集5. 跟踪真机 RL 与机器人操作领域前沿进展(如 SERL 等代表性工作),快速验证并落地到产品 职位要求 任职要求1. 硕士及以上,计算机 / 机器人 / 自动化等相关专业2. 具备真机强化学习的完整项目经验,熟悉从仿真训练到真机策略部署的全流程,了解 Sim2Real 迁移的关键技术(域随机化、阻抗控制、自动重置等)3. 精通主流 RL 算法(SAC /
具身智能算法工程师(框架方向) 北京、上海 社招 全职 互联网 / 电子 / 网游 - 研发 职位 ID:A141087 职位描述 1. 将强化学习(RL)、模仿学习(IL)、扩散策略、VLM/LLM 微调等具身算法,高效嵌入 RLinf 框架,定义训练、推理、回放、评测的标准接口与数据流。2. 主导大规模分布式 RL 训练 pipeline 的算法侧调优(如 PPO、SAC的并行采样、经验池管理、优势估计加速),提升训练效率和样本利用率。3. 负责具身基座模型(如 VLA、WAM 类)在 RLinf 上的 LoRA/QLoRA 微调适配,并参与 sim-to-real 迁移策略,保证模型在真实机器人上的性能可复现。4. 设计高效的数据采集、标注、重放与评测工作流,与硬件团队配合制定数据格式标准,支持仿真环境与真实传感器数据的统一接入。5. 针对典型具身任务(操作、导航、抓取等),构建 benchmark
大模型算法工程师 北京 技术 - 算法 硕士及以上 职位描述 1、大模型训练与优化:负责金融场景大语言模型的训练全流程研发,持续提升模型的推理、对齐与泛化能力,设计并实现基于强化学习的大模型训练方案(如 PPO、GRPO 等),优化奖励模型(Reward Model)设计与训练稳定性;2、Agent 系统研发:构建与优化基于大模型的 Agentic 系统,包括任务规划、工具调用(Tool Use)、多智能体协作、长程记忆与推理等核心能力;3、自进化系统探索:研究并落地模型自我迭代(Self-Evolving)机制,推动模型能力的持续自主提升;4、前沿技术跟踪:跟踪大模型领域最新进展(RL、Agent、harness),并结合业务场景快速验证与落地。 职位要求 1、计算机、人工智能、数学、统计等相关专业硕士及以上学历;2、扎实的机器学习/深度学习基础,熟悉 Transformer 架构及主流大模型原理;3、熟练掌握 Python,熟悉 PyTorch 等主流深度学习框架;4、熟悉大模型训练全流程(预训练、SFT、对齐训练等),有实际训练经验;5、良好的工程能力、问题分析能力与团队协作意识。 优先条件(加分项)1、具备大模型监督微调/强化学习训练经验,有奖励模型设计与训练调优经验者优先;2、具备 Agentic 系统研发经验,熟悉 Function Calling、多智能体框架、规划与推理链路者优先;3、具备自进化 / 自我改进系统相关研究或落地经验者优先;4、在顶级会议/期刊(NeurIPS、ICML、ICLR、ACL、CVPR 等)发表过论文,或有知名开源项目贡献者优先。 职位信息 部门: 技术体系 投递温馨提示:投递顺序代表志愿顺序,请同学谨慎选择 投递...
具身智能操作模型算法工程师-深圳 深圳 校招 正式 智能制造 / 工业互联网 / 工业自动化 职位描述 你将参与:1. 参与具身操作模型的 SFT 和 RL 训练,包括数据格式设计、训练配置与效果评估;2. 在真实机器人平台上设计并实施 RL 训练方案,提升模型泛化能力与鲁棒性;3. 参与通用奖励模型设计与训练,实现长程任务下的高效真机强化学习;4. 跟踪具身智能前沿论文,探索基础模型与 RL 结合的新技术;5. 编写技术文档,沉淀训练-部署最佳实践。 职位要求 1. 2027届毕业生,本科及以上学历及以上,、计算机、人工智能、机器人、自动化等相关专业。2. 理解 PPO/SAC 等 RL 核心算法,熟悉 VA/VLA/WAM 等具身操作大模型;3. 扎实的机器人运动学与动力学基础,能处理真机延迟、噪声等非线性问题;4. 精通 Python
具身智能运动控制算法工程师-深圳 深圳 校招 正式 智能制造 / 工业互联网 / 工业自动化 职位描述 你将参与:1. 研发四足、人形机器人(腿足/机械臂)相关强化学习和模仿学习的运动控制算法,基于 IsaacSim/MuJoCo 等仿真平台搭建大规模并行训练环境,实现动作轨迹跟踪、全身协调控制及力控策略,自适应多种地形环境;2. 参与 Sim-to-Real 迁移全流程,系统性分析并解决电驱、结构、传感器相关 gap ,结合系统辨识、状态估计、域随机化等技术提升真机部署鲁棒性;3. 实现运控系统端侧高效部署,与认知大模型、空间/语义感知模型构建分层端到端架构,完成从环境感知、高层决策到底层运动执行的跨模型协同;4. 对齐 Scaling Law 驱动的运动智能前沿,探索动作基模、世界模型驱动运控、多模态具身大模型等新范式,构建面向通用运动能力的统一架构与训练体系; 职位要求 1. 2027届毕业生,硕士及以上学历及以上,控制科学、计算机科学、机械电子、机器人等相关专业。2. 掌握机器人运动学/动力学基础,了解多刚体动力学建模、正逆运动学等核心算法;3. 具备强化学习理论基础,熟悉 PPO、SAC 等主流算法,有实际项目或课题经验;4. 熟练使用 Python,熟悉 PyTorch 深度学习框架,具备良好的代码规范和工程能力;5. 具备至少一种仿真工具(MuJoCo/Isaac Gym/PyBullet/Gazebo)的使用经验;6.
The Next Level of Fire & Life Safety Leadership With more than two centuries of combined history, brands like Kidde, Kidde Commercial, Edwards, GST, Badger, Gloria and Aritech have been leading the way in protecting people
About the job Delart is home to a team of world-class engineers and project leaders dedicated to developing the next generation of advanced networking technologies, consumer devices, and innovative technology solutions. Trusted by some of the
Job description & Key Responsibilities: 1. Issue Management Lead issue resolution and escalation handling; ensure clear and timely communication with stakeholders 2. Operational Excellence & Digital Transformation (Strategic Focus) a. Drive end-to-end optimization of operating models,
强化学习实习生(真机操作)(R12185) 上海 实习 职位描述 岗位JD(含岗位职责和岗位要求)岗位职责1. 参与真机 RL 训练 pipeline 的搭建与调试,涵盖仿真环境搭建、策略训练、真机联调2. 参与人机协作训练实验:遥操作数据采集、奖励函数设计、策略调优3. 复现前沿论文算法,沉淀可复用的实验方案与技术文档任职要求1. 计算机 / 机器人 / 自动化等相关专业在读硕博(优秀本科亦可)2. 掌握 RL 基础理论,熟悉 SAC / PPO 等主流算法;熟练使用 Python,了解 PyTorch 或 JAX3. 对真机 RL 或机器人操作方向有浓厚兴趣,阅读过 SERL 等相关论文者优先4. 每周 ≥4 天,连续 ≥6
具身算法工程师(VLA+RL)-通用业务部 上海 校招 正式 技术 - 算法类 职位 ID:A121738 职位描述 VLA 端到端模型研发: 设计并训练端到端视觉-语言-动作模型(如 RT-2、OpenVLA、π0、Diffusion Policy、3D Diffusion Actor 等),实现从视觉输入与语言指令到机器人低维动作空间的直接映射。研究动作表示与生成机制: 动作 Token 化(Action Tokenization)、隐动作量化(Latent Action Quantization, LAPA)、扩散式动作生成(Diffusion Policy)、流匹配(Flow Matching)等前沿方案。探索 RL 与模仿学习(IL)的混合训练范式:利用人类演示数据初始化策略,再通过 RL 进行微调和鲁棒性增强。强化学习运控与策略优化: 包括 PPO、SAC、RLHF(Human Feedback for Robotics)、DAPG 等算法在关节级/任务级控制中的应用。模型部署与实时性优化: