具身算法工程师(VLA+RL)-通用业务部 上海 校招 正式 技术 - 算法类 职位 ID:A121738 职位描述 VLA 端到端模型研发: 设计并训练端到端视觉-语言-动作模型(如 RT-2、OpenVLA、π0、Diffusion Policy、3D Diffusion Actor 等),实现从视觉输入与语言指令到机器人低维动作空间的直接映射。研究动作表示与生成机制: 动作 Token 化(Action Tokenization)、隐动作量化(Latent Action Quantization, LAPA)、扩散式动作生成(Diffusion Policy)、流匹配(Flow Matching)等前沿方案。探索 RL 与模仿学习(IL)的混合训练范式:利用人类演示数据初始化策略,再通过 RL 进行微调和鲁棒性增强。强化学习运控与策略优化: 包括 PPO、SAC、RLHF(Human Feedback for Robotics)、DAPG 等算法在关节级/任务级控制中的应用。模型部署与实时性优化:
校招-大模型算法工程师(数据闭环方向) 上海、北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-正式批 职位 ID:A151513A 职位描述 负责智能辅助驾驶端到端模型的强化学习训练框架设计与优化,包括但不限于 PPO、GRPO、DPO、Offline RL、RLHF 等技术路线。负责智能辅助驾驶训练数据体系建设,包括数据版本管理、数据质量评估、场景覆盖分析、长尾场景挖掘和数据迭代策略设计。负责智能辅助驾驶奖励模型(Reward Model)和评测体系建设,设计兼顾安全性、舒适性、效率和规则遵守的奖励函数体系。负责智能辅助驾驶模型训练闭环建设,包括数据挖掘、数据生产、训练、评测、回灌和迭代优化。负责大规模分布式训练任务开发与优化,提升训练效率、资源利用率和模型收敛效果。探索 Diffusion、Autoregressive、World Model、RL 等前沿技术在智能辅助驾驶中的应用,并推动落地。跟踪学术界和工业界最新进展,推动先进算法在业务中的快速验证和落地。 职位要求 计算机、人工智能、自动化、机器人等相关专业硕士及以上学历。扎实的机器学习和深度学习基础,熟悉 Transformer、Diffusion、LLM 等主流模型架构。熟悉强化学习基础理论,包括:MDP、Policy Gradient、Actor-Critic、Offline RL熟悉智能辅助驾驶训练链路,包括:数据构建数据清洗数据版本管理模型训练模型评测闭环迭代具备良好的工程能力,能够独立完成算法设计、实验验证和线上部署。加分项智能辅助驾驶方向有端到端智能辅助驾驶(E2E Driving)经验。有 Planning、Behavior、Trajectory Prediction 或 Closed-loop Simulation 经验。有 CARLA、闭环仿真或真实车辆部署经验。有智能辅助驾驶数据引擎建设经验。有数据版本管理平台设计经验。数据与训练体系方向有 PB 级数据管理经验。有训练数据自动发版体系建设经验。有数据质量度量、场景覆盖分析、难例挖掘经验。有训练效率优化经验(吞吐、收敛、成本优化)。学术背景在以下顶级会议或期刊发表论文者优先有智能辅助驾驶、强化学习或大模型方向高质量开源项目经验者优先。 投递...