端到端大模型算法工程师(Mstar) 北京、上海、深圳、苏州 Mstar计划 职位描述 1、面向端到端自动驾驶大模型,研究并落地RL、On-policy Distillation等后训练范式,提升模型在复杂驾驶场景下的决策质量与泛化能力;2、结合Momenta海量量产真实路测数据,设计数据闭环驱动的后训练策略,加速模型在长尾驾驶场景中的能力提升;3、对比和融合SFT、RL、On-policy Distillation等范式,针对驾驶决策任务的特殊性设计最优后训练方案;4、结合分布式训练框架优化后训练系统效率,推动模型从研究到量产的快速迭代;5、追踪并复现LLM、端到端自动驾驶领域最新研究成果。 职位要求 1、计算机、人工智能等相关专业硕士/博士应届毕业生;2、必须具备Flow Matching相关经验;3、深入理解后训练核心范式,对以下概念有实质性认知:- On-Policy Vs Off-policy采样的本质区别- Dense vs Sparse Reward对训练效果与收敛的影响4、在以下至少一个方向有研究或工程实践经验:- RL后训练(PPO、GRPO、RLHF 等)- On-policy/Sequence-level蒸馏(GKD、MiniLLM、DAGGER 相关方法)5、熟悉至少一种主流训练框架(VeRL、Megatron-LM、DeepSpeed、vLLM等);6、有顶会论文(NeurIPS、ICML、ICLR等)或相关方向实习经历者优先。加分项1、同时具备Flow Matching与RL经验;2、同时具备RL与蒸馏两个方向经验;3、有Reward Model、Value Model或Token-level Scoring相关研究经验;4、对自动驾驶决策、具身智能或物理AI场景有了解,理解驾驶轨迹数据与通用NLP数据的本质差异。 投递...