多模态RL infra工程师 北京、上海、成都、深圳 社招 全职 技术 - 开发 职位 ID:A79965 职位描述 1、RL训练框架搭建与优化:建设支持多模态大模型后训练的RL基础设施,包括SFT、DPO、GRPO等算法的训练框架开发与性能调优。2、训练效率提升:优化RL训练的资源调度、通信模式与计算-通信重叠,降低显存占用与训练耗时,提升端到端训练吞吐。3、训练稳定性保障:建立训练监控与容错机制,解决大规模RL训练中常见的训推不一致、reward hacking、loss震荡等问题。4、多模态模型适配:支持图文理解模型与全模态模型(MiniCPM-V/o)的RL后训练,解决视觉/音频模态与文本模态在RL训练中的效率与对齐问题。5、工具链建设:协助算法团队搭建数据流水线、评测链路和模型迭代闭环,提升整体研发效率。 职位要求 职位要求1.本科及以上学历,了解常见强化学习算法的相关原理、实现方式、优化策略;2.具备搭建、优化和维护强化学习训练基础设施(Infra)的经验;3.熟悉集群资源管理、监控与CI/CD等Infra体系,能保障训练平台稳定性;4.熟悉至少一种主流的RLHF框架,如OpenRLHF/VeRL/ChatLearn等;5.了解分布式训练基本原理,熟悉通信库的相关工作原理;6.有良好的沟通合作能力、快速学习和应用新技术的能力、及基本的英文文献阅读能力。加分项:1.有强化学习项目实施经验;2.熟悉模型部署和推理优化;3.了解云平台部署和容器化技术。 投递...