视频生成算法工程师 (强化学习) 北京、上海、深圳 全职 研发 - 算法 职位描述 负责视频生成模型的后训练算法,基于 reward model、人工偏好和自动评测信号,提升模型在文本对齐、审美、动态、稳定性和用户满意度上的综合表现:1. 设计视频生成后训练流程,包括 SFT、DPO、diffusion RL 等。2. 基于多维 RM 构建训练 reward,优化文本-视频对齐、运动质量、美感、主体一致性和崩坏率。3. 探索 reward hacking 防御、多 reward balance、online/offline preference data mixing。4. 支持 recaption model RL,探索基于 benchmark 或 RM 的