Refine Reset All
Sort by
Job Title
Location
Employer/Recruiter
Experience
Date Posted
Job Title
Skills
Location
Job Type
Employer/Recruiter
Experience
All Filters

Ppo Jobs In China - 72 Job Positions Available

Top Cities:
1 – 20 of 72 jobs
NIO jobs

智能辅助驾驶算法工程师(端到端模型 / 强化学习) AD内推 蔚来自动驾驶研发团队 北京 社招 全职 数字技术 - 算法 硕士及以上 3-5 年 职位描述 负责端到端智能辅助驾驶轨迹生成算法的研发与优化,重点方向包括但不限于:端到端模仿学习(如 VLA/世界模型、自回归生成、Diffusion Policy 等);强化学习(涵盖轨迹生成、闭环训练、世界模型等相关技术)。持续跟踪人工智能领域的前沿技术动态,推动先进算法在量产项目中的实际应用与落地。 职位要求 硕士及以上学历,计算机、软件工程、人工智能或相关专业;具备扎实的深度学习理论基础,熟悉常见深度学习与机器学习算法;熟练掌握至少一种主流深度学习框架,具有 TensorFlow 或 PyTorch 深度开发经验者优先。【加分项】①具备端到端路径/轨迹生成相关经验,熟悉以下任一方向者优先:主流模仿学习方法(如行为克隆);主流 BEV 任务(如动态/静态目标检测与跟踪等);时序建模方法(RNN/LSTM/GRU等)。②具备强化学习相关经验,熟悉以下任一方向者优先:主流 RL 算法(如 DQN、DDPG、SAC、PPO、GRPO 等);强化学习在轨迹预测、决策规划或仿真环境中的应用;世界模型(World Model)、模型预测控制(MPC)或基于强化学习的闭环仿真技术。③具备 VLA/VLN/世界模型等相关项目实践经验,熟悉以下任一方向者优先:主流 VLA 方法(如 OpenVLA、PAI0 等);主流世界模型方法(如

NIO  14 days ago
ZERON 零一汽车 jobs

高级智能驾驶算法工程师 - 强化学习(RL) 上海 全职 职位描述 -研发强化学习、模仿学习、人类反馈强化学习在智驾领域的融合方式,提升系统表现与安全性。-开发基于强化学习与生成式模型的闭环仿真算法和基础设施,实现大规模场景的闭环训练。 职位要求 -具有计算机视觉,机器学习,电子信息,机器人等相关学科硕士/博士学历,AI相关研究方向。-精通强化学习主流算法(PPO/SAC/GRPO等),有结合世界模型/神经渲染方法进行闭环训练的项目经验。-熟悉大规模分布式RL训练,在自动驾驶或机器人领域有完整的RL落地项目经验。-能够紧跟学术界和产业界技术动态,对新技术进行调研和原型验证。有相关领域顶会文章发表经历优先。-精通Python/C++编程,熟练掌握PyTorch等深度学习框架-具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...

Premium Full-time
ZERON 零一汽车  14 days ago
Delart jobs

About the job Delart is home to a team of world-class engineers and project leaders dedicated to developing the next generation of advanced networking technologies, consumer devices, and innovative technology solutions. Trusted by some of the

Delart  29 days ago
小米科技 Xiaomi Technology jobs

机器人运动控制算法实习生 北京 校招 实习 软件研发类 职位描述 1、开发基于机器学习的机器人控制策略,并与传统控制方法互补; 2、负责算法策略的训练与移植部署,实现算法sim2real在机器人实机上落地应用; 3、持续跟踪国内外前沿研究成果,并进行相关算法复现。 职位要求 1、硕士及以上学历,机器人、计算机、人工智能、机器学习、应用数学等专业,理论功底深厚,有相关足式机器人传统控制经验更优; 2、具有强化学习相关项目研究经验,熟悉Mujoco、Pybullet、Isaac Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;3、掌握主流强化学习算法如DQN、PPO、DDPG、SAC等主流算法,熟悉Pytorch、TensorFlow机器学习框架;4、扎实的C++、python编程能力;5、数学基础扎实,具有较强的学习与研究能力;6、熟悉大模型理论者优先; 投递...

Premium Full-time
小米科技 Xiaomi Technology  28 days ago
小米科技 Xiaomi Technology jobs

语言大模型算法实习生 武汉 校招 实习 软件研发类 职位描述 负责大模型方向技术研究和应用,工作内容包括以几个方向:1. 负责追踪大模型学术进展,预研前沿技术问题,打造行业领先技术影响力;2. 负责根据业务场景,抽象技术问题,建立大模型智能体解决方案;3. 负责将解决方案落地应用在具体业务场景,打造卓越的用户体验。技术方向包括但不限于:1. 优化AI搜索中的改写及精筛模型,探索更为有效的端到端强化学习算法,提升AI标准搜索结果的相关性、权威性、时效性;2. 构建更加高质量的Deep Search训练数据,探索更加有效的CPT、SFT及RL算法,提升Deep Search效果;3. 探索端到端Deep Research训练方案,解决开放式问题训练难题;4. 探索开放式摘要总结任务SFT及RL训练,提升AI总结效果。 职位要求 1. 研究生及以上学历,发表过自然语言处理/大模型相关研究AI顶会论文优先;2. 了解常用强化学习算法,如PPO、GRPO、DAPO等,熟悉常见的RL框架,如verl、openRLHF等;3. 掌握NLP主流大模型,如GPT3/T5/PaLM/LLaMA/GLM等的原理,并对差异有深入的理解;4. 熟练掌握主流深度学习框架pytorch,大模型训练框架Megatron-LM/Deepspeed等多机多卡方案,有大模型训练和项目经验优先;5. 有良好的代码开发能力,有开源项目开发经验优先。 投递...

Premium Full-time
小米科技 Xiaomi Technology  28 days ago
小米科技 Xiaomi Technology jobs

大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...

小米科技 Xiaomi Technology  28 days ago
小米科技 Xiaomi Technology jobs

Miclaw-AI agent开发实习生 AI人才专项 热招 南京 校招 实习 软件研发类 职位描述 1. 开发基于机器学习的机器人控制策略,完成机器人端到端的算法训练与部署。负责算法策略的训练与移植,实现Sim2Real在机器人实机上的落地应用;2. 参与具身智能算法模型在技能学习、动作规划、抓取操作等应用上的研发,实现多场景多任务的泛化。设计、训练、部署模仿学习、强化学习、迁移学习、多模态学习等算法,构建机器人各类应用的通用技能;3. 持续跟踪国内外前沿研究成果,进行相关算法复现。紧跟最新技术进展,将学术界前沿创新内容进行快速复现并创新,参与相关方向的论文与专利积累;4. 与大模型、运控等团队合作,推动具身智能数据集、机器人平台等各项目落地实施,共同解决技术难题。 职位要求 1. 机器人、计算机、人工智能、机器学习、应用数学等相关专业背景,理论功底深厚;2. 掌握主流强化学习算法(如DQN、PPO、DDPG、SAC等),熟悉机器人操作快慢双系统设计理念(如VLM+VLA),掌握相关ACT/Diffusion Policy/RDT/Pi0等基础算法。在多模态模型、自监督学习、迁移学习、强化学习、知识蒸馏、CoT等方向具备SOTA项目经验或坚实知识基础;3. 熟悉Mujoco、Pybullet、Isaac Sim/Gym等机器人仿真平台,熟悉Linux、ROS等操作系统;4. 扎实的C++、Python编程能力,熟悉PyTorch、TensorFlow等主流机器学习框架,掌握规范的git工作流;5. 具备较强的学习与研究能力,有创新的想法,乐于接受技术挑战;6. 具备良好的英文读写能力,能够阅读和撰写英文技术文档和论文。 投递...

Premium Full-time
小米科技 Xiaomi Technology  28 days ago
XPENG jobs

运动控制算法实习生(强化学习方向) 深圳 实习 研发 - 算法 27届AI人才专项计划(实习生专场) 职位描述 【关于我们】小鹏机器人中心致力于研发先进的人形机器人技术,覆盖机器人行走、灵巧操作、智能导航,以及在大语言模型支持下的人机交互等方向。我们的软硬件研发团队分布于深圳、上海、广州、北京及北美,汇聚跨学科的一流人才。加入我们,你将参与把人工智能真正落地到物理世界的核心工作,与控制、感知、规划、硬件等多领域工程师紧密协作,攻克前沿科研与工程难题,并推动人形机器人关键能力的持续演进。【工作职责】1、参与机器人的强化学习训练,优化机器人运动规划与控制策略,与传统控制方法形成互补,提升整体运动性能;2、参与机器人数据重映射(retargeting / remapping)与位置/姿态跟踪算法的开发与优化;3、将先进运动控制与机器学习方法应用于我们的自研人形机器人,推动算法从离线验证到真机闭环;4、研究和复现前沿强化学习算法,探索相关领域学术和工程问题。 职位要求 【岗位要求】1、本科及以上在读,数学、计算机、人工智能、自动化、机器人等相关专业优先;2、至少 1 年强化学习相关项目或研究经验,熟悉足式机器人运动学和动力学;3、熟练使用基于 Pytorch 的深度学习框架,掌握 PPO、DQN、SAC 等主流强化学习算法,以及 MuJoCo、Isaac Gym/Sim 等主流仿真工具;4、热爱机器人行业,有相关期刊或会议论文发表经历,或实际强化学习项目落地经验者优先。【你将获得】1、深度参与最前沿的具身智能算法研发,专注于双足机器人运动规划与控制,以及从仿真到实机的迁移;2、行业内资深专家的指导,对于优秀成果,我们将全力支持发表学术论文或申请专利;3、完备的实验室支持,包括充足的计算资源、稳定的机器人平台和强大的软硬件团队;4、明确的成长路径:实习生是公司的重要储备人才,对于即将毕业的优秀实习生,我们优先考虑其全职工作申请。 投递...

Premium Full-time PyTorch
XPENG  28 days ago
小米科技 Xiaomi Technology jobs

足式机器人运动控制算法工程师实习生(强化学习) 北京 校招 实习 算法类 职位描述 1. 开发基于强化/模仿学习的机器人行走及全身控制策略;2. 开发复杂地形下基于视觉的强化学习行走策略;3. 负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用;4. 持续跟踪国内外前沿研究成果,并进行相关算法复现;5. 编写相关技术文档,推动团队技术沉淀与知识共享。 职位要求 1. 硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力;2. 掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等;3. 掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等;4. 熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台;5. 有足式机器人强化学习算法的实机调试和sim-to-real经验者优先,有基于模型/优化等传统控制经验者优先;6. 扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具。 投递...

小米科技 Xiaomi Technology  28 days ago
Booming Tech jobs

游戏AI工程师(AI算法方向) 杭州 全职 互联网 / 电子 / 网游 职位描述 【岗位职责】- 战斗AI算法研发 - 优化基于传统规则驱动的战斗AI系统,增强Bot的智能性、灵活性和可控性,优化玩家体验。 - 推动基于数据驱动的模仿学习,构建玩家战斗行为数据集,分析战斗中的各类态势,通过行为克隆复现高玩操作模式,提升AI对抗的真实感。 - 构建强化学习环境,设计和实现强化学习策略,增强战斗类Bot的控制。 - 研发动态难度调整算法,通过玩家能力评估实时调节AI强度,平衡挑战性与趣味性。 - 设计NPC战斗风格模板系统,支持通过参数配置快速生成激进型、防御型等差异化AI角色。- 战斗AI的模拟、评估体系建设 - 开发战斗沙盒模拟系统,支持大规模并行化的AI训练与快速迭代验证。 - 构建战斗AI评估体系,设计灵活性、伤害效率、策略多样性、行为拟真度等量化指标,快速对战斗AI做出评估。 - 开发AI决策可视化分析工具,支持策划人员直观调试技能释放时序、走位路径等细节,进一步评估AI行为。 职位要求 【任职要求】- 计算机/人工智能相关专业本科及以上学历(如有一定经验,此条可放宽)- 精通C++/Python,熟悉PyTorch/TensorFlow框架,具备将学术论文转化为工业级解决方案的能力- 深入理解模仿、强化学习(PPO/DQN/SAC)等AI算法原理我们希望你拥有下列能力:- 对战斗类游戏博弈、战斗数值平衡等有深刻洞察- 有MOBA、FPS、ARPG等强对抗品类游戏AI开发经验- 对AI+游戏创新方向有强烈热情,具备技术前瞻性视野- 优秀的跨团队协作能力,能有效沟通技术方案与落地细节

Premium Full-time
Booming Tech  26 days ago
Nuvei jobs

The world of payment processing is rapidly evolving, and businesses are looking for loyal and strategic partners, to help them grow. Meet Nuvei, Nuvei is the global fintech building the infrastructure for every payment, everywhere. Its

Nuvei  27 days ago
Nuvei jobs

The world of payment processing is rapidly evolving, and businesses are looking for loyal and strategic partners, to help them grow. Meet Nuvei, Nuvei is the global fintech building the infrastructure for every payment, everywhere. Its

Nuvei  27 days ago
XPENG jobs

大模型算法工程师 / 专家 北京 全职 通用智能板块 职位描述 岗位简介:聚焦云端大模型算法研发,包括 VLM / VLA 大模型、生成式世界模型(WAM)等,重点解决自动驾驶场景数据闭环体系及数据治理能力建设;利用语义标签、长时序描述及推理、向量化或隐空间表征等手段建立数据图谱,实现数据分层治理。主要职责:1、云端任务大模型算法研发:负责数据驱动的云端大模型算法研发与优化,包括多模态大模型、世界模型等方向;开发基于多传感器数据、时空数据融合的自动标注算法;研发场景与标签的生成式算法,提升自动驾驶感知–预测–规划-拓扑云端一体化能力;2、云端基座大模型研发:基于海量量产数据,研发无监督 / 自监督算法,持续提升大模型的语义理解与空间感知能力;3、Scaling Law 驱动的算法研发:负责车云平台一体化大模型算法研发与优化,研发和设计基于数据驱动的感知迭代链路;构建高效的自训练感知流水线,提升数据闭环效率;4、强化学习研发:基于 PPO、DPO、GRPO、SAC 等主流强化学习算法,搭建长尾场景的后训练方案,完成奖励设计、分布式训练、模型调优,提升模型在复杂场景、恶劣天气、小众交通场景下的泛化能力与稳定性。 职位要求 1、学历基础:计算机、人工智能、自动化、数学等相关专业硕士及以上学历,博士优先。具备扎实的深度学习与强化学习数理功底;2、大模型能力:精通 VLM / VLA 端到端自动驾驶模型原理与全链路研发,熟悉大模型跨域泛化、域自适应、微调蒸馏技术,有智驾或机器人大模型落地经验优先;3、强化学习能力:熟练掌握 PPO、DPO、GRPO 等算法,具备用强化学习解决问题的实战经验,有智驾或机器人项目量产落地经验;4、自动驾驶认知:熟悉自动驾驶感知、预测、规划、控制全链路逻辑,兼具传统模块化与端到端模型研发认知;5、工程与综合能力:熟练使用 PyTorch,掌握 Agent / Harness 等自动化工具;具备良好的逻辑攻坚、跨团队协作与项目推进能力,有技术带队经验优先。-加分项1、参与过自动驾驶或机器人技术路线、算法体系标准搭建;2、深耕VLM/VLA预训练、后训练方向,有相关落地成果;3、拥有顶会论文、核心专利成果。 投递...

Premium Full-time Harness
XPENG  26 days ago
智元创新(上海)科技有限公司 jobs

优才-大模型算法研究员-通用业务部 上海 正式 职位描述 1.负责多模态大模型(如 LLaVA、Qwen-VL、GPT-4V 类架构)的模型设计、训练策略制定与性能优化。2.研究视觉编码器(ViT/CLIP/SigLIP)与大语言模型的对齐机制,包括投影层设计、指令微调(SFT)、RLHF/DPO 对齐。3.主导预训练、指令微调、多模态上下文学习(In-context Learning)及模型压缩(量化、剪枝、蒸馏)的全链路。4.负责模型推理加速(vLLM、TensorRT-LLM、FlashAttention、投机解码等),解决长上下文、高并发场景下的延迟与吞吐问题。5.构建多模态数据 pipeline(图文对、视频-文本、交互相机数据),设计数据清洗、去重与质量评估策略。6.将 MLLM 能力封装为 API 或 SDK,支撑产品侧的图文理解、视觉问答、多模态 Agent 等应用。 职位要求 1.计算机、人工智能、数学等相关专业,硕士及以上学历优先。2.精通 PyTorch/JAX,具备大规模分布式训练工程经验(千卡集群、模型并行、数据并行、ZeRO/PP/TP)。3.深入理解 Transformer、ViT、LLaVA、Qwen-VL、GPT-4V 等多模态大模型架构,具备预训练/SFT/RLHF 全流程实操经验。4.扎实的强化学习理论基础,熟悉 PPO、GAE、Diffusion Policy、ACT、RT-1/RT-2、π0 等算法。5.优秀的代码能力(Python/C++),熟悉 ROS2、Isaac Sim/Gym、MuJoCo、Gazebo 等仿真与中间件生态。 投递...

Premium Full-time API
智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身算法工程师(VLA+RL)-通用业务部 上海 正式 职位描述 VLA 端到端模型研发: 设计并训练端到端视觉-语言-动作模型(如 RT-2、OpenVLA、π0、Diffusion Policy、3D Diffusion Actor 等),实现从视觉输入与语言指令到机器人低维动作空间的直接映射。研究动作表示与生成机制: 动作 Token 化(Action Tokenization)、隐动作量化(Latent Action Quantization, LAPA)、扩散式动作生成(Diffusion Policy)、流匹配(Flow Matching)等前沿方案。探索 RL 与模仿学习(IL)的混合训练范式:利用人类演示数据初始化策略,再通过 RL 进行微调和鲁棒性增强。强化学习运控与策略优化: 包括 PPO、SAC、RLHF(Human Feedback for Robotics)、DAPG 等算法在关节级/任务级控制中的应用。模型部署与实时性优化: 负责 VLA/RL 模型在机器人芯片(Orin、Thor)上的轻量化部署,满足实时控制需求(端到端延迟 50ms,控制频率 ≥ 50Hz),解决长上下文视觉序列与语言指令的并行处理瓶颈。设计模型与底层运控(WBC/MPC)的协同接口:

智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身智能算法工程师(后训练 Infra 方向)-觅蜂子公司 上海 正式 职位描述 1. 负责具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力。2. 深入理解强化学习、模仿学习、在线学习等后训练算法(PPO/SAC/DAgger/RLHF 等),基于算法特性设计高效的训练架构与数据流。3. 设计并实现云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练架构,支撑从单机到百台规模的扩展。4. 构建多种后训练算法的统一框架支撑,实现新算法低成本快速接入与验证。5. 负责云边通信体系设计(权重同步、数据回传、时延隐藏),保障大规模分布式训练的效率与稳定性。6. 跟进后训练领域前沿进展(π0.6 / RLT / flow matching RL 等),具备快速复现并工程化落地新算法的能力。 职位要求 1. 计算机、AI、机器人等相关专业硕士及以上学历。2. 具备扎实的 Python/C++ 编程能力,熟悉分布式系统设计与实现。3. 熟悉强化学习算法(PPO/SAC/DAgger 等),深入理解 on-policy / off-policy / online

智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身算法工程师(全身运动控制wbc+感控融合方向)-通用业务部 上海 正式 职位描述 人形机器人运动控制算法研发:参与人形机器人全身运动控制、动作追踪、运动重定向、WBC 接入与控制策略优化等核心算法研发工作。强化学习与 BeyondMimic 相关工作:参与人形机器人强化学习运动策略的训练、调优与评测,包括 BeyondMimic / Sonic 等动作模仿与运动追踪框架的复现、适配、训练优化、策略评估、Sim2Sim 与 Sim2Real 迁移等工作。Avatar / Teleoperation 系统研发:参与“身外化身”系统建设,将光学动捕、VR 设备、人体姿态估计或其他上游意图输入,映射为机器人可执行的全身运动指令,实现高动态、高精度的人机动作同步。算法工程化与真实机器人部署:基于 C++ / Python / ROS2 等技术栈,参与算法模块开发、系统联调、性能优化和机器人本体部署,推动前沿算法在真实产品场景中落地。 职位要求 2026 届或 2027 届优秀本科、硕士、博士毕业生,计算机、自动化、机器人、机械电子、人工智能、控制科学与工程、航空航天、车辆工程等相关专业优先。具备扎实的编程和工程能力,熟练掌握 C++ 和 Python,熟悉 Linux 开发环境,熟悉 Git、CMake、调试工具、性能分析工具等常用工程工具。具备较好的机器人学或控制基础,理解以下内容中的一项或多项:正逆运动学、雅可比矩阵、动力学建模;全身控制

智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身智能算法研究员(空间智能方向)-觅蜂子公司 上海 正式 职位描述 【方向:空间智能与三维重建】空间智能与三维重建研发前馈式(Feedforward)3D Gaussian Splatting 场景重建算法,从稀疏多视角或单目视频毫秒级输出紧凑3D高斯表示,支持动态更新与压缩。构建实时SLAM系统(融合传统/NeRF/3DGS方法),处理自我中心(egocentric)与人中心(exocentric)混合输入,输出机器人坐标系下的稠密几何、物体6DoF位姿及相机轨迹。开发人体-物体交互(HOI)重建:从多视角外部视频重建物体网格+姿态、人体SMPL/手部MANO参数;从单目自我中心视频实时重建手部与接触关系,生成时空对齐的HOI轨迹。设计自动标定与数据预处理管线(多相机外参自标定、时间同步、空间对齐),为下游模型提供规范化输入。向端到端模型输出可消费的空间Token(如场景图序列、可操作实体列表、接触点坐标),并与RL组协同提供动态场景下的状态预测(世界模型)。 职位要求 计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先。在以下至少一个方向有深入研究和项目经验:三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等)多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架。熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台。具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型。加分项有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)。在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献。处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验。熟悉ROS/ROS2,有实时系统或嵌入式开发经验。 投递...

智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身智能算法研究员(VLA端到端与RL方向)-觅蜂子公司 上海 正式 职位描述 【方向:VLA端到端模型与RL后训练】设计并训练视觉-语言-动作多模态Transformer(参考RT-2、Octo、PaLM-E),输入自然语言指令 + 空间Token + 本体感觉,输出离散/连续动作Token(关节角度、末端位姿或扩散策略)。优化模型在真机上的推理速度与泛化能力,探索不同动作表示与模型压缩技术。利用仿真环境(Isaac Sim、Mujoco)对VLA模型进行强化学习微调(PPO/SAC/RLPD),解决域迁移导致的分布漂移。设计域随机化、系统辨识、扰动注入策略,提升策略在真实机器人上的成功率与平滑度。 职位要求 计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先。在以下至少一个方向有深入研究和项目经验:三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等)多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架。熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台。具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型。加分项有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)。在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献。处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验。熟悉ROS/ROS2,有实时系统或嵌入式开发经验。 投递...

智元创新(上海)科技有限公司  26 days ago
智元创新(上海)科技有限公司 jobs

优才-具身智能算法研究员(预训练方向)-觅蜂子公司 上海 正式 职位描述 【方向:预训练、Omni大模型与数据策略】利用大规模人类视频(Ego4D、Open X-Embodiment)及无本体交互数据,预训练多模态基座模型(视觉-语言-动作联合),作为VLA主干backbone。探索scaling law,设计模型架构(如Transformer、DiT)与预训练任务(MAE、动作预测、对比学习)。基于VLM/VLA大模型构建自动标注管线,对视频、轨迹、触觉信号进行结构化标注(动作阶段、接触事件、成功/失败标签),降低人工成本。设计主动学习策略,从海量数据中筛选高价值样本(失败轨迹、长尾场景)。牵头制定数据混合策略:真机遥操作数据 : 无本体人类视频 : 仿真合成数据的最优比例,设计消融实验验证,建立数据价值评估模型。 职位要求 计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先。在以下至少一个方向有深入研究和项目经验:三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等)多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架。熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台。具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型。加分项有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)。在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献。处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验。熟悉ROS/ROS2,有实时系统或嵌入式开发经验。 投递...

智元创新(上海)科技有限公司  26 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

ppo

You also might be interested in:

实习生

研究员

PyTorch

Automation

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Location
Employer/Recruiter
Experience