Agentic RL 算法实习生 北京 校招 实习 软件研发类 职位描述 工作内容:1. RL训练环境搭建:负责构建易用、稳定且支持高并发的工具调用环境,搭建和优化 Agent 框架。2. 推理能力提升: 针对 DeepResearch、CodeAgent 等复杂推理场景,设计并实现高效的能力增强方案。3. 数据合成与优化:围绕业务需求构建、筛选和优化 Agent 行为数据与知识增强语料,为对齐训练、RL 训练和持续预训练提供高质量数据支撑。 职位要求 任职要求:1. 计算机相关专业;在CCF-A类会议发表过相关论文者优先考虑; 2. 熟悉主流 Agent 框架(如 Claude Code、LangGraph、AgentScope、Qwen-Agent 等),具备实际开发或使用经验。3. 熟练掌握主流 Agentic RL 训练框架(如 VeRL、OpenRLHF),具备后训练(post-training)和数据处理相关项目经验者优先。4. 理解并掌握并行训练框架,有多机多卡训练经验者优先。 投递...
AIGC图像生成算法工程师 Beijing Full-time R&D - Algorithm Responsibilities - 基于业务目标与产品需求,负责团队图像生成/编辑模型与端到端多模态统一模型的训练迭代与落地,包括但不限于 SFT、偏好对齐 / RL(RLHF / DPO / GRPO 等)。- 负责端到端多模态原生统一模型(理解 + 生成一体)的训练与工程化:图文交错序列建模、统一 token 空间、理解–生成联合训练、原生长上下文与长程一致性的实现与优化。- 负责训练数据全流程建设:数据收集与清洗、质量评估、去重与过滤、难例挖掘、数据配比与版本管理,构建可持续迭代的数据体系与规范。- 负责训练管线与工程化建设:分布式训练(DeepSpeed/FSDP 等)、显存/吞吐优化、checkpoint 管理、训练监控与故障排查,持续提升训练效率与稳定性。- 设计并实现图像/多模态生成质量评估体系:自动指标(CLIP/美学/一致性/可控性/长程一致等)+ 人工评测流程,建立「评测→诊断→迭代」的闭环。- 跟进前沿论文与开源生态(Diffusers/ComfyUI/SD 系列、DiT/Flow Matching,以及自回归多模态、图文交错生成、统一理解-生成模型、长上下文推理/serving),结合业务场景完成复现、改进、实验对比与 A/B 验证。- 跨团队协作(产品/工程/运营),将模型能力沉淀为可复用的训练策略、数据策略与最佳实践文档,推动生产化交付。 Qualifications - 计算机/数学/统计/相关专业本科及以上学历;具备扎实的机器学习与深度学习基础。-
机器人专项-世界模型方向 深圳、北京 社招 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 岗位职责:1.探索研究具身智能领域的多模态大模型、世界模型、生成式模型、AIGC等人工智能前沿技术;2.探索大规模多模态理解与生成交织的基础模型,并进行极致系统优化;数据建设、指令微调、偏好对齐、RLHF模型优化;提升数据合成、模型推理、规划能力,构建全面客观准确的评测体系,探索提升大模型能力;3.探索突破包括而不限于多模态大模型、端到端VLA模型、视觉COT与Agent在内的多模态模型、世界模型;4.通过预训练或SFT,使用生成式模型技术能力对现实世界的各类环境进行建模,提供多模态交互探索的基本能力,推动应用落地,研发以人工智能技术为核心的新技术、新产品。 职位要求 职位要求:1.硕士及以上学历,计算机、电子、数学等相关专业;2.在计算机视觉、多模态大模型、AIGC等一个或多个领域有较深入的研究者;3.具有出色的分析、解决问题的能力,能深入解决大模型训练、应用存在的问题,有自主探索解决方案的能力者;4.具有良好的沟通协作能力,工作积极主动,能够与团队融洽合作,一起探索新技术,推进技术进步。加分项:1.具有优秀的基础算法、扎实的机器学习基础,熟悉CV、AIGC、NLP、RL、ML等领域的技术,在CVPR、ECCV、ICCV、NeurIPS、ICLR、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者优先;2.具有优秀的代码能力,熟练掌握C/C++或Python编程语言,ACM/ICPC、NOI/IOI、Kaggle等比赛获奖者优先;3.在多模态大模型、基础模型、世界模型、生成领域,主导过大影响力项目者优先。 投递...
算法工程师 - LLM后训练 Beijing Full-time R&D - Algorithm Responsibilities 参与公司AI算法相关工作,专注于提升大语言模型(LLM)的生成质量,推动技术创新和产品落地,具体职责包括但不限于:1. 监督微调:深入研究和实施大语言模型(LLM)的SFT、RFT等技术方案,优化AI的情感表达能力和剧情设计能力,突破长期记忆、行为一致性等技术难点2. 奖励模型:基于海量用户交互日志和反馈数据,深入挖掘真实用户偏好信号,构建高质量的偏好数据集;设计并实现包括生成式奖励模型(GRM)、过程奖励模型(PRM)等在内的多维度奖励函数3. 强化学习:深入理解PPO、DPO、GRPO等常用LLM强化学习方法,结合具体业务目标(如上下文一致性、逻辑正确性、OOC等),设计定制化的奖励组合与训练策略4. Agent:面向复杂、多步骤的业务场景,设计并实现基于大语言模型的Agent架构;集成工具调用(Tool Use)、记忆机制(Memory)、反思(Reflection)、多智能体协作等范式实现复杂任务的能力跃迁 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;3. 在虚拟角色生成、角色扮演、情感陪伴等方向有项目经验或论文成果者优先;4. 能系统性拆解角色类模型在生成一致性、长期记忆等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。 Apply...
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA is leading company of AI computing. At NVIDIA, our employees are passionate about AI, HPC , VISUAL, GAMING. Our SA team is more focusing to bring NVIDIA new technology into difference industries. We help to
【基座模型】高级算法工程师(智能体强化学习方向) 北京 全职 互联网 / 电子 / 网游 职位描述 高级算法工程师(智能体强化学习方向)岗位职责深度参与 MindGPT 智能体后训练全流程,包括但不限于 MidTrain(中期训练)、SFT(监督微调)、推理侧 RL(Reasoning RL)及 Agent RL 的算法设计与大规模训练实现。负责 DeepResearch Agent(深度研究助手)与 Code Agent(自主编程助手)等核心能力的迭代,提升模型在长上下文、多步骤推理及工具调用(Tool-use)上的成功率。 职位要求 任职要求计算机科学、数学、人工智能、统计学等相关专业,硕士及以上学历。具备深厚的强化学习(RL)理论功底,熟悉传统 RL 与 LLM 结合的最新进展,对 Agent-RL、Search-RL、Online RL 或决策智能体有深入理解。精通 PyTorch,拥有出色的工程素养。能够高效处理大规模训练数据,具备在大规模 GPU 集群上进行模型分布式训练与算子调优的实战经验。加分项在 NeurIPS、ICLR、ICML、ACL 等顶会发表强化学习、大模型或智能体相关论文。有开源 LLM / Agent 项目贡献经验,或在数学推理、代码生成、工具使用等相关榜单取得优异成绩。具备多智能体系统、在线强化学习、大模型对齐或复杂决策系统规模化落地经验。 投递...
【27届校招】机器学习引擎工程师 北京 正式 技术类 2027届秋季校园招聘项目 职位描述 1、方向一:训练框架工程师①研发支持公司大规模分布式训练的自研框架,深度优化训练性能,提升模型迭代效率与资源利用率;②攻克同时支持百亿级稀疏参数与数十亿级稠密参数的高效并行训练难题;③构建通用底座,无缝适配 TensorFlow / PyTorch 等多种开源框架,兼顾性能与易用性;④支持复杂多阶段训练流程与强化学习(RL)训练范式;⑤适配多云、多芯片(GPU/国产芯片)的复杂算力环境;⑥联合算法团队持续跟进大模型在搜推广场景的落地。2、方向二:推理引擎工程师①负责高性能、低延迟的GPU/CPU异构在线推理引擎研发,支撑公司各业务线每日数百亿级 PV 请求;②基于Triton Inference Server等技术方案迭代在线推理服务,保障高并发、低延迟(核心场景 P99 10ms);③深入推理计算图优化、算子融合、量化编译、内存复用等技术,极致压榨推理吞吐、降低显存占用;④保障服务稳定性与可靠性(99.99%+ 可用性),完善可观测性,支撑模型灰度发布、A/B 测试与分钟级部署;⑤面向GPU/NPU等多硬件架构做适配与性能调优;⑥跟进大模型推理框架(如 SGLang、vLLM、TensorRT-LLM 等)技术演进,落地到真实业务场景中。 职位要求 1、具备扎实的编程基础,熟练掌握C++或Python编程语言;2、接触过至少一种深度学习框架(TensorFlow/PyTorch等);3、具备独立解决问题的能力,良好的团队合作精神;4、2027届毕业生,硕士及以上学历,计算机、软件工程等相关专业优先。5、加分项:①有深度学习框架(TensorFlow/PyTorch)开发经验者优先;②熟悉开源推理框架(Triton Server/SGLang/vLLM等)的原理与二次开发经验者优先;③熟悉GPU编程、高性能网络编程、AI编译器(TVM/MLIR/XLA等)者优先;④熟悉机器学习/深度学习算法,并致力于系统架构方向者优先;⑤在顶级会议(OSDI/SOSP/NSDI/MLSys/RecSys/ICML/NeurIPS etc.)上有发表论文者优先;⑥有开源项目贡献代码者优先。 投递...
【27届校招】大模型训练推理框架工程师 深圳、北京 正式 研发 - 算法 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、硕士及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有丰富以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和 RL 训练的基本流程。 投递...
【27届校招】RLHF强化学习算法工程师 深圳、北京 正式 研发 - 算法 职位描述 我们致力于推动强化学习(Reinforcement Learning, RL)在人形机器人运动控制、大语言模型推理优化、和具身智能体(Embodied AI) 领域的突破性应用。现招募具备深厚RL技术背景的算法工程师,参与从算法设计、仿真训练到真实场景部署的全链路研发,探索AI与物理世界的深度融合。1、研究大语言模型RLHF阶段的广义强化算法,提升大模型的能力,探索大模型的自我进化之路;2、研究大模型驱动的智能体算法,包括但是不局限于ReACT、Voyager、WebGPT、AutoGPT;3、撰写技术报告和论文,分享研究成果,参与内外部的技术交流和合作,推动团队技术水平的提升,提高团队在行业内的影响力。 职位要求 1、具备扎实的机器学习基础和强悍的编码能力,能熟练使用 PyTorch;2、在大模型训练和强化学习至少一个方向上有经验;3、对人工智能和大模型技术有强烈的兴趣和热情,愿意不断学习和探索新技术。【加分项】1、有 ICML、ICLR、NeurIPS、ACL、CVPR 等顶级学术会议发表过有影响力研究成果的优先;2、在 ACM/ICPC、NOI/IOI、Kaggle 等编程/AI 比赛获奖者优先;3、主导、参与过 AI 相关的有大影响力的开源/闭源项目的优先。 投递...
vla算法实习生 北京 社招 实习 互联网 / 电子 / 网游 职位描述 工作内容参与VLA模型研发,包括多模态大模型、diffusion model的开发与训练完善对训练数据的需求,验证数据数量、质量和分布对模型效果的影响推动闭环仿真评测体系建设,分析各种badcase并推动模型迭代优化VLA模型推理延迟,包括gpu和车端芯片探索world model与VLA结合的设计方案,并带来效果提升探索基于闭环仿真的 RL 后训练在轨迹生成上的应用 职位要求 基本要求硕士/博士在读,计算机、自动化、机器人等相关专业扎实的 Python 与 PyTorch 工程能力,能独立完成模型训练与实验分析熟悉深度学习基础,了解 Transformer 架构与多模态模型基本原理良好的代码习惯与沟通能力,有 owner 意识,能独立推进一个子课题加分项(满足其一即可)熟悉vlm / flow matching的原理,了解diffusion的加速采样技术了解端到端自动驾驶相关工作有 VLA / world model /具身智能相关经验有 RLHF/RL 后训练实践经验,熟悉 CARLA 等闭环仿真环境在 CVPR/ICCV/ECCV/NeurIPS/ICRA/CoRL
算法工程师 - Agent Beijing Full-time R&D - Algorithm Responsibilities 负责公司AI Agent方向的算法研究与落地工作,围绕个性化内容生成与长期记忆构建,将大模型训练技术(SFT、RL等)应用于Agent能力的持续提升,具体职责包括但不限于:1. Agent架构设计:面向个性化内容生成和角色交互场景,设计并实现基于大语言模型的Agent架构;定义Agent的编排流程、工具调用(Tool Use)、反思(Reflection)等核心范式,使Agent能够基于用户画像和历史交互生成高度个性化的内容与回复2. Agent训练与优化:运用SFT、RFT、PPO、DPO、GRPO等训练方法,针对Agent场景设计专项训练方案;构建Agent行为轨迹数据集,通过强化学习优化Agent的个性化生成质量、记忆调用准确性和多轮对话一致性3. 训练环境设计:构建Agent训练所需的真实可执行交互环境(工具调用沙箱、用户模拟器、多轮对话场景等),定义状态空间、动作空间和反馈信号,为Agent提供高质量的训练闭环4. 奖励建模:设计Agent专用的奖励函数与评估体系,针对个性化程度、内容一致性、记忆调用准确性、用户满意度等多维目标,结合过程奖励模型(PRM)、生成式奖励模型(GRM)以及个性化奖励模型(Personalized RM,基于用户偏好和交互历史动态调整奖励信号),实现对Agent行为链路的细粒度奖励,解决奖励稀疏、奖励欺骗等核心难题5. 记忆与个性化系统:构建可解释、可迁移、可控的Agent记忆架构,支持用户偏好的长期建模与动态更新;实现记忆的版本化管理,支持精确遗忘(通过token删除)和跨模型迁移,保障个性化体验的连续性与可控性6. 持续学习(Continual Learning):研究并实现Token Space下的持续学习机制,通过更新Agent的learned context(系统提示、记忆库、工具定义等)而非模型权重来实现Agent的持续进化;解决context poisoning(上下文污染)/ context rot(上下文退化)等有限上下文窗口下的记忆退化问题,在避免灾难性遗忘的前提下实现Agent知识的增量积累8. 快速实验与迭代闭环:具备从eval构建、数据准备、方案实现到结果评估的全链路快速实验能力;参与Agent的线上A/B实验设计,通过线上效果度量和用户反馈分析定位算法瓶颈,驱动下一轮训练与模型优化的方向 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP相关的算法和技术,具备大模型训练和RL算法的实践经验;3. 对LLM-based Agent系统有深入理解,具备Agent训练或Agent系统相关的项目经验;4. 能系统性拆解Agent在长期记忆管理、个性化内容生成、上下文窗口利用等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。加分项:1. 在Agent记忆机制、个性化生成、持续学习、上下文优化(如DSPy等prompt optimization方法)等方向有论文成果;2. 对continous
AI工程师 - Agent Beijing Full-time Intelligent manufacturing / Industrial Internet / Industrial automation - R&D Responsibilities 负责公司AI Agent系统的工程设计、开发与落地,围绕个性化内容生成与长期记忆场景,端到端负责Agent从原型到生产的完整生命周期(Agent Development Life Cycle),具体职责包括但不限于:1. Agent系统架构:设计并实现生产级Agent运行框架,包括编排引擎(Orchestration)、工具调用链路(Tool Use Pipeline)、记忆存储与检索系统、上下文管理等核心模块;确保系统在高并发场景下的稳定性、低延迟和可扩展性2. Agent行为工程:设计并实现Agent的编排策略、路由逻辑、多步规划与fallback机制;将算法团队的研究成果(记忆、个性化、持续学习等)工程化为可靠的生产行为模式,确保Agent在真实场景中的可控性与一致性3. 记忆系统工程:构建Agent长期记忆的存储、索引和检索基础设施;实现高效的向量检索、记忆版本管理、增量更新与过期淘汰机制;支撑sleep-time异步记忆整理的后台任务调度与计算资源管理4. 工具调用与环境集成:设计并实现Agent与外部工具、API、数据源的集成框架;构建安全、可靠的工具调用沙箱与执行环境;实现工具注册、权限管理、调用链追踪与异常处理等工程能力5. 可观测性、评估与持续改进:构建Agent行为的全链路追踪、日志与监控体系;设计Agent质量评估pipeline,包括个性化效果、记忆准确性、多轮一致性等维度的自动化评测;建立从发布、灰度、A/B测试到反馈收集的完整迭代流程,通过线上数据分析定位Agent薄弱环节,形成发布→度量→归因→改进的持续优化飞轮6. 推理与服务优化:优化Agent推理链路的端到端性能,包括LLM调用策略(缓存、批处理、流式输出)、上下文窗口高效利用、多轮对话状态管理等;针对异步Agent场景设计高效的任务队列与调度系统7. 数据平台与Pipeline:构建Agent训练数据的采集、清洗、标注与管理平台;设计用户交互日志的实时/离线处理pipeline,为算法团队的SFT、RL训练和奖励模型迭代提供高质量数据支撑8. 算法-工程协作:与算法团队紧密配合,理解记忆、持续学习、个性化奖励模型等研究方向的技术原理,将研究成果高效转化为可靠的生产系统;共同定义Agent评估标准与数据需求,打通从研究到上线的协作链路 Qualifications 1. 扎实的软件工程能力,熟练掌握Python,具备大规模分布式系统的设计与开发经验;熟悉Go、Rust、C++中至少一门者优先;2. 对LLM-based Agent系统有深入理解,具备Agent系统的生产环境开发与部署经验;3. 具备良好的系统设计能力,能在可靠性、延迟、成本之间做出合理权衡;有消息队列、任务调度、异步计算等基础设施经验者优先;4.
VLM视频理解算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、负责 PE Model、Caption Model、Reward Model 三类 VLM 的训练与优化,基于千卡级算力进行大规模模型训练,探索 SFT、RL、Agentic RL 等训练方法,持续提升模型在视频理解、视频描述和视频质量评价等任务上的能力,训练业界 SOTA 的视频理解 VLM 和流式视频理解 VLM;2、负责 VLM Agent 的设计与训练,探索 VLM 在复杂视频理解任务中的 Agent 化能力,包括任务规划、工具调用、多轮推理、长视频分析等,结合 Agentic RL 等方法提升模型复杂任务的自主推理与问题解决能力;3、负责三类 VLM 的训练数据构建与优化,针对视频理解、视频描述、视频质量评价等任务,通过规则匹配、自动化方法及外包标注团队进行数据筛选、标注和质检,持续提升训练数据的规模与质量,并探索适用于 Agentic RL 的训练数据与反馈信号构建方法;4、负责三类
大模型算法工程师 北京 技术 - 算法 硕士及以上 职位描述 1、大模型训练与优化:负责金融场景大语言模型的训练全流程研发,持续提升模型的推理、对齐与泛化能力,设计并实现基于强化学习的大模型训练方案(如 PPO、GRPO 等),优化奖励模型(Reward Model)设计与训练稳定性;2、Agent 系统研发:构建与优化基于大模型的 Agentic 系统,包括任务规划、工具调用(Tool Use)、多智能体协作、长程记忆与推理等核心能力;3、自进化系统探索:研究并落地模型自我迭代(Self-Evolving)机制,推动模型能力的持续自主提升;4、前沿技术跟踪:跟踪大模型领域最新进展(RL、Agent、harness),并结合业务场景快速验证与落地。 职位要求 1、计算机、人工智能、数学、统计等相关专业硕士及以上学历;2、扎实的机器学习/深度学习基础,熟悉 Transformer 架构及主流大模型原理;3、熟练掌握 Python,熟悉 PyTorch 等主流深度学习框架;4、熟悉大模型训练全流程(预训练、SFT、对齐训练等),有实际训练经验;5、良好的工程能力、问题分析能力与团队协作意识。 优先条件(加分项)1、具备大模型监督微调/强化学习训练经验,有奖励模型设计与训练调优经验者优先;2、具备 Agentic 系统研发经验,熟悉 Function Calling、多智能体框架、规划与推理链路者优先;3、具备自进化 / 自我改进系统相关研究或落地经验者优先;4、在顶级会议/期刊(NeurIPS、ICML、ICLR、ACL、CVPR 等)发表过论文,或有知名开源项目贡献者优先。 职位信息 部门: 技术体系 投递温馨提示:投递顺序代表志愿顺序,请同学谨慎选择 投递...
AI Agent算法实习生 北京 校招 实习 算法类 职位描述 1. 参与优化小爱同学导航出行与本地生活服务能力,为任务完成率与响应速度负责。2. 探索Agent前沿方案,通过Harness优化、评估器优化、Agentic模型精调等方式,持续迭代Agent效果;3. 推动Agent驱动模型的持续优化,探索数据合成、预训练及后训练(SFT / RL)等技术路径; 职位要求 1. 计算机相关方向的硕士或博士;2. 有大模型AI Agent相关研究和项目经历,发表过相关方向的顶会论文优先3. 具有优秀的解决复杂问题和多人协作沟通的能力,能够独立思考并开展工作,具有强烈的好奇心和责任心; 投递...
多模态大模型算法实习生-2027届 北京 校招 实习 算法类 职位描述 1. 提升自动驾驶场景中训练数据的自动化标注能力,协助完成数据闭环;2. 负责视觉语言模型(VLM / VLA)的后训练调优(涵盖小规模与大规模阶段),持续增强模型在自动驾驶场景中的感知与推理能力;3. 探索多模态融合、基座模型、思维链(CoT / CoC)等前沿技术在自动驾驶领域的创新应用,提升复杂场景下的模型推理能力与泛化边界;4. 深度对接自动驾驶业务需求,推动关键技术落地,协同实现模型效果与系统性能的双重提升;5. 从业务实际问题出发,参与解决方案的探索与预研,推动技术持续演进与落地。 职位要求 1. 教育背景 a. 计算机科学与技术、人工智能、机器学习或相关专业,在读硕士或博士研究生。2. 专业技能 a. 具备扎实的计算机与人工智能基础,熟悉 Transformer、ViT、LLaVA、Qwen-VL、InternVL、MiMo-V2-Omni 等常见模型架构; b. 熟悉 LoRA、SFT、RL 等主流后训练技术; c. 编程能力强,熟练掌握 Python,熟悉 PyTorch 及相关大模型训练框架(如 ms-swift、DeepSpeed、Megatron 等)。3.
自动驾驶多模态大模型实习生-2027届 北京 校招 实习 算法类 职位描述 VLM基座模型研发与迭代:参与自动驾驶场景下VLM/VLA模型的预训练、指令微调(SFT)、RL优化,提升模型在物理世界理解、空间推理、驾驶决策等任务上的表现。 职位要求 1. 计算机、人工智能、自动化等相关专业在读硕士或博士研究生;2. 扎实的深度学习基础,熟悉Transformer等主流架构,理解VLM/LLM基本原理;3. 熟练掌握Python及PyTorch框架;4. 有VLM/LLM微调经验(LoRA、SFT、RLHF等)或大规模模型训练实践经验者优先。5. 具备AI Coding能力,能高效利用AI辅助代码编写与调试。加分项1. 有VLM/VLA模型研究或复现经验,或参与过端到端自动驾驶项目(如UniAD、VAD);2. 在CVPR、NeurIPS、ICCV、ECCV等顶会发表过多模态学习/自动驾驶相关论文;3. 了解自动驾驶感知任务(红绿灯识别、交通标志检测、目标检测等)。 投递...
大模型研究和工程实习生-MiMo 北京 校招 实习 算法类 职位描述 1.创新模型结构设计: - 参与大型语言模型核心架构设计与优化 - 探索Transformer及其变种的改进方案2. 原生多模态探索: - 研发原生多模态架构,实现文本、图像、音频等模态信息的深度融合 - 研究多模态对齐技术,实现不同模态的语义一致性3. 模型推理能力提升: - 借助强化学习+CoT,提升大语言模型推理能力 - 自研强化学习算法,搭建强化学习训练框架,设计奖励函数、构建环境、优化模型提升性能4. 大模型训练推理Infra - 开发和优化大规模分布式训练推理系统 - 优化大模型训练的内存使用和通信效率5. 科学评测体系构建: - 构建科学严谨的算法评测方法,系统评估模型的性能 - 探索模型能力的潜在机制,推动模型优化和创新 职位要求 职位要求1. 学术能力: - 精通深度学习、强化学习(RL)、自然语言处理(NLP)等领域,具备创新研究能力 -
大模型训练优化工程师 北京 全职 研发 - 算法 职位描述 岗位描述1. 深入优化大模型端到端训练链路,系统分析计算、通信、内存、数据供给与集群运行效率,解决大规模训练中的性能瓶颈,提升算力利用率和训练迭代速度。2. 参与不同计算硬件的训练框架适配与性能优化,推动模型、框架、通信和硬件之间的协同设计。3. 跟踪并探索分布式训练、RL Infra及高性能计算领域的前沿技术,推动创新方案从原型验证走向生产应用,形成技术报告、专利、开源成果或高水平论文。加分项:1. 具有异构硬件适配、编译器、通信库或软硬件联合优化经验。2. 具有千卡及以上模型训练经验,负责过大规模训练任务的稳定性或性能优化。3. 为 Megatron、Deepspeed、verl 等项目贡献过核心代码。4. 在 mlsys等会议发表过相关论文。 职位要求 1. 硕士及以上学历,计算机、人工智能、数学等相关专业2. 具有生产级大模型训练系统研发经验,实际解决过训练吞吐、规模扩展、Loss异常、任务长尾、节点故障、OOM或断点恢复等问题。3. 具备良好的技术判断和跨团队推动能力,能够与算法、模型、集群、硬件等团队协作,推动复杂系统问题形成闭环。 投递...