Job Description SummaryResponsible for designing and programming a small module or a large component and designing a feature, set of features, or whole feature area. She/he will work independently and contribute to the immediate team and
AI院-GLM团队-预训练算法工程师 北京 全职 研发 - 算法 职位描述 职位描述1. 参与数学或代码大模型预训练的研发工作,包括模型的预训练、对齐和评测等2. 负责构建和优化数学或代码的预训练和对齐数据,提升模型在数学或代码任务上的效果3. 探索针对数学或代码任务的数据合成方法,提升模型在数学或代码任务上的泛化能力 职位要求 职位要求1. 自然语言处理、机器学习等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Pytorch、Huggingface、DeepSpeed等框架;4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先;加分项:1. 在ACL,NeurIPS,ICLR,EMNLP等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先;3. 熟悉CUDA编程/Triton编程,有相关算子加速经验者优先; 投递...
端侧工程-异构计算实习生 北京 实习 数字技术 - 算法 职位 ID:A155108A 职位描述 1. 负责自动驾驶算法车端的工程优化2. 负责现有异构计算模块的runtime优化 职位要求 1. 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;2. 熟练掌握 C/C++和Python,有良好的代码编写习惯;3. 熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;4. 以下掌握其一优先 1. 熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库; 2. 熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架 3. 熟悉NEON等SIMD指令5. 优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;6. 有深度学习、计算机视觉、自动驾驶背景优先 投递...
智能辅助驾驶大模型工程实习生 北京 实习 数字技术 职位 ID:A132275 职位描述 车端工程链路开发云端离线验证链路开发单元测试开发实车调试与性能分析 职位要求 熟练使用使用C++ or Python熟悉在linux平台下的开发工作有自驱解决问题的能力熟悉Git/Shell对算法,数据结构和操作系统有较好理解加分项CUDA开发Gitlab CICD精通C++ or Python高性能编程有ROS或者Cyber相关经验熟悉GTest等单元测试框架【实习时间】1. 每周至少现场4天(Base北京) 2. 实习至少六个月,可尽快入职者优先 投递...
算法工程化实习生 北京 实习 数字技术 职位 ID:A224879 职位描述 负责自动驾驶算法车端的工程优化;负责现有异构计算优化和监控工具链的开发。 职位要求 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;熟练掌握 C/C++和Python,有良好的代码编写习惯;熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;以下掌握其一优先:熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库;熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架熟悉NEON等SIMD指令优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;有深度学习、计算机视觉、自动驾驶背景优先。 投递...
高性能计算实习生 北京 实习 数字技术 职位 ID:A148157 职位描述 基于 Nvidia GPU/ARM CPU 等架构特性完成深度学习算子、CV 算法及计算库的开发及优化;与深度学习引擎前端团队一起,共同完成深度学习引擎在端侧落地,保证算法运行的高效性及实时性。 职位要求 岗位职责:基本要求:熟悉 ARM/DSP/CUDA 并行编程模型;熟悉 C/C++ 编程,了解常用算法及数据结构;了解 Nvidia GPU/ARM CPU 处理器体系结构,理解软件与硬件底层映射关系。加分项:熟悉程序性能分析、问题定位及调试方法熟悉深度学习算法或常见 CV 算法;熟悉深度学习量化方法。 投递...
AI 院-MOE 训练/推理Infra工程师 北京 全职 互联网 / 电子 / 网游 职位描述 我们正在寻找一位经验丰富的 MOE 训练/推理 Infra 开发工程师,负责设计、实现并优化我们的 MOE(Mixture of Experts)训练和推理框架。该职位需要您具备扎实的分布式系统、高性能计算、深度学习框架以及硬件加速优化的相关知识,能够解决 MOE 训练和推理过程中的各种技术难题,并与算法团队紧密合作,确保算法的顺利实现。主要职责:1、设计并实现高效的 MOE 训练/推理框架:•设计并开发支持大规模分布式训练和推理的 MOE 框架,确保其在各种硬件配置下的高效运行;•优化训练和推理性能,通过算法优化、并行计算、缓存策略等方式,缩短训练和推理时间,提高效率;2、解决 MOE 训练/推理过程中的技术难题:•针对专家网络的选择问题,研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性;• 解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源的利用率,避免过载或空闲状态;• 优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率,缩短训练和推理时间3、与算法团队密切合作:•与算法团队保持密切沟通,了解算法需求,根据需求调整和优化训练和推理基础设施,确保算法的顺利实现;•跟踪业界最新技术动态,引入适合项目需求的新技术、新方法,提升团队整体技术水平; 职位要求 关键技能:分布式训练技术:•掌握分布式训练框架(如 Horovod、PyTorch Distributed)的使用和优化。•具备设计和实现高效分布式训练系统的能力。硬件加速优化:•熟悉 GPU、TPU 等硬件架构,能够进行硬件级性能调优。•了解 CUDA、cuDNN 等相关技术,能够利用硬件加速提升训练和推理效率。模型优化技术:•了解量化、剪枝、压缩等模型优化方法,以提升推理效率•能够在实际项目中应用这些技术,优化模型大小和推理速度•负载均衡与通信优化•能够设计高效的负载均衡策略和通信机制,以应对
AI院-GLM团队-训练/推理infra算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 岗位职责 1. 与算法团队深度协作,参与 下一代 GLM 大模型架构设计与系统实现 ,推动模型结构与系统效率的协同优化2. 构建 大模型推理成本分析与模拟系统 ,从算力、通信、KV cache、并行策略等维度优化推理效率3. 设计与优化 超大规模训练基础设施(万卡级) ,提升训练稳定性、资源利用率与训练效率4. 探索 MoE、Sparse Attention、长上下文等新架构在训练与推理系统中的高效落地 你将参与 * 下一代 GLM 系列基础模型(百亿到万亿参数级) 的系统设计* 万卡规模训练系统 的优化与稳定性工程* 推理系统的 极致效率优化(吞吐
AI院-大模型量化算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。【工作内容】1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。 职位要求 1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。 投递...
自动驾驶 AI 部署工具链研发实习生 北京 校招 实习 软件研发类 职位描述 1、负责自动驾驶深度学习模型部署和优化工作2、基于车载异构硬件对模型进行部署及优化3、参与模型部署工具链、算子库开发 职位要求 1、本科及以上学历,扎实的编程基础与良好的工程习惯2、优秀的编程能力,掌握 Python、C++、Cuda 等编程语言3、熟悉 Pytorch 框架、AI 模型导出及部署流程者优先4、熟悉常见的深度学习推理编译框架者优先,如:TensorRT、TVM、MLIR5、熟悉 GPU 硬件架构及软件优化者优先 投递...
机器人 VLN 大模型导航-实习生 北京 校招 实习 算法类 职位描述 机器人 VLN 大模型导航方向,参与团队相关研发工作:* VLN/LocoManipulation 模型研发* 算法云端/实机部署,性能优化* 数据管线搭建/优化* 算法评测等 职位要求 满足部分条目即可:1. 优秀的编程与工程能力,熟悉 C/(Modern)C++ 或 Python 或 CUDA 或 Rust2. 参与过开源项目,或在维护自己的 github 公开项目,或拥有一些机器人竞赛经验3. 对 AI 辅助编程工具有较多使用经验4. 对 VLM/VLA/VLN 等模型方案有所实践5. 工作地点在亦庄小米汽车工厂,需现场办公 投递...
训练平台性能优化工程师实习生-2027届 北京 校招 实习 软件研发类 职位描述 深度优化训练流程 主导模型训练全链路性能分析与优化,设计GPU资源弹性调度策略 开发自动化训练加速工具链,构建可扩展的云端训练框架 研发混合精度训练、梯度压缩等前沿技术,突破训练吞吐瓶颈构建训练优化体系 制定标准化训练效能评估体系,建立成本-效率量化模型 设计可复用的训练加速组件库,沉淀最佳实践方法论 开发训练过程性能分析平台,实现性能问题智能诊断赋能业务研发 优化多任务资源调度策略,提升GPU集群整体利用率 为算法团队提供训练加速解决方案,缩短模型迭代周期 职位要求 1.精通深度学习训练加速技术,熟悉分布式训练框架设计2.掌握CUDA编程及GPU性能分析工具(nsys/torch profiler)3.熟练使用PyTorch框架,具备训练流程优化实战经验4.熟悉常见模型压缩技术(量化/剪枝/蒸馏)及落地应用5.具备大规模集群资源调度系统开发经验者优先【技术加分项】1.有mmcv//deepspeed/megatron/ray等训练框架开发经验2.算子优化经验,triton/cuda等开发经验.3.熟悉MPI/NCCL等分布式通信协议4.在MLSys/ICLR等顶会发表过训练优化相关论文 投递...
26届校招-推理Infra工程师 北京 正式 互联网 / 电子 / 网游 职位描述 1. 参与大模型推理框架的设计与开发:协助团队进行支撑大语言模型、图像生成等复杂模型推理的高性能框架研发,推动算法到产品落地的全链路优化,确保推理的高效性、稳定性和低延迟。2. 性能优化与调优:在资深工程师指导下,参与优化内存管理、计算资源分配与调度策略,提升模型推理速度和资源利用率。学习并使用性能分析工具(如Nvidia Nsight)进行瓶颈定位和优化。3. 模型推理加速技术探索:学习并应用业界前沿的推理优化技术,KV Cache优化、模型量化(Quantization)、剪枝(Pruning),跨机分布式推理优化等。 职位要求 1. 基础技能: - 熟练掌握 C++ 和 Python 编程语言,具备扎实的数据结构、算法和操作系统基础。 - 熟悉至少一种主流的深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理。 - 了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验。2. 专业知识: - 对 Transformer 架构及主流大模型(如GPT、Llama、Qwen等)的推理特性有基本理解。 - 了解大模型推理的基本流程和常见挑战(如延迟、吞吐、内存占用)。3.
26届校招-训练Infra工程师 北京 正式 互联网 / 电子 / 网游 职位描述 1. 参与训练框架研发与优化:协助团队进行大规模分布式训练框架的设计、实现与维护,支持复杂AI模型(如大语言模型、多模态模型)的高效训练。2. 性能调优与效率提升:在导师指导下,优化训练过程中的内存管理、计算资源调度和分布式通信效率,提升训练速度和资源利用率。3. 集成与适配先进技术:学习并应用业界前沿的训练加速技术(offload、动态分布式并行/流水线排布),确保框架的先进性和竞争力。4. 支持算法研发与交付:与算法工程师紧密配合,提高训练效率,降低研发成本,提升交付能力。 职位要求 1. 基础技能: - 熟练掌握 Python 和 C++ 编程语言,具备扎实的数据结构、算法和操作系统基础。 - 熟悉至少一种主流深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理和机制。 - 了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验。2. 专业知识: - 对 Transformer 架构及主流大模型(如GPT、Llama等)的训练特性有基本理解。 - 了解分布式训练的基本原理(如数据并行、模型并行、流水并行)和常见挑战。3. 加分之项(满足以下任一即可):
大模型研究和工程实习生-MiMo 北京 校招 实习 算法类 职位描述 1.创新模型结构设计: - 参与大型语言模型核心架构设计与优化 - 探索Transformer及其变种的改进方案2. 原生多模态探索: - 研发原生多模态架构,实现文本、图像、音频等模态信息的深度融合 - 研究多模态对齐技术,实现不同模态的语义一致性3. 模型推理能力提升: - 借助强化学习+CoT,提升大语言模型推理能力 - 自研强化学习算法,搭建强化学习训练框架,设计奖励函数、构建环境、优化模型提升性能4. 大模型训练推理Infra - 开发和优化大规模分布式训练推理系统 - 优化大模型训练的内存使用和通信效率5. 科学评测体系构建: - 构建科学严谨的算法评测方法,系统评估模型的性能 - 探索模型能力的潜在机制,推动模型优化和创新 职位要求 职位要求1. 学术能力: - 精通深度学习、强化学习(RL)、自然语言处理(NLP)等领域,具备创新研究能力
训练平台性能优化工程师实习生 北京 校招 实习 软件研发类 职位描述 深度优化训练流程 主导模型训练全链路性能分析与优化,设计GPU资源弹性调度策略 开发自动化训练加速工具链,构建可扩展的云端训练框架 研发混合精度训练、梯度压缩等前沿技术,突破训练吞吐瓶颈构建训练优化体系 制定标准化训练效能评估体系,建立成本-效率量化模型 设计可复用的训练加速组件库,沉淀最佳实践方法论 开发训练过程性能分析平台,实现性能问题智能诊断赋能业务研发 优化多任务资源调度策略,提升GPU集群整体利用率 为算法团队提供训练加速解决方案,缩短模型迭代周期 职位要求 1.精通深度学习训练加速技术,熟悉分布式训练框架设计2.掌握CUDA编程及GPU性能分析工具(nsys/torch profiler)3.熟练使用PyTorch框架,具备训练流程优化实战经验4.熟悉常见模型压缩技术(量化/剪枝/蒸馏)及落地应用5.具备大规模集群资源调度系统开发经验者优先【技术加分项】1.有mmcv//deepspeed/megatron/ray等训练框架开发经验2.算子优化经验,triton/cuda等开发经验.3.熟悉MPI/NCCL等分布式通信协议4.在MLSys/ICLR等顶会发表过训练优化相关论文 投递...
大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...
高性能计算实习生 北京 校招 实习 算法类 职位描述 1、负责深度学习模型在车载平台上加速和调优,设计基于GPU和自研芯片的高性能算法基础库,支持下游各个算法研发;2、负责自动驾驶系统的核心算法的实现,配合算法研究员完成算法的落地与部署工作,并在代码与指令集层面优化算法运行效率。3、负责大规模分布式训练系统的设计与调优,提升模型训练的效率与吞吐率 职位要求 1、熟悉CUDA工作原理,能独立完成代码热点分析并制定优化方案。2、良好的编程能力,熟悉python,c++,掌握常见的算法和数据结构知识;3、良好的工程能力,有较强的的代码结构设计能力,熟练使用git、ssh,cmake等工具。加分项1、ACM/ICPC、CCPC、NOI、IOI等计算机/信息学竞赛获奖经历。2、有自研NPU部署和优化的经验3、有大规模分布式训练系统设计和优化的经验 投递...
Miclaw-大模型训练推理方向实习生 AI人才专项 热招 北京 校招 实习 软件研发类 职位描述 1. 研究并复现业界与学术界 SOTA 的大模型推理优化技术,包括但不限于极低比特量化、FlashAttention、投机解码(Speculative Decoding)、KV Cache 优化等关键方向,并在真实端侧场景中进行性能评估与对比分析。2. 面向端侧算力与内存受限场景,探索高效的大模型结构与推理策略,如端侧友好的 MoE 方案、稀疏与线性注意力、长上下文推理优化等,推动模型在性能、效果与资源消耗之间的最优权衡。3. 参与大模型与芯片协同设计(Model–Chip Co-design),从模型结构、算子设计到推理系统层面进行联合优化,深入理解端侧 NPU / GPU / CPU 架构对模型推理性能的影响。4. 与模型、系统、芯片团队深度协作,将研究成果转化为可落地的工程方案,并有机会参与核心模块的设计与实现,产生可量化的性能提升结果。 职位要求 1. 计算机科学、人工智能、电子工程或相关专业在读本科 / 硕士 / 博士,对大模型、系统或芯片方向有强烈兴趣。2. 具备扎实的算法与系统基础,对复杂系统的性能瓶颈具有较强分析能力,愿意深入到实现细节解决“难而重要”的问题。3. 至少在以下一个或多个方向具备良好基础或实践经验:-
端到端算法工程师实习生 北京 校招 实习 软件研发类 职位描述 1. Develop quantization, sparsity, pruning, and distillation techniques to enhance the production-level autonomous driving models.2. Optimize, convert, and deploy autonomous driving models (e.g., ONNX models) that operate efficiently on diverse