Job Description SummaryResponsible for designing and programming a small module or a large component and designing a feature, set of features, or whole feature area. She/he will work independently and contribute to the immediate team and
AI院-GLM团队-预训练算法工程师 北京 全职 研发 - 算法 职位描述 职位描述1. 参与数学或代码大模型预训练的研发工作,包括模型的预训练、对齐和评测等2. 负责构建和优化数学或代码的预训练和对齐数据,提升模型在数学或代码任务上的效果3. 探索针对数学或代码任务的数据合成方法,提升模型在数学或代码任务上的泛化能力 职位要求 职位要求1. 自然语言处理、机器学习等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Pytorch、Huggingface、DeepSpeed等框架;4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先;加分项:1. 在ACL,NeurIPS,ICLR,EMNLP等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先;3. 熟悉CUDA编程/Triton编程,有相关算子加速经验者优先; 投递...
端侧工程-异构计算实习生 北京 实习 数字技术 - 算法 职位 ID:A155108A 职位描述 1. 负责自动驾驶算法车端的工程优化2. 负责现有异构计算模块的runtime优化 职位要求 1. 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;2. 熟练掌握 C/C++和Python,有良好的代码编写习惯;3. 熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;4. 以下掌握其一优先 1. 熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库; 2. 熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架 3. 熟悉NEON等SIMD指令5. 优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;6. 有深度学习、计算机视觉、自动驾驶背景优先 投递...
智能辅助驾驶大模型工程实习生 北京 实习 数字技术 职位 ID:A132275 职位描述 车端工程链路开发云端离线验证链路开发单元测试开发实车调试与性能分析 职位要求 熟练使用使用C++ or Python熟悉在linux平台下的开发工作有自驱解决问题的能力熟悉Git/Shell对算法,数据结构和操作系统有较好理解加分项CUDA开发Gitlab CICD精通C++ or Python高性能编程有ROS或者Cyber相关经验熟悉GTest等单元测试框架【实习时间】1. 每周至少现场4天(Base北京) 2. 实习至少六个月,可尽快入职者优先 投递...
算法工程化实习生 北京 实习 数字技术 职位 ID:A224879 职位描述 负责自动驾驶算法车端的工程优化;负责现有异构计算优化和监控工具链的开发。 职位要求 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;熟练掌握 C/C++和Python,有良好的代码编写习惯;熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;以下掌握其一优先:熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库;熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架熟悉NEON等SIMD指令优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;有深度学习、计算机视觉、自动驾驶背景优先。 投递...
高性能计算实习生 北京 实习 数字技术 职位 ID:A148157 职位描述 基于 Nvidia GPU/ARM CPU 等架构特性完成深度学习算子、CV 算法及计算库的开发及优化;与深度学习引擎前端团队一起,共同完成深度学习引擎在端侧落地,保证算法运行的高效性及实时性。 职位要求 岗位职责:基本要求:熟悉 ARM/DSP/CUDA 并行编程模型;熟悉 C/C++ 编程,了解常用算法及数据结构;了解 Nvidia GPU/ARM CPU 处理器体系结构,理解软件与硬件底层映射关系。加分项:熟悉程序性能分析、问题定位及调试方法熟悉深度学习算法或常见 CV 算法;熟悉深度学习量化方法。 投递...
AI 院-MOE 训练/推理Infra工程师 北京 全职 互联网 / 电子 / 网游 职位描述 我们正在寻找一位经验丰富的 MOE 训练/推理 Infra 开发工程师,负责设计、实现并优化我们的 MOE(Mixture of Experts)训练和推理框架。该职位需要您具备扎实的分布式系统、高性能计算、深度学习框架以及硬件加速优化的相关知识,能够解决 MOE 训练和推理过程中的各种技术难题,并与算法团队紧密合作,确保算法的顺利实现。主要职责:1、设计并实现高效的 MOE 训练/推理框架:•设计并开发支持大规模分布式训练和推理的 MOE 框架,确保其在各种硬件配置下的高效运行;•优化训练和推理性能,通过算法优化、并行计算、缓存策略等方式,缩短训练和推理时间,提高效率;2、解决 MOE 训练/推理过程中的技术难题:•针对专家网络的选择问题,研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性;• 解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源的利用率,避免过载或空闲状态;• 优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率,缩短训练和推理时间3、与算法团队密切合作:•与算法团队保持密切沟通,了解算法需求,根据需求调整和优化训练和推理基础设施,确保算法的顺利实现;•跟踪业界最新技术动态,引入适合项目需求的新技术、新方法,提升团队整体技术水平; 职位要求 关键技能:分布式训练技术:•掌握分布式训练框架(如 Horovod、PyTorch Distributed)的使用和优化。•具备设计和实现高效分布式训练系统的能力。硬件加速优化:•熟悉 GPU、TPU 等硬件架构,能够进行硬件级性能调优。•了解 CUDA、cuDNN 等相关技术,能够利用硬件加速提升训练和推理效率。模型优化技术:•了解量化、剪枝、压缩等模型优化方法,以提升推理效率•能够在实际项目中应用这些技术,优化模型大小和推理速度•负载均衡与通信优化•能够设计高效的负载均衡策略和通信机制,以应对
AI院-GLM团队-训练/推理infra算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 岗位职责 1. 与算法团队深度协作,参与 下一代 GLM 大模型架构设计与系统实现 ,推动模型结构与系统效率的协同优化2. 构建 大模型推理成本分析与模拟系统 ,从算力、通信、KV cache、并行策略等维度优化推理效率3. 设计与优化 超大规模训练基础设施(万卡级) ,提升训练稳定性、资源利用率与训练效率4. 探索 MoE、Sparse Attention、长上下文等新架构在训练与推理系统中的高效落地 你将参与 * 下一代 GLM 系列基础模型(百亿到万亿参数级) 的系统设计* 万卡规模训练系统 的优化与稳定性工程* 推理系统的 极致效率优化(吞吐
AI院-大模型量化算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。【工作内容】1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。 职位要求 1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。 投递...
26届校招-推理Infra工程师 北京 正式 互联网 / 电子 / 网游 职位描述 1. 参与大模型推理框架的设计与开发:协助团队进行支撑大语言模型、图像生成等复杂模型推理的高性能框架研发,推动算法到产品落地的全链路优化,确保推理的高效性、稳定性和低延迟。2. 性能优化与调优:在资深工程师指导下,参与优化内存管理、计算资源分配与调度策略,提升模型推理速度和资源利用率。学习并使用性能分析工具(如Nvidia Nsight)进行瓶颈定位和优化。3. 模型推理加速技术探索:学习并应用业界前沿的推理优化技术,KV Cache优化、模型量化(Quantization)、剪枝(Pruning),跨机分布式推理优化等。 职位要求 1. 基础技能: - 熟练掌握 C++ 和 Python 编程语言,具备扎实的数据结构、算法和操作系统基础。 - 熟悉至少一种主流的深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理。 - 了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验。2. 专业知识: - 对 Transformer 架构及主流大模型(如GPT、Llama、Qwen等)的推理特性有基本理解。 - 了解大模型推理的基本流程和常见挑战(如延迟、吞吐、内存占用)。3.
26届校招-训练Infra工程师 北京 正式 互联网 / 电子 / 网游 职位描述 1. 参与训练框架研发与优化:协助团队进行大规模分布式训练框架的设计、实现与维护,支持复杂AI模型(如大语言模型、多模态模型)的高效训练。2. 性能调优与效率提升:在导师指导下,优化训练过程中的内存管理、计算资源调度和分布式通信效率,提升训练速度和资源利用率。3. 集成与适配先进技术:学习并应用业界前沿的训练加速技术(offload、动态分布式并行/流水线排布),确保框架的先进性和竞争力。4. 支持算法研发与交付:与算法工程师紧密配合,提高训练效率,降低研发成本,提升交付能力。 职位要求 1. 基础技能: - 熟练掌握 Python 和 C++ 编程语言,具备扎实的数据结构、算法和操作系统基础。 - 熟悉至少一种主流深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理和机制。 - 了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验。2. 专业知识: - 对 Transformer 架构及主流大模型(如GPT、Llama等)的训练特性有基本理解。 - 了解分布式训练的基本原理(如数据并行、模型并行、流水并行)和常见挑战。3. 加分之项(满足以下任一即可):
【27届校招】大模型训练推理框架工程师 深圳、北京 正式 研发 - 算法 智能机器人板块 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、硕士及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有丰富以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和 RL
大模型AI Infra工程师(PRC) 北京 全职 互联网 / 电子 / 网游 职位描述 1、核心算子开发与极致优化:基于华为昇腾(Ascend 910B等)、平头哥等国产AI加速芯片,进行深度学习核心计算算子(如Attention、Linear、LayerNorm、MoE等)的高性能定制开发与迭代优化;2、AI框架与系统适配:负责将主流开源AI框架(如PyTorch、MindSpore)及大模型训练/推理工具链(如Megatron-LM、DeepSpeed、vLLM等)深度适配到国产算力平台上,确保功能正确性与系统稳定性;3、端到端性能调优:使用底层性能分析工具(如Ascend Profiler等)进行算子级与模型级的性能瓶颈分析。针对计算、访存、通信瓶颈制定调优策略(如算子融合、混合精度、计算与通信重叠设计);4、编译优化与前瞻探索:参与探索TVM、MLIR、Triton等AI编译器技术在国产异构后端的应用,提升算子自动生成效率与多硬件平台的泛化适配能力。 职位要求 1、基础条件:计算机科学、软件工程、电子工程、数学或相关专业,本科及以上学历,具备扎实的计算机体系结构基础,深入理解GPU/NPU微架构、并行计算原理及内存一致性模型;2、专业技能:编程能力:精通C/C++与Python,具备出色的工程实现与架构设计能力;异构开发经验:熟练掌握至少一种主流并行编程语言(CUDA / HIP / OpenCL / Ascend C),有丰富的底层算子开发、调试和调优经验;AI框架机制:深入理解至少一种深度学习框架(PyTorch/TensorFlow/MindSpore)的底层运行机制(如计算图、算子分发机制、显存池管理等);3、【加分项】(满足其一即可优先考虑):具备华为昇腾CANN开发体系经验,熟练掌握Cube/Vector Core编程模型者优先;有千亿级参数大模型(如LLaMA、Qwen、GLM)在国产算力集群上的训练、微调或推理落地经验者优先;在开源社区(如MindSpore、vLLM、FlashAttention、Cutlass等)有核心代码贡献者优先。 投递...
Job Description SummaryWe are seeking an experienced CT Reconstruction Software Architect to lead the architecture and development of next-generation CT reconstruction platforms. The successful candidate will be responsible for defining software architecture, driving image reconstruction innovations,
【校招实习】AI Infra工程师 北京 实习 互联网 / 电子 / 网游 - 研发 千寻智能2027届校招实习招聘项目 职位描述 1、负责具身智能大模型千卡大规模训练系统性能优化及MFU优化。2、负责多模态大模型(VLM)在云端的高性能分布式推理系统设计、开发与全链路端到端部署。3、负责具身智能VLA模型在端侧的推理系统的研发和模型加速算法研究。 职位要求 1、熟悉GPU体系结构,熟练掌握CUDA/triton,熟练掌握C++或Python语言。2、深入了解PyTorch等深度学习框架的架构和运行原理,深入理解大模型训练多维并行架构,如Tensor并行、流水线并行、序列并行等。3、深入理解多模态模型结构,如ViT、DiT等,了解开源多模态大模型结构,如qwen-vl、llama等。4、熟悉至少一种主流开源推理引擎(如 vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo等)的底层机制与源码魔改。5、熟悉量化、剪枝、蒸馏、投机推理、步数蒸馏等前沿推理加速及模型小型化技术方案。 投递...
软件实习生 - 端到端模型性能优化 北京 实习 职位描述 1. 负责AI端到端模型的性能分析与优化;2. 负责CUDA算子开发与维护。 职位要求 1. 计算机或相关专业本科及以上学历;2. 扎实的软件工程能力,熟练掌握计算机基础知识;3. 有CUDA编程经验,熟悉TensorRT或其它AI加速库;4. 熟悉至少一种深度学习框架(Pytorch优先)。加分项:1. 熟练掌握CUDA编程,有CUDA优化经验;2. 有算法竞赛经历;3. 有基于TensorRT的模型优化经验;4. 有模型量化、蒸馏、剪枝等工程经验。 投递...
算法实习生-多模态感知大模型 北京 实习 职位描述 1. 负责基于 Camera、LiDAR 及多模态融合的感知算法开发与优化,工作方向包括但不限于动态目标检测与追踪、3D occ、在线地图感知等。2. 负责研发面向高精度静态环境感知的端到端深度学习模型,重点覆盖交通信号灯(红绿灯)、交通标识、车道线、路缘、静态障碍物等关键元素的检测与识别。3. 设计端到端模型架构(如BEV感知、Transformer-based模型),实现从原始数据到结构化静态场景输出的高效映射4. 负责算法在自动驾驶实际产品中的落地和优化提升,解决实际问题。 职位要求 1. 计算机或相关专业本科以上学历;2. 熟练掌握深度学习及计算机视觉相关的基本算法;3. 熟悉基于CNN的图像检测、跟踪、识别等算法流程;4. 优秀的编程能力,熟悉C/C++或Python;5. 有较强的独立解决问题能力,学习能力及沟通能力;若能满足如下条件的其中一个,会适当加分:1. 有较强的研究能力优先,如发表过第一作者CCF A类会议或期刊等论文;2. 熟悉某种深度学习框架,如Pytorch等,对深度学习有深入的了解;3. 熟悉并行计算或cuda编程,或图像处理方面经验的优先;4. 在自动驾驶行业有实习经验;5. 能实习6个月及以上。 投递...
AI Infra实习生(日常实习) 北京 实习 研发 - 基础架构 千寻智能2025年秋季校园招聘项目 职位描述 1、负责构建支撑具身智能体的核心机器学习系统,开发面向机器人场景的VLA大模型训练与推理系统,支撑多模态感知、运动控制、任务规划等核心能力的持续进化;2、研发新一代具身智能系统工具链,涵盖数据采集、仿真训练、物理部署、持续优化全生命周期。 职位要求 1、计算机、人工智能、软件工程等相关专业,硕士及以上学历,2026年及之后毕业; 2、熟练使用C++/Python/Pytorch/CUDA开发生态,具有嵌入式系统开发经验者优先;3、能至少保障3个月以上的实习时间,每周4天以上出勤;4、加分项:在以下一个或多个领域有深度实践: a. 大模型训练推理:多模态大模型分布式训练、端上推理加速、Transformer模型优化; b. 高性能计算:GPU Kernel编写,高性能通信(NCCL、RDMA),AI编译器(TVM、Triton),模型量化等; c. 机器人系统:ROS2、运动控制算法、传感器数据处理pipeline。 投递...
机器学习势函数工程研发实习生 北京 实习 本科及以上 职位描述 1. 计算机、软件工程、人工智能、计算科学或相关专业本科及以上学历;2. 熟练使用 Python,具备 C/C++ 基础,能够阅读和调试工程代码;3. 熟悉 PyTorch及常见模型训练、测试和性能评测流程;4. 熟悉 Linux、Git及常用开发工具,能够根据日志定位和解决实验问题;5. 具备良好的代码规范、测试意识和实验复现意识;6. 了解 CUDA、Triton、GPU性能分析或分布式训练者优先;7. 有 DeePMD-kit、分子动力学、机器学习势函数或科学计算经验者优先;8. 大四即以上211,985在读优先;9. 善于独立思考,灵活使用各类AI工具。 职位要求 1. 根据既定方案配置、提交和监控机器学习势函数训练及测试任务;2. 整理实验数据与结果,完成精度、速度和资源消耗等指标的对比分析;3. 参与 DeePMD-kit 的功能开发、问题排查、单元测试和文档维护;4. 协助开展关键计算流程和算子的性能分析与优化;5. 完善实验脚本及自动化工具,保障实验流程稳定、可复现。 职位信息 部门: OpenLAM 投递...
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential