At NVIDIA, we are proud of our advanced analysis and debugging tools that help engineers reach outstanding performance and power efficiency in products and applications. We invite creative, diligent, and innovative people to join our committed
At NVIDIA, we build groundbreaking products for the following sectors: Deep Learning, High Performance Computing, Gaming, VR, and Automotive. See your efforts in action as developers use your tools to debug, profile and analyze the performance
智能辅助驾驶算法工程岗位 - 模型训练方向 AD内推 上海 社招 全职 数字技术 本科及以上 3-5 年 职位描述 我们希望找到一位兼具算法理解与工程落地能力的同学,加入智能辅助驾驶核心研发团队,共同建设高可靠、高性能的车云协同链路体系。您将参与从算法模块设计、工程集成、系统优化到车端实车部署的全流程,面对真实场景、真实挑战,构建支撑量产智能辅助驾驶产品的关键基础设施。该岗位将与端侧、大模型、规划、仿真、云平台等多个团队协作,因此需要你具备跨模块协作能力和扎实的系统工程素养。主要职责:1. 算法模块集成与实车部署- 深度参与智能辅助驾驶诸多算法模块的集成与工程化改造- 开发统一集成算法模块的工程链路,并可跨平台(arm/x86)部署,支持链路快速调试和部署- 对接云端与仿真验证体系,建设统一的车云工程体系2. 车云链路系统设计与性能优化- 负责车云链路集成架构的设计,开发与迭代,包括数据格式、调度机制等- 持续优化链路时延、吞吐与系统稳定性,保障算法模块在车端的高可靠运行- 解决车云链路中的高并发、数据一致性,跨版本伴生下发等诸多工程难题3. CI/CD 与自动化质量体系建设- 构建稳定可靠的 CI/CD 流程(构建、编译、自动部署、回归验证)- 设计多层级的拦截系统,拦截所有上车模块的质量问题- 设计工程质量度量体系,提升整个团队的交付效率与代码质量4. 工程质量与系统级问题攻关- 推进 C++/Python 工程规范、性能 profiling、内存、日志管理优化等专项工作- 参与定位和解决系统级崩溃、性能瓶颈、线程安全、内存泄漏等复杂问题- 主导关键模块的工程重构,使系统具备可扩展性、可维护性 职位要求 【教育水平】硕士及以上学历,计算机、自动化、电子工程等相关专业背景【能力要求】1.
智能辅助驾驶-系统集成工程师 AD内推 蔚来自动驾驶研发团队 北京、上海 社招 全职 数字技术 - 软件研发 本科及以上 5-7 年 职位描述 主要职责:1. 算法模块集成与实车部署- 深度参与智能辅助驾驶驾驶诸多算法模块的集成与工程化改造- 开发统一集成算法模块的工程链路,并可跨平台(arm/x86)部署,支持链路快速调试和部署- 对接云端与仿真验证体系,建设统一的车云工程体系2. 车云链路系统设计与性能优化- 负责车云链路集成架构的设计,开发与迭代,包括数据格式、调度机制等- 持续优化链路时延、吞吐与系统稳定性,保障算法模块在车端的高可靠运行- 解决车云链路中的高并发、数据一致性,跨版本伴生下发等诸多工程难题3. CI/CD 与自动化质量体系建设- 构建稳定可靠的 CI/CD 流程(构建、编译、自动部署、回归验证)- 设计多层级的拦截系统,拦截所有上车模块的质量问题- 设计工程质量度量体系,提升整个团队的交付效率与代码质量4. 工程质量与系统级问题攻关- 推进 C++/Python 工程规范、性能 profiling、内存、日志管理优化等专项工作- 参与定位和解决系统级崩溃、性能瓶颈、线程安全、内存泄漏等复杂问题- 主导关键模块的工程重构,使系统具备可扩展性、可维护性 职位要求
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
By clicking the “Apply” button, I understand that my employment application process with Takeda will commence and that the information I provide in my application will be processed in line with Takeda’s Privacy Notice and Terms
大模型优化与高性能计算实习生 上海 实习 职位描述 针对自动驾驶端到端+多模态大语言模型的训练及推理速度优化,以及在车端计算平台的部署。车载计算节点(CPU/GPU)的性能优化,包括系统分析、内存优化、算子开发等。智能驾驶车载系统相关模块开发,构建高可靠性、低延迟的车载计算平台。 职位要求 具有计算机,电子信息,自动化,深度学习,高性能计算等相关领域硕士学历。精通Python/C++/CUDA编程以及PyTorch深度学习框架, 熟练掌握TensorRT-LLM/vLLM/ONNX等推理框架和工具。熟悉CPU/GPU profiling工具,熟练掌握模型计算图优化、编译优化、内存优化技能,对新技术充满热情。有自动驾驶经验,ACM/ICPC竞赛并获奖者优先。具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...
软件工程师 - 大模型端侧优化和部署 北京、广州、上海 全职 职位描述 负责将大模型部署到自动驾驶车端芯片平台(NVIDIA Orin / Thor 等),并进行极致的性能、内存与能效优化。你将在算力、内存、功耗与实时性严格受限、且对安全与稳定性要求极高的车载环境下,打通从推理引擎定制、核心算子优化到车端运行时管理的全栈链路,推动大模型在自动驾驶(端到端决策、场景理解等)场景的规模化落地。岗位职责1. 适配、移植与深度优化车端推理引擎/运行时(TensorRT-LLM、TensorRT Edge-LLM、vLLM、SGLang 等),通过计算图优化、算子融合、高性能 CUDA 算子开发及 KV Cache、投机采样等优化,充分发挥 Orin / Thor 平台算力,满足实时性要求;2. 建立 Benchmark 与 Profiling 体系,跟踪首字延迟(TTFT)、吞吐、内存峰值、冷启动、模型切换、cache 命中率、长稳与抖动等车端核心指标。支持场景理解、Function Calling、结构化输出、流式输出、多模态推理等核心场景的低延迟落地; 职位要求 1. 计算机、电子工程、人工智能、自动化等相关专业,本科及以上学历;2. 具备 2 年以上 AI 推理部署、端侧AI、系统性能优化或模型工程化相关经验;3.
我们正在寻找一位 全栈工程师,参与核心 AI Agent 产品从架构设计、能力建设到生产落地的完整过程。你将参与 Web 产品、API 服务、Agent 编排系统、后台任务系统、数据层和部署流程等多个环节,和团队一起构建面向真实生产环境的 AI Agent 产品。 你将深度参与 AI Agent 系统的工程化建设,包括 Agent Loop、工具调用、任务编排、多步骤执行、上下文管理、模型路由、异步任务处理、结果持久化、错误恢复、日志追踪与系统可观测性等关键模块。这个岗位不是简单调用大模型 API,而是需要将 LLM 能力、业务流程、前后端系统和用户体验结合起来,构建可稳定运行、可持续扩展的生产级 Agent 产品。 在这个角色中,你需要理解 Agent 如何接收用户目标、拆解任务、选择工具、执行动作、处理中间状态、根据反馈继续推理,并最终产出可靠结果。你也需要关注 Agent 执行过程中的实际工程问题,例如任务超时、工具失败、重试策略、状态一致性、成本控制、并发执行、队列调度、数据追踪以及生成结果的可复现性。 你会和产品、设计、前端、后端和基础设施团队紧密协作,把 AI 能力落到真实的产品体验中。我们希望你既能理解前端产品形态和用户交互,也能深入后端服务、数据模型、任务队列和 Agent 编排系统,帮助团队搭建长期可维护、可扩展、可观测的 AI Agent 工程体系。
具身大模型推理性能优化实习生 上海 实习 职位描述 1. 参与到面向具身机器人本体亲和的轻量化、高性能推理框架模块化开发;2. 基于GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 3. 开发模型解析、转换、性能剖析、可视化profiling工具;4. 洞察算子融合、低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术并复现开发;5. 调研VLA、世界模型、空间智能等最新算法架构趋势; 职位要求 1. 熟练掌握C/C++,具备汇编(ARM/x86)或CUDA/OpenCL优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp);3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ 等)及相关工具链;4. 熟悉常见算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax 等);5. 具备端上 profiling 能力(perf、简单性能计数器、硬件事件、功耗测量); 投递...
AI编译器研发(自动驾驶/机器人) 深圳、上海 全职 芯片板块 职位描述 1、编译器架构设计:设计并实现AI编译器中间表示(IR),支持模型图优化、算子融合、循环优化等;构建从模型解析到硬件指令生成的完整编译流水线,支持PyTorch/Onnx等主流框架。2、硬件后端优化:针对自研芯片,开发高效算子库与代码生成策略:优化内存访问、指令调度,提升端到端推理性能。3、性能调优与验证:通过Profiling工具定位性能瓶颈,优化算子,并设计自动调优流程;与硬件团队合作,验证算子在目标设备上的性能与正确性。4、业务场景落地:结合自动驾驶感知、决策规划,或机器人SLAM、运动控制等场景,优化编译器对实时性、低功耗的需求;参与模型量化与编译器的协同设计。5、技术探索与创新:研究动态形状处理、稀疏计算等前沿编译技术;探索LLVM/GCC等传统编译技术与MLIR的集成方案。 职位要求 1、必备技能:(1)精通C++/Python,具备大型系统开发经验。(2)深入理解MLIR框架,熟悉其Dialect设计、Pass优化机制。(3)有NPU或GPU硬件经验,熟悉CUDA、OpenCL或NPU专用指令集。(4)熟悉至少一种深度学习框架(TensorFlow/PyTorch/Onnx)。2、加分项:(1)有LLVM/GCC后端开发经验,熟悉内联优化、寄存器分配、指令调度、代码生成等。(2)参与过开源AI编译器项目(如TVM、Apache MLIR)。(3)了解自动驾驶感知算法(如BEV感知、多传感器融合)或机器人控制等模型。(4)发表过编译器优化、体系结构相关论文或专利。岗位介绍:我们正在寻找AI编译器研发工程师,专注于AI编译器框架设计与优化。包括模型量化、图优化、codegen、算子优化及软硬件协同优化等。您将参与构建高性能、低延迟的AI编译工具链,支撑自动驾驶、机器人等业务场景。 投递...
大模型训练加速工程师 / 高级专家 北京 全职 通用智能板块 职位描述 【岗位职责】训练加速与优化: 负责大模型训练场景下的性能分析 (Profiling) 与全链路优化,包括显存管理、计算加速及通信优化 (NCCL),提升集群训练吞吐率。算子开发与协同设计 (Co-design): 负责高性能算子 (Kernel) 的开发与调优;与算法团队紧密协作,针对特定模型结构(如 Transformer, MoE)进行定制化算子设计。分布式框架建设: 基于 Megatron-LM, DeepSpeed, FSDP 等框架进行二次开发与优化,设计适应大规模集群的并行训练方案。稳定性保障: 负责大规模训练过程中的问题定位与解决,包括但不限于 NCCL 超时、显存溢出 (OOM)、训练速度波动等,保障训练任务的高效稳定运行。 职位要求 理论基础: 计算机基础扎实,深刻理解深度学习训练原理(计算图、自动微分、混合精度),熟悉主流并行策略及 FlashAttention 等加速算法。编程能力: 熟练掌握 Python/C++,熟悉 GPU 编程模型,具备 CUDA
具身智能大模型训练系统开发与优化实习生 上海 实习 职位描述 将会参与如下四个典型训练系统优化方向工作(包括但不限于下面四个方向)参与方向一:支撑大规模预训练/微调的高效稳定运行关键任务:1. 参与千卡级别分布式训练集群的框架优化,确保训练任务在大规模集群上的稳定性(任务失败率 xxx%)和可恢复性(断点续训时间 xxx分钟)2. 优化训练任务的吞吐量(Throughput),相比基线提升至少 20%3. 参与至少一种并行策略(数据并行、模型并行、流水线并行、MoE并行)的框架级实现或深度优化方向二:降低大模型训练显存占用,支持更大规模模型关键任务:1. 集成或优化至少一种显存节省技术(ZeRO-1/2/3、重计算(Activation Checkpointing)、混合精度训练),使相同GPU下的可训练参数量提升 30% 以上2. 参与FlashAttention、Flash-FFN等高性能算子在分布式训练框架中的集成与适配3. 验证并对比不同并行策略组合(如 FSDP + 张量并行)的显存效率与计算效率方向三:优化跨节点通信效率,降低通信开销关键任务:1. 使用 NCCL 或 CANN ACL profiling工具分析通信瓶颈(AllReduce、AllGather等),并提出至少 2 项有效优化方案2. 参与实现通信与计算的重叠(overlap)优化,使通信隐藏比例提升至 50% 以上3. 探索并验证低比特通信(如 FP8 梯度通信)在训练中的可行性与效果方向四:完善训练框架的可用性与可观测性关键任务:1. 开发或优化训练监控 Dashboard,覆盖多类关键指标(GPU利用率、内存占用、通信耗时、吞吐量、损失曲线)2. 参与实现训练任务的自动容错与恢复机制,支持节点级/进程级故障自动重调度3.
Work Your Magic with us! Ready to explore, break barriers, and discover more? We know you’ve got big plans – so do we! Our colleagues across the globe love innovating with science and technology to enrich
大模型训练工程专家-稳定性方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位为大模型「预训练 + 后训练」的基础设施稳定性与效率负总责的资深工程师——横向拉通 GPU 算力、RDMA 网络、通信库、高性能存储、集群调度、训练任务生命周期等多个技术域,确保大规模训练不中断 / 少中断,并持续把有效训练算力(MFU / ETTR)做上去。二、为什么这个岗位重要大模型训练是公司最核心、最烧算力的战役。训练稳定性直接决定旗舰模型能否按期炼成。这是一个端到端 Owner 岗,不是分工到某个组件的螺丝钉——你对训练能不能稳、跑得快不快这个结果负责,向上直面算法 / 训练团队的真实诉求。你将有从 0 到 1 搭建训练稳定性体系的空间:可观测、故障自愈、预案、效率工程,都还有大片可建设的地带。三、你将负责什么(职责)1. 训练全栈基础设施保障(横向拉通,核心)GPU 算力:GPU 机器交付与健康管理、坏卡 / 掉卡 / 降频的检测与自愈、节点池管理与快速置换。RDMA / 高性能网络:IB /