NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA is seeking Software Performance Architects to optimize GPU kernel performance for state-of-the-art data-center platforms. We build automated, data-driven workflows to detect, explain, and prevent performance regressions across key deep learning workloads, partnering closely with kernel developers, compiler
Were looking for outstanding AI systems software engineers to develop groundbreaking technologies across the inference systems software stack. Our team builds core AI systems software that accelerates high-impact workloads on NVIDIA GPUs, from deep learning primitives
具身智能算法工程师(训练效率方向)-觅蜂子公司 上海 校招 正式 技术族 - 算法类 职位 ID:A11632 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责具身智能训练效率的度量、分析与系统性优化,覆盖预训练与后训练全链路。2. 深入理解不同模型架构(Transformer / Diffusion / Flow Matching 等)与训练算法(IL/RL/BC 等)的计算特性,针对性设计优化方案。3. 构建训练效率监控体系,包括 GPU 利用率、训练吞吐、通信效率、数据加载延迟等核心指标的可视化与自动化追踪。4. 模型训练效率优化:算子融合、CUDA graph、kernel 调优等,提升单卡和多卡计算效率。5. 并行与通信效率优化:梯度同步、云边通信、权重分发等通信开销分析与优化,支撑百台规模训练不退化。6. 数据加载效率优化:数据预处理 pipeline、IO 吞吐优化,消除数据侧瓶颈。 职位要求 1. 计算机、AI 等相关专业硕士及以上学历。2. 具备扎实的 Python/C++/CUDA 编程能力,有
大模型训练框架研发工程师(智能辅助驾驶方向) 上海 社招 全职 数字技术 本科及以上 3-5 年 职位描述 蔚来汽车智能辅助驾驶研发部从平台、架构、工程、算法到运营,建立行业领先的智能辅助驾驶技术自研体系;通过自研AI大模型化技术架构,兼顾单车智能和群体智能,已实现换电、泊车、高速和城区场景的全覆盖。行业唯一大模型化的智能安全辅助系统,也是唯一被行业头部保险公司认证的智能安全。团队在AI驱动的智能辅助驾驶领域拥有长期愿景与决心,研究方向涵盖多模态感知、视觉基模、世界模型、认知计算、人机交互、低速功能等,通过领域协作与持续创新,推动AI技术从实验室走向产业实践,为智能辅助驾驶到物理AI提供高精度、高可靠、高安全的技术支撑。工作职责:负责大模型训练框架的开发、优化、跟踪大模型训练优化前沿技术,并将其应用于智能辅助驾驶大模型的训练;负责智能辅助驾驶模型训练相关的资源及效率优化,深入分析大模型训练瓶颈,从数据处理、模型计算、多机通信、显存优化等多角度全链条开展优化;负责探索并落地 AI Agent 在大模型训练优化中的应用,面向智能辅助驾驶场景构建自动化训练优化能力,包括超参数调优、训练过程监控、异常诊断、性能瓶颈分析与优化建议生成、代码生成合并、评测 Harness等;负责模型训练稳定性工具建设,能在模型训练异常时,通过监控指标及时发现问题原因并解决;从计算专业角度,赋能算法,影响算法设计硬件友好的模型结构。 职位要求 计算机、人工智能等相关专业,硕士及以上学历;熟悉深度学习训练流程,精通Pytorch框架,了解常见模型结构及训练原理;熟练掌握python/C++编程语言,具备扎实的代码能力和数据结构基础;了解常见的深度学习视觉或语言模型;有良好的沟通能力,具有强烈的责任心和团队合作精神;熟悉CUDA kernel/Triton/TileLang研发和优化的优先;熟悉Linux编程,有多线程、内存管理、网络通信等底层经验者优先。 投递...
AI院-推理Infra工程师(量化算法研究/推理框架优化/GPU优化) 北京、上海 全职 互联网 / 电子 / 网游 职位描述 【方向一】量化算法研究员-职位描述通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。-工作内容1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。-职位要求1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。【方向二】推理框架优化工程师-职位描述1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术集成与应用:研究并应用业界前沿的优化技术(如模型量化QAT/PTQ、算子融合、动态形状支持、FlashAttention等),并将其集成至推理/训练引擎。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。【方向三】GPU优化工程师-职位描述利用对 cuda 生态软件和底层体系结构的了解,帮助团队优化训练和推理的计算效率。-工作内容1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率、多流并行协同等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术选型:对 GPU 领域相关的 DSL/编译器(例如 triton/cuteDSL/tilelang)等进行尝试和了解,确定团队内的 DSL/编译器的技术选型,为未来的迭代做好技术储备。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。 职位要求 -
大模型算法工程Co-Design-2027届 北京、上海 校招 实习 研发 - 算法 2027届校园招聘 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
大模型算法工程Co-Design-日常实习 北京、上海 校招 实习 研发 - 算法 日常实习 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
We are looking to hire an accomplished Senior Engineering Leader for an exciting and fun role in our Compiler and AI System Software organization. We deliver foundational technology to enable NVIDIA systems to make AI workloads
We are now looking for a Deep Learning Performance Software Engineer! We are expanding our research and development for Inference. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize in
As a Senior GPU & AI Infra Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving GPU/AI Infra technical strategy, system-level
A key part of NVIDIAs strength is our sophisticated development tools and modelling environments that enable our incredible pace of delivering new technology to market. We are looking for forward-thinking, hard-working, and creative people to join
We are expanding our research and development for Inference. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize in developing GPU-accelerated Deep learning software. Researchers around the world are using
Are you passionate about programming languages, compiler technology, and GPU performance? Do you want to help shape the future of high-performance kernel development for AI? We are looking for outstanding engineers to build CUTLASS DSL, a Python-native
NVIDIA is leading the way in groundbreaking developments in Artificial Intelligence, High-Performance Computing and Visualization. The GPU, our invention, serves as the visual cortex of modern computers and is at the heart of our products and
高性能计算工程师-Genie业务部 北京、上海 校招 正式 技术族 - 算法类 职位 ID:A200131 职位描述 负责 HPC 核心算法设计开发,优化 CPU/GPU/ASIC 多芯片性能,追求极致吞吐量与延迟;对接业务场景,定位并解决计算性能瓶颈,提升业务运行效率;参与异构计算集群的构建,推进异构计算方案落地与迭代。 职位要求 有高性能计算(HPC)或 AI 优化加速相关工作经验;精通 CUDA 生态,熟悉编译流程,深入理解 GPU 架构、内存模型及并行计算原理,具备扎实的 CUDA 编程功底,能独立编写、调试并优化 CUDA Kernel;熟练使用 Triton、CUTLASS 等工具,有基于这些工具进行算子开发、模型加速的实战经验;理解 PyTorch/TensorFlow 等 AI 框架及常见 AI 模型(VLA, LLM等);熟悉Nsys, NCU 等性能分析工具,能精准定位并解决 GPU 计算中的性能瓶颈;熟悉国产芯片的运行流程及编译链路,具备相关算子开发实战经验。
大模型推理框架开发工程师 武汉、北京、南京、上海 校招 正式 算法类 2027届校园招聘计划 职位描述 1.负责基于 vLLM、SGLang 等技术的大模型推理框架的开发工作,包括但不限于设计和实现高效的推理引擎架构,优化推理过程中的计算流程,提高推理性能,以满足不同规模大模型的实时推理需求;2.复杂大模型框架性能评估和调优工作,构建并完善性能监控体系,通过实时监测训练指标,定位性能瓶颈,提出优化方案,确保在不同硬件上达到最优性能;3.负责Cuda Kernel优化,开发高性能的GPU算子, 提升大模型推理性能。 职位要求 1.硕士及以上学历,计算机、软件工程、数学等相关专业,具备扎实计算机理论基础和丰富编程经验;2.熟悉 C++ / Python,掌握至少一种深度学习框架(如 PyTorch),理解Transformer系统深度学习原理算法;3.熟悉 GPU 和其他加速硬件的使用,有基本的性能调优经验,有FastTransformer、CUDA优化、TensorRT、Triton经验优先;4.熟悉大模型推理框架的基本原理和流程,了解 vLLM、SGLang 等大模型推理框架的核心技术和实现优先;5.有良好团队协作与沟通能力,有强烈的上进心和自我驱动,学习适应能力强,乐观自信,能挑战自我不断追求卓越。 投递...
【27届校招】AI软件工程师 上海 正式 研发 - 电子 / 半导体 职位描述 1. 高性能计算核心开发:针对自研芯片架构,设计、开发并优化高性能的CUDA及DSP算子,以支撑大模型推理、实时图像处理等关键业务。2. AI系统集成与验证:负责自研芯片上AI加速器系统的集成与验证,并搭建与完善算子自动化测试验证平台,确保代码的工程化质量与高效落地。3. 嵌入式与算法软件交付:参与高实时性、高算力的嵌入式软件平台与通用机器人操作系统的设计与交付。 4. 前沿算法探索与实现:参与自动驾驶/机器人算法(如识别、规划、导航、多模态大模型等)的设计、交付与优化。 5. 全栈生态建设:深度参与从芯片需求到架构设计的转换,并为建设高性能计算软件栈的生态做出贡献。 职位要求 1. 硕士及以上学历,计算机、电子、软件、通信、自动化、数学等相关专业。2. 精通 C/C++ 与 Python,熟悉Linux开发环境,掌握gprof/perf等性能剖析工具,具备扎实的数据结构与算法基础和良好的软件工程习惯。 3. 具备极强的学习能力、良好的沟通协调能力和团队合作精神。4. 核心技术要求 (满足以下至少一项): * 高性能计算:理解GPU架构(如SM/Tensor Core/Memory Hierarchy)及CUDA编程模型(Kernel/Thread Hierarchy/Stream),了解并行计算、缓存优化、向量化指令集(AVX/NEON)等知识。* 深度学习工程化:熟悉深度学习模型从训练到部署的全流程,对CUDA、PyTorch/TensorFlow、ONNX Runtime以及Transformer、VLM等流行模型架构有一定了解。 * 底层系统软件:对CPU体系结构、操作系统原理、Linux驱动和应用有较深入的理解。加分项 (有以下经验者优先):1. 有CUDA/OpenCL/ROCm等异构计算平台的算子开发与性能优化经验(课程设计、实验室项目、相关竞赛或开源贡献。2. 熟悉深度学习框架底层,如PyTorch
模型优化工程师 上海 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1. 负责AI模型的网络级压缩与优化,涵盖量化(QAT/PTQ)、投机采样(Speculative Decoding)、Token压缩、知识蒸馏等技术; 2. 针对大小模型设计并实现差异化量化方案,如小模型的KL散度、Percentile、AdaRound等,大模型的SmoothQuant、AWQ等; 3. 参与模型网络结构的优化与重构,将现有网络的算子、Block替换为高效、硬件友好的架构; 4. 参与模型训练与微调,能够复现、分析并改进前沿模型结构; 5. 与硬件团队紧密合作,提供模型优化视角的硬件设计建议,推动下一代芯片对新型算子与网络结构的支持。 职位要求 1. 计算机科学、人工智能、数学等相关专业硕士及以上学历;2. 深入理解模型量化技术(PTQ/QAT),至少熟悉一种小模型或大模型量化方案,并有实际部署经验;3. 熟悉大模型推理优化技术,如投机采样、Token剪枝、稀疏化等;4. 具备较强的模型训练与复现能力,能够阅读论文并快速实现网络结构改进;5. 了解芯片计算特性;6. 代码能力强,熟练使用PyTorch/TensorFlow等框架,熟悉底层算子开发(如CUDA kernel)者更佳。 投递...
图形AI渲染工程师 上海 校招 正式 软件研发类 2027届校园招聘计划 职位描述 一、AI 渲染算法研究与工程化1. 神经超分辨率(Neural Super Sampling):参与 NSS / XSR / DLSS 类算法在移动 GPU 的移植与优化,覆盖游戏(原神、王者、和平精英、绝区零)与系统 UI 场景;2. 神经插帧(Neural Frame Generation):参与 NFRU / AIFI / DLFG 类算法研究,实现 60→120fps 补帧,兼顾延迟与画质;3. 神经降噪与光追加速:Neural Denoiser、ReSTIR、Neural Irradiance