NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA is seeking Software Performance Architects to optimize GPU kernel performance for state-of-the-art data-center platforms. We build automated, data-driven workflows to detect, explain, and prevent performance regressions across key deep learning workloads, partnering closely with kernel developers, compiler
Were looking for outstanding AI systems software engineers to develop groundbreaking technologies across the inference systems software stack. Our team builds core AI systems software that accelerates high-impact workloads on NVIDIA GPUs, from deep learning primitives
具身智能算法工程师(训练效率方向)-觅蜂子公司 上海 校招 正式 技术族 - 算法类 职位 ID:A11632 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责具身智能训练效率的度量、分析与系统性优化,覆盖预训练与后训练全链路。2. 深入理解不同模型架构(Transformer / Diffusion / Flow Matching 等)与训练算法(IL/RL/BC 等)的计算特性,针对性设计优化方案。3. 构建训练效率监控体系,包括 GPU 利用率、训练吞吐、通信效率、数据加载延迟等核心指标的可视化与自动化追踪。4. 模型训练效率优化:算子融合、CUDA graph、kernel 调优等,提升单卡和多卡计算效率。5. 并行与通信效率优化:梯度同步、云边通信、权重分发等通信开销分析与优化,支撑百台规模训练不退化。6. 数据加载效率优化:数据预处理 pipeline、IO 吞吐优化,消除数据侧瓶颈。 职位要求 1. 计算机、AI 等相关专业硕士及以上学历。2. 具备扎实的 Python/C++/CUDA 编程能力,有
大模型训练框架研发工程师(智能辅助驾驶方向) 上海 社招 全职 数字技术 本科及以上 3-5 年 职位描述 蔚来汽车智能辅助驾驶研发部从平台、架构、工程、算法到运营,建立行业领先的智能辅助驾驶技术自研体系;通过自研AI大模型化技术架构,兼顾单车智能和群体智能,已实现换电、泊车、高速和城区场景的全覆盖。行业唯一大模型化的智能安全辅助系统,也是唯一被行业头部保险公司认证的智能安全。团队在AI驱动的智能辅助驾驶领域拥有长期愿景与决心,研究方向涵盖多模态感知、视觉基模、世界模型、认知计算、人机交互、低速功能等,通过领域协作与持续创新,推动AI技术从实验室走向产业实践,为智能辅助驾驶到物理AI提供高精度、高可靠、高安全的技术支撑。工作职责:负责大模型训练框架的开发、优化、跟踪大模型训练优化前沿技术,并将其应用于智能辅助驾驶大模型的训练;负责智能辅助驾驶模型训练相关的资源及效率优化,深入分析大模型训练瓶颈,从数据处理、模型计算、多机通信、显存优化等多角度全链条开展优化;负责探索并落地 AI Agent 在大模型训练优化中的应用,面向智能辅助驾驶场景构建自动化训练优化能力,包括超参数调优、训练过程监控、异常诊断、性能瓶颈分析与优化建议生成、代码生成合并、评测 Harness等;负责模型训练稳定性工具建设,能在模型训练异常时,通过监控指标及时发现问题原因并解决;从计算专业角度,赋能算法,影响算法设计硬件友好的模型结构。 职位要求 计算机、人工智能等相关专业,硕士及以上学历;熟悉深度学习训练流程,精通Pytorch框架,了解常见模型结构及训练原理;熟练掌握python/C++编程语言,具备扎实的代码能力和数据结构基础;了解常见的深度学习视觉或语言模型;有良好的沟通能力,具有强烈的责任心和团队合作精神;熟悉CUDA kernel/Triton/TileLang研发和优化的优先;熟悉Linux编程,有多线程、内存管理、网络通信等底层经验者优先。 投递...
AI院-推理Infra工程师(量化算法研究/推理框架优化/GPU优化) 北京、上海 全职 互联网 / 电子 / 网游 职位描述 【方向一】量化算法研究员-职位描述通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。-工作内容1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。-职位要求1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。【方向二】推理框架优化工程师-职位描述1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术集成与应用:研究并应用业界前沿的优化技术(如模型量化QAT/PTQ、算子融合、动态形状支持、FlashAttention等),并将其集成至推理/训练引擎。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。【方向三】GPU优化工程师-职位描述利用对 cuda 生态软件和底层体系结构的了解,帮助团队优化训练和推理的计算效率。-工作内容1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率、多流并行协同等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术选型:对 GPU 领域相关的 DSL/编译器(例如 triton/cuteDSL/tilelang)等进行尝试和了解,确定团队内的 DSL/编译器的技术选型,为未来的迭代做好技术储备。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。 职位要求 -
AI院-GLM团队-训练/推理infra算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 岗位职责 1. 与算法团队深度协作,参与 下一代 GLM 大模型架构设计与系统实现 ,推动模型结构与系统效率的协同优化2. 构建 大模型推理成本分析与模拟系统 ,从算力、通信、KV cache、并行策略等维度优化推理效率3. 设计与优化 超大规模训练基础设施(万卡级) ,提升训练稳定性、资源利用率与训练效率4. 探索 MoE、Sparse Attention、长上下文等新架构在训练与推理系统中的高效落地 你将参与 * 下一代 GLM 系列基础模型(百亿到万亿参数级) 的系统设计* 万卡规模训练系统 的优化与稳定性工程* 推理系统的 极致效率优化(吞吐
大模型算法工程Co-Design-2027届 北京、上海 校招 实习 研发 - 算法 2027届校园招聘 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
端到端算法工程师实习生 北京 校招 实习 软件研发类 职位描述 1. Develop quantization, sparsity, pruning, and distillation techniques to enhance the production-level autonomous driving models.2. Optimize, convert, and deploy autonomous driving models (e.g., ONNX models) that operate efficiently on diverse
自动驾驶 - 大模型部署优化算法工程师(实习)-2027届 北京 校招 实习 算法类 职位描述 1. 负责自动驾驶端侧大模型的部署和优化工作2. 参与模型部署&优化工具链的研发3. 对大模型部署优化技术展开研究,并落地到自动驾驶,包括算子实现和优化、投机采样、AI 优化 Kernel 等 职位要求 1. 有参与模型部署优化的经验,有高性能计算经验者优先2. 扎实的(Python/C++)编程基础与良好的工程习惯,熟悉常用的数据结构及算法3. 熟悉 NV GPU 硬件架构与 CUDA 编程模型4. 熟悉 Claude/Codex/OpenCode 等 Agentic Coding 工具 投递...
大模型算法工程Co-Design-日常实习 北京、上海 校招 实习 研发 - 算法 日常实习 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
Sr. Manager, Future Computing Prototyping Studio Description - The Opportunity HP is creating a Shanghai-based Future Computing Prototyping Studio to make the next generation of personal computing tangible on real HP hardware. We are seeking a
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: You will design, implement, optimize, and maintain GStreamer plugins for streaming, hardware-accelerated video/audio encoding & decoding, muxing/demuxing, camera integration, GPU/NPU AI inference, and end-to-end
AI Infra实习生(日常实习) 北京 实习 研发 - 基础架构 千寻智能2025年秋季校园招聘项目 职位描述 1、负责构建支撑具身智能体的核心机器学习系统,开发面向机器人场景的VLA大模型训练与推理系统,支撑多模态感知、运动控制、任务规划等核心能力的持续进化;2、研发新一代具身智能系统工具链,涵盖数据采集、仿真训练、物理部署、持续优化全生命周期。 职位要求 1、计算机、人工智能、软件工程等相关专业,硕士及以上学历,2026年及之后毕业; 2、熟练使用C++/Python/Pytorch/CUDA开发生态,具有嵌入式系统开发经验者优先;3、能至少保障3个月以上的实习时间,每周4天以上出勤;4、加分项:在以下一个或多个领域有深度实践: a. 大模型训练推理:多模态大模型分布式训练、端上推理加速、Transformer模型优化; b. 高性能计算:GPU Kernel编写,高性能通信(NCCL、RDMA),AI编译器(TVM、Triton),模型量化等; c. 机器人系统:ROS2、运动控制算法、传感器数据处理pipeline。 投递...
We are looking to hire an accomplished Senior Engineering Leader for an exciting and fun role in our Compiler and AI System Software organization. We deliver foundational technology to enable NVIDIA systems to make AI workloads
We are now looking for a Deep Learning Performance Software Engineer! We are expanding our research and development for Inference. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize in
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
As a Senior GPU & AI Infra Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving GPU/AI Infra technical strategy, system-level
A key part of NVIDIAs strength is our sophisticated development tools and modelling environments that enable our incredible pace of delivering new technology to market. We are looking for forward-thinking, hard-working, and creative people to join
We are expanding our research and development for Inference. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize in developing GPU-accelerated Deep learning software. Researchers around the world are using