2027校招-GPU驱动软件工程师(北京/上海/成都) 北京、上海、成都 校招 正式 职位描述 负责GPU驱动开发,包括UMD、KMD、FW驱动开发 职位要求 1. 计算机,电子工程,通信或相关专业,本科及以上2. 有嵌入式驱动开发经验3. 熟悉C/C++4. 熟悉操作系统架构(Linux/Unix)5. 了解设备驱动开发,如内存管理, 任务调度等, 有GPU驱动经验尤佳6. 有cuda/hip/opencl/vulkan/opengl/directx等AI驱动或图形驱动开发经验是加分项 投递...
NVIDIA has been defining computer graphics, PC gaming, and accelerated computing for more than 25 years. With an outstanding legacy of innovation, driven by phenomenal technology, and extraordinary people, NVIDIA is looking for a strong technical
AI Infra 工程师 北京 技术 - 算法 本科及以上 职位描述 1、负责大模型推理框架的开发与优化,包括算子优化、显存/KV Cache 管理优化、分布式加速等技术方向; 2、参与高并发场景下的推理性能分析与瓶颈定位,推动改进方案落地; 3、探索低资源下的轻量化推理方案:量化、投机采样、Sparse Attention 等; 4、参与 Disaggregated Serving / PD 分离等新型推理架构的设计与实现; 5、与算法、业务团队协作,推动优化技术在业务中的规模化应用。 职位要求 1、计算机、人工智能、软件工程等相关专业本科及以上; 2、熟悉大模型推理优化方法,对主流开源推理框架(TensorRT-LLM、vLLM、SGLang 等)有开发或深度使用经验; 3、精通 Python/C++ 编程,有 CUDA 开发及 GPU 调优经验者优先; 4、具备良好的系统性能分析能力,熟悉 nsight/nvidia-smi/py-spy 等分析工具者优先。加分项:1、有国产 GPU(如昇腾、昆仑、PPU等)适配与优化经验;2、有 Mooncake
表征算法研究员 北京 全职 博士及以上 职位描述 1. 负责开展表征算法模拟数值优化工作,运用先进算法和模型,不断提升模拟计算的准确性和效率;2. 进行各类复杂的计算任务,为物理研究和项目推进提供精确的数据支持;3. 参与并主导基于原子物理和分子动力学结合先进表征的相关研究课题,深入探索微观世界的物理规律;4. 优化电镜成像模拟算法,提升模拟精度和计算效率。 职位要求 1. 物理学相关领域专业的博士学历,具备扎实的计算能力;2. 精通编程,如 Python、Fortran、C++、CUDA 等编程语言,熟悉GPU加速,可编写大型的计算程序;3. 对原子物理有深入的理解和研究,熟悉相关理论和实验方法;4. 精通第一性原理计算方法和软件,掌握分子动力学基本原理,能够运用分子动力学模拟软件进行相关模拟和分析。5. 有散射物理、高性能计算、并行计算经验者优先。 职位信息 部门: 表征 投递...
2027校招-推理框架工程师(上海/成都/北京) 北京、上海、成都 校招 正式 职位描述 分布式推理系统开发1、设计并实现大规模AI模型(如LLM、多模态模型)的分布式推理框架,优化吞吐量(Throughput)和延迟(Latency)。2、开发模型并行(Tensor/Pipeline Parallelism)、动态批处理(Dynamic Batching)和连续批处理(Continuous Batching)策略。3、解决多节点、多GPU环境下的负载均衡和通信瓶颈问题。4、优化计算图执行(如使用TensorRT、ONNX Runtime、vLLM等工具)。5、实现量化(FP8/INT8)、KV Cache优化、Flash Attention等加速技术。 职位要求 精通 Python/C++,熟悉PyTorch/TensorFlow推理生态。深入理解分布式系统(NCCL/RPC通信、GPU Direct RDMA)和 并行计算(CUDA、OpenMP)。熟悉推理加速技术(量化、剪枝、算子融合)和框架(TensorRT、vLLM 、Sglang)。 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项-
云端训推优化负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 负责云端训练与推理优化团队整体建设和管理,对模型训推效率负责;负责大模型、VLM / VLA、机器人模型等训练任务的性能优化,包括:训练吞吐、GPU 利用率、Tensor Core 利用率、显存利用率、多机多卡扩展效率负责分布式训练优化,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP / ZeRO 等方案设计与落地;负责模型推理优化,包括算子优化、KV Cache、Batching、量化、并行推理及服务化性能优化;针对模型结构和训练流程进行 Profiling,定位通信、计算、显存、IO 等性能瓶颈,并推动系统性优化;负责训练/推理框架和基础组件建设,沉淀可复用的性能优化能力;与模型算法团队协作,在保证模型效果的前提下优化模型结构、训练策略和推理方案;与智算平台团队协作,提升 GPU 集群整体资源利用率,降低单位训练与推理成本;建立训推性能指标体系和 Benchmark,持续跟踪不同模型、硬件和框架下的性能表现。 职位要求 5 年以上深度学习系统、训练加速、推理优化、AI Infra 或相关工作经验,有团队管理经验;熟悉 PyTorch 及主流深度学习训练框架,理解计算图、Autograd、CUDA 执行模型;熟悉大规模分布式训练,有 NCCL、FSDP、DeepSpeed、Megatron-LM 等实际优化经验;对 GPU 架构和性能优化有深入理解,熟悉
NVIDIA is leading company of AI computing. At NVIDIA, our employees are passionate about AI, HPC , VISUAL, GAMING. Our SA team is more focusing to bring NVIDIA new technology into difference industries. We help to
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
We are now looking for an AI Developer Technology Engineer Interns. Intelligent machines powered by AI computers that can learn, reason and interact with people are no longer science fiction. Today, a self-driving car can meander
NVIDIA has been redefining computer graphics, PC gaming, and accelerated computing for more than 30 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
Intelligent machines powered by AI computers that can learn, reason and interact with people are no longer science fiction. Today, a self-driving car can meander through a country road at night and find its way. An
NVIDIA is the world leader in computer graphics, artificial intelligence, and accelerated computing. For over 30 years, we have been at the forefront of research and engineering around the greatest advances in technology. Our history of
At NVIDIA, we’re solving the world’s most ambitious problems with our groundbreaking developments in Artificial Intelligence, High-Performance Computing and Visualization. We are looking for a Developer Relations Manager to work with China industrial/research community to integrate
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA is currently seeking a Solutions Architect for High-Performance Databases! Would you enjoy researching new algorithms and memory management techniques to accelerate databases on modern computer architectures? Do you like investigating hardware and system bottlenecks, and
We are now looking for an AI Developer Technology Engineer Intern. Intelligent machines powered by AI computers that can learn, reason and interact with people are no longer science fiction. Today, a self-driving car can meander
3D生成算法推理优化专家 Beijing Experienced Full-time Responsibilities 1. 负责3D生成大模型、3D AIGC模型的推理优化、性能调优与工业化工程落地,涵盖推理链路重构、服务化适配与生产环境稳定部署;2. 负责3D生成场景全链路推理优化工作,针对Mesh生成、三维重建、UV贴图生成、骨骼动画生成、NeRF等核心场景,解决模型推理延迟高、显存占用大、吞吐低等核心痛点;3. 主导3D大模型推理优化技术方案落地,包括算子优化、推理图编译、量化压缩、显存复用、算子融合、推理精度适配等核心优化工作,持续提升模型推理效率;4. 搭建3D生成模型推理性能评测体系、基准测试流程与自动化监控体系,常态化迭代优化推理性能、稳定性与GPU资源使用效率;5. 负责GPU推理服务、多卡分布式推理、批量推理调度系统的优化与迭代,适配大规模3D资产批量生成的生产业务场景;6. 深度协同算法团队,跟进最新3D生成大模型架构与算法迭代,快速完成新模型的推理适配、优化打磨与生产落地,缩短算法落地周期;7. 负责3D模型推理优化工具链、底层SDK、内部推理优化平台的开发、迭代与维护,沉淀可复用的3D推理优化方案与技术规范。 Qualifications 必备要求1. 3年左右深度学习推理优化、AI模型工程化相关工作经验,计算机、人工智能、图形学相关专业,具备扎实的软件工程与深度学习基础;2. 熟练掌握Python开发,精通Linux环境下模型部署、调试与性能优化,具备独立设计、迭代和维护大规模推理系统的工程能力;3. 具备扎实的3D图形学基础,熟悉主流3D数据结构与处理流程,理解Mesh几何、UV贴图、法线拓扑、骨骼动画、三维点云等核心3D场景特性;4. 精通PyTorch等深度学习框架,熟练掌握模型推理部署与优化核心技术,具备GPU推理性能调优、问题排查、精度对齐实战经验;5. 熟悉以下至少部分核心能力:- 大模型量化、剪枝、蒸馏、推理编译加速- 自定义GPU算子开发、算子优化与适配- 3D生成模型推理链路瓶颈分析与专项优化- 多卡分布式推理、批量调度、显存内存优化- 模型格式转换与推理引擎适配(ONNX/TensorRT等)加分项- 有3D AIGC、3D生成大模型、NeRF三维重建模型推理优化落地经验;- 精通TensorRT、ONNX Runtime、TorchScript等主流推理加速引擎,有工业级大模型推理优化项目经验;- 熟悉CUDA编程、GPU底层架构,具备自定义算子开发、GPU高性能计算优化经验;- 熟悉分布式任务调度与推理架构(Ray/K8s/Celery等),有大规模批量推理系统优化经验;- 熟悉Blender等DCC工具自动化流程、3D资产处理Pipeline;- 熟悉Unity/Unreal等3D引擎资产流程,有端侧/云端3D模型适配优化经验;- 掌握C++开发,有图形学高性能计算、3D几何加速计算相关项目经验;- 熟悉ComfyUI等3D AIGC生态工具,有生成流程优化、插件开发经验。我们希望你- 对3D图形学、3D AIGC与大模型推理优化方向有持续的探索兴趣和长期深耕意愿;- 对推理性能、服务稳定性、工程落地质量有极致追求,注重技术细节与落地效果;- 具备较强的问题攻坚能力、自主学习能力与自驱力,能够独立解决复杂推理优化问题;-
About the Opportunity Personal Connect is recruiting a Senior Confidential Computing Infrastructure Engineer on behalf of an innovative technology company in Beijing. This is a highly specialized infrastructure engineering position focused on building secure environments for