NVIDIA is seeking for an experienced Software Engineer with a strong background in networking and virtualization technologies. This full-time position requires close collaboration with other NVIDIA SW and SW architecture teams, pre-sale teams and different industry
NVIDIA has been redefining computer graphics, PC gaming, and accelerated computing for more than 25 years. Today, we lead in artificial intelligence, driving advances in natural language processing, computer vision, autonomous systems, and scientific research. We
We are looking for a networking test engineer with strong system‑level debugging skills to join our End‑to‑End Verification team. You will work on cutting‑edge Ethernet‑based AI clusters, owning complex issues across hardware, system software and AI
NVIDIA is seeking for an experienced Software Engineer with a strong background in networking and virtualization technologies. This full-time position requires close collaboration with other NVIDIA SW and SW architecture teams, pre-sale teams and different industry
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
We are the GPU Communications Libraries and Networking team at NVIDIA. We deliver communication libraries like NCCL & NVSHMEM for Deep Learning and HPC. DL and HPC applications have a huge compute demand already and run
NVIDIA is a world‑leading, fast‑growing AI computing company, delivering everything from the most powerful GPU‑accelerated supercomputers to gigawatt‑scale AI data centers. We build and optimize end‑to‑end GPU server platforms that combine accelerated computing, high‑performance networking, and
As a Senior Agent Infrastructure Network Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving DPU/SmartNIC-based North-South network architecture strategy, Agent-aware
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA is the world leader in GPU Computing. We are passionate about markets include gaming, automotive, professional vision, HPC, datacenters and networking in addition to our traditional OEM business. NVIDIA is also well positioned as the
NVIDIA is seeking for an experienced Software Engineer with a strong background in networking and virtualization technologies. This full-time position requires close collaboration with other NVIDIA SW and SW architecture teams, pre-sale teams and different industry
大模型训练框架工程师-2027届 北京、上海 校招 正式 研发 - 算法 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。 投递...
大模型训练框架工程师-2028届 北京、上海 校招 实习 研发 - 算法 2028届实习生招聘 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。
大模型训练框架工程师-日常实习 北京、上海 校招 实习 研发 - 算法 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。 投递...
训练推理优化算法工程师(Mstar) 北京、苏州、上海、深圳 Mstar计划 职位描述 负责Momenta自动驾驶大模型、世界模型的分布式训练推理框架研发,主要包括:1、参与设计、研发、维护团队内部的模型分布式训练框架,擅长分析并深度优化训练各个阶段的性能瓶颈,包括计算效率、通信延迟、显存占用等;2、结合不断迭代的模型算法逻辑,设计并实现针对性的高效分布式并行训练策略;3、深入研究 CUDA、NCCL、RDMA 等编程范式和通信库,针对团队内部的GPU和集群拓扑约束,开发高性能算子 并 优化分布式通信效率,达到行业SOTA水平;4、深入研究低精度混合精度训练策略,在保证模型精度满足预期的情况下,探索低精度(FP8、FP4)训练的性能极限;5、配合算法需求,开发RL训练框架、迭代RL训练算法逻辑,优化在线Rollout推理性能,深度优化分布式On-Policy/异步RL训练效率。 职位要求 学历背景: 计算机相关专业硕士及以上学历,具备扎实的理论基础和强大的动手能力;编程能力:- 熟悉 Python/C++/CUDA/CUTLASS/Triton编程,熟悉PyTorch框架及其底层实现;- 熟悉分布式系统开发与调试,熟悉分布式通信开发NCCL/RDMA/IB/RoCE,有多进程调度与并行算法优化经验者优先;训练与推理经验:- 熟悉大模型结构与算法(LLM/VLM/VLA/DiT、MoE架构、各种RL算法等);- 熟悉分布式训练/推理的常用策略(DP/TP/PP/EP/CP、recompute、offloading、PD分离等);- 有主流开源分布式训练框架(如Megatron-LM、DeepSpeed、VeRL)或推理框架(如SGLang、vLLM)的深度二次开发与优化经验。 投递...
机器人高性能通信工程师 急招 深圳、上海 全职 智能机器人板块 职位描述 负责人形机器人内部和外部通信系统的架构设计与性能优化,保障多芯片、多设备间的高速可靠数据传输。1、设计和实现机器人内部多芯片(XP5-A/B/C、HRU)之间的高性能以太网通信架构,保障控制指令和传感器数据的低延迟传输;2、深度优化机器人在 5G、WiFi 等无线网络环境下的通信性能,解决网络适配、带宽瓶颈、信号稳定性等问题;3、设计和开发 DDS Bridge 系统,支持 WebSocket/UDP/WebRTC 等多协议到 DDS 总线的高效桥接;4、主导无线图传系统的架构设计与延迟优化(端到端采集→编码→传输→解码→渲染),支撑遥操作和远程监控场景;5、制定通信协议规范和测试标准,建立通信链路的自动化测试和监控体系。 职位要求 1、本科及以上学历,计算机、通信工程、电子工程等相关专业;2、精通 TCP/IP 协议栈,具备 3 年以上网络通信系统开发经验;3、熟悉 DDS(FastDDS/CycloneDDS/自研 xDDS)或类似发布-订阅中间件;4、有以下至少一项深入经验:- 实时音视频传输(WebRTC/RTP/H.264/H.265 编解码);- 高性能网络编程(epoll/io_uring/DPDK/RDMA);- 无线网络优化(5G/WiFi 6/蓝牙);5、精通 C/C++,熟悉 Linux 网络子系统。加分项:- 有机器人或自动驾驶系统的通信架构设计经验;- 熟悉 EtherCAT 工业通信协议;- 有端到端延迟优化实战经验(目标
Summary: Plans, designs, develops and tests software systems or applications for software enhancements and new products including cloud-based or internet-related tools. Most companies should be able to match to a specific software development engineer position. Use
2027校招-通信库开发工程师(北京/上海/成都) 北京、成都、上海 校招 正式 职位描述 负责 GPU 集合通信库开发与优化,服务大模型分布式训练。主要工作维护 / 二次开发 NCCL,调优 All‑Reduce、All‑Gather 等集合通信算子;RDMA、IB、以太网多链路性能调优,解决多机多卡通信瓶颈;定位分布式训练中的通信报错、超时、性能低下问题;对接 PyTorch/TensorFlow 协作对象:训练、推理、GPU 驱动、集群运维。 职位要求 精通 C/C++、Linux 开发调试,掌握计算机网络、体系结构,了解 GPU 编程、CUDA,熟悉集合通信、RDMA 优先。懂 NCCL 源码、分布式训练框架者加分,侧重性能优化与问题排查能力。 投递...
At Roche you can show up as yourself, embraced for the unique qualities you bring. Our culture encourages personal expression, open dialogue, and genuine connections, where you are valued, accepted and respected for who you are,
Joining NVIDIAs DGX Cloud Team means contributing to the infrastructure that powers our innovative AI research. This team focuses on optimizing efficiency and resiliency of AI workloads, as well as developing scalable AI and Data infrastructure