Refine Reset All
Sort by
Company
Employer/Recruiter
Date Posted
Company
Job Title
Location
Job Type
Employer/Recruiter
All Filters

Gpu Cuda Jobs In Shanghai - 85 Job Positions Available

1 – 20 of 85 jobs
Qualcomm jobs

Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Interested in enabling next generation graphics, games, ray tracing, machine learning, image and video processing, even Mars drones? In the GPU Developer Tools team, you

Qualcomm  24 days ago
XPENG jobs

GPU tools高级/资深/专家工程师 上海 全职 芯片板块 职位描述 工作职责:1.负责GPGPU CUDA tools设计开发,比如gpusmi,nsight,trace,debug等工具。2.tools UI开发。3.支持和驱动交互。 职位要求 职位要求:1.一年以上GPU工具开发经验,C/C++编程功底扎实。2.熟悉CUDA工具之一的原理设计和实现。3.熟悉CUDA工具的UI和功能。4.工作积极主动,良好的分析和解决问题能力 投递...

Premium Full-time CUDA
XPENG  19 days ago
XPENG jobs

GPU驱动高级/资深/专家工程师 上海 全职 芯片板块 职位描述 工作职责:1.负责xpu的linux内核态或用户态驱动程序的设计开发2.高性能AI异构计算的性能分析与定位3.driver相关工具的设计开发职位要求:1.3年以上GPU驱动开发经验,C/C++编程功底扎实2.熟悉CUDA,HIP等GPU编程API3.熟悉GPGPU架构4.工作积极主动,良好的分析和解决问题能力 职位要求 - 投递...

Premium Full-time
XPENG  19 days ago
Nvidia jobs

NVIDIA is the world leader in GPU Computing. We are passionate about markets including Data centers, Gaming, Professional vision, Automotive, HPC and networking. We are well positioned as the “AI Computing Company”, and our GPUs are the

Nvidia  16 days ago
Nvidia jobs

NVIDIA is the world leader in GPU Computing. We are passionate about markets including Data centers, Gaming, Professional vision, Automotive, HPC and networking. We are well positioned as the “AI Computing Company”, and our GPUs are the

Nvidia  16 days ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential

Nvidia  9 days ago
NIO jobs

AI算子开发工程师 杭州、合肥、上海、深圳 社招 全职 数字技术 - 算法 本科及以上 1-3 年 职位描述 职位描述:1.负责AI处理器的高性能算子方案设计,功能开发,性能优化工作;2.负责算子自测试用例的设计和开发,保证算子的质量提升和 CI 看护;3.探索AI高性能算子的软硬件协同优化方案,提升硬件的利用效率4.开发算子库开发所需的功能和性能分析工具,提升算子库开发效率 职位要求 岗位要求:1.熟悉C/C++、python编程,有较好的编程习惯和编程基础;2.熟悉常用数据结构及算法,如堆/栈/队列/树/图等;有如下经验优先考虑:1.熟悉常用NN算子的实现方式,有算子开发和优化经验,包括Conv,DeConv,激活,Pool,Attention等;2.有计算机体系结构背景,熟悉芯片架构/微架构(包括CPU/GPU/SoC/FPGA等),有软硬件协同设计经验;3.熟悉GPGPU硬件架构,熟悉CUDA,熟悉cuDNN,有深度学习计算框架优化经验尤佳;4.有复杂算法(如图像与视频处理、计算机视觉等)CUDA/OpenCL/汇编级优化经验尤佳; 投递...

Premium Full-time
NIO  13 days ago
NIO jobs

智能辅助驾驶算法工程岗位 - 模型训练方向 AD内推 上海 社招 全职 数字技术 本科及以上 3-5 年 职位描述 我们希望找到一位兼具算法理解与工程落地能力的同学,加入智能辅助驾驶核心研发团队,共同建设高可靠、高性能的车云协同链路体系。您将参与从算法模块设计、工程集成、系统优化到车端实车部署的全流程,面对真实场景、真实挑战,构建支撑量产智能辅助驾驶产品的关键基础设施。该岗位将与端侧、大模型、规划、仿真、云平台等多个团队协作,因此需要你具备跨模块协作能力和扎实的系统工程素养。主要职责:1. 算法模块集成与实车部署- 深度参与智能辅助驾驶诸多算法模块的集成与工程化改造- 开发统一集成算法模块的工程链路,并可跨平台(arm/x86)部署,支持链路快速调试和部署- 对接云端与仿真验证体系,建设统一的车云工程体系2. 车云链路系统设计与性能优化- 负责车云链路集成架构的设计,开发与迭代,包括数据格式、调度机制等- 持续优化链路时延、吞吐与系统稳定性,保障算法模块在车端的高可靠运行- 解决车云链路中的高并发、数据一致性,跨版本伴生下发等诸多工程难题3. CI/CD 与自动化质量体系建设- 构建稳定可靠的 CI/CD 流程(构建、编译、自动部署、回归验证)- 设计多层级的拦截系统,拦截所有上车模块的质量问题- 设计工程质量度量体系,提升整个团队的交付效率与代码质量4. 工程质量与系统级问题攻关- 推进 C++/Python 工程规范、性能 profiling、内存、日志管理优化等专项工作- 参与定位和解决系统级崩溃、性能瓶颈、线程安全、内存泄漏等复杂问题- 主导关键模块的工程重构,使系统具备可扩展性、可维护性 职位要求

NIO  13 days ago
NIO jobs

智能辅助驾驶-系统集成工程师 AD内推 蔚来自动驾驶研发团队 北京、上海 社招 全职 数字技术 - 软件研发 本科及以上 5-7 年 职位描述 主要职责:1. 算法模块集成与实车部署- 深度参与智能辅助驾驶驾驶诸多算法模块的集成与工程化改造- 开发统一集成算法模块的工程链路,并可跨平台(arm/x86)部署,支持链路快速调试和部署- 对接云端与仿真验证体系,建设统一的车云工程体系2. 车云链路系统设计与性能优化- 负责车云链路集成架构的设计,开发与迭代,包括数据格式、调度机制等- 持续优化链路时延、吞吐与系统稳定性,保障算法模块在车端的高可靠运行- 解决车云链路中的高并发、数据一致性,跨版本伴生下发等诸多工程难题3. CI/CD 与自动化质量体系建设- 构建稳定可靠的 CI/CD 流程(构建、编译、自动部署、回归验证)- 设计多层级的拦截系统,拦截所有上车模块的质量问题- 设计工程质量度量体系,提升整个团队的交付效率与代码质量4. 工程质量与系统级问题攻关- 推进 C++/Python 工程规范、性能 profiling、内存、日志管理优化等专项工作- 参与定位和解决系统级崩溃、性能瓶颈、线程安全、内存泄漏等复杂问题- 主导关键模块的工程重构,使系统具备可扩展性、可维护性

NIO  13 days ago
Nvidia jobs

We are looking for a Software Test development engineer in NVIDIA’s AI SWQA team. The position is in NVIDIA AI Software Quality Assurance team that defines, develops and performs tests to validate robustness and measure the

Nvidia  13 days ago
ZERON 零一汽车 jobs

大模型优化与高性能计算实习生 上海 实习 职位描述 针对自动驾驶端到端+多模态大语言模型的训练及推理速度优化,以及在车端计算平台的部署。车载计算节点(CPU/GPU)的性能优化,包括系统分析、内存优化、算子开发等。智能驾驶车载系统相关模块开发,构建高可靠性、低延迟的车载计算平台。 职位要求 具有计算机,电子信息,自动化,深度学习,高性能计算等相关领域硕士学历。精通Python/C++/CUDA编程以及PyTorch深度学习框架, 熟练掌握TensorRT-LLM/vLLM/ONNX等推理框架和工具。熟悉CPU/GPU profiling工具,熟练掌握模型计算图优化、编译优化、内存优化技能,对新技术充满热情。有自动驾驶经验,ACM/ICPC竞赛并获奖者优先。具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...

Premium Full-time
ZERON 零一汽车  13 days ago
ZERON 零一汽车 jobs

系统集成工程师 上海 全职 职位描述 工作职责:1、 负责自动驾驶算法、功能模块的集成实现、工程化改造与实车部署,开发支持跨平台(x86/arm)的统一工程链路,并确保链路可快速调试与部署。2、负责车云链路集成架构的设计、开发与迭代,优化链路时延、吞吐与稳定性,解决高并发、数据一致性等工程难题。3、负责构建稳定可靠的CI/CD流程与自动化质量体系,设计多层级的质量拦截系统与工程质量度量体系,提升团队交付效率与代码质量。4、推进工程规范、性能优化、内存与日志管理等专项工作,定位并解决系统级崩溃、性能瓶颈、线程安全等复杂问题,主导关键模块的工程重构。 职位要求 职位要求:1、具有计算机、电子信息、自动化、软件工程等相关学科本科/硕士学历。2、熟练掌握Linux开发环境,熟悉常用构建、调试与性能工具;熟练使用Git/GitLab CI等研发流程。3、扎实掌握C++编程,熟悉C++11/14/17/20标准,理解内存模型、智能指针、多线程编程,熟悉STL与现代模板编程。4、扎实掌握Python编程,熟悉多进程/多线程/协程模型,理解Python虚拟机、GIL、对象模型及内存管理机制。5、具有良好的工作态度、团队合作精神、主观能动性和沟通能力。符合以下条件者优先:1、具备高性能计算、CUDAGPU加速相关经验;2、拥有大规模C++工程架构设计与模块化开发经验;3、熟悉JPerf、SonarQube、ASan/TSan、Perf、VTune等性能与质量工具;4、熟悉视频编解码、图像传输链路优化;5、了解LLM或多模态模型在自动驾驶中的应用;6、具有自动驾驶、机器人或实时系统项目经验。 投递...

Premium Full-time
ZERON 零一汽车  13 days ago
ZERON 零一汽车 jobs

大模型部署和加速工程师 上海 全职 职位描述 1、负责自动驾驶多模态大模型在车端的性能优化,包括模型量化、剪枝、蒸馏、投机解码等加速方法,以充分利用车端计算硬件。2、负责自动驾驶核心软件架构的研发、模型部署和系统优化,确保软件高效、鲁棒、跨平台运行。3、负责高性能算子的研发,挖掘算力潜能,支撑模型性能持续提升。 职位要求 1、具有计算机、人工智能、电子信息、自动化等相关学科本科/硕士学历。2、具备以下一项或多项经验: 多模态模型优化经验,熟悉VLM、VLA、DiT等模型的轻量化部署与加速方法,具备量化、剪枝、蒸馏、投机解码等实战经历; 精通CUDA并行计算与高性能算子开发,或具备GPU/NPU性能分析与调优经验;精通C++及Python编程,熟悉Linux和ROS平台开发。3、具有良好的工作态度、团队合作精神、主观能动性和沟通能力。 投递...

Premium Full-time
ZERON 零一汽车  13 days ago
ZERON 零一汽车 jobs

自动驾驶软件开发工程师 上海 全职 职位描述 -自动驾驶核心车载软件系统的开发,包括车载基础系统研发,中间件开发,系统节点开发,性能分析与优化等。-自动驾驶数据闭环管线开发,包括数据上传,数据挖掘,数据库开发,数据评测系统研发等。-自动驾驶系统集成,智驾测试,文档编写,数据传输,故障诊断等。 职位要求 -具有电子信息,自动化,计算机,机器人等相关学科本科/硕士学历。-具有自动驾驶相关行业经验。-精通C++及Python编程,熟悉Linux和ROS平台开发。-具有CPU和GPU优化相关经验,熟悉CUDA/Pytorch/TensorRT者优先。-具有良好的工作态度,团队合作精神,主观能动性和沟通能力。 投递...

Premium Full-time
ZERON 零一汽车  13 days ago
MiniMax jobs

MaaS 架构师 上海、北京 社招 全职 互联网 / 电子 / 网游 - 研发 职位描述 作为 MaaS 架构师,你将全面负责大模型线上服务的全链路架构设计与质量保障,构建高性能、高可用、可弹性伸缩的模型服务平台,确保模型在生产环境中的 SLA、延迟、吞吐量达到业界领先水平。工作包括不限于:负责 MaaS 平台架构设计,明确模型从产出到上线的全链路环节,对模型服务的 SLA、延迟、吞吐量等核心指标负责主导大模型推理网关的设计与建设,包括多模型路由、流量调度、优先级队列、多租户隔离与 Token 级计量能力设计 GPU 资源弹性伸缩策略,结合模型特征与负载信号实现智能调度与资源高效利用推动 KV Cache 感知调度的方案设计与落地,包括 Prefix Caching、Paged Attention 等技术在生产环境的应用,提升显存利用率与系统吞吐参与单机推理框架的选型、适配与性能调优,跟进 vLLM / TensorRT-LLM / SGLang 等主流引擎的演进,推动

MiniMax  27 days ago
Nvidia jobs

We are now looking for a Senior AI Training Performance Engineer! NVIDIA is seeking senior engineers who are obsessed with performance analysis and optimization to help us squeeze every last clock cycle out of AI training,

Nvidia  25 days ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential

Nvidia  24 days ago
Nvidia jobs

Were looking for outstanding AI systems software engineers to develop groundbreaking technologies across the inference systems software stack. Our team builds core AI systems software that accelerates high-impact workloads on NVIDIA GPUs, from deep learning primitives

Nvidia  25 days ago
智元创新(上海)科技有限公司 jobs

优才-模型推理AI Infra开发工程师-中央研发部 上海、北京 正式 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架 投递...

智元创新(上海)科技有限公司  25 days ago
智元创新(上海)科技有限公司 jobs

优才-训练AI Infra系统优化工程师-中央研发部 上海、北京 正式 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战 投递...

Premium Full-time PyTorch
智元创新(上海)科技有限公司  25 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

gpu cuda jobs in shanghai

You also might be interested in:

Software Engineer

AI

实习生

PyTorch

Python

Deep Learning

Computing

Software Engineering

Kernel

C++

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Company
Employer/Recruiter