Refine Reset All
Sort by
Job Title
Job Type
Employer/Recruiter
Experience
Date Posted
Job Title
Location
Job Type
Employer/Recruiter
Experience
All Filters

Gpu Cuda Jobs In Beijing (Peking) - 35 Job Positions Available

1 – 20 of 35 jobs
NIO jobs

高性能计算工程师(CUDA方向) AD内推 蔚来自动驾驶研发团队 北京 社招 全职 数字技术 - 软件研发 本科及以上 3-5 年 职位描述 岗位职责: 基于 NVidia GPU 架构特性,完成深度学习算子,CV 、点云计算库的开发及优化 职位要求 基本要求:1、计算机、软件工程、自动化等相关专业硕士及以上;2、熟悉 Nvidia GPU 体系结构,理解CUDA与硬件底层映射关系,掌握 CUDA 编程模型,熟悉常用 CUDA 优化方法,熟悉基于 TensorCore 编程方法; 3、熟悉常用算法、数据结构,有较强的 C/C++ 编程能力; 5、具备 C/C++和CUDA程序性能分析、问题定位、调试的能力,掌握对应调试分析工具的使用; 6、良好的编程风格习惯、文档撰写能力,团队沟通协作能力; 加分项1、深入理解计算机体系结构;3、熟悉 cub、cutlass 、cute等计算库; 4、熟悉 PTX/SASS 汇编;5、熟悉国产NPU等加速器 投递...

Premium Full-time CUDA
NIO  13 days ago
小米科技 Xiaomi Technology jobs

大模型后训练与GPU/加速器内核优化实习生 北京 校招 实习 算法类 职位描述 面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。 职位要求 1. 硕士/博士在读,大模型方向;2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。加分项1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。 投递...

小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

Miclaw-大模型训练推理方向实习生 AI人才专项 热招 北京 校招 实习 软件研发类 职位描述 1. 研究并复现业界与学术界 SOTA 的大模型推理优化技术,包括但不限于极低比特量化、FlashAttention、投机解码(Speculative Decoding)、KV Cache 优化等关键方向,并在真实端侧场景中进行性能评估与对比分析。2. 面向端侧算力与内存受限场景,探索高效的大模型结构与推理策略,如端侧友好的 MoE 方案、稀疏与线性注意力、长上下文推理优化等,推动模型在性能、效果与资源消耗之间的最优权衡。3. 参与大模型与芯片协同设计(Model–Chip Co-design),从模型结构、算子设计到推理系统层面进行联合优化,深入理解端侧 NPU / GPU / CPU 架构对模型推理性能的影响。4. 与模型、系统、芯片团队深度协作,将研究成果转化为可落地的工程方案,并有机会参与核心模块的设计与实现,产生可量化的性能提升结果。 职位要求 1. 计算机科学、人工智能、电子工程或相关专业在读本科 / 硕士 / 博士,对大模型、系统或芯片方向有强烈兴趣。2. 具备扎实的算法与系统基础,对复杂系统的性能瓶颈具有较强分析能力,愿意深入到实现细节解决“难而重要”的问题。3. 至少在以下一个或多个方向具备良好基础或实践经验:- 大模型推理与优化(Attention、KV

小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

自动驾驶 - 大模型部署优化算法工程师(实习)-2027届 北京 校招 实习 算法类 职位描述 1. 负责自动驾驶端侧大模型的部署和优化工作2. 参与模型部署&优化工具链的研发3. 对大模型部署优化技术展开研究,并落地到自动驾驶,包括算子实现和优化、投机采样、AI 优化 Kernel 等 职位要求 1. 有参与模型部署优化的经验,有高性能计算经验者优先2. 扎实的(Python/C++)编程基础与良好的工程习惯,熟悉常用的数据结构及算法3. 熟悉 NV GPU 硬件架构与 CUDA 编程模型4. 熟悉 Claude/Codex/OpenCode 等 Agentic Coding 工具 投递...

小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

自动驾驶 AI 部署工具链研发实习生 北京 校招 实习 软件研发类 职位描述 1、负责自动驾驶深度学习模型部署和优化工作2、基于车载异构硬件对模型进行部署及优化3、参与模型部署工具链、算子库开发 职位要求 1、本科及以上学历,扎实的编程基础与良好的工程习惯2、优秀的编程能力,掌握 Python、C++、Cuda 等编程语言3、熟悉 Pytorch 框架、AI 模型导出及部署流程者优先4、熟悉常见的深度学习推理编译框架者优先,如:TensorRT、TVM、MLIR5、熟悉 GPU 硬件架构及软件优化者优先 投递...

Premium Full-time PyTorch AI
小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

大模型研究和工程实习生-MiMo 北京 校招 实习 算法类 职位描述 1.创新模型结构设计: - 参与大型语言模型核心架构设计与优化 - 探索Transformer及其变种的改进方案2. 原生多模态探索: - 研发原生多模态架构,实现文本、图像、音频等模态信息的深度融合 - 研究多模态对齐技术,实现不同模态的语义一致性3. 模型推理能力提升: - 借助强化学习+CoT,提升大语言模型推理能力 - 自研强化学习算法,搭建强化学习训练框架,设计奖励函数、构建环境、优化模型提升性能4. 大模型训练推理Infra - 开发和优化大规模分布式训练推理系统 - 优化大模型训练的内存使用和通信效率5. 科学评测体系构建: - 构建科学严谨的算法评测方法,系统评估模型的性能 - 探索模型能力的潜在机制,推动模型优化和创新 职位要求 职位要求1. 学术能力: - 精通深度学习、强化学习(RL)、自然语言处理(NLP)等领域,具备创新研究能力

Premium Full-time
小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

高性能计算实习生 北京 校招 实习 算法类 职位描述 1、负责深度学习模型在车载平台上加速和调优,设计基于GPU和自研芯片的高性能算法基础库,支持下游各个算法研发;2、负责自动驾驶系统的核心算法的实现,配合算法研究员完成算法的落地与部署工作,并在代码与指令集层面优化算法运行效率。3、负责大规模分布式训练系统的设计与调优,提升模型训练的效率与吞吐率 职位要求 1、熟悉CUDA工作原理,能独立完成代码热点分析并制定优化方案。2、良好的编程能力,熟悉python,c++,掌握常见的算法和数据结构知识;3、良好的工程能力,有较强的的代码结构设计能力,熟练使用git、ssh,cmake等工具。加分项1、ACM/ICPC、CCPC、NOI、IOI等计算机/信息学竞赛获奖经历。2、有自研NPU部署和优化的经验3、有大规模分布式训练系统设计和优化的经验 投递...

Premium Full-time
小米科技 Xiaomi Technology  27 days ago
小米科技 Xiaomi Technology jobs

训练平台性能优化工程师实习生 北京 校招 实习 软件研发类 职位描述 深度优化训练流程 主导模型训练全链路性能分析与优化,设计GPU资源弹性调度策略 开发自动化训练加速工具链,构建可扩展的云端训练框架 研发混合精度训练、梯度压缩等前沿技术,突破训练吞吐瓶颈构建训练优化体系 制定标准化训练效能评估体系,建立成本-效率量化模型 设计可复用的训练加速组件库,沉淀最佳实践方法论 开发训练过程性能分析平台,实现性能问题智能诊断赋能业务研发 优化多任务资源调度策略,提升GPU集群整体利用率 为算法团队提供训练加速解决方案,缩短模型迭代周期 职位要求 1.精通深度学习训练加速技术,熟悉分布式训练框架设计2.掌握CUDA编程及GPU性能分析工具(nsys/torch profiler)3.熟练使用PyTorch框架,具备训练流程优化实战经验4.熟悉常见模型压缩技术(量化/剪枝/蒸馏)及落地应用5.具备大规模集群资源调度系统开发经验者优先【技术加分项】1.有mmcv//deepspeed/megatron/ray等训练框架开发经验2.算子优化经验,triton/cuda等开发经验.3.熟悉MPI/NCCL等分布式通信协议4.在MLSys/ICLR等顶会发表过训练优化相关论文 投递...

小米科技 Xiaomi Technology  25 days ago
小米科技 Xiaomi Technology jobs

端到端算法工程师实习生 北京 校招 实习 软件研发类 职位描述 1. Develop quantization, sparsity, pruning, and distillation techniques to enhance the production-level autonomous driving models.2. Optimize, convert, and deploy autonomous driving models (e.g., ONNX models) that operate efficiently on diverse

小米科技 Xiaomi Technology  19 days ago
小米科技 Xiaomi Technology jobs

训练平台性能优化工程师实习生-2027届 北京 校招 实习 软件研发类 职位描述 深度优化训练流程 主导模型训练全链路性能分析与优化,设计GPU资源弹性调度策略 开发自动化训练加速工具链,构建可扩展的云端训练框架 研发混合精度训练、梯度压缩等前沿技术,突破训练吞吐瓶颈构建训练优化体系 制定标准化训练效能评估体系,建立成本-效率量化模型 设计可复用的训练加速组件库,沉淀最佳实践方法论 开发训练过程性能分析平台,实现性能问题智能诊断赋能业务研发 优化多任务资源调度策略,提升GPU集群整体利用率 为算法团队提供训练加速解决方案,缩短模型迭代周期 职位要求 1.精通深度学习训练加速技术,熟悉分布式训练框架设计2.掌握CUDA编程及GPU性能分析工具(nsys/torch profiler)3.熟练使用PyTorch框架,具备训练流程优化实战经验4.熟悉常见模型压缩技术(量化/剪枝/蒸馏)及落地应用5.具备大规模集群资源调度系统开发经验者优先【技术加分项】1.有mmcv//deepspeed/megatron/ray等训练框架开发经验2.算子优化经验,triton/cuda等开发经验.3.熟悉MPI/NCCL等分布式通信协议4.在MLSys/ICLR等顶会发表过训练优化相关论文 投递...

小米科技 Xiaomi Technology  19 days ago
度小满科技(北京)有限公司 Du Xiaoman Technology jobs

AI infra工程师 北京 技术 - 算法 硕士及以上 小满星AGI顶尖人才专项 职位描述 1、利用算子优化,显存/KV cache管理优化、分布式加速等技术开发和改进推理框架;2、参与高并发场景下大模型推理的性能分析与优化工作,定位系统瓶颈并提出改进方案;3、探索低资源下的大模型轻量化方案:量化、投机采样、sparse attention等技术;4、与团队协作,推动优化技术在业务中的应用。 职位要求 1、计算机、人工智能、软件工程等相关专业硕士及以上;2、熟悉大模型推理优化方法,对主流开源推理框架tensorRT_llm、vllm、sglang 有开发经验者优先;3、精通 Python/C++ 编程,具有 CUDA 开发及 GPU 调优经验者优先;4、有顶会论文、竞赛获奖或相关实习经验者优先;5、有infra相关实习经验者优先。 职位信息 部门: 智能技术发展部 投递...

Premium Full-time CUDA AI
度小满科技(北京)有限公司 Du Xiaoman Technology  19 days ago
XPENG jobs

大模型训练加速工程师 / 高级专家 北京 全职 通用智能板块 职位描述 【岗位职责】训练加速与优化: 负责大模型训练场景下的性能分析 (Profiling) 与全链路优化,包括显存管理、计算加速及通信优化 (NCCL),提升集群训练吞吐率。算子开发与协同设计 (Co-design): 负责高性能算子 (Kernel) 的开发与调优;与算法团队紧密协作,针对特定模型结构(如 Transformer, MoE)进行定制化算子设计。分布式框架建设: 基于 Megatron-LM, DeepSpeed, FSDP 等框架进行二次开发与优化,设计适应大规模集群的并行训练方案。稳定性保障: 负责大规模训练过程中的问题定位与解决,包括但不限于 NCCL 超时、显存溢出 (OOM)、训练速度波动等,保障训练任务的高效稳定运行。 职位要求 理论基础: 计算机基础扎实,深刻理解深度学习训练原理(计算图、自动微分、混合精度),熟悉主流并行策略及 FlashAttention 等加速算法。编程能力: 熟练掌握 Python/C++,熟悉 GPU 编程模型,具备 CUDA /

XPENG  19 days ago
XPENG jobs

【27届校招】 软件工程师(自动驾驶仿真) 广州、北京 正式 研发 - 算法 通用智能板块 职位描述 岗位职责研发和优化小鹏汽车核心自动驾驶仿真模拟器平台,为算法研发、模型训练、评测验证提供高效迭代的平台能力和工程支撑;面向下一代基于人工智能的全套自动驾驶系统,建设模拟器训练与评测支撑平台,支撑模型迭代和系统验证;负责仿真引擎功能开发,搭建和维护大模型推理链路,提升仿真链路的稳定性、吞吐效率和易用性;基于 Python / C++ 开发仿真平台工具链、自动化流程、数据处理与分析工具,提升研发效率和问题定位效率;探索并落地 Agent 在自动驾驶仿真研发中的应用,包括仿真任务自动提交、结果自动分析、问题归因、报告生成和研发流程自动化等方向; 职位要求 职位要求:计算机、软件工程、自动化、电子工程等相关专业,本科及以上学历,硕士优先;熟悉 Linux 系统,具备扎实的 C++ 面向对象编程基础,理解常见工程设计模式和性能优化方法;熟悉 Python 开发,能够使用 Python 完成工具链开发、数据处理、自动化脚本、服务接口开发或算法工程辅助开发;具备一定的软件工程能力,熟悉调试、性能分析、问题定位、代码优化和工程化交付流程;了解模型推理部署与优化相关技术者优先,包括 ONNX、TensorRT、PyTorch、CUDAGPU 推理性能优化、批处理、并发调度等;了解 Agent、LLM 应用开发、RAG、工具调用、自动化工作流等相关技术,并有实际落地经验者优先;具有自动驾驶、仿真平台、机器人、控制、规划、感知、电子工程相关背景者优先;具备较强的问题分析能力、工程落地能力和跨团队沟通协作能力。 投递...

XPENG  16 days ago
Nvidia jobs

At NVIDIA, we’re solving the world’s most ambitious problems with our groundbreaking developments in Artificial Intelligence, High-Performance Computing and Visualization. We are looking for a Developer Relations Manager to work with China industrial/research community to integrate

Nvidia  16 days ago
Nvidia jobs

At NVIDIA, we’re solving the world’s most ambitious problems with our groundbreaking developments in Artificial Intelligence, High-Performance Computing and Visualization. We are looking for a Developer Relations Manager to work with China industrial/research community to integrate

Nvidia  16 days ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential

Nvidia  11 days ago
Canva jobs

Company Description At Canva, were building a future powered by AI thats as magical as it is impactful. As a Research Scientist at Canva, youll be responsible for advancing the future of AI by experimenting with

Canva  9 days ago
Canva jobs

Company Description At Canva, were building a future powered by AI thats as magical as it is impactful. As a Research Scientist at Canva, youll be responsible for advancing the future of AI by experimenting with

Canva  6 days ago
Xiaomi jobs

高性能算子库开发工程师 北京 社招 全职 职位 ID:A202179 职位描述 1. 设计、开发并优化面向NPU的高性能算子库,覆盖卷积、矩阵运算、归一化等核心算子;2.基于类CUDA编程语言或NPU专用指令集,实现算子极致性能优化,降低延迟与功耗;3.深入理解NPU硬件架构(如计算单元、内存层级、数据流),针对硬件特性进行算子级优化;4.与芯片团队紧密协作,反馈算子性能瓶颈并提出硬件改进建议;5.编写高性能计算代码、汇编级优化及Benchmark测试。 职位要求 1.计算机科学、电子工程、数学等相关专业,本科及以上学历;2. 熟悉cuda/C++/Python中至少一种编程语言;3. 具备类CUDA编程经验(CUDA/OpenCL/HIP等)或NPU SDK开发经验;4. 熟悉并行计算体系结构,有NPU/GPU开发和优化经验优先;5. 对性能优化有极致追求,能通过Profiling工具(如Nsight、VTune)定位瓶颈6. 良好的团队沟通能力, 责任心强。 投递...

Premium Full-time
Xiaomi  5 days ago
Xiaomi jobs

大模型训练与推理Infra工程师-MiMo 北京 社招 全职 职位 ID:A14015 职位描述 1. 模型训练基础设施开发 - 设计和实现支持大规模分布式训练的计算平台,优化模型训练效率和资源利用率。 - 维护和扩展现有的分布式训练框架,确保平台的高性能和稳定性(如基于 PyTorch、TensorFlow 或 JAX)。 - 集成和优化高性能计算技术(如 CUDA、MPI、NCCL 等)。2. 模型推理基础设施开发 - 构建高效的推理框架,支持大模型的在线和离线推理需求。 - 优化推理速度、内存占用和能耗,支持多种硬件架构(GPU、NPU等 )。 - 实现PD分离、Context Caching、模型量化、推敲编码等推理优化技术。3. 性能监控与优化 - 开发工具链和监控系统,跟踪训练与推理过程的性能瓶颈。 - 分析并优化数据加载、通信效率和硬件利用率等关键环节。4. 跨团队协作 - 与模型研究团队密切合作,理解模型需求,定制训练和推理策略。 -

Xiaomi  5 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

gpu cuda jobs in beijing

You also might be interested in:

实习生

AI

C++

Python

Machine Learning

PyTorch

Kernel

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Job Type
Employer/Recruiter
Experience