Refine Reset All
Sort by
Job Title
Skills
Job Type
Employer/Recruiter
Date Posted
Job Title
Skills
Location
Job Type
Employer/Recruiter
Experience
All Filters

Cuda Jobs In Beijing (Peking) - 19 Job Positions Available

Top Cities:
1 – 19 of 19 jobs
GE HealthCare jobs

Job Description SummaryWe are seeking an experienced CT Reconstruction Software Architect to lead the architecture and development of next-generation CT reconstruction platforms. The successful candidate will be responsible for defining software architecture, driving image reconstruction innovations,

GE HealthCare  29 days ago
千寻智能(杭州)科技有限公司 jobs

【校招实习】AI Infra工程师 北京 实习 互联网 / 电子 / 网游 - 研发 千寻智能2027届校招实习招聘项目 职位描述 1、负责具身智能大模型千卡大规模训练系统性能优化及MFU优化。2、负责多模态大模型(VLM)在云端的高性能分布式推理系统设计、开发与全链路端到端部署。3、负责具身智能VLA模型在端侧的推理系统的研发和模型加速算法研究。 职位要求 1、熟悉GPU体系结构,熟练掌握CUDA/triton,熟练掌握C++或Python语言。2、深入了解PyTorch等深度学习框架的架构和运行原理,深入理解大模型训练多维并行架构,如Tensor并行、流水线并行、序列并行等。3、深入理解多模态模型结构,如ViT、DiT等,了解开源多模态大模型结构,如qwen-vl、llama等。4、熟悉至少一种主流开源推理引擎(如 vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo等)的底层机制与源码魔改。5、熟悉量化、剪枝、蒸馏、投机推理、步数蒸馏等前沿推理加速及模型小型化技术方案。 投递...

Premium Full-time
千寻智能(杭州)科技有限公司  29 days ago
Pony.ai jobs

软件实习生 - 端到端模型性能优化 北京 实习 职位描述 1. 负责AI端到端模型的性能分析与优化;2. 负责CUDA算子开发与维护。 职位要求 1. 计算机或相关专业本科及以上学历;2. 扎实的软件工程能力,熟练掌握计算机基础知识;3. 有CUDA编程经验,熟悉TensorRT或其它AI加速库;4. 熟悉至少一种深度学习框架(Pytorch优先)。加分项:1. 熟练掌握CUDA编程,有CUDA优化经验;2. 有算法竞赛经历;3. 有基于TensorRT的模型优化经验;4. 有模型量化、蒸馏、剪枝等工程经验。 投递...

Premium Full-time
Pony.ai  29 days ago
Pony.ai jobs

算法实习生-多模态感知大模型 北京 实习 职位描述 1. 负责基于 Camera、LiDAR 及多模态融合的感知算法开发与优化,工作方向包括但不限于动态目标检测与追踪、3D occ、在线地图感知等。2. 负责研发面向高精度静态环境感知的端到端深度学习模型,重点覆盖交通信号灯(红绿灯)、交通标识、车道线、路缘、静态障碍物等关键元素的检测与识别。3. 设计端到端模型架构(如BEV感知、Transformer-based模型),实现从原始数据到结构化静态场景输出的高效映射4. 负责算法在自动驾驶实际产品中的落地和优化提升,解决实际问题。 职位要求 1. 计算机或相关专业本科以上学历;2. 熟练掌握深度学习及计算机视觉相关的基本算法;3. 熟悉基于CNN的图像检测、跟踪、识别等算法流程;4. 优秀的编程能力,熟悉C/C++或Python;5. 有较强的独立解决问题能力,学习能力及沟通能力;若能满足如下条件的其中一个,会适当加分:1. 有较强的研究能力优先,如发表过第一作者CCF A类会议或期刊等论文;2. 熟悉某种深度学习框架,如Pytorch等,对深度学习有深入的了解;3. 熟悉并行计算或cuda编程,或图像处理方面经验的优先;4. 在自动驾驶行业有实习经验;5. 能实习6个月及以上。 投递...

Premium Full-time
Pony.ai  29 days ago
千寻智能(杭州)科技有限公司 jobs

AI Infra实习生(日常实习) 北京 实习 研发 - 基础架构 千寻智能2025年秋季校园招聘项目 职位描述 1、负责构建支撑具身智能体的核心机器学习系统,开发面向机器人场景的VLA大模型训练与推理系统,支撑多模态感知、运动控制、任务规划等核心能力的持续进化;2、研发新一代具身智能系统工具链,涵盖数据采集、仿真训练、物理部署、持续优化全生命周期。 职位要求 1、计算机、人工智能、软件工程等相关专业,硕士及以上学历,2026年及之后毕业; 2、熟练使用C++/Python/Pytorch/CUDA开发生态,具有嵌入式系统开发经验者优先;3、能至少保障3个月以上的实习时间,每周4天以上出勤;4、加分项:在以下一个或多个领域有深度实践: a. 大模型训练推理:多模态大模型分布式训练、端上推理加速、Transformer模型优化; b. 高性能计算:GPU Kernel编写,高性能通信(NCCL、RDMA),AI编译器(TVM、Triton),模型量化等; c. 机器人系统:ROS2、运动控制算法、传感器数据处理pipeline。 投递...

Premium Full-time AI
千寻智能(杭州)科技有限公司  29 days ago
北京科学智能研究院 AI for Science Institute, Beijing jobs

机器学习势函数工程研发实习生 北京 实习 本科及以上 职位描述 1. 计算机、软件工程、人工智能、计算科学或相关专业本科及以上学历;2. 熟练使用 Python,具备 C/C++ 基础,能够阅读和调试工程代码;3. 熟悉 PyTorch及常见模型训练、测试和性能评测流程;4. 熟悉 Linux、Git及常用开发工具,能够根据日志定位和解决实验问题;5. 具备良好的代码规范、测试意识和实验复现意识;6. 了解 CUDA、Triton、GPU性能分析或分布式训练者优先;7. 有 DeePMD-kit、分子动力学、机器学习势函数或科学计算经验者优先;8. 大四即以上211,985在读优先;9. 善于独立思考,灵活使用各类AI工具。 职位要求 1. 根据既定方案配置、提交和监控机器学习势函数训练及测试任务;2. 整理实验数据与结果,完成精度、速度和资源消耗等指标的对比分析;3. 参与 DeePMD-kit 的功能开发、问题排查、单元测试和文档维护;4. 协助开展关键计算流程和算子的性能分析与优化;5. 完善实验脚本及自动化工具,保障实验流程稳定、可复现。 职位信息 部门: OpenLAM 投递...

Premium Full-time
北京科学智能研究院 AI For Science Institute, Beijing  28 days ago
Automatically Get Matched to cuda Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
Li Auto jobs

智能车控软件架构师 北京 全职 生产 / 制造 / 加工 - 汽车制造 职位描述 工作职责: Ø 负责智能车控(智能能源,智能底盘,智能环境等)功能的平台化软件架构设计和落地实施 - 支持不同硬件加速器和智能化算法的平台化开发框架设计 - 结合不同硬件架构,深度学习框架和AI编译等相关技术,加速智能车控算法的推理,部署的落地Ø 负责智能化软件性能和资源使用的优化方案制定和落地实施Ø 负责根据实际业务情况制定智能化软件开发和分工流程Ø 负责分析智能功能对芯片资源的需求,支撑控制器芯片选型 职位要求 任职要求: Ø 在智能算法架构设计,开发,集成,部署领域有8年以上工作经历,有产品量产开发经验Ø 熟悉至少一种主流深度学习算法开发框架(TensorFlow, PyTorch)和性能调优Ø 熟练掌握模型部署时的压缩技巧(模型剪枝、量化和蒸馏等)Ø 熟悉AI编译器相关技术,至少熟悉一种片上的主流算力芯片的编译(地平线,昇腾等)和性能调优Ø 熟悉 ARM 体系架构,熟悉DSP, GPU, NPU等硬件加速器的特性和性能调优Ø 熟悉至少一种并行计算编程框架(OpenCL,CUDA)和性能调优者Ø 熟悉智能软件全开发环节,有平台化软件架构的设计能力和成功经历Ø 可以根据智能化功能需求,完成功能部署分配和资源消耗的预估Ø

Premium Full-time
Li Auto  26 days ago
XPENG jobs

【27届校招】大模型训练推理框架工程师 深圳、北京 正式 研发 - 算法 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、硕士及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有丰富以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和 RL 训练的基本流程。

Premium Full-time Ml
XPENG  23 days ago
XPENG jobs

【27届校招】 软件工程师(自动驾驶仿真)-北京 北京 正式 研发 - 算法 职位描述 岗位职责研发和优化小鹏汽车核心自动驾驶仿真模拟器平台,为算法研发、模型训练、评测验证提供高效迭代的平台能力和工程支撑;面向下一代基于人工智能的全套自动驾驶系统,建设模拟器训练与评测支撑平台,支撑模型迭代和系统验证;负责仿真引擎功能开发,搭建和维护大模型推理链路,提升仿真链路的稳定性、吞吐效率和易用性;基于 Python / C++ 开发仿真平台工具链、自动化流程、数据处理与分析工具,提升研发效率和问题定位效率;探索并落地 Agent 在自动驾驶仿真研发中的应用,包括仿真任务自动提交、结果自动分析、问题归因、报告生成和研发流程自动化等方向; 职位要求 职位要求:计算机、软件工程、自动化、电子工程等相关专业,本科及以上学历,硕士优先;熟悉 Linux 系统,具备扎实的 C++ 面向对象编程基础,理解常见工程设计模式和性能优化方法;熟悉 Python 开发,能够使用 Python 完成工具链开发、数据处理、自动化脚本、服务接口开发或算法工程辅助开发;具备一定的软件工程能力,熟悉调试、性能分析、问题定位、代码优化和工程化交付流程;了解模型推理部署与优化相关技术者优先,包括 ONNX、TensorRT、PyTorch、CUDA、GPU 推理性能优化、批处理、并发调度等;了解 Agent、LLM 应用开发、RAG、工具调用、自动化工作流等相关技术,并有实际落地经验者优先;具有自动驾驶、仿真平台、机器人、控制、规划、感知、电子工程相关背景者优先;具备较强的问题分析能力、工程落地能力和跨团队沟通协作能力。 投递...

XPENG  23 days ago
千寻智能(杭州)科技有限公司 jobs

【2027 届校招】AI Infra工程师 北京、杭州 正式 互联网 / 电子 / 网游 - 研发 【千寻智能2027届秋季校园招聘】 职位描述 1、负责具身智能大模型千卡大规模训练系统性能优化及MFU优化。2、负责多模态大模型(VLM)在云端的高性能分布式推理系统设计、开发与全链路端到端部署。3、负责具身智能VLA模型在端侧的推理系统的研发和模型加速算法研究。 职位要求 1、熟悉GPU体系结构,熟练掌握CUDA/triton,熟练掌握C++或Python语言。2、深入了解PyTorch等深度学习框架的架构和运行原理,深入理解大模型训练多维并行架构,如Tensor并行、流水线并行、序列并行等。3、深入理解多模态模型结构,如ViT、DiT等,了解开源多模态大模型结构,如qwen-vl、llama等。4、熟悉至少一种主流开源推理引擎(如 vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo等)的底层机制与源码魔改。5、熟悉量化、剪枝、蒸馏、投机推理、步数蒸馏等前沿推理加速及模型小型化技术方案。 投递...

Premium Full-time
千寻智能(杭州)科技有限公司  23 days ago
度小满科技(北京)有限公司 Du Xiaoman Technology jobs

AI Infra 工程师 北京 技术 - 算法 本科及以上 职位描述 1、负责大模型推理框架的开发与优化,包括算子优化、显存/KV Cache 管理优化、分布式加速等技术方向; 2、参与高并发场景下的推理性能分析与瓶颈定位,推动改进方案落地; 3、探索低资源下的轻量化推理方案:量化、投机采样、Sparse Attention 等; 4、参与 Disaggregated Serving / PD 分离等新型推理架构的设计与实现; 5、与算法、业务团队协作,推动优化技术在业务中的规模化应用。 职位要求 1、计算机、人工智能、软件工程等相关专业本科及以上; 2、熟悉大模型推理优化方法,对主流开源推理框架(TensorRT-LLM、vLLM、SGLang 等)有开发或深度使用经验; 3、精通 Python/C++ 编程,有 CUDA 开发及 GPU 调优经验者优先; 4、具备良好的系统性能分析能力,熟悉 nsight/nvidia-smi/py-spy 等分析工具者优先。加分项:1、有国产

Premium Full-time CUDA AI
度小满科技(北京)有限公司 Du Xiaoman Technology  16 days ago
北京科学智能研究院 AI for Science Institute, Beijing jobs

表征算法研究员 北京 全职 博士及以上 职位描述 1. 负责开展表征算法模拟数值优化工作,运用先进算法和模型,不断提升模拟计算的准确性和效率;2. 进行各类复杂的计算任务,为物理研究和项目推进提供精确的数据支持;3. 参与并主导基于原子物理和分子动力学结合先进表征的相关研究课题,深入探索微观世界的物理规律;4. 优化电镜成像模拟算法,提升模拟精度和计算效率。 职位要求 1. 物理学相关领域专业的博士学历,具备扎实的计算能力;2. 精通编程,如 Python、Fortran、C++、CUDA 等编程语言,熟悉GPU加速,可编写大型的计算程序;3. 对原子物理有深入的理解和研究,熟悉相关理论和实验方法;4. 精通第一性原理计算方法和软件,掌握分子动力学基本原理,能够运用分子动力学模拟软件进行相关模拟和分析。5. 有散射物理、高性能计算、并行计算经验者优先。 职位信息 部门: 表征 投递...

Premium Full-time
北京科学智能研究院 AI For Science Institute, Beijing  14 days ago
北京思朗科技有限责任公司 jobs

2027校招-推理框架工程师(上海/成都/北京) 北京、上海、成都 校招 正式 职位描述 分布式推理系统开发1、设计并实现大规模AI模型(如LLM、多模态模型)的分布式推理框架,优化吞吐量(Throughput)和延迟(Latency)。2、开发模型并行(Tensor/Pipeline Parallelism)、动态批处理(Dynamic Batching)和连续批处理(Continuous Batching)策略。3、解决多节点、多GPU环境下的负载均衡和通信瓶颈问题。4、优化计算图执行(如使用TensorRT、ONNX Runtime、vLLM等工具)。5、实现量化(FP8/INT8)、KV Cache优化、Flash Attention等加速技术。 职位要求 精通 Python/C++,熟悉PyTorch/TensorFlow推理生态。深入理解分布式系统(NCCL/RPC通信、GPU Direct RDMA)和 并行计算(CUDA、OpenMP)。熟悉推理加速技术(量化、剪枝、算子融合)和框架(TensorRT、vLLM 、Sglang)。 投递...

Premium Full-time
北京思朗科技有限责任公司  9 days ago
北京思朗科技有限责任公司 jobs

2027校招-GPU驱动软件工程师(北京/上海/成都) 北京、上海、成都 校招 正式 职位描述 负责GPU驱动开发,包括UMD、KMD、FW驱动开发 职位要求 1. 计算机,电子工程,通信或相关专业,本科及以上2. 有嵌入式驱动开发经验3. 熟悉C/C++4. 熟悉操作系统架构(Linux/Unix)5. 了解设备驱动开发,如内存管理, 任务调度等, 有GPU驱动经验尤佳6. 有cuda/hip/opencl/vulkan/opengl/directx等AI驱动或图形驱动开发经验是加分项 投递...

Premium Full-time
北京思朗科技有限责任公司  9 days ago
北京思朗科技有限责任公司 jobs

2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项-

北京思朗科技有限责任公司  9 days ago
NIO jobs

智能辅助驾驶端到端算法实习生 北京 实习 数字技术 职位 ID:A148847 职位描述 1.参与研发智能辅助驾驶端到端模型算法研究及优化2.探索智能辅助驾驶端到端网络的应用落地3.参与基建完善,训练系统、评测系统优化等4.与团队协作实现算法迭代与优化,实现算法在智能辅助驾驶业务中应用落地 职位要求 【必备】本科及以上学历,计算机、自动化、计算机视觉、人工智能等相关专业; 【必备】熟悉在linux平台下的开发工作【必备】有扎实的 python开发能力;【必备】有计算机视觉、智能辅助驾驶项目的实践or科研经验;熟悉pytorch,有深度学习调优经验;了解前沿感知技术。【加分项】有「规控,轨迹预测、意图识别,强化学习,LLM,VLM」相关经验者优先【加分项】有相关顶会paper/期刊【加分项】熟悉C++开发、CUDA开发 投递...

Premium Full-time
NIO  8 days ago
Xiaomi jobs

自动驾驶 - 模型部署优化算法工程师 北京、武汉 社招 全职 职位 ID:A143148 职位描述 1. 负责自动驾驶端侧模型的部署和优化工作2. 负责模型部署&优化工具链的研发3. 对模型部署优化技术展开研究,并落地到自动驾驶 职位要求 1. 丰富的模型部署和优化经验,包括图优化、算子优化、模型量化/裁剪等2. 扎实的(Python/C++)编程基础与良好的工程习惯,熟悉常用的数据结构及算法3. 熟悉NV GPU硬件架构与CUDA编程模型,有AI推理框架研发经验者优先4. 有高性能计算经验者优先5. 发表过人工智能/机器学习顶会论文者优先 投递...

Premium Full-time
Xiaomi  6 hours ago
RoboScience jobs

云端训推优化负责人 北京、深圳 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 负责云端训练与推理优化团队整体建设和管理,对模型训推效率负责;负责大模型、VLM / VLA、机器人模型等训练任务的性能优化,包括:训练吞吐、GPU 利用率、Tensor Core 利用率、显存利用率、多机多卡扩展效率负责分布式训练优化,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP / ZeRO 等方案设计与落地;负责模型推理优化,包括算子优化、KV Cache、Batching、量化、并行推理及服务化性能优化;针对模型结构和训练流程进行 Profiling,定位通信、计算、显存、IO 等性能瓶颈,并推动系统性优化;负责训练/推理框架和基础组件建设,沉淀可复用的性能优化能力;与模型算法团队协作,在保证模型效果的前提下优化模型结构、训练策略和推理方案;与智算平台团队协作,提升 GPU 集群整体资源利用率,降低单位训练与推理成本;建立训推性能指标体系和 Benchmark,持续跟踪不同模型、硬件和框架下的性能表现。 职位要求 5 年以上深度学习系统、训练加速、推理优化、AI Infra 或相关工作经验,有团队管理经验;熟悉 PyTorch 及主流深度学习训练框架,理解计算图、Autograd、CUDA 执行模型;熟悉大规模分布式训练,有 NCCL、FSDP、DeepSpeed、Megatron-LM

RoboScience  4 hours ago

About the Opportunity Personal Connect is recruiting a Senior Confidential Computing Infrastructure Engineer on behalf of an innovative technology company in Beijing. This is a highly specialized infrastructure engineering position focused on building secure environments for

Personal Connect  16 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Also try:

Receive the latest job openings for:

cuda jobs in beijing

You also might be interested in:

实习生

AI

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Title
Skills
Job Type
Employer/Recruiter