【27届校招】算子库开发培训生 武汉、上海 正式 研发 - 电子 / 半导体 职位描述 1、基于类 cuda 环境, 设计并实现高性能算子, 例如 gemm, Attention, FFN, CNN 等.2、结合芯片微架构特性进行极致调优, 优化核心算子性能逼近理论设计上限.3、开发性能评估工具, 并总结性能测试报告.4、编写算子设计文档与交付文档,保障算子库的稳定性与可维护性。 职位要求 1、精通 C/C++, 熟悉 Linux 开发环境, 掌握 CMake, Git 等工程化工具, 必须具备良好的代码风格与调试能力.2、深入理解 CPU/GPU 并行计算原理(如 SIMD/SIMT 架构),
【27届校招】AI软件工程师 上海 正式 研发 - 电子 / 半导体 职位描述 1. 高性能计算核心开发:针对自研芯片架构,设计、开发并优化高性能的CUDA及DSP算子,以支撑大模型推理、实时图像处理等关键业务。2. AI系统集成与验证:负责自研芯片上AI加速器系统的集成与验证,并搭建与完善算子自动化测试验证平台,确保代码的工程化质量与高效落地。3. 嵌入式与算法软件交付:参与高实时性、高算力的嵌入式软件平台与通用机器人操作系统的设计与交付。 4. 前沿算法探索与实现:参与自动驾驶/机器人算法(如识别、规划、导航、多模态大模型等)的设计、交付与优化。 5. 全栈生态建设:深度参与从芯片需求到架构设计的转换,并为建设高性能计算软件栈的生态做出贡献。 职位要求 1. 硕士及以上学历,计算机、电子、软件、通信、自动化、数学等相关专业。2. 精通 C/C++ 与 Python,熟悉Linux开发环境,掌握gprof/perf等性能剖析工具,具备扎实的数据结构与算法基础和良好的软件工程习惯。 3. 具备极强的学习能力、良好的沟通协调能力和团队合作精神。4. 核心技术要求 (满足以下至少一项): * 高性能计算:理解GPU架构(如SM/Tensor Core/Memory Hierarchy)及CUDA编程模型(Kernel/Thread Hierarchy/Stream),了解并行计算、缓存优化、向量化指令集(AVX/NEON)等知识。* 深度学习工程化:熟悉深度学习模型从训练到部署的全流程,对CUDA、PyTorch/TensorFlow、ONNX Runtime以及Transformer、VLM等流行模型架构有一定了解。 *
Job Details: Job Description: We are looking for motivated graduate candidates who are interested in platform performance engineering for AI server platforms. In this role, you will learn and contribute to GPU-as-an-I/O-device performance validation and optimization,
南京实习基地-AI开发实习生 南京 校招 实习 职位描述 1、负责AI推理框架的调研、分析和测试2、负责视觉、音频、影像算法等AI 模型在推理框架上的部署和适配调试3、负责 AI 模型的性能优化,包括模型量化、剪枝,算子融合、优化等 职位要求 1、本科及以上学历,计算机相关专业2、具有扎实C++编程基础、数据结构基础,良好的工程开发能力3、熟悉模型量化/剪枝/图优化等技术,有模型部署经验者优先,有mnn,qnn等框架开发使用经验者优先4、熟悉计算机体系结构,有simd/opencl/cuda其中一种开发经验者优先5、具有较强的学习能力、执行力,对技术充满热情并持续探索 投递...
异构算子开发工程师(上海) 上海 算法类 硕士及以上 2027届算法人才专项招聘 职位描述 1.负责ARM/Neon、GPU(CUDA/OpenCL)、高通DSP(Hexagon/HVX)等异构平台的算子开发、移植适配与极致性能优化工作。2.参与异构计算软件架构设计与方案迭代,协同硬件、算法团队开展软硬件联合调试与性能调优,打通算法落地链路。3.针对不同异构平台特性,设计合理的并行计算策略与数据流方案,解决计算瓶颈、访存瓶颈,保障算子高效、稳定运行。 职位要求 1.硕士及以上学历,计算机、电子信息、软件工程、自动化、微电子等相关专业。2.精通C/C++,深入理解计算机体系结构,熟悉缓存机制、流水线、DMA等底层原理,基础功底扎实。3.具备至少一类异构平台算子开发经验,包括ARM Neon/SVE、CUDA/OpenCL、高通Hexagon/HVX、C66x、CEVA等优先。性能调优能力:熟练使用perf、NSight、SDP Profiler等性能剖析工具,具备指令级、内核级、系统级的性能分析、瓶颈定位与调优能力。4.熟悉异构计算内存管理、任务调度、核间通信机制,能够独立设计高效的并行策略与数据流架构。加分项:有雷达信号处理算子、AI推理算子开发、异构平台量产优化相关项目或实习经验者优先。 职位信息 招聘数量: 5 投递...
2027校招-GPU驱动软件工程师(北京/上海/成都) 北京、上海、成都 校招 正式 职位描述 负责GPU驱动开发,包括UMD、KMD、FW驱动开发 职位要求 1. 计算机,电子工程,通信或相关专业,本科及以上2. 有嵌入式驱动开发经验3. 熟悉C/C++4. 熟悉操作系统架构(Linux/Unix)5. 了解设备驱动开发,如内存管理, 任务调度等, 有GPU驱动经验尤佳6. 有cuda/hip/opencl/vulkan/opengl/directx等AI驱动或图形驱动开发经验是加分项 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项-
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: You will design, implement, optimize, and maintain GStreamer plugins for streaming, hardware-accelerated video/audio encoding & decoding, muxing/demuxing, camera integration, GPU/NPU AI inference, and end-to-end
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Interested in enabling next generation graphics, games, ray tracing, machine learning, image and video processing, even Mars drones? In the GPU Developer Tools team,
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As a member of Qualcomm Chinas engineering team dedicated to automotive infotainment and ADAS platforms, you will play a pivotal role in
AI开发实习生 深圳 校招 实习 职位描述 1. 负责AI推理框架的调研、分析和测试,输出方案选型报告2. 负责视觉、音频、影像等AI模型在推理框架上的部署3. 负责AI推理框架中各个算子性能/兼容性等问题并解决 职位要求 1. 本科及以上学历,软件工程、电子信息等计算机相关专业2. 具有扎实C++编程基础、数据结构基础以及良好的架构设计能力3. 熟悉模型量化/剪枝/图优化等技术,有模型部署经验者优先4. 熟悉计算机体系结构,有simd/opencl/cuda其中一种开发经验者优先5. 具有较强的学习能力、执行力,对技术充满热情并持续探索 投递...
校招-端侧AI芯片推理基座软件开发工程师 上海、合肥 校招 正式 数字技术 - 软件研发 硕士及以上 2027届校园招聘-正式批 职位 ID:A97754 职位描述 负责大模型(LLM/VLM)在车端 AI 芯片(NPU/GPU/DSP 等)上的推理部署与工程化落地;参与端侧推理引擎的适配与开发,完成算子映射、调度与执行优化;开展模型量化、算子开发与调优、内存与带宽优化等工作;参与异构计算框架(CUDA、OpenCL、NPU SDK 等)的集成与性能调优;与算法、芯片、嵌入式团队协作,推动 AI 推理基座在多芯片平台上的适配与复用;跟踪端侧大模型推理、算子优化、异构计算等前沿技术。 职位要求 本科及以上学历,计算机、软件工程、人工智能、电子信息等相关专业;扎实的计算机基础,至少熟练掌握一门主流编程语言(Python / C / C++ 等);了解主流大模型的基本原理与推理流程,熟悉 ONNX、TensorRT、TFLite、llama.cpp 等推理框架之一者优先;了解 GPU 并行计算(CUDA/OpenCL)、NPU/DSP 开发或有相关实践经历者优先;具备较强的学习能力、自驱力和团队协作意识,对智能汽车行业有浓厚兴趣者优先。 投递...
AI算子开发工程师 杭州、合肥、上海、深圳 社招 全职 数字技术 - 算法 本科及以上 1-3 年 职位描述 职位描述:1.负责AI处理器的高性能算子方案设计,功能开发,性能优化工作;2.负责算子自测试用例的设计和开发,保证算子的质量提升和 CI 看护;3.探索AI高性能算子的软硬件协同优化方案,提升硬件的利用效率4.开发算子库开发所需的功能和性能分析工具,提升算子库开发效率 职位要求 岗位要求:1.熟悉C/C++、python编程,有较好的编程习惯和编程基础;2.熟悉常用数据结构及算法,如堆/栈/队列/树/图等;有如下经验优先考虑:1.熟悉常用NN算子的实现方式,有算子开发和优化经验,包括Conv,DeConv,激活,Pool,Attention等;2.有计算机体系结构背景,熟悉芯片架构/微架构(包括CPU/GPU/SoC/FPGA等),有软硬件协同设计经验;3.熟悉GPGPU硬件架构,熟悉CUDA,熟悉cuDNN,有深度学习计算框架优化经验尤佳;4.有复杂算法(如图像与视频处理、计算机视觉等)CUDA/OpenCL/汇编级优化经验尤佳; 投递...
视觉图像算法工程师 北京、上海 校招 正式 算法类 2027届校园招聘计划 职位描述 1、参与图像/视频相关领域的深度学习或传统算法研发工作;2、结合产品需求,参与算法的设计、开发、验证、集成、优化和维护,解决算法产品化过程中的各种技术问题,确保算法达到上线要求;3、跟进特定领域的行业进展,并结合产品对算法进行优化,使相关产品效果达到业界领先水平;4、参与学术研究,产出具备行业影响力的科研成果。 职位要求 1、硕士及以上学历优先,计算机视觉、图像信号处理、机器学习、模式识别、数学等相关专业;2、一定的图像视频算法实践经验,扎实的数学功底,对图像/视频相关的深度学习或传统算法有深入的理解,或有突出的学术成绩;3、良好的编码能力,熟练掌握至少一门编程语言(c/c++/python/java/matlab),能够熟练使用c/c++相关开发工具进行代码调试、优化者更佳;4、熟悉并能灵活运用Tensorflow、Caffe、pytorch、PaddlePaddle等机器(深度)学习工具解决实际图像/视觉问题者优先;5、有安卓平台app开发, 或了解jni及安卓native代码开发、调试、优化经验者优先;6、熟悉OpenCL者优先;7、具有较强的内外部沟通能力和协调能力,视野开阔,思维敏捷 ,创新能力强。 投递...
端侧全模态大模型工程专家 北京、上海、深圳 社招 全职 技术 - 基础架构 职位 ID:A133605 职位描述 1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;2. 深入全模态模型双工异步工作流推理开发与优化;3. 模型量化、KV Cache 管理与投机推理加速;4. 分析硬件性能调优与内存管理;5. 跟进主流芯片厂商技术栈演进; 职位要求 1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;3. 有Orin平台开发经验;4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;5. 精通 C/C++/python;6. 具备 异步多线程计算、内存管理优化 实战经验;7.
校招-AI芯片加速算法工程师 上海、合肥、杭州 校招 正式 数字技术 - 芯片研发 硕士及以上 2027届校园招聘-正式批 职位 ID:A249060 职位描述 1.结合自研芯片硬件架构特性,开展软硬件协同算法研究,参与芯片需求定义,参与算法、硬件、软件联合优化,解决精度、时延、吞吐、显存占用等核心瓶颈。2.参与工作包括但不限于:模型量化、KV cache压缩、算子加速、高性能 Kernel 开发、图优化、显存调度等,充分释放芯片硬件算力、提高能效。3.参与深度学习引擎适配,完成主流模型移植、性能建模、精度调优,搭建性能分析、自动化测试验证工具,定位并解决性能退化、精度异常问题。4.跟踪异构计算、AI 编译器、算子优化、量化压缩等前沿技术,完成原型验证、技术方案输出,推动技术落地产品版本,支撑具身智能、Agent 平台等业务落地。 职位要求 1.学历专业:2027 届硕士 / 博士,计算机体系结构、计算机软件、人工智能、通信与网络、电子与信息、微电子、自动化、应用数学等相关专业;2.编程基础:熟悉 C/C++ 、Python;熟悉 Linux 开发环境,掌握性能分析工具,具备良好调试、性能调优能力。3.知识储备:熟悉计算机体系结构、存储层次、NPU/GPU计算基本原理;了解深度学习基本原理,熟悉 PyTorch/vLLM/SGLang等至少一种框架或引擎。4.具备较强算法思维,能够分析性能瓶颈,独立完成技术原型实现,具备良好文档、方案撰写能力。自我驱动,热爱底层技术,善于定位复杂系统问题,具备良好沟通与团队协作。优先(满足其一即加分)有 CUDA/OpenCL/ 异构 NPU 开发、GPU算子库开发优化经历;有 AI推理引擎、量化算法、稀疏计算、芯片架构设计相关项目经验;硕士 / 博士课题涉及神经网络加速、芯片软硬件协同、高性能计算;有开源框架开发、模型部署优化实战经历,或有相关顶会论文经验。 投递...
AI Infra专家/工程师 北京、上海 社招 全职 职位 ID:A154597 职位描述 1. 基于高性能异构计算平台,设计开发面向自动驾驶场景的AI推理基础架构;2. 主导高性能推理框架的开发与优化,重点提升模型在复杂场景下的实时推理效率与能效比;3. 针对核心自驾模型进行计算图与算子级优化;4. 参与软硬件协同优化体系设计,为硬件架构升级提供算法侧优化建议;5. 协同算法团队推进模型在异构计算平台的性能调优与落地验证。 职位要求 1. 计算机、电子、自动化等相关专业本科及以上学历,3年以上高性能计算或AI推理系统开发经验;2. 精通GPGPU编程(如CUDA、OpenCL)及高性能推理框架(如TensorRT/TensorRT-LLM、ONNX Runtime、TVM/MLC-LLM等)的开发与优化;3. 具备丰富的高性能算子开发与优化经验,熟悉主流AI模型(特别是视觉、多模态及扩散模型)的推理特性;4. 对自动驾驶场景有深刻理解,熟悉自驾场景模型的推理优化;5. 有异构计算平台(含GPU/FPGA/专用加速器等)开发经验者优先;6. 优秀的系统分析、解决问题和团队协作能力。 投递...
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Applications Engineering General Summary: Job Overview Qualcomm Customer Engineering is looking for motivated and experienced software engineers to support the China Auto AI Ecosystem program. This role
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As part of the engineering team at Qualcomm China, focusing on automotive infotainment and ADAS platforms, we are seeking talented engineers with
At NVIDIA, we build groundbreaking products for the following sectors: Deep Learning, High Performance Computing, Gaming, VR, and Automotive. See your efforts in action as developers use your tools to debug, profile and analyze the performance