AI算子开发工程师 杭州、合肥、上海、深圳 社招 全职 数字技术 - 算法 本科及以上 1-3 年 职位描述 职位描述:1.负责AI处理器的高性能算子方案设计,功能开发,性能优化工作;2.负责算子自测试用例的设计和开发,保证算子的质量提升和 CI 看护;3.探索AI高性能算子的软硬件协同优化方案,提升硬件的利用效率4.开发算子库开发所需的功能和性能分析工具,提升算子库开发效率 职位要求 岗位要求:1.熟悉C/C++、python编程,有较好的编程习惯和编程基础;2.熟悉常用数据结构及算法,如堆/栈/队列/树/图等;有如下经验优先考虑:1.熟悉常用NN算子的实现方式,有算子开发和优化经验,包括Conv,DeConv,激活,Pool,Attention等;2.有计算机体系结构背景,熟悉芯片架构/微架构(包括CPU/GPU/SoC/FPGA等),有软硬件协同设计经验;3.熟悉GPGPU硬件架构,熟悉CUDA,熟悉cuDNN,有深度学习计算框架优化经验尤佳;4.有复杂算法(如图像与视频处理、计算机视觉等)CUDA/OpenCL/汇编级优化经验尤佳; 投递...
算法工程师(彩色打印技术) 急招岗位 深圳 社招 全职 职位描述 岗位职责1. RIP算法开发与优化 - 负责打印机RIP核心算法的设计、实现及优化,包括图像解析、色彩管理、半色调处理(如误差扩散、抖动算法)、分辨率转换等模块。 - 研究并改进RIP处理效率,提升打印速度与输出质量,优化多PASS打印流程等功能。2. 打印精度与效果优化 - 熟悉打印技术中的机械校准方法,理解波形控制墨滴的过程,结合其原理优化打印精度和输出效果。 - 研究墨滴落点补偿、喷头校准、步进精度调整等技术,提升打印一致性。3. 性能调优与问题解决 - 分析并优化RIP处理中的性能瓶颈、内存泄漏及图像输出异常问题。 - 针对高分辨率、大幅面打印场景优化硬件资源占用。4. 协作与集成 - 与硬件团队协作,完成RIP与打印机控制器的通信协议开发及驱动集成。 - 配合UI团队设计用户友好的配置界面(如色彩校准、打印参数设置)。5. 技术预研 - 跟踪行业前沿技术(如GPU加速RIP、AI图像增强),探索在现有产品中的应用。 职位要求 任职要求- 计算机、电子工程、数学、自动化等相关专业本科及以上学历。- 3年以上图像处理/打印算法开发经验,熟悉RIP技术及打印流程。- 精通C/C++/Python,熟悉OpenGL性能优化。- 熟悉多PASS打印技术,具备半色调算法(误差扩散、抖动等)优化经验。-
优才-模型推理AI Infra开发工程师-中央研发部 上海、北京 正式 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架 投递...
优才-训练AI Infra系统优化工程师-中央研发部 上海、北京 正式 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战 投递...
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: You will design, implement, optimize, and maintain GStreamer plugins for streaming, hardware-accelerated video/audio encoding & decoding, muxing/demuxing, camera integration, GPU/NPU AI inference, and end-to-end
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As part of the engineering team at Qualcomm China, focusing on automotive infotainment and ADAS platforms, we are seeking talented engineers with
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Interested in enabling next generation graphics, games, ray tracing, machine learning, image and video processing, even Mars drones? In the GPU Developer Tools team,
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Interested in enabling next generation graphics, games, ray tracing, machine learning, image and video processing, even Mars drones? In the GPU Developer Tools team,
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As a member of Qualcomm Chinas engineering team dedicated to automotive infotainment and ADAS platforms, you will play a pivotal role in
具身大模型推理性能优化实习生 上海 实习 职位描述 1. 参与到面向具身机器人本体亲和的轻量化、高性能推理框架模块化开发;2. 基于GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 3. 开发模型解析、转换、性能剖析、可视化profiling工具;4. 洞察算子融合、低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术并复现开发;5. 调研VLA、世界模型、空间智能等最新算法架构趋势; 职位要求 1. 熟练掌握C/C++,具备汇编(ARM/x86)或CUDA/OpenCL优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp);3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ 等)及相关工具链;4. 熟悉常见算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax 等);5. 具备端上 profiling 能力(perf、简单性能计数器、硬件事件、功耗测量); 投递...
AI编译器研发(自动驾驶/机器人) 深圳、上海 全职 芯片板块 职位描述 1、编译器架构设计:设计并实现AI编译器中间表示(IR),支持模型图优化、算子融合、循环优化等;构建从模型解析到硬件指令生成的完整编译流水线,支持PyTorch/Onnx等主流框架。2、硬件后端优化:针对自研芯片,开发高效算子库与代码生成策略:优化内存访问、指令调度,提升端到端推理性能。3、性能调优与验证:通过Profiling工具定位性能瓶颈,优化算子,并设计自动调优流程;与硬件团队合作,验证算子在目标设备上的性能与正确性。4、业务场景落地:结合自动驾驶感知、决策规划,或机器人SLAM、运动控制等场景,优化编译器对实时性、低功耗的需求;参与模型量化与编译器的协同设计。5、技术探索与创新:研究动态形状处理、稀疏计算等前沿编译技术;探索LLVM/GCC等传统编译技术与MLIR的集成方案。 职位要求 1、必备技能:(1)精通C++/Python,具备大型系统开发经验。(2)深入理解MLIR框架,熟悉其Dialect设计、Pass优化机制。(3)有NPU或GPU硬件经验,熟悉CUDA、OpenCL或NPU专用指令集。(4)熟悉至少一种深度学习框架(TensorFlow/PyTorch/Onnx)。2、加分项:(1)有LLVM/GCC后端开发经验,熟悉内联优化、寄存器分配、指令调度、代码生成等。(2)参与过开源AI编译器项目(如TVM、Apache MLIR)。(3)了解自动驾驶感知算法(如BEV感知、多传感器融合)或机器人控制等模型。(4)发表过编译器优化、体系结构相关论文或专利。岗位介绍:我们正在寻找AI编译器研发工程师,专注于AI编译器框架设计与优化。包括模型量化、图优化、codegen、算子优化及软硬件协同优化等。您将参与构建高性能、低延迟的AI编译工具链,支撑自动驾驶、机器人等业务场景。 投递...
算子开发工程师 深圳、上海 全职 芯片板块 职位描述 1. 设计并优化CUDA算子/ DSP算子,针对公司自研芯片架构,开发高性能异构计算算子,支撑大模型推理、实时图像处理等关键业务。2. 搭建和完善算子测试验证平台,保证算子的工程化落地。 职位要求 学历背景:1.重点大学硕士/,计算机/电子/数学/AI方向核心技术栈:1.精通 C/C++ 与 Python,掌握Linux开发环境及性能剖析工具(gprof/perf)。2.深入理解GPU架构(SM/Tensor Core/Memory Hierarchy)及CUDA编程模型(Kernel/Thread Hierarchy/Stream)。3.具备高性能计算基础:并行算法、缓存优化、向量化指令集(AVX/NEON)。实操经验(至少满足1项):4.有CUDA/OpenCL算子开发优化经验。熟悉深度学习框架底层(PyTorch CUDA Extension/TensorFlow XLA)。5.参与过异构计算项目(GPU+FPGA/ASIC/DSP协同计算)。 投递...
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As a member of Qualcomm Chinas engineering team dedicated to automotive infotainment and ADAS platforms, you will play a pivotal role in
【27届校招】算子库开发培训生 武汉、上海 正式 研发 - 电子 / 半导体 职位描述 1、基于类 cuda 环境, 设计并实现高性能算子, 例如 gemm, Attention, FFN, CNN 等.2、结合芯片微架构特性进行极致调优, 优化核心算子性能逼近理论设计上限.3、开发性能评估工具, 并总结性能测试报告.4、编写算子设计文档与交付文档,保障算子库的稳定性与可维护性。 职位要求 1、精通 C/C++, 熟悉 Linux 开发环境, 掌握 CMake, Git 等工程化工具, 必须具备良好的代码风格与调试能力.2、深入理解 CPU/GPU 并行计算原理(如 SIMD/SIMT 架构),
【27届校招】AI软件工程师 上海 正式 研发 - 电子 / 半导体 职位描述 1. 高性能计算核心开发:针对自研芯片架构,设计、开发并优化高性能的CUDA及DSP算子,以支撑大模型推理、实时图像处理等关键业务。2. AI系统集成与验证:负责自研芯片上AI加速器系统的集成与验证,并搭建与完善算子自动化测试验证平台,确保代码的工程化质量与高效落地。3. 嵌入式与算法软件交付:参与高实时性、高算力的嵌入式软件平台与通用机器人操作系统的设计与交付。 4. 前沿算法探索与实现:参与自动驾驶/机器人算法(如识别、规划、导航、多模态大模型等)的设计、交付与优化。 5. 全栈生态建设:深度参与从芯片需求到架构设计的转换,并为建设高性能计算软件栈的生态做出贡献。 职位要求 1. 硕士及以上学历,计算机、电子、软件、通信、自动化、数学等相关专业。2. 精通 C/C++ 与 Python,熟悉Linux开发环境,掌握gprof/perf等性能剖析工具,具备扎实的数据结构与算法基础和良好的软件工程习惯。 3. 具备极强的学习能力、良好的沟通协调能力和团队合作精神。4. 核心技术要求 (满足以下至少一项): * 高性能计算:理解GPU架构(如SM/Tensor Core/Memory Hierarchy)及CUDA编程模型(Kernel/Thread Hierarchy/Stream),了解并行计算、缓存优化、向量化指令集(AVX/NEON)等知识。* 深度学习工程化:熟悉深度学习模型从训练到部署的全流程,对CUDA、PyTorch/TensorFlow、ONNX Runtime以及Transformer、VLM等流行模型架构有一定了解。 *
The role Imagination is dedicated to designing graphics processors for a growing market, including mobile, automotive, desktop & data centre and consumer. You will support Imaginations customers in the design of their products that utilise Imagination’s
We are now looking for a Deep Learning Performance Software Engineer! We are expanding our research and development for Inference. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize in
We are now looking for a Senior Accelerated Computing Architect! NVIDIA is developing software and system architectures for accelerated high performance computing, scientific computing, machine learning, AI, datacenter, and automotive computing. This position offers you the
训练AI Infra系统优化工程师 上海 校招 正式 技术族 - 软件类 职位 ID:A46765 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战; 投递...
手机部-相机算法优化工程师 北京、上海、深圳 社招 全职 职位 ID:H5202 职位描述 负责相机算法在手机平台上的优化 职位要求 1. 熟练掌握C/C++编程2. 符合下面一项即可 a,ARM平台neon加速经验 b,GPU(图像处理器)加速经验,opencl或cuda都可以 c,具备Hexagon(数字信号处理器)DSP加速经验,熟悉HVX和CEVA DSP加速技术 d,有halide使用经验 e,对于ncnn,snpe等有实际的使用经验背景3. 有安防行业和手机行业机器视觉算法的优化和加速经验优先 投递...