AI模型部署优化工程师 (上海) 上海 算法类 硕士及以上 2027届算法人才专项招聘 职位描述 1、负责深度学习模型跨框架适配工作,完成模型在PyTorch、ONNX、TensorRT、NCNN、QNN、SNPE、TVM等主流推理引擎的转换、对齐验证与一致性调试,保障模型跨平台推理精度稳定、流程可靠。2、面向嵌入式、车载SOC平台落地场景,落地各类模型压缩与推理加速技术,涵盖计算图优化、算子融合、模型量化、网络剪枝、知识蒸馏、模型稀疏化等深度优化方案,持续提升模型推理性能。3、针对模型推理过程中的性能瓶颈、精度衰减、延时过高、显存占用过大等问题,开展深度定位与分析,输出算子优化、模型结构迭代、推理策略调优等改进方案,推动方案落地闭环。4、跟进端侧推理、模型轻量化前沿技术,结合车载硬件平台特性持续迭代优化方案,保障AI模型在车载场景高效、稳定量产落地。 职位要求 1、硕士及以上学历,计算机、人工智能、软件工程、电子信息、自动化等相关专业,基础知识扎实。2、技术基础:扎实掌握深度学习基础理论,熟练掌握量化、剪枝、知识蒸馏、稀疏化等模型压缩加速技术,具备计算图优化、算子融合、推理调优实战经验。3、框架能力:精通PyTorch框架,熟练掌握QNN、ONNX、TensorRT、NCNN、TVM等至少一种主流推理框架,具备完整的模型转换、部署调试、精度对齐、性能调优全流程实战能力。4、具备深度学习模型在嵌入式、车载SOC平台的部署调试经验,能够独立排查推理精度丢失、推理延时、内存占用超标等各类工程问题,完成优化方案闭环。5、逻辑思维清晰,具备较强的问题攻坚能力、学习能力与执行力,拥有良好的跨部门沟通协作能力,可独立推动技术方案迭代落地与规模化复用。6、优先条件:拥有英伟达Orin Thor、高通8775/8650/8797、地平线J5/J6等车载芯片量产部署经验,或大模型端侧轻量化、推理优化相关项目、实习经验者优先。 职位信息 招聘数量: 2 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项-
CIM 编译器与工具链工程师实习生 深圳 校招 实习 智能制造 / 工业互联网 / 工业自动化 职位描述 安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。【你将参与】1.负责芯片 AI 编译器的开发与维护2.完成算子优化、算子映射与调度策略设计3.开发模型部署工具链,支持 PyTorch/ONNX 等框架到芯片的转换4.优化编译器生成的代码性能(吞吐、延迟、功耗)5.与算法团队协同,完成模型量化与精度优化 职位要求 1.硕士在读(27/28 届),计算机科学、软件工程、微电子、电子工程等相关专业2.熟悉 LLVM/MLIR/TVM 等编译器框架3.了解 AI 模型部署流程(量化、剪枝、蒸馏)4.有编译器/算子优化/模型部署等相关项目经历者优先 投递...
Locations: Shanghai, China Categories: Engineering Req ID: 89499 WHAT YOU DO AT AMD CHANGES EVERYTHING At AMD, our mission is to build great products that accelerate next-generation computing experiences—from AI and data centers, to PCs, gaming
CIM 编译器与工具链工程师-深圳/上海 深圳、上海 校招 正式 智能制造 / 工业互联网 / 工业自动化 职位描述 你将参与:1. 负责芯片 AI 编译器的开发与维护2. 完成算子优化、算子映射与调度策略设计3. 开发模型部署工具链,支持 PyTorch/ONNX 等框架到芯片的转换4. 优化编译器生成的代码性能(吞吐、延迟、功耗)5. 与算法团队协同,完成模型量化与精度优化 职位要求 1. 2027届毕业生,硕士及以上学历,计算机科学、软件工程、微电子、电子工程等相关专业2. 有编译器/算子优化/模型部署等相关项目经历3. 熟悉 LLVM/MLIR/TVM 等编译器框架4. 了解 AI 模型部署流程(量化、剪枝、蒸馏)5. 有存算一体或 NPU 编译器开发项目经历者优先优先条件:熟悉算子优化与调度策略 投递...
AI编译器技术工程师 杭州、上海、合肥、深圳 社招 全职 数字技术 - 算法 本科及以上 3-5 年 职位描述 职位描述:1. 负责AI处理器的图编译或者推理引擎方案设计、验证、开发和维护工作;2. 负责AI编译栈的性能评估及优化工作,并探索软硬件协同优化方案;3. 对智能辅助驾驶领域常用算法和工具进行调研和分析4. 改进工具链各个组件和性能分析工具 职位要求 岗位要求:1. 熟悉C/C++、python编程,有较好的编程习惯和编程基础;2. 熟悉常用数据结构及算法,如堆/栈/队列/树/图等;3. 熟悉计算机体系结构及常见硬件架构(如GPGPU、CPU、DSP、DSA等);有如下经验优先考虑:1. 熟悉常见编译器优化技术,了解编译器构成和编译原理,如寄存器分配、指令选择与调度、循环优化、数据流分析、静态分析等。2. 熟悉TVM/MLIR/GLOW/IREE等深度学习框架编译器;3. 熟悉推理引擎的关键技术,包括图优化,量化,算子融合,tiling等 投递...
AI runtime工程师 上海、合肥 社招 全职 数字技术 - 算法 本科及以上 3-5 年 职位描述 负责开发深度学习AI模型的runtime软件,完成计算资源调度、内存管理、host-device并行优化工作。1,分析和解决KMD/UMD的功能、性能和稳定性问题,确保高质量交付AI系统的运行时软件;2,与编译器、驱动工程师协同提供定制优化项和编程api;3,参与故障检测和恢复机制设计,保证AI系统的可靠性;4,参与Profiling工具设计,保证AI系统的性能可视化和瓶颈定位;5,持续改进通信和调度机制, 与业务团队协作完成多模型部署,提高芯片的综合计算效率和系统吞吐量; 职位要求 1,计算机、通信或者电子相关专业,本科及以上学历,有AI芯片系统软件开发或验证经验者优先;2,熟悉NPU/GPGPU体系结构,深入理解ROCm/Cuda Runtime项目;满足以下条件优先:1,熟悉AI系统的运行时开发;2,熟悉集群通信的原理和实现,包括MPI,NCCL等通信库。熟悉AI推理引擎运行机制,理解Pytorch Aten,Executorch,TVM Runtime 投递...
Were looking for outstanding AI systems software engineers to develop groundbreaking technologies across the inference systems software stack. Our team builds core AI systems software that accelerates high-impact workloads on NVIDIA GPUs, from deep learning primitives
We are now looking for a Deep Learning Performance Software Engineer! We are expanding our research and development for deep learning. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize
【2027】NPU编译器开发工程师 合肥、上海 校招 正式 互联网 / 电子 / 网游 职位描述 1. 参与自研 NPU/RPU 编译器开发,完善前端、IR、优化 Pass、代码生成、运行时对接等模块2. 参与面向 NPU 的易编程 DSL 设计与实现,提升算子开发效率、表达能力和可维护性3. 对接 Triton、PyTorch、MLIR、TVM 等开源编程框架或编译生态,探索主流模型和算子在自研芯片上的落地路径4. 编写和优化 RPU 算子、DSL 算子、Triton 算子,包括矩阵计算、归约、Attention、激活函数、数据搬运等核心算子5. 参与算子性能分析与调优,包括内存访问、并行划分、数据布局、流水调度、指令生成等方向6. 建设编译器和算子相关测试,包括功能正确性测试、性能回归测试、端到端模型验证等7. 阅读和分析开源编译器、AI 框架、GPU/NPU 编程模型相关代码,为内部编译器和 DSL 设计提供参考 职位要求 1.
2027届校招-算法和解决方案工程师 北京、杭州、上海 校招 正式 研发 - 电子 / 半导体 职位 ID:A227994 职位描述 1、跟进前沿算法技术、开源框架及训推并行加速技术,协同客户或上游团队,完成算法选型或迭代。2、协同系统架构等团队,输出算法部署和对应的系统架构方案, 完成方案原型搭建。3、协同工具链等团队,解决算法部署过程中的精度、速度、存储限制等问题,推进项目落地。 职位要求 1、编程基础扎实:熟练掌握Python、C、C++等主流开发语言,具备扎实的代码编写、调试及工程开发能力,可独立完成算法代码开发与优化。2、熟悉深度学习基础理论、训练策略及模型优化方法,掌握PyTorch等主流深度学习开源框架,理解算法量化,量化感知训练等量化方案。3、深入理解神经网络基本工作原理,掌握CNN、LSTM/GRU、Transformer+Attention、MoE等核心网络架构的原理、特性及适用场景,可根据业务需求完成模型选型与替换。4、具备极强的自主学习能力和环境适应能力,能够快速跟进前沿算法技术与工程方案;拥有优秀的逻辑分析、问题排查和拆解能力,可高效解决算法研发与落地过程中的各类技术问题。5、具备优秀的跨团队沟通能力和团队协作意识,责任心强、执行力突出,能够高效推进项目落地,抗压能力良好。加分项:1、具备大语言模型、生成扩散模型、多模态大模型、图像、视频、语音、TTS等至少一个及以上方向的算法研发与工程落地实战经验,可独立完成算法从训练到上线的全流程落地。2、推理加速与工程优化能力:熟悉TVM、ONNX、TensorRT、NCNN、MNN,vLLM,llama.cpp等主流深度学习推理框架及加速平台,掌握模型量化、算子优化、推理链路精简等工程优化手段;具备大模型KV Cache优化、推理加速、显存及算力资源优化、模型轻量化等相关经验。 投递...
机器学习训练框架工程师/专家 北京、上海 全职 研发 - 机器学习 技术类 职位描述 1、负责搜索/推荐/广告场景的机器学习训练框架的设计与开发,服务于公司各业务线;2、负责深入优化训练框架的性能,持续提升模型训练的迭代效率、资源利用效率;3、联合算法持续跟进大模型在搜推广场景的落地,提升业务效果。 职位要求 1、具备扎实的编程基础,熟练掌握C++或Python编程语言;2、接触过至少一种深度学习框架(TensorFlow/PyTorch等);3、有分布式系统、高性能计算的实际项目经验;4、具备独立解决问题的能力,良好的团队合作精神;5、本科及以上学历优先,工作经验3年以上优先。加分项:1、有深度学习框架(TensorFlow/PyTorch)开发经验优先;2、熟悉GPU编程、高性能网络编程、AI编译器者(TVM/MLIR/XLA)优先;3、熟悉机器学习、深度学习算法,希望从事系统架构者优先;4、有开源项目贡献代码者优先。 投递...
AI编译器开发工程师 北京、上海 全职 职位描述 全栈开发自研编译器,辅助算法业务落地跟进算法交付,在规定时间内交付可部署的算法,并支持多芯片部署持续优化编译器各层能力,保持编译效果对齐业界SOTA 职位要求 5年以上AI编译经验,独立部署过vla,vlm类型模型;理解AI框架及常见的AI模型;熟练掌握python以及C/C++编程;对AI编译技术栈有深度理解,前端、优化、后端有基本认知熟悉transformers,hugginface,pytorch等框架的使用并了解算法搭建过程深度理解torch.compile, torch.trace, jax.jit过程原理,有能力进行AST语法树解析熟练使用TVM,TensorRT等框架并有实际部署经验了解算子优化与集成常用技术,可以使用算子注册加速模型 投递...
具身智能-运动智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 - 研发 职位描述 【具身端到端规划算法工程师/资深/专家/TL】(深圳/上海/北京)岗位职责:1. 负责研发基于深度学习的四足/人形等机器人的全身状态规划控制,实现灵活自然的动态环境的避障和通过2. 设计实现鲁棒高效的 感知-规划-控制 端到端方案,实现鲁棒高效精准的机器人动作规划3. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建4. 应用模仿学习,在/离线强化学习进行模型训练提升模型性能,开发高效的模型评测方法提高迭代效率5. 解决模型评测/部署/真机测试中遇到的问题,满足项目交付指标要求6. 跟踪前沿技术方案,持续迭代升级方案 岗位要求:满足3条及以上1. 人工智能、计算机、机器人、自动驾驶、控制等相关专业硕士或博士学位2. 熟练掌握主流深度学习的时序规划方法如transformer,生成式方法 diffusion policy,掌握主流端到端架构方案如BEV-tranformer/diffusion架构。3. 熟悉基于采样/搜索/优化的决策规划算法,熟悉机器人全身控制。4. 具有模仿学习或强化学习训练经验,熟悉PPO/GRPO/DPO等5. 有实际的端到端系统开发经验,如智能驾驶的E2E。6. 熟练使用PyTorch/TensorFlow深度学习框架,熟练使用Python/C++语言编程,有实际项目开发经验7. 熟悉机器人常用开发环境Mojuco/NVIDIA Isaac/gazebo,有 ROS2/DDS下的开发经验,,能够在Linux环境下独立进行开发和调试; 加分项:8. 有智能驾驶/机器人领域的工程落地经验者优先9. 在机器人顶会(SR/IJRR/TRO/RSS/ICRA/IROS等)或AI顶会(CVPR/NeurIPS/ICML/ICLR等)发表论文者优先
机器人智能体-模型框架算法工程师/专家 深圳、上海 社招 全职 互联网 / 电子 / 网游 职位描述 职责:负责端侧具身智能体业务模型中的:数据清洗/标注,模型架构设计与联合训练,模型部署优化一个或多个方向:1. 对多个模型进行分布式高效联合训练,解决联合训练冲突, 1. 高效的数据加载/增强策略,加速模型训练与实验迭代。 2. 优化训练Pipeline(混合精度/梯度检查点/显存优化)2. 制作联合标注训练和评测样本,根据模型功能搭建联合标注/自标注的自动化框架,支持大规模批量自动化标注和构建。3. 大规模数据闭环构建与驱动:实现基于场景挖掘、失败案例分析、主动学习的数据自动筛选、标注增强与策略迭代优化。4. 模型部署与性能优化: 1. 通过模型剪枝/蒸馏/量化等实现提升业务模型部署推理效率 2. 优化主干网络,和模型结构 3. 解决模型在端侧部署时的精度和性能问题。 4. 训练和推理的对齐 职位要求 要求:1. 人工智能、计算机、机器人、自动驾驶等相关专业硕士或博士学位2. 熟练掌握C++/Python/脚本编程,有Linux下开发经验,具备优秀的开发和调试能力;3. 熟悉Pytorch、TensorFlow等AI框架,了解TensorRT、TVM;4. 如下一个或多个方向经验 1. 有实际模型压缩、剪枝、蒸馏、量化技术等轻量化经验; 2. 掌握LoRA等微调技术,熟悉MoE架构/多模态训练
中间件软件开发专家-具身智能 北京、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 岗位职责:1. 负责通信与调度中间件架构与研发2. 负责端侧推理引擎与模型部署优化3. 负责系统性能分析与优化 职位要求 任职要求:1.计算机、电子信息或软件相关专业本科及以上学历;2.熟悉Linux 系统软件与驱动开发,拥有扎实大规模C/C++开发调试技能与经验;3.熟悉主流端侧AI计算平台并有相关算法部署与优化经验;4.熟悉模型端侧推理部署与优化,有TVM/TensorRT/Cuda经验优先;5.熟悉系统性能分析与优化,有大规模高性能高可靠代码设计与实现经验; 投递...
新业务部-AI编译器开发工程师/专家 北京、成都 社招 全职 职位 ID:A196077 职位描述 1.负责AI芯片编译器的方案及开发实现(侧重点为高能效比与加速器的高利用率);2.负责编译器及相应工具链的开发和维护;3.结合AI算法,架构和产品需求,完成AI编译器的方案及软件开发;4.模型的性能优化,研发性能和功耗分析及优化工作5.结合业界编译器的发展动态,规划自研编译器的演进 职位要求 1.计算机,通信,微电子工程或相关专业硕士以上学历,本方向3年及以上工作经验;2.精通处理器的指令集,图编译,编译前端,中端优化技术,后端code生成,任务排序优化;3.熟悉TVM或者MLIR一种编译框架,熟悉网络的编译优化策略;4.精通C++编程,有GPGPU/NPU编译经验者优先;5.有成功IP落地的经验者优先 投递...
深度学习工具链研发工程师 北京、武汉 社招 全职 职位 ID:A127152 职位描述 1. 负责开发自动驾驶深度学习工具链2. 负责自动驾驶算法模型优化与部署工作3. 负责自动驾驶深度学习模型量化/压缩算法的研发 职位要求 1. 扎实的编程基础(Python/C++)与良好的工程习惯2. 熟悉常用深度学习框架(如PyTorch, TensorFlow等)3. 有深度学习模型训练、量化、裁剪、NAS、HPO、部署等任一经验者优先4. 熟悉编译优化技术(TVM/XLA/MLIR/Halide等)者优先5. 熟悉计算机视觉、自动驾驶感知算法者优先 投递...
AI Infra专家/工程师 北京、上海 社招 全职 职位 ID:A154597 职位描述 1. 基于高性能异构计算平台,设计开发面向自动驾驶场景的AI推理基础架构;2. 主导高性能推理框架的开发与优化,重点提升模型在复杂场景下的实时推理效率与能效比;3. 针对核心自驾模型进行计算图与算子级优化;4. 参与软硬件协同优化体系设计,为硬件架构升级提供算法侧优化建议;5. 协同算法团队推进模型在异构计算平台的性能调优与落地验证。 职位要求 1. 计算机、电子、自动化等相关专业本科及以上学历,3年以上高性能计算或AI推理系统开发经验;2. 精通GPGPU编程(如CUDA、OpenCL)及高性能推理框架(如TensorRT/TensorRT-LLM、ONNX Runtime、TVM/MLC-LLM等)的开发与优化;3. 具备丰富的高性能算子开发与优化经验,熟悉主流AI模型(特别是视觉、多模态及扩散模型)的推理特性;4. 对自动驾驶场景有深刻理解,熟悉自驾场景模型的推理优化;5. 有异构计算平台(含GPU/FPGA/专用加速器等)开发经验者优先;6. 优秀的系统分析、解决问题和团队协作能力。 投递...
AI编译器研发(自动驾驶/机器人) 深圳、上海 全职 芯片板块 职位描述 1、编译器架构设计:设计并实现AI编译器中间表示(IR),支持模型图优化、算子融合、循环优化等;构建从模型解析到硬件指令生成的完整编译流水线,支持PyTorch/Onnx等主流框架。2、硬件后端优化:针对自研芯片,开发高效算子库与代码生成策略:优化内存访问、指令调度,提升端到端推理性能。3、性能调优与验证:通过Profiling工具定位性能瓶颈,优化算子,并设计自动调优流程;与硬件团队合作,验证算子在目标设备上的性能与正确性。4、业务场景落地:结合自动驾驶感知、决策规划,或机器人SLAM、运动控制等场景,优化编译器对实时性、低功耗的需求;参与模型量化与编译器的协同设计。5、技术探索与创新:研究动态形状处理、稀疏计算等前沿编译技术;探索LLVM/GCC等传统编译技术与MLIR的集成方案。 职位要求 1、必备技能:(1)精通C++/Python,具备大型系统开发经验。(2)深入理解MLIR框架,熟悉其Dialect设计、Pass优化机制。(3)有NPU或GPU硬件经验,熟悉CUDA、OpenCL或NPU专用指令集。(4)熟悉至少一种深度学习框架(TensorFlow/PyTorch/Onnx)。2、加分项:(1)有LLVM/GCC后端开发经验,熟悉内联优化、寄存器分配、指令调度、代码生成等。(2)参与过开源AI编译器项目(如TVM、Apache MLIR)。(3)了解自动驾驶感知算法(如BEV感知、多传感器融合)或机器人控制等模型。(4)发表过编译器优化、体系结构相关论文或专利。岗位介绍:我们正在寻找AI编译器研发工程师,专注于AI编译器框架设计与优化。包括模型量化、图优化、codegen、算子优化及软硬件协同优化等。您将参与构建高性能、低延迟的AI编译工具链,支撑自动驾驶、机器人等业务场景。 投递...