Were looking for outstanding AI systems software engineers to develop groundbreaking technologies across the inference systems software stack. Our team builds core AI systems software that accelerates high-impact workloads on NVIDIA GPUs, from deep learning primitives
NVIDIA is seeking Software Performance Architects to optimize GPU kernel performance for state-of-the-art data-center platforms. We build automated, data-driven workflows to detect, explain, and prevent performance regressions across key deep learning workloads, partnering closely with kernel developers, compiler
固件开发专家 上海、杭州 全职 互联网 / 电子 / 网游 职位描述 岗位职责1. 主导 AI 芯片运行时(Runtime/Fireware)、驱动(Driver)及基础库(Lib)的设计与优化,构建高效的异构计算框架。2. 开发调试工具(Debugger)、性能分析工具(Profiler)及自动化测试框架,支撑芯片量产交付。3.Pre-silicon阶段协同架构/DV/CV团队建立验证基础设施,支持C-Model/Simulation/Emulation平台算子开发4.Post-silicon阶段NPU Bringup;职位要求:1.计算机相关专业,5年以上工作经验,3年以上芯片Firmware开发、调试和测试经验;2.熟悉ARM/RISC-V架构,熟悉NEON/RVV向量指令优化,熟悉汇编,驱动开发3.有NPU Firmware/Runtime 开发和量产交付经验优先;4.熟悉linux kernel内存管理/进程管理/系统调用等核心机制,具备os开发相关经验者优先。5. 具备复杂问题拆解能力,能独立制定技术方案并推动跨团队协作。 职位要求 - 投递...
自研 NPU 芯片运行时高级开发工程师 上海 全职 互联网 / 电子 / 网游 职位描述 1. 主导 AI 芯片运行时(Runtime/Fireware)、驱动(Driver)及基础库(Lib)的设计与优化,构建高效的异构计算框架。2. 开发调试工具(Debugger)、性能分析工具(Profiler)及自动化测试框架,支撑芯片量产交付。3.Pre-silicon阶段协同架构/DV/CV团队建立验证基础设施,支持C-Model/Simulation/Emulation平台算子开发4.Post-silicon阶段NPU Bringup; 职位要求 1.计算机相关专业,5年以上工作经验,3年以上芯片Firmware开发、调试和测试经验;2.熟悉ARM/RISC-V架构,熟悉NEON/RVV向量指令优化,熟悉汇编,驱动开发3.有NPU Firmware/Runtime 开发和量产交付经验优先;4.熟悉linux kernel内存管理/进程管理/系统调用等核心机制,具备os开发相关经验者优先。5. 具备复杂问题拆解能力,能独立制定技术方案并推动跨团队协作。 投递...
【27届校招】嵌入式软件工程师 上海 正式 研发 - 电子 / 半导体 职位描述 1.负责嵌入式平台的方案设计、开发、调试、验证以及维护。2.基于仿真平台、FPGA验证平台,完成操作系统移植、SOC底层驱动软件开发。3.负责Bootloader、Linux内核的驱动开发、调试与优化工作。 职位要求 1. 方向要求,熟悉以下任一方向即可:1)以太网驱动:Ethernet驱动开发与验证;2)高速方向:高速接口(PCIe)。2.熟悉Linux内核驱动开发框架,有较好的Linux基础,熟悉makefile,熟悉常用的Linux kernel调试工具。3.熟悉ARM Cortex-A/R/M架构,具备芯片bringup、移植经验者优先。4.熟练使用示波器等硬件工具分析定位问题。5.具备芯片验证和驱动开发经验者优先。6.有参与开源软件硬件项目,具备良好的团队合作能力,沟通能力和学习能力。 投递...
【27届校招】AI软件工程师 上海 正式 研发 - 电子 / 半导体 职位描述 1. 高性能计算核心开发:针对自研芯片架构,设计、开发并优化高性能的CUDA及DSP算子,以支撑大模型推理、实时图像处理等关键业务。2. AI系统集成与验证:负责自研芯片上AI加速器系统的集成与验证,并搭建与完善算子自动化测试验证平台,确保代码的工程化质量与高效落地。3. 嵌入式与算法软件交付:参与高实时性、高算力的嵌入式软件平台与通用机器人操作系统的设计与交付。 4. 前沿算法探索与实现:参与自动驾驶/机器人算法(如识别、规划、导航、多模态大模型等)的设计、交付与优化。 5. 全栈生态建设:深度参与从芯片需求到架构设计的转换,并为建设高性能计算软件栈的生态做出贡献。 职位要求 1. 硕士及以上学历,计算机、电子、软件、通信、自动化、数学等相关专业。2. 精通 C/C++ 与 Python,熟悉Linux开发环境,掌握gprof/perf等性能剖析工具,具备扎实的数据结构与算法基础和良好的软件工程习惯。 3. 具备极强的学习能力、良好的沟通协调能力和团队合作精神。4. 核心技术要求 (满足以下至少一项): * 高性能计算:理解GPU架构(如SM/Tensor Core/Memory Hierarchy)及CUDA编程模型(Kernel/Thread Hierarchy/Stream),了解并行计算、缓存优化、向量化指令集(AVX/NEON)等知识。* 深度学习工程化:熟悉深度学习模型从训练到部署的全流程,对CUDA、PyTorch/TensorFlow、ONNX Runtime以及Transformer、VLM等流行模型架构有一定了解。 * 底层系统软件:对CPU体系结构、操作系统原理、Linux驱动和应用有较深入的理解。加分项
低精度量化/模型压缩算法工程师 上海 校招 正式 技术族 - 算法类 职位 ID:A39276 职位描述 1. 负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地。2. 研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等。3. 负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益。4. 与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈。5. 构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程。6. 针对机器人端侧(Jetson//Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署。7. 输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效。 职位要求 1. 硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验。2. 精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数。3. 熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8 ()、FP8 量化。4. 熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)。5. 熟练使用
优才-低精度量化/模型压缩算法工程师 上海 校招 正式 技术族 - 算法类 职位 ID:A43922 职位描述 1. 负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地。2. 研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等。3. 负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益。4. 与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈。5. 构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程。6. 针对机器人端侧(Jetson//Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署。7. 输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效。 职位要求 1. 硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验。2. 精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数。3. 熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8 ()、FP8 量化。4. 熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)。5. 熟练使用
At Sonos we want to create the ultimate listening experience for our customers and know that it starts by listening to each other. As part of the Sonos team, you’ll collaborate with people of all styles,
大模型算法工程Co-Design-2028届实习 北京、上海 校招 实习 研发 - 算法 2028届实习生招聘 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
SummaryImagine what you could do here. At Apple, new ideas have a way of becoming extraordinary products, services, and customer experiences very quickly. We are looking for great Systems Reliability Engineers to design, build and operate
大模型算法工程Co-Design-2027届 北京、上海 校招 实习 研发 - 算法 2027届校园招聘 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
大模型算法工程Co-Design-日常实习 北京、上海 校招 实习 研发 - 算法 日常实习 职位描述 寻找深度理解大模型算法,同时具备顶尖系统工程设计能力的专家。你将作为算法研究与工程落地的核心桥梁,主导优化大模型训练/推理效率、性能与成本,确保前沿算法在大规模系统中高效实现。1. 协同设计与优化: - 深入理解大模型算法(架构、训练/推理技术),评估其工程可行性、性能瓶颈与成本。 - 主导设计下一代训练/推理框架或核心组件,确保原生支持高效算法实现(如高效Attention、通信优化)。 - 系统性解决训练/推理工作负载的性能瓶颈(计算、通信、存储)。2. 高性能系统实现: - 设计并实现高性能核心(如定制Kernel)、优化通信与数据流水线。3. 分布式架构: - 设计构建大规模分布式训练系统(DeepSpeed/Megatron-LM/FSDP)。 - 设计构建高并发、低延迟的大模型推理服务平台。4. 前瞻探索与协作: - 跟踪领域前沿,探索验证新技术(新硬件、非Transformer架构等)。 - 高效沟通,跨团队(算法、工程、平台)协作推动方案落地。 职位要求 1. 学历/经验: 计算机/人工智能等相关领域本科及以上,或具备同等杰出实践经验。2. 大模型基础: 深刻理解Transformer架构及大模型训练/推理等相关核心技术。3. 工程硬实力:
AI-System 研发实习生 上海、北京 校招 实习 研发 - 后端开发 职位描述 我们在做什么 MiniMax 正在构建支撑下一代 AGI 的超大规模 AI基础设施。我们管理着业界领先规模的 GPU 集群,直接面向大模型训练与推理,从 Linux 内核、高性能网络、分布式存储到云原生平台,为模型的高速迭代提供最坚实的基础设施支撑。 在这里,你写的每一行代码都可能让万卡训练任务快几个百分点,让推理延迟再降一个量级——你的工作直接影响模型迭代速度与产品体验。 开放方向(Base 上海 / 北京)1. LinuxOS & Kernel 方向 — 深入内核调度 / 内存 / IO / 网络协议栈,优化超大规模AI 集群
具身智能操作系统工程师(Linux开源社区方向) 上海 全职 职位描述 1、负责面向具身智能场景的Linux开源操作系统核心模块研发,包括内核、系统服务、基础软件包、编译构建系统及软件仓库等。2、负责操作系统性能优化,围绕计算、存储、网络及异构算力场景,优化CPU调度、内存管理、I/O和网络性能。3、负责操作系统稳定性与安全建设,包括故障诊断、内核崩溃分析、安全加固、漏洞修复和长期版本维护。4、参与openEuler、龙蜥、Linux Kernel等开源社区运作,负责社区提案、代码贡献、版本发布、分支维护及开发者协作。5、推动操作系统适配主流服务器、CPU架构、加速卡、存储和网络设备,完善软硬件兼容性。6、建设发行版工程体系,包括软件包管理、自动化构建、CI/CD、质量测试、版本升级和镜像发布。 职位要求 1、本科及以上学历,计算机、软件工程等相关专业,3年以上Linux操作系统或服务器基础软件研发经验。2、熟练掌握C/C++、Shell或Python,具备扎实的Linux系统开发和问题排查能力。3、深入理解Linux内核,熟悉进程调度、内存管理、文件系统、网络协议栈、设备驱动中的一个或多个方向。4、熟悉RPM、DNF/YUM、systemd、Koji/OBS等发行版构建及软件包管理体系。5、熟悉x86、ARM等服务器架构,具备数据中心计算、存储、网络或虚拟化相关经验。6、具备openEuler、龙蜥、Linux Kernel等开源社区贡献经验,熟悉社区协作、代码评审和版本维护流程。7、熟悉Git、CI/CD及自动化测试,能够独立负责模块开发、性能调优和复杂问题定位。 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项-
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: General Summary Qualcomm is leveraging its expertise in wireless and computing technologies to drive a major technological revolution in the automotive industry. Having led
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: General Summary Qualcomm is leveraging its expertise in wireless and computing technologies to drive a major technological revolution in the automotive industry. Having led
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Role Summary We are seeking a AI solution Software Engineer focused on end-to-end latency optimization across heterogeneous compute IPs (GPU, NPU, ISP, CPU). You
Locations: Shanghai, China Categories: Engineering Req ID: 89498 WHAT YOU DO AT AMD CHANGES EVERYTHING At AMD, our mission is to build great products that accelerate next-generation computing experiences—from AI and data centers, to PCs, gaming