2027校招-NPU/GPGPU验证工程师(北京/西安/上海) 北京、西安、上海 校招 正式 职位描述 岗位职责1. 聚焦自研高端NPU/GPGPU算力内核,负责张量计算阵列、指令调度、并行流水线、片上缓存、访存控制、算力调度等核心模块的全流程验证,深度参与芯片从研发、仿真迭代到流片量产的完整过程;2. 基于UVM验证方法论,搭建标准化、可复用的内核验证平台,依据模块规格书设计常规功能、边界场景、异常场景测试方案,独立开发测试用例、激励序列及参考模型;3. 负责功能仿真、波形分析、日志排查,精准定位RTL功能Bug,跟进问题迭代修复,完成问题闭环;主导代码覆盖率、功能覆盖率收集与收敛,保障验证完备性;4. 学习并维护芯片仿真编译、自动化回归测试流程,协助团队优化VCS仿真脚本、验证测试流程;配合团队完成日常版本迭代、回归测试及功能验收工作,保障芯片研发迭代高效有序推进,助力项目顺利交付。 职位要求 任职要求1. 本科、硕士应届生、微电子、集成电路、电子信息、计算机、自动化等相关专业,认同芯片行业发展,愿意长期深耕IC验证赛道;2. 熟练掌握Verilog/SystemVerilog语法,精通时序逻辑、状态机、流水线等数字电路核心原理;了解UVM验证体系,熟悉Testbench搭建、激励生成、覆盖率收敛等核心验证流程;3. 熟悉Linux开发环境,掌握基础命令操作;了解Shell、Python脚本编写,可独立完成简单仿真脚本优化、批量回归任务优先;4. 逻辑思维清晰,具备较强的问题分析和Debug排查能力,工作细心严谨、主动性强,具备良好的团队协作能力;5. 拥有NPU/GPU/AI加速器/处理器内核相关项目、课设、竞赛或科研经历;熟练使用VCS、Verdi工具,有独立搭建UVM验证环境经验;熟悉脉动阵列、张量计算、指令流水线、Cache、片上总线等算力芯片架构者优先。 投递...
2027校招-推理框架工程师(上海/成都/北京) 北京、上海、成都 校招 正式 职位描述 分布式推理系统开发1、设计并实现大规模AI模型(如LLM、多模态模型)的分布式推理框架,优化吞吐量(Throughput)和延迟(Latency)。2、开发模型并行(Tensor/Pipeline Parallelism)、动态批处理(Dynamic Batching)和连续批处理(Continuous Batching)策略。3、解决多节点、多GPU环境下的负载均衡和通信瓶颈问题。4、优化计算图执行(如使用TensorRT、ONNX Runtime、vLLM等工具)。5、实现量化(FP8/INT8)、KV Cache优化、Flash Attention等加速技术。 职位要求 精通 Python/C++,熟悉PyTorch/TensorFlow推理生态。深入理解分布式系统(NCCL/RPC通信、GPU Direct RDMA)和 并行计算(CUDA、OpenMP)。熟悉推理加速技术(量化、剪枝、算子融合)和框架(TensorRT、vLLM 、Sglang)。 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项- 有自研芯片/FPGA/NPU/GPU
Locations: Shanghai, China Categories: Engineering Req ID: 89499 WHAT YOU DO AT AMD CHANGES EVERYTHING At AMD, our mission is to build great products that accelerate next-generation computing experiences—from AI and data centers, to PCs, gaming
SoC性能架构与建模工程师 上海、合肥 社招 全职 工程技术 本科及以上 工作年限不限 职位描述 岗位概述参与高性能智能辅助驾驶 SoC 的性能建模、架构分析与性能优化。通过 Cycle-Accurate / Transaction-Level 性能模型,对 CPU、NPU、NoC/总线互联、Cache/SLC、DDR 及典型 workload 进行端到端分析,识别系统瓶颈,为芯片的性能规格、互联架构、存储层次及关键微架构参数提供量化决策依据。模型是手段,架构决策是目标。核心职责使用 C++ / Python 搭建和维护 SoC 级性能模型,对 NoC/总线、Cache/SLC、DDR 等关键模块进行参数化建模。分析典型 AI / 智能辅助驾驶 workload 的计算、访存和通信特征,开展 trace 采集、回放及性能分析。分析带宽、延迟、Outstanding、Queue、Cache 命中率、DDR 效率及 NoC 拥塞等关键指标,定位系统性能瓶颈。参与 NoC
芯片设计工程师(总线) 合肥、上海 社招 全职 数字技术 - 芯片研发 本科及以上 3-5 年 职位描述 岗位职责● 负责SoC芯片片上总线与互联子系统的微架构设计与RTL实现,涵盖从架构方案到流片交付的全流程● 参与片上网络的拓扑定义、路由策略设计与流控机制实现,满足多核/多子系统的互联需求● 负责Cache一致性协议的微架构设计与实现,如:Snoop Filter、 一致性域划分与跨域互联方案、DVM● 完成总线的性能分析与调优,包括带宽、延迟、Outstanding等关键指标的优化● 编写设计文档,配合验证团队完成功能验证与覆盖率收敛● 协同前端综合、后端实现团队完成时序收敛与物理约束对接● 跟踪行业前沿技术与竞品方案,参与下一代总线架构的预研与规划 职位要求 基本要求● 硕士及以上学历,微电子、集成电路工程、计算机体系结构、电子工程等相关专业● 1-5年数字IC前端设计经验,具有总线/互联/NoC/Cache子系统相关项目经历● 熟练掌握Verilog/SystemVerilog,具备独立完成模块级RTL设计与调试的能力● 深入理解ARM AMBA协议体系,至少精通AXI4协议,对CHI协议有实际项目经验者优先● 熟悉Cache一致性原理,理解Snoop、Directory等一致性维护机制● 熟悉数字电路设计方法学,具备良好的时序意识与面积/功耗/性能权衡能力加分项● 有完整SoC芯片流片经验,参与过从定义到Tapeout的全流程● 具备NoC设计经验,了解主流NoC IP(如Arteris FlexNoC)的架构与应用● 有CHI协议实际开发或集成经验,了解CHI Issue B/E等演进方向● 了解UALink、CXL等新兴互联协议者优先 投递...
端侧全模态大模型工程专家 北京、上海、深圳 社招 全职 技术 - 基础架构 职位 ID:A133605 职位描述 1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;2. 深入全模态模型双工异步工作流推理开发与优化;3. 模型量化、KV Cache 管理与投机推理加速;4. 分析硬件性能调优与内存管理;5. 跟进主流芯片厂商技术栈演进; 职位要求 1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;3. 有Orin平台开发经验;4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;5. 精通 C/C++/python;6. 具备 异步多线程计算、内存管理优化 实战经验;7. 熟悉
大模型算法工程师-智能体方向 急招 北京、上海、成都 社招 全职 技术 - 算法 职位 ID:A22865 职位描述 1. 端到端智能系统构建与优化:覆盖意图识别、多轮对话改写、知识检索、内容生成与用户偏好对齐全链路,持续提升交互质量与系统稳定性;2. Agent Harness 设计与建设:设计并实现稳定可扩展的智能体运行框架(Agent Harness),负责工具调用编排、上下文与记忆管理、执行循环控制、错误恢复与重试、沙箱化执行环境等核心能力,为上层 Agent 提供可靠的运行底座;3. Agent 能力与范式演进:实现具备任务规划、工具调用、自我反思能力的 Agent;探索规划执行、反思迭代等范式的工程落地,以及多 Agent 协作机制在复杂任务分解中的应用;推动 Agent 长程任务执行的稳定性与可观测性建设;4. 垂直领域大模型应用落地:参与教育等场景对话式 AI 产品的全流程研发,探索长上下文、结构化推理与多模态能力在真实业务中的创新应用;5. 模型能力与评测体系:结合业务数据开展指令微调、偏好对齐及 Prompt 工程;推动 Agent 轨迹(trajectory)评测、工具调用成功率、端到端任务完成率等指标体系建设,构建覆盖准确性、可靠性与安全性的自动化评测框架。 职位要求 1.
Req ID 90929 | Shanghai, China, Capri (Shanghai) Automobile Technology Co., Ltd. About the Team This position is part of ZF’s ADAS & HPC business, which is entering an exciting new phase of growth and transformation
We are looking for a GPU C++ Modeling Engineer intern – Performance/Functional Modeling, Validation and Analysis of Shader. TPC arch team is a fast-growing team which welcomes all level engineers to join. Our aim is to
As a Senior GPU & AI Infra Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving GPU/AI Infra technical strategy, system-level
As a Senior Agent Infrastructure Network Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving DPU/SmartNIC-based North-South network architecture strategy, Agent-aware
RESPONSIBILITIES Development Management:Setting goals and planning the development process for the team Estimating the time of the implementation of individual tasks Organizing and facilitating team rituals Creating product QA process Participating in testing and delivery processes
大模型工程师-RL框架&算法 北京、上海 社招 全职 互联网 / 电子 / 网游 职位描述 职位描述RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。你会参与:1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR
【2027】AI推理部署工程师(具身智能方向) 北京、深圳、上海、杭州 校招 正式 互联网 / 电子 / 网游 职位描述 1. 具身模型库工程化落地:负责将点云感知、视觉定位等传统算法,以及Pi0/Groot等VLA模型,在自研大算力芯片上进行推理部署与性能调优,确保精度/延迟指标的统一出口2. 工具链开发与维护:参与对外发布的一键式训练-推理发版工具链建设,封装底层算子差异,保障模型在不同场景下的精度对齐和长期运行稳定性3. 模型轻量化加速:配合模型结构优化同学,落地W8A8、W4A16、W4A8等混合精度量化方案;针对Transformer架构和CNN架构进行算子融合与内存排布优化 职位要求 1. 熟练掌握C++/Python,具备良好的代码习惯和性能分析能力(会使用perf、Nsight等工具)2. 熟悉ONNX、TensorRT、PyTorch部署链路,有实际将PyTorch模型转为TensorRT/SNPE等端侧引擎并跑通的经验3. 了解常见量化原理(PTQ/QAT),有实际处理过精度掉点问题加分项:1. 对VLA(视觉语言动作模型) 的推理架构有基础认知,了解KV Cache、Beam Search等推理优化手段2. 有机器人、自动驾驶或AR/VR相关的嵌入式部署经验者优先 投递...
2027届校招-算法和解决方案工程师 北京、杭州、上海 校招 正式 研发 - 电子 / 半导体 职位 ID:A227994 职位描述 1、跟进前沿算法技术、开源框架及训推并行加速技术,协同客户或上游团队,完成算法选型或迭代。2、协同系统架构等团队,输出算法部署和对应的系统架构方案, 完成方案原型搭建。3、协同工具链等团队,解决算法部署过程中的精度、速度、存储限制等问题,推进项目落地。 职位要求 1、编程基础扎实:熟练掌握Python、C、C++等主流开发语言,具备扎实的代码编写、调试及工程开发能力,可独立完成算法代码开发与优化。2、熟悉深度学习基础理论、训练策略及模型优化方法,掌握PyTorch等主流深度学习开源框架,理解算法量化,量化感知训练等量化方案。3、深入理解神经网络基本工作原理,掌握CNN、LSTM/GRU、Transformer+Attention、MoE等核心网络架构的原理、特性及适用场景,可根据业务需求完成模型选型与替换。4、具备极强的自主学习能力和环境适应能力,能够快速跟进前沿算法技术与工程方案;拥有优秀的逻辑分析、问题排查和拆解能力,可高效解决算法研发与落地过程中的各类技术问题。5、具备优秀的跨团队沟通能力和团队协作意识,责任心强、执行力突出,能够高效推进项目落地,抗压能力良好。加分项:1、具备大语言模型、生成扩散模型、多模态大模型、图像、视频、语音、TTS等至少一个及以上方向的算法研发与工程落地实战经验,可独立完成算法从训练到上线的全流程落地。2、推理加速与工程优化能力:熟悉TVM、ONNX、TensorRT、NCNN、MNN,vLLM,llama.cpp等主流深度学习推理框架及加速平台,掌握模型量化、算子优化、推理链路精简等工程优化手段;具备大模型KV Cache优化、推理加速、显存及算力资源优化、模型轻量化等相关经验。 投递...
【技术保障】模型推理优化专家 杭州、上海 全职 互联网 / 电子 / 网游 技术类 职位描述 推理性能优化1. 对LLM在线推理全链路进行性能分析与瓶颈定位,针对性优化 TTFT、TPOT、吞吐等核心指标。2. 深入调优推理引擎(vLLM/SGLang/TensorRT-LLM等),包括 KV Cache 管理、continuous batching、量化、推测解码等关键技术。3. 结合业务 SLO 要求,设计推理部署方案(机型选型、并行策略、batch 策略等),在满足延迟约束的前提下最大化 GPU 利用率平台工程与成本优化1. 基于Kubernetes设计和落地 GPU 工作负载的调度策略,包括算力调度、虚拟化资源管理、拓扑感知、亲和性、HPA等。2. 识别低利用率、低性价比算力选型等资源低效问题,推动资源整合与优化,降低单位推理成本。3. 参与 AI 平台产品设计和研发,从工程角度出发不断优化推理服务管理模式和流程,提升用户体验和效率。业务协同与降本增效1. 与业务团队深度合作,理解其推理场景特征(模型大小、请求分布、延迟要求),提供定制化的优化方案,并推进落地2. 推进推理性能与成本的可观测体系建设,在大语言模型推理场景践行FIinops理念。 职位要求 1. 具备扎实的 LLM
大模型工程师-RL框架&算法-2027届 北京、上海 校招 正式 研发 - 算法 职位描述 我们希望你在某个领域有真正的深度——推理加速、GPU 性能优化、分布式系统、RL 工程,都行——同时对算法前沿保持真实的好奇心。你不需要什么都懂,但你应该知道自己不懂的东西在哪,并且想去弄懂它。1. RL Rollout:推理是 RL 循环的发动机,我们使用Forge作为我们的RL框架。Rollout占据整个 RL 循环大部分的 wall-clock 时间,并且约束RL算法和Rollout策略的多样性,能多快、多灵活地生成轨迹,直接决定迭代速度。难点包括:Agentic(多轮、环境交互、外部状态机感知的推理系统优化、工具调用和环境的速度不稳定性)、长尾(深入的调度策略和latency优化)、KV Cache 管理、极致的吞吐优化、RL算法Co-design的Rollout策略和优化。2. 通用高性能推理 serving——RL Rollout的效率,最终落在一个底座上:一个业界顶尖的高性能推理引擎。模型能力的上限,常常不卡在算法,而卡在基础设施的某个角落,我们做的事,就是把系统的瓶颈找出来,把它打通。3. 算法与推理 codesign——我们不把推理当成训练下游被动的执行方,而是让推理、模型结构、训练算法三者协同优化。一方面,我们做的是托底:让模型不受工程与推理的约束,去 scale up 模型规模、设计模型结构、实现算法——想法不该死在推理跑不动上。另一方面,我们把推理效率作为核心指标之一反向输入到设计里,和团队一起深度优化模型结构与训练算法,端到端地抬高模型能力与效率的双重上限。从架构设计阶段就一起做,而不是等方案定了再来实现。 职位要求 基本要求1. 编程能力扎实,有清晰的系统设计思路,有强烈的工程品味和责任心;2. 对大模型推理系统或 RL 工程某一方向有深入理解,能独立发现问题、提出方案并推动落地;3. 主动追踪算法与系统前沿,能将论文洞见转化为工程判断;加分项1. 对主流推理
大模型工程师-RL框架&算法-2028届 北京、上海 校招 实习 研发 - 算法 职位描述 RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。你会参与:1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR / Agentic
Company Description We take care of our employees, and they take care of our customers! Become a member of a global community! The international logistics industry is an integral piece of the global trade puzzle; we