AI runtime工程师 上海、合肥 社招 全职 数字技术 - 算法 本科及以上 3-5 年 职位描述 负责开发深度学习AI模型的runtime软件,完成计算资源调度、内存管理、host-device并行优化工作。1,分析和解决KMD/UMD的功能、性能和稳定性问题,确保高质量交付AI系统的运行时软件;2,与编译器、驱动工程师协同提供定制优化项和编程api;3,参与故障检测和恢复机制设计,保证AI系统的可靠性;4,参与Profiling工具设计,保证AI系统的性能可视化和瓶颈定位;5,持续改进通信和调度机制, 与业务团队协作完成多模型部署,提高芯片的综合计算效率和系统吞吐量; 职位要求 1,计算机、通信或者电子相关专业,本科及以上学历,有AI芯片系统软件开发或验证经验者优先;2,熟悉NPU/GPGPU体系结构,深入理解ROCm/Cuda Runtime项目;满足以下条件优先:1,熟悉AI系统的运行时开发;2,熟悉集群通信的原理和实现,包括MPI,NCCL等通信库。熟悉AI推理引擎运行机制,理解Pytorch Aten,Executorch,TVM Runtime 投递...
We are now seeking a Senior Managed Runtime Compiler Engineer with strong performance engineering, compiler, virtual machine, interpreter, and runtime experience to join our Compiler Team. We craft compiler and runtime technology that realize the potential of NVIDIAs CPUs
AGI产品研发工程师-应届生-TOP Talent 北京、上海 校招 正式 互联网 / 电子 / 网游 MiniMax Top Talent人才计划 职位描述 产品研发团队负责 MiniMax AI 产品/Agent的创新与研发。我们相信产品是 AI 连接、服务用户的 Interface,是 Agent 行动与获取反馈的环境,是实现 Intelligence with everyone 的关键。而技术驱动是 AGI 产品的核心。在这里,你将参与 AI Agent 的用户体验、能力、效果的定义与决策, Agent Environment/Runtime/Infra的研发,以及相关大模型训练环境/数据/Benchmark的构建。你的工作不是实现需求,而是定义和研发未来的技术与体验。- 定义 AGI 时代的用户体验与产品,技术驱动创新与效果提升,Intelligence
AI推理引擎/模型部署实习生 北京、深圳、上海 校招 实习 智能制造 / 工业互联网 / 工业自动化 职位描述 安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。【你将参与】1.参与 AI 模型在 CPU / GPU / NPU / DSP 等异构计算平台上的部署与推理优化工作;2.参与模型从 PyTorch / ONNX 等训练框架到端侧推理引擎的转换、编译、部署及调试;3.参与推理引擎的算子适配、算子性能优化、内存管理及数据传输优化;4.参与模型 FP32 / FP16 / INT8 等量化与精度验证,分析模型精度、性能及资源占用;5.参与端侧推理性能分析,包括 Latency、FPS、CPU/GPU/NPU利用率、内存、DDR带宽等指标;6.参与机器人感知、VLM/LLM等 AI 模型的端侧部署及工程化落地;7.配合完成推理引擎、Runtime、异构资源调度等相关基础软件开发与问题定位。 职位要求 任职要求1.计算机、软件工程、自动化、电子信息等相关专业,本科及以上学历;2.熟悉 C/C++
AGI产品研发工程师-实习-TOP Talent 上海、北京 校招 实习 互联网 / 电子 / 网游 - 研发 MiniMax Top Talent人才计划 职位描述 产品研发团队负责 MiniMax AI 产品/Agent的创新与研发。我们相信产品是 AI 连接、服务用户的 Interface,是 Agent 行动与获取反馈的环境,是实现 Intelligence with everyone 的关键。而技术驱动是 AGI 产品的核心。在这里,你将参与 AI Agent 的用户体验、能力、效果的定义与决策, Agent Environment/Runtime/Infra的研发,以及相关大模型训练环境/数据/Benchmark的构建。你的工作不是实现需求,而是定义和研发未来的技术与体验。- 定义
Worldwide Global Selling has been helping individuals and businesses increase sales and reach new customers around the globe. Today, more than 50% of Amazons total unit sales come from third-party selection. The Global Selling team in
实时多模态交互工程实习生(R12069) 上海、北京 实习 职位描述 岗位职责参与实时多模态交互核心功能的开发与测试。接入和调试端到端大模型、Realtime API 协议设计与实现 等服务。参与上下文管理、工具调用、任务编排和状态管理能力建设。协助实现 VAD、对话判停、拒识和打断等交互能力。编写单元测试与集成测试,复现并定位时序、并发和链路问题。参与机器人或开发环境中的联调和效果验收。 职位要求 任职要求计算机、人工智能、自动化、软件工程等相关专业在读。做过多模态相关项目,理解上下文、工具调用和任务编排等基本概念。了解异步编程、WebSocket、流式接口或事件驱动系统中的至少一项。能够使用 Git、Linux及常见调试工具。有测试意识,愿意通过实验和数据验证结论。学习能力强,能够主动拆解和推进技术问题。加分项使用过 OpenAI Agents SDK、ADK、Livekit agent、Pipecat、Agentscope 或类似 Agent 框架。接触过 Realtime API、流式语音交互或 WebRTC。熟悉 VAD、ASR、PCM 音频或基础音频处理。有机器人、智能硬件或嵌入式 Linux 项目经验。使用过 ONNX Runtime、TensorRT 或其他端侧推理工具。有开源项目、技术博客、竞赛或可演示的个人项目。们希望你不满足于“模型能够返回结果”,愿意继续追踪时延、错误和边界情况。能清楚说明自己做过的项目,以及其中真正由自己完成的部分。遇到不确定的问题时,能够提出假设并设计验证方法。对实时多模态交互和机器人方向有长期兴趣。你将获得参与真实机器人交互闭环系统从骨架到落地的完整经历。深入接触实时音视频交互、联合Agent 工程化及端侧部署。在导师指导下负责可以独立验收的功能模块。表现优秀者可获得转正机会。 投递...
2027校招-推理框架工程师(上海/成都/北京) 北京、上海、成都 校招 正式 职位描述 分布式推理系统开发1、设计并实现大规模AI模型(如LLM、多模态模型)的分布式推理框架,优化吞吐量(Throughput)和延迟(Latency)。2、开发模型并行(Tensor/Pipeline Parallelism)、动态批处理(Dynamic Batching)和连续批处理(Continuous Batching)策略。3、解决多节点、多GPU环境下的负载均衡和通信瓶颈问题。4、优化计算图执行(如使用TensorRT、ONNX Runtime、vLLM等工具)。5、实现量化(FP8/INT8)、KV Cache优化、Flash Attention等加速技术。 职位要求 精通 Python/C++,熟悉PyTorch/TensorFlow推理生态。深入理解分布式系统(NCCL/RPC通信、GPU Direct RDMA)和 并行计算(CUDA、OpenMP)。熟悉推理加速技术(量化、剪枝、算子融合)和框架(TensorRT、vLLM 、Sglang)。 投递...
2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。加分项- 有自研芯片/FPGA/NPU/GPU
AI Agent 算法工程师 深圳、上海、杭州 全职 研发 职位描述 岗位使命负责构建支撑AI Agent全生命周期的核心运行时系统与开发框架平台。你将站在大模型工程化落地的最前沿,设计并实现高性能、高可用、可扩展的Agent运行时引擎、编排调度核心、工具调用框架及可观测性体系,为上层业务Agent提供稳定、高效、安全的底层基础设施与开发范式。如果你拥有大数据/分布式系统基础设施的深厚背景,并对将大模型能力转化为可规模化运行的Agent系统充满热情,这正是属于你的机会。核心职责1. Agent运行时系统(Runtime)设计与研发:负责Agent Runtime内核的设计、研发与性能优化,涵盖Agent生命周期管理、状态持久化、上下文窗口管理、长程任务执行与断点恢复等核心能力,保障智能体核心引擎稳定高效运行。2. Agent编排框架与工作流引擎:基于LangGraph/AutoGen/Strands等主流框架理念,设计并实现Agent编排引擎,支持多智能体协作调度、复杂状态机与工作流DAG定义、动态任务路由与负载分发,构建统一的Agent执行通道抽象。3. 工具链与基础设施底座:构建Tool/Plugin注册与调用框架,支持动态工具发现、权限控制、安全沙箱隔离执行;设计大规模Sandbox系统与公司级Agent Tool网关,保障多租户场景下的安全与资源隔离。4. 大规模Agent系统集成与性能优化:深度结合分布式计算、流处理与高并发系统设计经验,优化端到端LLM推理调用链路,实现Token预算管理、上下文压缩、提示词缓存与模型路由策略,持续降低系统延迟与成本。5. Agent可观测性与治理体系:建设全链路可观测性体系,覆盖Tracing、Logging、Metrics及Agent执行轨迹追踪与分析;构建Agent行为合规检测、Prompt漂移监控及自动化质量评估与回归验证管线。6.开发者平台与SDK建设:模块化输出Agent开发套件,封装API/SDK/CLI,降低业务团队Agent构建与调优门槛;定义并维护Agent开发规范与最佳实践,支撑业务场景快速集成与规模化交付。7. 前沿技术探索与架构演进:持续跟踪业界Agent基础设施、MCP/A2A协议、云原生编排等方向的技术进展,推动新技术在平台中的规模化落地,持续迭代架构以适应不断增长的智能体规模与复杂度需求。 职位要求 必备技术能力1. 精通至少一种系统级编程语言(Go/Java/Rust)与至少一种AI/脚本语言(Python),具备扎实的编程功底与优秀的系统设计能力;2. 具备3年以上分布式系统或大数据基础设施(如Kafka、Flink、Spark、Ray、HDFS、消息队列等)的设计开发经验,深刻理解分布式一致性、状态管理、高可用架构与弹性伸缩等核心概念;3. 熟悉Docker/Kubernetes等云原生技术栈,具备微服务架构、服务网格(Service Mesh)、容器编排、CI/CD流水线的工程实践经验;4. 熟悉至少一种主流AI Agent开发框架(LangGraph/AutoGen/LangChain/Strands等)的设计理念与底层实现,理解Agent工作流编排、工具调用、记忆管理等核心机制;5. 理解大语言模型(LLM)基本原理与推理部署流程,有RAG系统、向量数据库或模型服务化的工程经验;6. 具备良好的系统抽象能力与组件化设计思维,熟悉事件驱动架构、插件化架构等常见架构模式。经验背景:1. 在大数据平台、分布式调度系统、云原生PaaS平台或高并发消息系统等相关领域有项目实践经验者优先;2. 有Agent运行时系统、Agent平台基础设施或LLM推理服务平台的设计开发经验者优先;3. 熟悉多租户系统设计,具备大规模系统部署、性能优化与容量规划经验;综合素质:1. 具备优秀的系统抽象、问题拆解与工程架构能力,对构建高可靠、可扩展的Agent基础设施充满热情2. 拥有出色的自驱力、学习能力和跨团队沟通协作能力——你将同时与算法团队、平台工程团队和业务团队深度合作3. 能够快速适应AI Agent领域的高速技术迭代,在快节奏环境中持续学习并输出高质量工程成果4. 对将大数据/分布式系统经验迁移至AI Agent基础设施这一全新领域充满探索欲与使命感加分项:1. 有从0到1构建Agent开发框架、Agent运行时或智能体平台的核心架构经历2. 熟悉Agent评估体系(如SWE-Bench、TAU-Bench等),有自动化评测集构建经验3.
软件工程师 - 大模型端侧优化和部署 北京、广州、上海 全职 职位描述 负责将大模型部署到自动驾驶车端芯片平台(NVIDIA Orin / Thor 等),并进行极致的性能、内存与能效优化。你将在算力、内存、功耗与实时性严格受限、且对安全与稳定性要求极高的车载环境下,打通从推理引擎定制、核心算子优化到车端运行时管理的全栈链路,推动大模型在自动驾驶(端到端决策、场景理解等)场景的规模化落地。岗位职责1. 适配、移植与深度优化车端推理引擎/运行时(TensorRT-LLM、TensorRT Edge-LLM、vLLM、SGLang 等),通过计算图优化、算子融合、高性能 CUDA 算子开发及 KV Cache、投机采样等优化,充分发挥 Orin / Thor 平台算力,满足实时性要求;2. 建立 Benchmark 与 Profiling 体系,跟踪首字延迟(TTFT)、吞吐、内存峰值、冷启动、模型切换、cache 命中率、长稳与抖动等车端核心指标。支持场景理解、Function Calling、结构化输出、流式输出、多模态推理等核心场景的低延迟落地; 职位要求 1. 计算机、电子工程、人工智能、自动化等相关专业,本科及以上学历;2. 具备 2 年以上 AI
Agent Harness 工程师 上海、北京 社招 全职 数字技术 本科及以上 3-5 年 职位描述 负责通用办公 Agent Harness 的设计、开发与持续优化。负责 Agent 与蔚来用户集群业务系统的连接,提升业务系统对 Agent 的可理解性和可操作性。推动 Agent 在实际办公场景中的落地,持续提升目标用户群体中的渗透率、使用频率和任务完成效果。跟进 Agent / Coding Agent 领域的前沿技术,并结合实际产品场景推动技术演进。 职位要求 技术要求:熟悉主流 Agent Harness / Agent Framework,对 Agent Loop、Context、Tool、Planning、HITL 等核心机制有较深入理解。熟练使用
具身软件系统实习生 深圳、上海 实习 互联网 / 电子 / 网游 职位描述 负责人形机器人本体软件系统的设计与开发,将 AI 算法落地为可靠运行的机器人软件。1、与算法团队紧密协作,将强化学习、VLA、大语言模型等 AI 能力集成到机器人系统中,开发并优化 C++ 推理管道;2、设计并实现机器人核心软件架构,包括功能状态机、资源编排、任务调度,控制机器人自主完成复杂任务;3、开发高性能中间件(通信、监控、日志),确保多模块间低延迟、高可靠的数据交换;4、负责机器人数据采集、录制、回放及云端同步的全链路开发,保障数据闭环;5、参与嵌入式层开发,包括传感器(IMU、摄像头、力传感器)和执行器驱动,打通 AI 算法到底层硬件的完整链路。 职位要求 1、本科及以上学历,计算机、自动化、电子工程等相关专业;2、 熟悉 C++(C++17 及以上),具备 Linux 环境下系统级软件开发经验;3、 具备基本代码调试能力,逻辑思维清晰,有良好的沟通能力和团队协作意识;4、踏实好学,对人形机器人、机器人底层软件有浓厚兴趣,能保证连续实习6个月;5、具备良好的系统设计能力,能完成模块架构设计和跨团队技术对接。【加分项】1、有人形机器人或足式机器人的软件系统开发经验;2、熟悉 Bazel 构建系统;3、有 CUDA 编程或 GPU 加速经验;4、了解 MuJoCo/Isaac Gym 等仿真平台与真机部署的对接;5、机器人中间件开发(ROS2/DDS/自研通信框架);6、深度学习推理引擎集成(TensorRT/ONNX Runtime/MNN);7、嵌入式驱动开发(EtherCAT/CAN/SPI);8、熟悉实时系统开发,了解 PREEMPT_RT
端侧全模态大模型工程专家 北京、上海、深圳 社招 全职 技术 - 基础架构 职位 ID:A133605 职位描述 1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;2. 深入全模态模型双工异步工作流推理开发与优化;3. 模型量化、KV Cache 管理与投机推理加速;4. 分析硬件性能调优与内存管理;5. 跟进主流芯片厂商技术栈演进; 职位要求 1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;3. 有Orin平台开发经验;4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;5. 精通 C/C++/python;6. 具备 异步多线程计算、内存管理优化 实战经验;7.
SummaryWorking at Apple offers the chance to do your best work and be part of something truly remarkable. Imagine the possibilities of what you could do here. At Apple, innovative ideas swiftly transform into phenomenal platforms
Locations: Shanghai, China Categories: Engineering Req ID: 91273 ADVANCE YOUR CAREER. ADVANCE THE WORLD. At AMD, we believe technology has the power to solve the world’s most important challenges. From advancing healthcare and scientific discovery to
General Information Job Title ZeBu Application Engineer Job ID 18605 Country China City Shanghai Date Posted 02-Sep-2026 Job Category Engineering Job Subcategory Applications Engineering Hire Type Employee Remote Eligible No Descriptions & Requirements Job Description and
PLAY, GROW and WIN To be a part of Virtuos means to be a creator. At Virtuos, we harness the latest technologies to make games better and more immersive than ever before. That is why we
校招-座舱Agent Harness算法工程师 北京、上海 校招 正式 数字技术 - 算法 本科及以上 2027届校园招聘-正式批 职位 ID:A13971 职位描述 * 探索 agent harness / runtime 在车载场景下对话系统的研究和应用,包括论文调研、方案设计、数据分析、效果优化、代码实现等工作,用极致的工程手段把Agent做到更快、把系统做到量产级的稳定与可观测;* 直接参与公司自研 Agent harness 框架的全链路设计与开发,包括Agentic Loop、工具系统、会话持久化、上下文压缩、Hook 机制、MCP 协议* 参与实时语音工程研发:全流式链路构建、barge-in、端到端时延优化* 针对 Agent 执行链路分析与问题定位;优化 Agent 响应效率、稳定性及容错能力;* 对接离线SFT/agentic RL训练环境,协助提升端到端模型效果; 职位要求 *
Super Sparks-校招-高性能AI推理平台研究员/工程师 上海、圣何塞 校招 正式 数字技术 - 算法 硕士及以上 Super Sparks 招聘计划 职位 ID:A47632 职位描述 AI 推理引擎与模型优化-在车规级 SoC(含 NPU、DSP、GPU 等异构计算单元)上进行大模型(LLM/VLM/VLA)的推理部署与极致性能调优,包括低功耗优化、模型量化(INT4/INT8)、剪枝、蒸馏、算子融合等;-针对 RTOS/Linux/QNX 等操作系统及中间件层深度优化 AI 推理引擎(如 TensorRT、ONNX Runtime、llama.cpp 等),提升端侧推理的实时性与稳定性;-参与具身智能场景下的端到端模型推理链路设计,将 VLA 大模型的推理能力高效部署到车端嵌入式平台,支撑物理世界精准闭环操作。AI 原生的车控与 SOA 场景-将 AI 推理能力原生融入车控系统、车身控制等业务场景,设计 AI 驱动的智能控制策略;-参与 SOA