Refine Reset All
Sort by
Skills
Job Type
Employer/Recruiter
Experience
Date Posted
Skills
Location
Job Type
Employer/Recruiter
Experience
All Filters

Cache Jobs In Shanghai - 40 Job Positions Available

Top Cities:
1 – 20 of 40 jobs
AMD jobs

Locations: Shanghai, China Categories: Engineering Req ID: 89499 WHAT YOU DO AT AMD CHANGES EVERYTHING At AMD, our mission is to build great products that accelerate next-generation computing experiences—from AI and data centers, to PCs, gaming

AMD  23 days ago
NIO jobs

SoC性能架构与建模工程师 上海、合肥 社招 全职 工程技术 本科及以上 工作年限不限 职位描述 岗位概述参与高性能智能辅助驾驶 SoC 的性能建模、架构分析与性能优化。通过 Cycle-Accurate / Transaction-Level 性能模型,对 CPU、NPU、NoC/总线互联、Cache/SLC、DDR 及典型 workload 进行端到端分析,识别系统瓶颈,为芯片的性能规格、互联架构、存储层次及关键微架构参数提供量化决策依据。模型是手段,架构决策是目标。核心职责使用 C++ / Python 搭建和维护 SoC 级性能模型,对 NoC/总线、Cache/SLC、DDR 等关键模块进行参数化建模。分析典型 AI / 智能辅助驾驶 workload 的计算、访存和通信特征,开展 trace 采集、回放及性能分析。分析带宽、延迟、Outstanding、Queue、Cache 命中率、DDR 效率及 NoC 拥塞等关键指标,定位系统性能瓶颈。参与 NoC

NIO  18 days ago
NIO jobs

芯片设计工程师(总线) 合肥、上海 社招 全职 数字技术 - 芯片研发 本科及以上 3-5 年 职位描述 岗位职责● 负责SoC芯片片上总线与互联子系统的微架构设计与RTL实现,涵盖从架构方案到流片交付的全流程● 参与片上网络的拓扑定义、路由策略设计与流控机制实现,满足多核/多子系统的互联需求● 负责Cache一致性协议的微架构设计与实现,如:Snoop Filter、 一致性域划分与跨域互联方案、DVM● 完成总线的性能分析与调优,包括带宽、延迟、Outstanding等关键指标的优化● 编写设计文档,配合验证团队完成功能验证与覆盖率收敛● 协同前端综合、后端实现团队完成时序收敛与物理约束对接● 跟踪行业前沿技术与竞品方案,参与下一代总线架构的预研与规划 职位要求 基本要求● 硕士及以上学历,微电子、集成电路工程、计算机体系结构、电子工程等相关专业● 1-5年数字IC前端设计经验,具有总线/互联/NoC/Cache子系统相关项目经历● 熟练掌握Verilog/SystemVerilog,具备独立完成模块级RTL设计与调试的能力● 深入理解ARM AMBA协议体系,至少精通AXI4协议,对CHI协议有实际项目经验者优先● 熟悉Cache一致性原理,理解Snoop、Directory等一致性维护机制● 熟悉数字电路设计方法学,具备良好的时序意识与面积/功耗/性能权衡能力加分项● 有完整SoC芯片流片经验,参与过从定义到Tapeout的全流程● 具备NoC设计经验,了解主流NoC IP(如Arteris FlexNoC)的架构与应用● 有CHI协议实际开发或集成经验,了解CHI Issue B/E等演进方向● 了解UALink、CXL等新兴互联协议者优先 投递...

Premium Full-time
NIO  18 days ago
ModelBest jobs

端侧全模态大模型工程专家 北京、上海、深圳 社招 全职 技术 - 基础架构 职位 ID:A133605 职位描述 1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;2. 深入全模态模型双工异步工作流推理开发与优化;3. 模型量化、KV Cache 管理与投机推理加速;4. 分析硬件性能调优与内存管理;5. 跟进主流芯片厂商技术栈演进; 职位要求 1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;3. 有Orin平台开发经验;4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;5. 精通 C/C++/python;6. 具备 异步多线程计算、内存管理优化 实战经验;7. 熟悉

ModelBest  17 days ago
ModelBest jobs

大模型算法工程师-智能体方向 急招 北京、上海、成都 社招 全职 技术 - 算法 职位 ID:A22865 职位描述 1. 端到端智能系统构建与优化:覆盖意图识别、多轮对话改写、知识检索、内容生成与用户偏好对齐全链路,持续提升交互质量与系统稳定性;2. Agent Harness 设计与建设:设计并实现稳定可扩展的智能体运行框架(Agent Harness),负责工具调用编排、上下文与记忆管理、执行循环控制、错误恢复与重试、沙箱化执行环境等核心能力,为上层 Agent 提供可靠的运行底座;3. Agent 能力与范式演进:实现具备任务规划、工具调用、自我反思能力的 Agent;探索规划执行、反思迭代等范式的工程落地,以及多 Agent 协作机制在复杂任务分解中的应用;推动 Agent 长程任务执行的稳定性与可观测性建设;4. 垂直领域大模型应用落地:参与教育等场景对话式 AI 产品的全流程研发,探索长上下文、结构化推理与多模态能力在真实业务中的创新应用;5. 模型能力与评测体系:结合业务数据开展指令微调、偏好对齐及 Prompt 工程;推动 Agent 轨迹(trajectory)评测、工具调用成功率、端到端任务完成率等指标体系建设,构建覆盖准确性、可靠性与安全性的自动化评测框架。 职位要求 1.

ModelBest  17 days ago
ZF Friedrichshafen AG jobs

Req ID 90929 | Shanghai, China, Capri (Shanghai) Automobile Technology Co., Ltd. About the Team This position is part of ZF’s ADAS & HPC business, which is entering an exciting new phase of growth and transformation

ZF Friedrichshafen AG  17 days ago
Automatically Get Matched to cache Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
Nvidia jobs

We are looking for a GPU C++ Modeling Engineer intern – Performance/Functional Modeling, Validation and Analysis of Shader. TPC arch team is a fast-growing team which welcomes all level engineers to join. Our aim is to

Nvidia  15 days ago
Nvidia jobs

As a Senior GPU & AI Infra Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving GPU/AI Infra technical strategy, system-level

Nvidia  15 days ago
Nvidia jobs

As a Senior Agent Infrastructure Network Expert focusing on Cloud Service Providers (CSPs) in China, you will be a core technical pillar in NVIDIA’s CSP SA team, responsible for driving DPU/SmartNIC-based North-South network architecture strategy, Agent-aware

Nvidia  15 days ago
Xsolla jobs

RESPONSIBILITIES Development Management:Setting goals and planning the development process for the team Estimating the time of the implementation of individual tasks Organizing and facilitating team rituals Creating product QA process Participating in testing and delivery processes

Xsolla  15 days ago
MiniMax jobs

大模型工程师-RL框架&算法 北京、上海 社招 全职 互联网 / 电子 / 网游 职位描述 职位描述RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。你会参与:1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR

Premium Full-time Rollout
MiniMax  14 days ago
辉羲智能 jobs

【2027】AI推理部署工程师(具身智能方向) 北京、深圳、上海、杭州 校招 正式 互联网 / 电子 / 网游 职位描述 1. 具身模型库工程化落地:负责将点云感知、视觉定位等传统算法,以及Pi0/Groot等VLA模型,在自研大算力芯片上进行推理部署与性能调优,确保精度/延迟指标的统一出口2. 工具链开发与维护:参与对外发布的一键式训练-推理发版工具链建设,封装底层算子差异,保障模型在不同场景下的精度对齐和长期运行稳定性3. 模型轻量化加速:配合模型结构优化同学,落地W8A8、W4A16、W4A8等混合精度量化方案;针对Transformer架构和CNN架构进行算子融合与内存排布优化 职位要求 1. 熟练掌握C++/Python,具备良好的代码习惯和性能分析能力(会使用perf、Nsight等工具)2. 熟悉ONNX、TensorRT、PyTorch部署链路,有实际将PyTorch模型转为TensorRT/SNPE等端侧引擎并跑通的经验3. 了解常见量化原理(PTQ/QAT),有实际处理过精度掉点问题加分项:1. 对VLA(视觉语言动作模型) 的推理架构有基础认知,了解KV Cache、Beam Search等推理优化手段2. 有机器人、自动驾驶或AR/VR相关的嵌入式部署经验者优先 投递...

Premium Full-time
辉羲智能  14 days ago
Witmem Technology 知存科技 jobs

2027届校招-算法和解决方案工程师 北京、杭州、上海 校招 正式 研发 - 电子 / 半导体 职位 ID:A227994 职位描述 1、跟进前沿算法技术、开源框架及训推并行加速技术,协同客户或上游团队,完成算法选型或迭代。2、协同系统架构等团队,输出算法部署和对应的系统架构方案, 完成方案原型搭建。3、协同工具链等团队,解决算法部署过程中的精度、速度、存储限制等问题,推进项目落地。 职位要求 1、编程基础扎实:熟练掌握Python、C、C++等主流开发语言,具备扎实的代码编写、调试及工程开发能力,可独立完成算法代码开发与优化。2、熟悉深度学习基础理论、训练策略及模型优化方法,掌握PyTorch等主流深度学习开源框架,理解算法量化,量化感知训练等量化方案。3、深入理解神经网络基本工作原理,掌握CNN、LSTM/GRU、Transformer+Attention、MoE等核心网络架构的原理、特性及适用场景,可根据业务需求完成模型选型与替换。4、具备极强的自主学习能力和环境适应能力,能够快速跟进前沿算法技术与工程方案;拥有优秀的逻辑分析、问题排查和拆解能力,可高效解决算法研发与落地过程中的各类技术问题。5、具备优秀的跨团队沟通能力和团队协作意识,责任心强、执行力突出,能够高效推进项目落地,抗压能力良好。加分项:1、具备大语言模型、生成扩散模型、多模态大模型、图像、视频、语音、TTS等至少一个及以上方向的算法研发与工程落地实战经验,可独立完成算法从训练到上线的全流程落地。2、推理加速与工程优化能力:熟悉TVM、ONNX、TensorRT、NCNN、MNN,vLLM,llama.cpp等主流深度学习推理框架及加速平台,掌握模型量化、算子优化、推理链路精简等工程优化手段;具备大模型KV Cache优化、推理加速、显存及算力资源优化、模型轻量化等相关经验。 投递...

Premium Full-time
Witmem Technology 知存科技  13 days ago
得物App jobs

【技术保障】模型推理优化专家 杭州、上海 全职 互联网 / 电子 / 网游 技术类 职位描述 推理性能优化1. 对LLM在线推理全链路进行性能分析与瓶颈定位,针对性优化 TTFT、TPOT、吞吐等核心指标。2. 深入调优推理引擎(vLLM/SGLang/TensorRT-LLM等),包括 KV Cache 管理、continuous batching、量化、推测解码等关键技术。3. 结合业务 SLO 要求,设计推理部署方案(机型选型、并行策略、batch 策略等),在满足延迟约束的前提下最大化 GPU 利用率平台工程与成本优化1. 基于Kubernetes设计和落地 GPU 工作负载的调度策略,包括算力调度、虚拟化资源管理、拓扑感知、亲和性、HPA等。2. 识别低利用率、低性价比算力选型等资源低效问题,推动资源整合与优化,降低单位推理成本。3. 参与 AI 平台产品设计和研发,从工程角度出发不断优化推理服务管理模式和流程,提升用户体验和效率。业务协同与降本增效1. 与业务团队深度合作,理解其推理场景特征(模型大小、请求分布、延迟要求),提供定制化的优化方案,并推进落地2. 推进推理性能与成本的可观测体系建设,在大语言模型推理场景践行FIinops理念。 职位要求 1. 具备扎实的 LLM

得物App  13 days ago
MiniMax jobs

大模型工程师-RL框架&算法-2027届 北京、上海 校招 正式 研发 - 算法 职位描述 我们希望你在某个领域有真正的深度——推理加速、GPU 性能优化、分布式系统、RL 工程,都行——同时对算法前沿保持真实的好奇心。你不需要什么都懂,但你应该知道自己不懂的东西在哪,并且想去弄懂它。1. RL Rollout:推理是 RL 循环的发动机,我们使用Forge作为我们的RL框架。Rollout占据整个 RL 循环大部分的 wall-clock 时间,并且约束RL算法和Rollout策略的多样性,能多快、多灵活地生成轨迹,直接决定迭代速度。难点包括:Agentic(多轮、环境交互、外部状态机感知的推理系统优化、工具调用和环境的速度不稳定性)、长尾(深入的调度策略和latency优化)、KV Cache 管理、极致的吞吐优化、RL算法Co-design的Rollout策略和优化。2. 通用高性能推理 serving——RL Rollout的效率,最终落在一个底座上:一个业界顶尖的高性能推理引擎。模型能力的上限,常常不卡在算法,而卡在基础设施的某个角落,我们做的事,就是把系统的瓶颈找出来,把它打通。3. 算法与推理 codesign——我们不把推理当成训练下游被动的执行方,而是让推理、模型结构、训练算法三者协同优化。一方面,我们做的是托底:让模型不受工程与推理的约束,去 scale up 模型规模、设计模型结构、实现算法——想法不该死在推理跑不动上。另一方面,我们把推理效率作为核心指标之一反向输入到设计里,和团队一起深度优化模型结构与训练算法,端到端地抬高模型能力与效率的双重上限。从架构设计阶段就一起做,而不是等方案定了再来实现。 职位要求 基本要求1. 编程能力扎实,有清晰的系统设计思路,有强烈的工程品味和责任心;2. 对大模型推理系统或 RL 工程某一方向有深入理解,能独立发现问题、提出方案并推动落地;3. 主动追踪算法与系统前沿,能将论文洞见转化为工程判断;加分项1. 对主流推理

Premium Full-time
MiniMax  11 days ago
MiniMax jobs

大模型工程师-RL框架&算法-2028届 北京、上海 校招 实习 研发 - 算法 职位描述 RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。你会参与:1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR / Agentic

Premium Full-time Rollout
MiniMax  11 days ago
Expeditors jobs

Company Description We take care of our employees, and they take care of our customers! Become a member of a global community! The international logistics industry is an integral piece of the global trade puzzle; we

Expeditors  10 days ago
MiniMax jobs

大模型工程师-RL框架&算法-日常实习 北京、上海 校招 实习 研发 - 算法 日常实习 职位描述 RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。你会参与:1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR /

Premium Full-time Rollout
MiniMax  9 days ago
NIO jobs

大模型推理框架工程师实习生 上海、深圳、杭州 社招 实习 数字技术 本科及以上 工作年限不限 职位描述 1、参与大模型推理引擎核心模块的设计、开发与测试,提升系统吞吐、降低推理延迟与成本;2、探索并验证先进推理加速方案,如量化、KV Cache、PagedAttention、连续批处理、投机解码、分布式推理、算子优化等;3、参与推理平台与云平台建设:基于 Kubernetes/K8s、Docker、Helm 等,实现模型部署、弹性扩缩容、灰度发布、多租户资源隔离、监控告警与 CI/CD;4、参与 GPU/NPU 资源调度与集群利用率优化,提升推理服务稳定性与云平台资源管理效率;5、跟踪开源社区(如 vLLM、TensorRT-LLM、SGLang、LMDeploy 等)前沿动态,完成技术调研、复现与验证;6、与算法、业务和平台团队协作,优化端到端推理体验。 职位要求 1、本科及以上在读,计算机、AI、软件工程、电子信息、数学等相关专业;2、熟悉 Python,了解大模型 Transformer 基本工作原理;3、具备良好的工程习惯,熟悉 Linux、Git,学习能力强,能阅读英文技术资料;4、了解或对 Kubernetes/K8s、Docker、云平台、云原生技术有浓厚兴趣;5、乐于沟通协作,对 AI Infra、大模型推理方向有热情;6、能保证稳定实习时间,有较强的自我驱动能力。加分项(非必需)有 vLLM、SGLang、TensorRT-LLM、LMDeploy 等推理框架使用或二次开发经验;有 CUDA/Triton 算子编写经历;有 Kubernetes、Docker、云平台、Ray、Volcano、Kueue、Prometheus/Grafana 等云原生或 MLOps/LLMOps 实践经验;有 LLM 相关论文、开源项目、竞赛经历或高质量技术博客;有模型部署、压测、性能分析、监控告警相关经验。我们提供资深大佬 1v1

Premium Full-time AI
NIO  4 days ago
鉴智机器人 PhiGent Robotics jobs

自动驾驶软件架构师 杭州、上海 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 1、为鉴智下一代汽车平台以及自动驾驶系统设计、架构并交付与车载计算平台和核心功能相关的系统级工具链、框架以及SDK;保证其可靠性、实时性、稳定性、高性能;2、负责自动驾驶端侧工具链的总体架构设计,打造业界领先的自动驾驶工具链,包括海量数据的Bag、Cache、Persist、Trigger、Replay 等核心系统研发工作,并对关键技术问题把握其方案架构、设计实现和产品交付;3、主导产品研发过程中的技术攻坚工作,跟进中间件、影子模式等前沿技术,持续推进架构演进,不断提高工具链自动化水平。 职位要求 1、本科及以上学历,计算机/通信相关专业,五年以上相关工作经验;2、精通Linux环境下的开发,熟悉现代主流的C++设计模式,熟练掌握各种调试手段和系统调试工具,掌握复杂系统的性能优化方法;3、熟悉一种或多种嵌入式SoC体系架构以及软件栈,如:NVIDIA DRIVE/Jetson、TDAx、Horizon J3/J5等;4、具备大型系统的完整设计&实现经验,善于拆解需求到技术实现,超强的求知欲、学习能力以及工程能力;5、优秀的沟通能力和团队合作能力;满足以下条件为加分项:(1)编码能力强悍,对操作系统/计算机体系结构原理深入理解,思维敏捷,善于攻克技术难题;(2)熟悉一种或多种量产级中间件,如:CyberRT,地平线TROS.A,NVIDIA Driveworks,ROS2等;(3)熟悉域控制器平台传感器接入,深刻理解时间同步、图像编解码、数据存储等相关技术,具备丰富实战经验。 投递...

Premium Full-time
鉴智机器人 PhiGent Robotics  3 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Also try:

Receive the latest job openings for:

cache jobs in shanghai

You also might be interested in:

AI

CUDA

Kernel

C++

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Job Type
Employer/Recruiter
Experience