Refine Reset All
Sort by
Skills
Location
Employer/Recruiter
Experience
Date Posted
Skills
Location
Job Type
Employer/Recruiter
Experience
All Filters

Moe Jobs In China - 28 Job Positions Available

Top Cities:
1 – 20 of 28 jobs
Nvidia jobs

NVIDIA is seeking Software Performance Architects to optimize GPU kernel performance for state-of-the-art data-center platforms. We build automated, data-driven workflows to detect, explain, and prevent performance regressions across key deep learning workloads, partnering closely with kernel

Nvidia  24 days ago
Witmem Technology 知存科技 jobs

2027届校招-算法和解决方案工程师 北京、杭州、上海 校招 正式 研发 - 电子 / 半导体 职位 ID:A227994 职位描述 1、跟进前沿算法技术、开源框架及训推并行加速技术,协同客户或上游团队,完成算法选型或迭代。2、协同系统架构等团队,输出算法部署和对应的系统架构方案, 完成方案原型搭建。3、协同工具链等团队,解决算法部署过程中的精度、速度、存储限制等问题,推进项目落地。 职位要求 1、编程基础扎实:熟练掌握Python、C、C++等主流开发语言,具备扎实的代码编写、调试及工程开发能力,可独立完成算法代码开发与优化。2、熟悉深度学习基础理论、训练策略及模型优化方法,掌握PyTorch等主流深度学习开源框架,理解算法量化,量化感知训练等量化方案。3、深入理解神经网络基本工作原理,掌握CNN、LSTM/GRU、Transformer+Attention、MoE等核心网络架构的原理、特性及适用场景,可根据业务需求完成模型选型与替换。4、具备极强的自主学习能力和环境适应能力,能够快速跟进前沿算法技术与工程方案;拥有优秀的逻辑分析、问题排查和拆解能力,可高效解决算法研发与落地过程中的各类技术问题。5、具备优秀的跨团队沟通能力和团队协作意识,责任心强、执行力突出,能够高效推进项目落地,抗压能力良好。加分项:1、具备大语言模型、生成扩散模型、多模态大模型、图像、视频、语音、TTS等至少一个及以上方向的算法研发与工程落地实战经验,可独立完成算法从训练到上线的全流程落地。2、推理加速与工程优化能力:熟悉TVM、ONNX、TensorRT、NCNN、MNN,vLLM,llama.cpp等主流深度学习推理框架及加速平台,掌握模型量化、算子优化、推理链路精简等工程优化手段;具备大模型KV Cache优化、推理加速、显存及算力资源优化、模型轻量化等相关经验。 投递...

Premium Full-time
Witmem Technology 知存科技  22 days ago
MiniMax jobs

大模型训练框架工程师-2027届 北京、上海 校招 正式 研发 - 算法 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。 投递...

Premium Full-time MOE
MiniMax  20 days ago
MiniMax jobs

大模型训练框架工程师-2028届 北京、上海 校招 实习 研发 - 算法 2028届实习生招聘 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。

Premium Full-time MOE
MiniMax  20 days ago
Bosch Group jobs

Company Description Bosch Powertrain Systems Co., Ltd. (RBCD), the joint venture of Robert Bosch GmbH and Weifu High Technology Group Co., Ltd., is a high tech enterprise specializing in the development, production and sales of common

Bosch Group  16 days ago
MiniMax jobs

大模型训练框架工程师-日常实习 北京、上海 校招 实习 研发 - 算法 职位描述 训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 职位要求 基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。 投递...

Premium Full-time MOE
MiniMax  17 days ago
Automatically Get Matched to moe Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
Roche jobs

At Roche you can show up as yourself, embraced for the unique qualities you bring. Our culture encourages personal expression, open dialogue, and genuine connections, where you are valued, accepted and respected for who you are,

Roche  17 days ago
Bosch Group jobs

Company Description Do you want beneficial technologies being shaped by your ideas? Whether in the areas of mobility solutions, consumer goods, industrial technology or energy and building technology - with us, you will have the chance

Bosch Group  11 days ago
Telnyx jobs

About Telnyx Telnyx is an industry leader thats not just imagining the future of global connectivity—were building it. From architecting and amplifying the reach of a private, global, multi-cloud IP network, to bringing hyperlocal edge technology

Telnyx  10 days ago
Momenta jobs

训练推理优化算法工程师(Mstar) 北京、苏州、上海、深圳 Mstar计划 职位描述 负责Momenta自动驾驶大模型、世界模型的分布式训练推理框架研发,主要包括:1、参与设计、研发、维护团队内部的模型分布式训练框架,擅长分析并深度优化训练各个阶段的性能瓶颈,包括计算效率、通信延迟、显存占用等;2、结合不断迭代的模型算法逻辑,设计并实现针对性的高效分布式并行训练策略;3、深入研究 CUDA、NCCL、RDMA 等编程范式和通信库,针对团队内部的GPU和集群拓扑约束,开发高性能算子 并 优化分布式通信效率,达到行业SOTA水平;4、深入研究低精度混合精度训练策略,在保证模型精度满足预期的情况下,探索低精度(FP8、FP4)训练的性能极限;5、配合算法需求,开发RL训练框架、迭代RL训练算法逻辑,优化在线Rollout推理性能,深度优化分布式On-Policy/异步RL训练效率。 职位要求 学历背景: 计算机相关专业硕士及以上学历,具备扎实的理论基础和强大的动手能力;编程能力:- 熟悉 Python/C++/CUDA/CUTLASS/Triton编程,熟悉PyTorch框架及其底层实现;- 熟悉分布式系统开发与调试,熟悉分布式通信开发NCCL/RDMA/IB/RoCE,有多进程调度与并行算法优化经验者优先;训练与推理经验:- 熟悉大模型结构与算法(LLM/VLM/VLA/DiT、MoE架构、各种RL算法等);- 熟悉分布式训练/推理的常用策略(DP/TP/PP/EP/CP、recompute、offloading、PD分离等);- 有主流开源分布式训练框架(如Megatron-LM、DeepSpeed、VeRL)或推理框架(如SGLang、vLLM)的深度二次开发与优化经验。 投递...

Premium Full-time
Momenta  10 days ago
Z.ai jobs

AI院-训练Infra工程师 北京、上海 全职 互联网 / 电子 / 网游 职位描述 1、负责大规模预训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率2、分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性3、跟进业界技术进展,不断同步与集成最新训练优化策略 职位要求 1、对自然语言处理、计算机视觉和多模态算法有深入理解,熟悉主流的 LLM 和 VLM 模型架构,有分布式训练经验2、精通 Python 编程语言,熟悉 PyTorch 深度学习框架和 Megatron 分布式训练框架3、有大规模预训练优化 / MoE 训练优化经验的优先考虑加分项:1、在ACM、NOI、IOI、超算比赛中有获奖经历者优先2、具有 cuda 算子优化/profiling 能力者优先 投递...

Z.ai  9 days ago
北京思朗科技有限责任公司 jobs

2027校招-AI编译器工程师(上海/杭州/成都) 上海、成都、杭州 校招 正式 职位描述 一、岗位定位负责大模型推理 / 训练框架底层编译器的设计、开发与优化,将上层深度学习模型(Transformer / MoE / 多模态等)高效映射到 GPU、NPU、Ascend、CPU 等异构硬件,提升大模型在真实业务中的吞吐、延迟与资源利用率。二、岗位职责参与大模型编译器前后端开发:图级优化(算子融合、常量折叠、Layout 转换)、算子 Lowering、调度与内存规划。负责面向 Transformer / Attention / MoE 等核心算子的底层代码生成与 kernel 性能调优(Tiling、流水线、双缓冲、量化等)。对接主流编译基础设施(MLIR / LLVM / TVM / XLA / PyTorch 2.x Inductor 等),参与自定义 Dialect 与 Pass

北京思朗科技有限责任公司  8 days ago
北京思朗科技有限责任公司 jobs

2027校招-AI计算核算法分析工程师 (北京/上海/成都/西安) 北京、上海、成都、西安 校招 正式 职位描述 岗位职责1. 开展AI加速器性能架构分析与优化:· 面向AI及通用并行计算场景,围绕benchmark→性能度量→瓶颈定位→优化方案流程,分析计算系统性能;· 聚焦计算图优化、AI workload特征、不规则计算、负载均衡等关键方向。2. 性能分析与瓶颈定位:· 使用性能分析工具及Python/C++脚本,分析AI加速器执行效率;· 定位计算、访存、并行执行、资源利用率、任务调度等方面的性能瓶颈。3. 优化策略研究与验证:针对Transformer、LLM、MoE、稀疏计算等典型workload,分析性能特征;评估算法、编译优化及架构优化策略,输出数据驱动的优化方案。4. 软硬件协同优化:· 与架构、编译器、算子、软件栈团队协作,推动性能优化方案落地;· 建立实验环境,沉淀性能分析方法和技术报告。 职位要求 任职要求1. 硕士及以上学历,计算机体系结构、计算机科学、电子信息、微电子等相关专业;2. 熟练掌握C/C++、Python,具备并行计算或异构计算经验;3. 理解GPGPU/NPU架构和执行模型,了解计算、访存、并行效率等性能优化方法;4. 具备性能分析、benchmark设计和问题定位能力。加分项:· 有GPU/NPU性能优化或架构分析经验;· 熟悉CUDA、OpenCL、ROCm、Ascend等计算平台;· 熟悉CUDA Kernel优化、Triton、CUTLASS、TVM等技术;· 具备数字电路或处理器微架构基础。 投递...

Premium Full-time
北京思朗科技有限责任公司  8 days ago
北京思朗科技有限责任公司 jobs

2027校招-算子开发工程师(上海/北京/成都) 上海、北京、成都 校招 正式 职位描述 岗位职责- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。 职位要求 (优秀应届可放宽)。- 计算机/电子/自动化/数学等相关专业;- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。-

北京思朗科技有限责任公司  8 days ago
Pony.ai jobs

软件工程师 - 大模型端侧优化和部署 北京、广州、上海 全职 职位描述 负责将大模型部署到自动驾驶车端芯片平台(NVIDIA Orin / Thor 等),并进行极致的性能、内存与能效优化。你将在算力、内存、功耗与实时性严格受限、且对安全与稳定性要求极高的车载环境下,打通从推理引擎定制、核心算子优化到车端运行时管理的全栈链路,推动大模型在自动驾驶(端到端决策、场景理解等)场景的规模化落地。岗位职责1. 适配、移植与深度优化车端推理引擎/运行时(TensorRT-LLM、TensorRT Edge-LLM、vLLM、SGLang 等),通过计算图优化、算子融合、高性能 CUDA 算子开发及 KV Cache、投机采样等优化,充分发挥 Orin / Thor 平台算力,满足实时性要求;2. 建立 Benchmark 与 Profiling 体系,跟踪首字延迟(TTFT)、吞吐、内存峰值、冷启动、模型切换、cache 命中率、长稳与抖动等车端核心指标。支持场景理解、Function Calling、结构化输出、流式输出、多模态推理等核心场景的低延迟落地; 职位要求 1. 计算机、电子工程、人工智能、自动化等相关专业,本科及以上学历;2. 具备 2 年以上 AI

Pony.ai  8 days ago
智元创新(上海)科技有限公司 jobs

运动控制算法工程师 北京、深圳 校招 正式 技术 - 算法类 职位 ID:A227352 职位描述 1、负责机器人运动控制算法的研究和开发实现,完成机器人运动学、动力学模型的搭建与仿真模拟,优化机器人运动性能;2、发现和解决算法开发过程中出现的技术问题,根据机器人运动特性为本体/算法协同设计提出建设性意见和改进方向;3、参与机器人前沿控制技术预研,对相关技术成果资料进行查阅、整理及归纳。4、负责临时演示任务,能够快速定位排查调试过程中遇到的问题。 职位要求 1、硕士及以上学历,控制工程与控制理论、机械电子、计算机、自动化等相关专业2、掌握机电系统闭环控制方法,熟悉模仿学习、强化学习算法,能够使用常见的仿真环境完成强化学习训练任务3、熟悉机器人学、刚体运动学、刚体动力学;掌握常用的FK/IK方法,熟悉RBDL、Pinocchio等动力学库4、熟练使用C++及python、isaac gym、isaaclab以及mujuco等仿真器,熟练使用linux系统5、熟悉transformer,gru/lstm,CNN等的原理及其适用场景,以及在torch库中的使用6、了解T-S与MoE架构,对前沿论文有所研究为加分项7、需要具备一定的真机调试经验,能够快速定位问题,为加分项8、有机器人竞赛(如RoboCup、DARPA挑战赛),优先录取 投递...

Premium Full-time
智元创新(上海)科技有限公司  2 days ago
智元创新(上海)科技有限公司 jobs

优才-运控算法工程师 北京、深圳 校招 正式 技术 - 算法类 职位 ID:A49880 职位描述 1、负责机器人运动控制算法的研究和开发实现,完成机器人运动学、动力学模型的搭建与仿真模拟,优化机器人运动性能;2、发现和解决算法开发过程中出现的技术问题,根据机器人运动特性为本体/算法协同设计提出建设性意见和改进方向;3、参与机器人前沿控制技术预研,对相关技术成果资料进行查阅、整理及归纳。4、负责临时演示任务,能够快速定位排查调试过程中遇到的问题。 职位要求 1、硕士及以上学历,控制工程与控制理论、机械电子、计算机、自动化等相关专业2、掌握机电系统闭环控制方法,熟悉模仿学习、强化学习算法,能够使用常见的仿真环境完成强化学习训练任务3、熟悉机器人学、刚体运动学、刚体动力学;掌握常用的FK/IK方法,熟悉RBDL、Pinocchio等动力学库4、熟练使用C++及python、isaac gym、isaaclab以及mujuco等仿真器,熟练使用linux系统5、熟悉transformer,gru/lstm,CNN等的原理及其适用场景,以及在torch库中的使用6、了解T-S与MoE架构,对前沿论文有所研究为加分项7、需要具备一定的真机调试经验,能够快速定位问题,为加分项8、有机器人竞赛(如RoboCup、DARPA挑战赛),优先录取 投递...

Premium Full-time
智元创新(上海)科技有限公司  2 days ago
NIO jobs

AI 芯片加速算法与软件工程师 上海、深圳、杭州、合肥 社招 全职 数字技术 - 芯片研发 本科及以上 1-3 年 职位描述 1. 开展芯片与算法软硬件协同优化,针对Dense/MOE模型场景,优化推理精度、时延、吞吐、显存占用等核心指标,参与芯片架构需求定义;2. 结合自研异构算力芯片架构特性,参与 AI Infra软件栈研发,完成高性能算子开发、计算图优化、显存调度、算子融合等核心工作,最大化释放芯片硬件算力,支撑大模型、具身智能等业务落地;3. 负责深度学习训推引擎适配、主流模型移植与性能精度调优,搭建自动化性能测试、精度验证体系,定位并解决模型部署、版本迭代中的性能退化、精度异常等问题;4. 跟踪 AI 编译器、异构计算、量化稀疏、高性能算子加速等前沿技术,开展技术预研与原型验证,沉淀技术方案、专利成果,推动 AI 加速软件栈持续迭代与产品化落地。 职位要求 1. 学历专业:本科、硕士及以上学历;2. 工作经验:1-5 年及以上 AI 芯片加速、算子优化、推理引擎、异构计算软件开发相关工作经验,有算力芯片软件栈落地经验者优先;3. 技术能力:熟悉 C/C++、Linux 系统编程,熟练使用 Python,具备扎实的底层软件开发、调试与性能调优能力。熟练掌握AI coding高效开发经验者优先;4. 熟悉计算机体系结构、异构计算原理与深度学习基础,了解 PyTorch、ONNX

Premium Full-time AI
NIO  2 days ago
Nvidia jobs

NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology and amazing people. Today, we’re tapping into the unlimited

Nvidia  2 days ago
Nvidia jobs

The place to find available career opportunities at NVIDIA for you and people you know. We are now looking for a Performance Software Intern for Deep Learning Libraries! Do you enjoy tuning parallel algorithms and analyzing

Nvidia  2 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Also try:

Receive the latest job openings for:

moe

You also might be interested in:

AI

Python

Kernel

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Location
Employer/Recruiter
Experience