Refine Reset All
Sort by
Skills
Location
Employer/Recruiter
Date Posted
Skills
Location
Job Type
Employer/Recruiter
All Filters

Infiniband Jobs In China - 20 Job Positions Available

Top Cities:
1 – 20 of 20 jobs
ModelBest jobs

多模态Infra负责人 急招 北京 社招 全职 技术 - 基础架构 职位 ID:A64486 职位描述 1. 负责多模态训练基础设施的整体架构设计与技术规划,主导Infra方案的落地实施;2. 搭建并优化大规模训练系统,确保千/万卡级别集群的高效稳定运行;3. 主导训练框架的选型、优化与二次开发,持续提升训练效率与资源利用率;4. 带领团队解决训练过程中的系统瓶颈问题,包括通信、存储、调度等关键环节;5. 与算法团队紧密协作,推动训练流程的工程化与自动化建设。 职位要求 1. 本科及以上学历,计算机、软件工程等相关专业,有大规模训练项目经验;2. 深入理解大模型预训练原理,熟悉Transformer架构及主流大模型训练流程;3. 精通分布式训练原理,熟悉Megatron-LM、FSDP等主流分布式训练框架;4. 熟悉GPU集群架构、高性能网络(RDMA/InfiniBand)、并行存储系统;5. 熟悉NCCL/Gloo等通信库原理,有通信优化经验;6. 具备较强的技术视野和团队管理能力,能够带领团队攻克技术难题。加分项1. 有开源社区贡献或技术影响力。 投递...

Premium Full-time
ModelBest  19 days ago
Roche jobs

At Roche you can show up as yourself, embraced for the unique qualities you bring. Our culture encourages personal expression, open dialogue, and genuine connections, where you are valued, accepted and respected for who you are,

Roche  17 days ago
Li Auto jobs

RDMANIC架构师 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、关注RDMA NIC、SmartNIC/DPU、RoCEv2、InfiniBand及GPU Direct通信技术,判断AI集群网络对吞吐、时延、扩展性和可靠性的演进需求;2、定义NIC端到端产品架构,包括PCIe主机接口、DMA与地址转换、收发数据通路、队列与完成机制、RDMA传输、拥塞控制、虚拟化、安全隔离和可观测性;3、建立面向训练、推理和存储负载的性能模型,量化带宽、时延、队列、缓存及PPA约束,识别跨主机、芯片和网络的系统瓶颈;4、驱动架构规格和验证方案落地,协同ASIC、固件、驱动、操作系统及AI通信软件,完成前后仿真、芯片Bring up和规模化系统调优。 职位要求 1、网络适配器及RDMA协议架构能力:深入理解QP、MR、WQE、CQE、Doorbell和RDMAVerbs,掌握Read/Write/Send、Atomic、Ordering、ACK/Retry、丢包恢复以及PFC、ECN、DCQCN等流控与拥塞控制机制;2、主机互联、DMA与虚拟化能力:熟悉PCIe、DMA Engine、Descripptor、MSI-X、IOMMU、ATS/PASID和SR IOV,能够定义地址转换、内存保护、设备虚拟化、缓存与一致性边界及多租户隔离方案3、芯片微架构与软硬件协同能力:能够划分TX/RX、队列管理、调度、缓存和内存访问等模块,完成性能、面积、功耗权衡;理解固件、Linux RDMA驱动及通信库边界,具备仿真建模和前后硅调试能力。 投递...

Premium Full-time
Li Auto  14 days ago
Li Auto jobs

RDMA NIC 研发专家 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、在总体架构和产品规格指导下,负责RDMA NIC关键子系统或模决的微架构设计与研发交付,包括TX/RX数据通路、QP与上下文管理、WQE/CQE处理、DMA与地址转换、队列调度及完成机制等;2、负责RoCEv2或InfiniBand相关协议功能的设计实现与问题闭环,包括Read/Write/Send、Atomic、Ordering、ACK/Retry、异常处理以及PFC、ECN、DCQCN等流控与拥塞控制机制;3、开展模块级性能分析与优化,量化带宽、时延、队列深度、缓存利用率及PPA约束,定位并解决数据通路、内存访问和跨接口交互中的性能瓶颈;4、协同验证、固件、驱动、操作系统及系统团队,完成模块验证、子系统集成、芯片Bring-up、问题定位和规模化环境下的性能调优。 职位要求 1、RDMA协议与数据通路研发能力:熟悉QP、MR、WQE、CQE、Doorbell和RDMAVerbs,理解RDMA传输状态、顺序、可靠传输及拥塞控制机制,能够独立承担相关模块设计与周试;2、主机接口、DMA与队列管理能力:熟悉PCIe、DMA Engine、Descriptpr、MSI-X、IOMMU、ATS/PASID或SRIOV中的一种或多种技术,具备地址转换、内存保护、队列调度或虚拟化模块研发经验;3、ASIC实现与软硬件协同能力:具备模块微架构、RTL实现、架构验证或性能建模能力,能够完成时序、面积和功耗权衡;熟悉固件或Linux RDMA驱动接口,具备前后硅问题定位经验。关键经历学历背景:微电子、电子工程、计算机、通信等相关专业,具备数字电路、计算机体系结构、操作系统和网络基础;岗位经历:具备5年以上NIC、SmartNIC、DPU、RDMA或高性能网络芯片研发经历,独立承担过协议处理、队列管理、DMA、主机接口或收发数据通路中的一个或多个关键模块成功经验:参与过至少一款网络适配器或高性能网络芯片从现格、设计验证到流片、Bring-up的研发过程,并完成国所负责模块的性能或可靠性问题闭环。 投递...

Premium Full-time RDMA
Li Auto  14 days ago
Li Auto jobs

Scale-up交换机架构师 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、关注UALink、NVLink及高速Scale-up互联技术,理解AI训练、推理和集合通信对低时延、高带宽、确定性、扩展性和高可靠的系统需求;2、定义交换芯片端到端数据通路,包括端口与链路层、Ingress/Egress、路由、仲裁、缓存、Crossbar、VC/Credit、Ordering、Replay、QoS及多播/集合通信机制;3、建立面向真实AI通信模式的性能和流量模型,量化吞吐、时延、缓存、拥塞、扩展规模及PPA约束,指导关键微架构取舍;4、驱动架构规格和验证方案落地,协同ASIC、验证、固件、软件、软件、SerDes/PHY及系统团队完成前后仿真、芯片Bring-up和整机性能调优。 职位要求 1、交换与Fabric微架构能力:深入理解Packet/Flit/Transaction处理,能够定义端口、Ingress/Egress、路由、仲裁、共享/分布式缓存、Crossbar、调度、Traffic Management、QoS及多播数据通路;2、协议、流控与可靠性能力:掌握Credit/Backpressure、Virtual Channel、Ordering、Retry/Replay、CRC/FEC.错误隔离、死锁/活锁规避及拥塞控制,理解链路训练和SerDes/PHY接口边界;3、系统性能与芯片交付能力:能够基于AI流量进行延迟、带宽、缓存、拥塞和扩展性建模,完成时序、面积、功耗权衡;具备架构验证、Telemetry/RAS、安全隔离以及前后硅性能能调试能力。关键经历1、学历背景:微电子、电子工程、计算机、通信等相关专业,具备计算机体系结构、数字电路和网络互联基础;2、岗位经历:具备8年以上交换ASIC、NoC、GPU/CPU互联或高性能Fabric研发经历,承担过整芯片或路由、仲裁、缓存、Crossbar、流控等关键模块架构工作;3、成功经验:主导或核心参与过至少一款大型交换或互联芯片从架构、性能模型、设计验证到流片、Bring-up的完整闭环:且备UAI ink NVI infiniBand或Fthernet交换经验优先 投递...

Premium Full-time Ink
Li Auto  14 days ago
Li Auto jobs

Scale-up交换机专家 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、在总体架构和芯片规格指导下,负责Scale-up交换芯片关键子系统或模块的微架构设计与研发交付,包括Ingress/Egress、Packet/Flit处理、路由、仲裁、缓存、Crossbar、VC/Credit及端口数据通路等;2、负责Ordering、Retry/Replay、CRC/FEC、QoS、多播或集合通信信等协议与可靠性功能的设计实现,完成异常场景、流控依赖和死锁/活锁问题分析;3、开展模块级性能与流量分析,评估吞吐、时延、缓存占用、拥塞及PPA约束,针对All-to-All、Incast和集合通信等典型AI流量进行优化;4、协同验证、固件、软件、SerDes/PHY及系统团队,完成模块验证王、子系统集成、芯片Bring-up和整机环境下的性能与可靠性问题定位。 职位要求 1、交换数据通路研发能力:熟悉Packet/Flit处理、Ingress/Egress、路由、仲裁、缓存、Crossbar和调度机制,能够独立承担一个或多个关键模块的微架构设计、实现与验证;2、协议、流控与可靠性能力:理解Credit/Backpressure、Virtual Channel、Ordering、Retry/Replay、CRC/FECT拥塞控制机制,能够分析流控依赖、死锁和异常恢复问题;3、ASIC实现与性能调试能力:具备RTL设计、架构验证或性能建模能力,能够完成模块级时序、面积和功耗优化;熟悉Telemetry/RAS、链路调试或前后硅性能分析中的一种或多种能力。关键经历1、学历背景:微电子、电子工程、计算机、通信等相关专业,具备计算机体系结构、数字电路和网络互联基础2、岗位经历:具备5年以上交换ASIC、NoC、GPU/CPU互联或高性能Fabric研发经历,独立承担过路由、仲裁、缓存、Crossbar、流控或链路数据通路中的一个或多个关键模块决;3、成功经验:参与过至少一款交换或互联芯片从规格、设计验证到流片、Bring-up的研发过程,并完成过所负责模块的功能、性能或可靠性问题闭环;具备UALink、NVLink、InfiniBand或Ethernet相关经验优先 投递...

Premium Full-time
Li Auto  14 days ago
Desay SV jobs

AI智算平台工程师(DMC) 惠州 全职 职位描述 1.算力平台规划与建设:主导GPU集群、InfiniBand/RoCE高速网络及分布式存储的架构设计、部署与硬件调优。2.资源调度与效能提升:基于K8s/Volcano/Slurm优化调度策略,提升GPU利用率与集群整体MFU。3.算力成本与运营:建立FinOps成本模型,通过弹性伸缩与闲时资源整合,降低单位算力成本。4.智能化运维体系:构建全链路监控(Prometheus),利用AIOps实现故障预测与自动化运维。5.模型部署与推理优化:使用vLLM/Triton/TensorRT部署大模型,实施量化(INT8/FP8)、动态批处理等优化技术。6.混合云管理:维护公有云与私有云的混合云架构,确保资源统一调度与数据一致性。7.服务稳定性保障:确保在线推理服务的高可用与低延迟,设计熔断、降级、限流策略。 职位要求 一、核心要求1.技术栈深度:精通 Linux、K8s、Python/Go 自动化,熟悉 GPU 硬件与 NVIDIA 生态(CUDA、DCGM)。2.算力平台经验:3年以上云计算或AI基础设施经验,具备百卡级GPU集群的运维、调优实战经验。3.高性能网络:熟练掌握 InfiniBand/RoCE 网络配置与 NCCL 通信问题排查。4.模型工程化能力:熟悉大模型本地化部署流程,有 vLLM、TensorRT-LLM 等推理框架的生产环境优化经验。5.云原生与监控:深入理解云原生架构,能熟练搭建Prometheus/Grafana 全链路监控体系。加分项1.大规模集群经验:有千卡级别训练集群的运维优化或故障治理经验。2.国产化生态:熟悉华为昇腾、海光DCU等国产AI芯片的适配与开发生态。3.开源贡献:在 vLLM、TensorRT-LLM 等主流推理框架有代码贡献。4.前沿技术实践:对 MoE 模型、多模态大模型的端侧部署与优化有实际探索。 投递...

Desay SV  13 days ago
Nvidia jobs

NVIDIA is seeking a passionate, world-class software engineer to join its Compute Developer Technology team(DevTech). Our team has over 150 engineers across Beijing, Shanghai, Shenzhen, Taipei, Seoul, and Sydney. We understand algorithms, GPU, and real-world applications.

Nvidia  13 days ago
Nvidia jobs

Do you thrive in a fast-paced, high-growth technology organization? Are you excited to help enterprises build next-generation digital infrastructures powered by cloud and accelerated computing? At NVIDIA, our team is passionate about parallel computing, visual computing,

Nvidia  13 days ago
Nvidia jobs

This is an outstanding opportunity for switch SDK development engineer to join our multi-site team for switch and router related SW development. The successful candidate will collaborate closely with other development teams, arch and QA to

Nvidia  13 days ago
Nvidia jobs

NVIDIA is seeking an NCX Engineer, AI Accelerator to join our AI Accelerator team, collaborating closely with strategic customers to implement and enhance groundbreaking AI workloads! You will deliver hands-on technical assistance for advanced AI deployments,

Nvidia  13 days ago
Nvidia jobs

We are the GPU Communications Libraries and Networking team at NVIDIA. We deliver communication libraries like NCCL & NVSHMEM for Deep Learning and HPC. DL and HPC applications have a huge compute demand already and run

Nvidia  12 days ago
Nvidia jobs

We are looking for a networking test engineer with strong system‑level debugging skills to join our End‑to‑End Verification team. You will work on cutting‑edge Ethernet‑based AI clusters, owning complex issues across hardware, system software and AI

Nvidia  12 days ago
Nvidia jobs

NVIDIA networking designs and manufactures high-performance networking equipment that enable the most powerful super computers in the largest data centers in the world. With a distributed collection of NVIDIA GPUs inter-connected by networking solutions such as

Nvidia  12 days ago
Nvidia jobs

NVIDIA is leading the way in groundbreaking developments in Artificial Intelligence, High-Performance Computing and Visualization. The GPU, our invention, serves as the visual cortex of modern computers and is at the heart of our products and

Nvidia  12 days ago
无问芯穹 Infinigence AI jobs

AI基础设施系统架构师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位 ID:A258951 职位描述 岗位职责集群网络架构设计负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。网络方案规划与交付主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。网络性能调优与可靠性保障优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。跨域技术协同与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。技术标准化与自动化制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。 职位要求 任职要求学历与经验本科及以上学历,计算机、通信、网络工程等相关专业;5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。技术能力(硬性要求)精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。软性素质具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;具备项目管理能力,能协调厂商、施工队和内部团队按期交付;对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。 职位信息 部门: 计算平台研发 投递...

Premium Full-time
无问芯穹 Infinigence AI  11 days ago
Nvidia jobs

NVIDIA is building state-of-the-art accelerated computing platforms that know no boundaries. Our technology is essential for global innovators, scientists, researchers, and engineers empowering them to transform their boldest concepts into tangible outcomes. Our next-generation Infiniband, NVLink, and

Nvidia  11 days ago
Xiaomi jobs

VLA训练infra算法工程师 - XiaomiRobotics 北京 社招 全职 职位 ID:A243642 职位描述 1. 基于 PyTorch 生态(FSDP / DeepSpeed / Megatron 等)设计并实现 VLA 模型的分布式训练方案(DP / TP / PP / MoE),构建稳定高效的训练框架2. 推动混合精度(BF16 / FP8)与算子融合(FlashAttention / Triton kernel)3. 构建高吞吐数据pipeline,设计数据格式与 shard 策略,实现高效的数据加载4. 支持大规模实验追踪、管理、指标可视化

Xiaomi  7 days ago
Xiaomi jobs

AI基建-大模型训练框架开发工程师 北京 社招 全职 职位 ID:A142530 职位描述 - 基于 PyTorch、DeepSpeed、Megatron-LM 等技术,参与大模型训练框架的设计、开发与优化,提升模型训练的效率、稳定性与扩展性,支撑大规模模型的高效训练和部署。- 解决万卡集群中大模型训练中的关键技术难题,包括分布式训练通信、内存显存优化、数据加载与预处理加速等,保障训练高效稳定,降低资源消耗。- 开展大模型框架性能评估和调优工作,构建并完善性能监控体系,通过实时监测训练指标,定位性能瓶颈,提出优化方案,确保在不同硬件上达到最优性能。 职位要求 - 1–5 年高性能计算 / 分布式训练 / 深度学习系统研发经验;- 熟练阅读并修改 PyTorch/DeepSpeed/Megatron-LM 核心源码,有线上调优案例;- 熟练使用 nsight/NCCL profiler 分析任务训练性能瓶颈;- 熟悉 InfiniBand/RoCEv2 网络拓扑,能独立调优 DP/TP/PP/EP 切分策略,解决大规模下通信-计算重叠问题;- 具备 Python/C++ 混合开发能力,代码洁癖+CI/CD 意识。

Premium Full-time
Xiaomi  7 days ago
VAST jobs

SRE工程师 Shanghai Experienced Outsourced Responsibilities Vast 是一家专注于 3D AI 的独角兽公司,致力于构建能够理解和生成 3D 世界的基础模型。公司获得 NVIDIA、Lux Capital 等顶级机构投资,产品覆盖 3D 内容生成、机器人仿真训练、空间计算等前沿领域。SRE 团队是支撑这一切稳定运转的基础——你将直接参与构建服务于大规模 3D AI 模型训练与推理的基础设施体系。职位要求1、设计并维护 AWS / 阿里云的多账号体系(Organization / Landing Zone),规划账号结构与边界,制定并落地 IAM 权限策略,推行最小权限原则,管理角色、策略与 SCP2、建立云资源全生命周期管理规范,包括 Tagging 标准、资源审计与清理流程,推动 FinOps 实践:成本归因、预算告警、RI / SP

VAST  4 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Also try:

Receive the latest job openings for:

infiniband

You also might be interested in:

AI

RDMA

Debugging

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Location
Employer/Recruiter