Refine Reset All
Sort by
Skills
Location
Job Type
Employer/Recruiter
Date Posted
Skills
Location
Job Type
Employer/Recruiter
All Filters

CNI Jobs In China - 8 Job Positions Available

Top Cities:
1 – 8 of 8 jobs
智元创新(上海)科技有限公司 jobs

共创-云原生开发工程师-觅蜂子公司 上海 校招 正式 技术族 - 软件类 职位 ID:A250462 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1.负责公司 Kubernetes 集群的规划、部署、升级、监控与高可用保障,支撑数百节点规模的生产环境;2.设计并实施安全、稳定、高效的 CI/CD 流水线,集成 GitOps(如 Argo CD)、Helm、Kustomize 等工具;3.优化集群资源利用率,通过 HPA/VPA、Cluster Autoscaler、Cost Allocation 等手段实现成本可控;4.构建可观测性体系:基于 Prometheus + Grafana + Loki + Tempo 实现日志、指标、链路追踪一体化监控;5.制定并落地 K8s 安全策略:包括 Pod

智元创新(上海)科技有限公司  24 days ago
智元创新(上海)科技有限公司 jobs

云原生研发工程师-觅蜂子公司 上海、北京 校招 正式 技术族 - 系统架构类 职位 ID:A209974 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台核心系统的设计、开发和维护,包括多云管理、边缘集群管理、私有化部署、资源管理、GPU 设备管理及优化、容器编排调度、运行时优化等方向中的一项或多项,持续提升平台产品的资源利用率、稳定性和易用性。2. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台基础服务的搭建、开发和维护,如:a. 网络:容器网络、RDMA、API 网关等b. 存储:分布式文件存储、对象存储等c. 边缘节点:大规模机器人节点管理、网络通信优化等d. 调度编排:训练、推理、云边联合任务、工作流等3. 与实施交付的 SRE 沟通协调,参与系统优化及问题定位,保证项目顺利部署实施。4. 跟踪云原生生态发展趋势,推动云原生 Genie

智元创新(上海)科技有限公司  23 days ago
Momenta jobs

后端开发实习生(Golang) 北京 实习 互联网 / 电子 / 网游 日常实习生 职位描述 设计并落地大规模自动驾驶仿真平台能力,面向真实业务场景和用户需求交付高效产品。基于用户优先级与任务紧急程度进行资源分配和排队策略,规划仿真调度架构与策略,提升集群计算资源利用率。 职位要求 1. 计算机基础扎实:操作系统、并发/线程模型、网络协议(TCP/HTTP);能独立识别并解决线程交互与网络异常问题。2. 精通 Golang 与 Shell,具备生产级服务开发经验与性能调优能力。3. 熟练使用 git、make,具备良好的编码规范与文档能力。4. 熟悉 Kubernetes 及容器网络(CNI/Service/Ingress/DNS 等),能够排查调度与网络故障,保障集群稳定性。5. 自动驾驶行业经验,仿真平台或任务调度相关经验优先。6. GPU/CUDA 编程经验,或有 GPU 资源调度/优化实践优先。 投递...

Momenta  23 days ago
MiniMax jobs

K8S研发工程师-集群管理方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。二、为什么这个岗位重要Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。三、你将负责什么1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。 职位要求 四、我们期望你具备1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。2.

MiniMax  21 days ago
Merck Group jobs

Work Your Magic with us! Ready to explore, break barriers, and discover more? We know you’ve got big plans – so do we! Our colleagues across the globe love innovating with science and technology to enrich

Merck Group  4 days ago
Standard Chartered jobs

Job Summary The Container Platforms team, which encompasses the following functions, is a pivotal part of delivering on the Technology strategy for the Bank, which comprises: Kubernetes Container Platforms Openshift Container Platforms There is a requirement

Standard Chartered  2 days ago
Nvidia jobs

Nvidia is looking for an outstanding passionate and talented Senior SW & System Architect to join our SW Architecture group. The position includes researching new technologies with focus on architecture definition of groundbreaking technologies in different

Nvidia  2 days ago
无问芯穹 Infinigence AI jobs

AI基础设施系统架构师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位 ID:A258951 职位描述 岗位职责集群网络架构设计负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。网络方案规划与交付主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。网络性能调优与可靠性保障优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。跨域技术协同与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。技术标准化与自动化制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。 职位要求 任职要求学历与经验本科及以上学历,计算机、通信、网络工程等相关专业;5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。技术能力(硬性要求)精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。软性素质具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;具备项目管理能力,能协调厂商、施工队和内部团队按期交付;对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。 职位信息 部门: 计算平台研发 投递...

Premium Full-time
无问芯穹 Infinigence AI  17 hours ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

cni

You also might be interested in:

Kubernetes

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Location
Job Type
Employer/Recruiter