共创-云原生开发工程师-觅蜂子公司 上海 校招 正式 技术族 - 软件类 职位 ID:A250462 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1.负责公司 Kubernetes 集群的规划、部署、升级、监控与高可用保障,支撑数百节点规模的生产环境;2.设计并实施安全、稳定、高效的 CI/CD 流水线,集成 GitOps(如 Argo CD)、Helm、Kustomize 等工具;3.优化集群资源利用率,通过 HPA/VPA、Cluster Autoscaler、Cost Allocation 等手段实现成本可控;4.构建可观测性体系:基于 Prometheus + Grafana + Loki + Tempo 实现日志、指标、链路追踪一体化监控;5.制定并落地 K8s 安全策略:包括 Pod
云原生研发工程师-觅蜂子公司 上海、北京 校招 正式 技术族 - 系统架构类 职位 ID:A209974 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台核心系统的设计、开发和维护,包括多云管理、边缘集群管理、私有化部署、资源管理、GPU 设备管理及优化、容器编排调度、运行时优化等方向中的一项或多项,持续提升平台产品的资源利用率、稳定性和易用性。2. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台基础服务的搭建、开发和维护,如:a. 网络:容器网络、RDMA、API 网关等b. 存储:分布式文件存储、对象存储等c. 边缘节点:大规模机器人节点管理、网络通信优化等d. 调度编排:训练、推理、云边联合任务、工作流等3. 与实施交付的 SRE 沟通协调,参与系统优化及问题定位,保证项目顺利部署实施。4. 跟踪云原生生态发展趋势,推动云原生 Genie
后端开发实习生(Golang) 北京 实习 互联网 / 电子 / 网游 日常实习生 职位描述 设计并落地大规模自动驾驶仿真平台能力,面向真实业务场景和用户需求交付高效产品。基于用户优先级与任务紧急程度进行资源分配和排队策略,规划仿真调度架构与策略,提升集群计算资源利用率。 职位要求 1. 计算机基础扎实:操作系统、并发/线程模型、网络协议(TCP/HTTP);能独立识别并解决线程交互与网络异常问题。2. 精通 Golang 与 Shell,具备生产级服务开发经验与性能调优能力。3. 熟练使用 git、make,具备良好的编码规范与文档能力。4. 熟悉 Kubernetes 及容器网络(CNI/Service/Ingress/DNS 等),能够排查调度与网络故障,保障集群稳定性。5. 自动驾驶行业经验,仿真平台或任务调度相关经验优先。6. GPU/CUDA 编程经验,或有 GPU 资源调度/优化实践优先。 投递...
K8S研发工程师-集群管理方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。二、为什么这个岗位重要Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。三、你将负责什么1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。 职位要求 四、我们期望你具备1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。2.
Work Your Magic with us! Ready to explore, break barriers, and discover more? We know you’ve got big plans – so do we! Our colleagues across the globe love innovating with science and technology to enrich
Job Summary The Container Platforms team, which encompasses the following functions, is a pivotal part of delivering on the Technology strategy for the Bank, which comprises: Kubernetes Container Platforms Openshift Container Platforms There is a requirement
Nvidia is looking for an outstanding passionate and talented Senior SW & System Architect to join our SW Architecture group. The position includes researching new technologies with focus on architecture definition of groundbreaking technologies in different
AI基础设施系统架构师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位 ID:A258951 职位描述 岗位职责集群网络架构设计负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。网络方案规划与交付主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。网络性能调优与可靠性保障优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。跨域技术协同与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。技术标准化与自动化制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。 职位要求 任职要求学历与经验本科及以上学历,计算机、通信、网络工程等相关专业;5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。技术能力(硬性要求)精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。软性素质具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;具备项目管理能力,能协调厂商、施工队和内部团队按期交付;对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。 职位信息 部门: 计算平台研发 投递...