Work Your Magic with us! Ready to explore, break barriers, and discover more? We know you’ve got big plans – so do we! Our colleagues across the globe love innovating with science and technology to enrich
Nvidia is looking for an outstanding passionate and talented Senior SW & System Architect to join our SW Architecture group. The position includes researching new technologies with focus on architecture definition of groundbreaking technologies in different
AI基础设施系统架构师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位 ID:A258951 职位描述 岗位职责集群网络架构设计负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。网络方案规划与交付主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。网络性能调优与可靠性保障优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。跨域技术协同与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。技术标准化与自动化制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。 职位要求 任职要求学历与经验本科及以上学历,计算机、通信、网络工程等相关专业;5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。技术能力(硬性要求)精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。软性素质具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;具备项目管理能力,能协调厂商、施工队和内部团队按期交付;对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。 职位信息 部门: 计算平台研发 投递...
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
资深云原生基础设施工程师(Kubernetes/云网络方向) 上海 全职 互联网 / 电子 / 网游 职位描述 岗位职责1. 负责公司云原生基础设施的架构治理、生产运维与稳定性保障,覆盖多云托管 Kubernetes 集群及相关网络、存储、调度、发布和故障恢复能力。2. 深入负责 Kubernetes 数据面与公有云基础设施,重点建设和治理 CNI、CSI、VPC、负载均衡、DNS、路由、安全组、ENI、NetworkPolicy等能力,解决跨节点、跨可用区及多云环境中的复杂网络与存储问题。3. 逐步承接业务运维侧的 VPC 网络职责,梳理从公网或内网入口、云 LB、VPC、节点到 Service、CNI及Pod的完整流量路径,建立自主排障和稳定性保障能力。4. 负责 ACK、TKE、EKS、GKE 等多云托管 Kubernetes 环境的运维、治理与优化,推动集群基线、容量管理、弹性扩缩容、发布回滚和资源治理标准化。5. 参与游戏业务的部署交付、线上保障和重大活动保障,承担必要的值班及应急响应,在复杂故障中负责核心定位与处置,推动问题复盘和闭环整改。6. 与平台工程、研发、安全等团队协作,完善监控、告警、日志、Event和链路追踪等排障闭环;推动多集群、安全治理及云原生能力的工程化落地。7. 沉淀云原生基础设施相关文档、SOP、排障手册和最佳实践,提升团队对云网络、容器网络及存储体系的接管能力。任职资格1. 全日制本科及以上学历,计算机相关专业,5 年及以上运维、SRE、平台工程或云原生基础设施经验,具备大型互联网、游戏或高并发业务生产经验。2. 具备扎实的 Linux 和 TCP/IP 基础,能够独立分析生产环境中的网络、存储、性能及稳定性问题。3. 具备完整的