AI基础设施系统架构师 北京、上海 社招 全职 互联网 / 电子 / 网游 职位 ID:A258951 职位描述 岗位职责集群网络架构设计负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。网络方案规划与交付主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。网络性能调优与可靠性保障优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。跨域技术协同与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。技术标准化与自动化制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。 职位要求 任职要求学历与经验本科及以上学历,计算机、通信、网络工程等相关专业;5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。技术能力(硬性要求)精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。软性素质具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;具备项目管理能力,能协调厂商、施工队和内部团队按期交付;对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。 职位信息 部门: 计算平台研发 投递...
工作职责: 1.与潜在客户的技术团队沟通,深入理解其需求,基于技术需求筛选并锁定目标客户群体。 2.设计并展示基于 Alluxio的解决方案,设计并完成POC。 3.协同销售团队进行市场开拓,拜访现有客户及潜在客户,收集反馈,洞察市场与技术趋势。 4.向产品团队传递客户需求及市场洞察,推动客户需求与 Alluxio的roadmap保持一致。 任职资格: 1.具备7年以上AI/ML 领域的开发、解决方案架构设计或技术架构设计的经验。 2.熟悉 Java 和 Python,有 Shell 脚本和 Go 语言经验者优先。 3.满足以下至少两项要求: 1)熟悉大数据生态系统,精通至少一种计算框架(如 Hadoop/Spark/Presto/Impala/Flink),熟悉一种及以上存储系统(如 HDFS/S3/Ceph),并具备实际开发或解决方案设计经验。 2)熟悉 AI/ML 框架(如 TensorFlow、PyTorch ),有相关工作经验。 3)熟悉 Kubernetes,具备基于 K8s 的开发经验或解决方案设计经验。 4.熟悉 Linux与 Docker,具备实际操作经验。 5.自驱力强、富有团队精神、学习能力快。...
Canonicals Device Delivery Team works with tier-1 OEM and ODM customers to pre-load Ubuntu Desktop and Ubuntu Core, bringing Ubuntu directly to millions of users. As a Software Engineering Manager you will lead and manage the