高级存储工程师 惠州 全职 职位描述 1. 全栈存储运维管理对象存储、块存储、分布式存储、云存储(AWS S3/阿里云OSS)及高性能存储(Lustre/GPFS),涵盖部署、监控、调优与故障处理针对传统业务与HPC场景(CAE仿真/AI训练)优化存储架构,提升IO效率与资源利用率2. 性能与可靠性保障建立跨平台监控体系,分析IOPS/延迟/吞吐量等指标,实施QoS策略与负载均衡设计PB级数据容灾方案,包括备份恢复、多活架构及超算存储容灾标准3. 技术演进规划推动混合云/多云存储落地,探索超算与云存储融合架构(如热数据分级迁移)研究存储新技术(软件定义存储/STaaS/NVMe-oF)并推动试点 职位要求 1. 5年以上存储运维经验,含2年超算/HPC存储管理(Lustre/GPFS/BeeGFS)2. 精通以下至少两个领域:云存储集成(Terraform/AWS EBS)、HPC优化(MPI-IO调优/RDMA网络/元数据扩展)、容灾方案(Veeam/异地多活)3. 熟练使用Python/Shell实现运维自动化优先条件:1. 有PB级存储集群管理经验,熟悉超算硬件(DDN/HPE Apollo)2. 持云平台存储认证(AWS/Azure)或HPC认证(Intel HPC Academy)3. 熟悉容器存储(Kubernetes CSI)及AI训练数据管道 投递...
AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合) 上海 全职 职位描述 1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。 职位要求 1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。加分项1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;2.Elasticsearch、Loki、Jaeger 等组件部署调优;3.智驾 / 大规模 AI
AI 存储-高级研发工程师 武汉 社招 全职 职位 ID:A211036 职位描述 1. 负责内部文件/对象/块存储系统的研发迭代,打造业内一流的存储基建2. 支持大数据/云原生/AI 等业务场景,解决大规模、高吞吐、高性能存储需求挑战3. 探索存储新技术方向,推进存储技术在内部落地,助力业务提效降本 职位要求 1. 具有扎实的计算机专业基础,熟练掌握 Go/C++/Java 至少1门语言2. 具有优秀的自我驱动和学习能力,责任心强,追求卓越,对解决有挑战的问题充满热情3. 具有三年以上分布式存储研发经验,有较深的系统认知理解,有内核级别优化经验4. 熟悉 HDFS/JuiceFS/CubeFS/Ceph/Lustre/块/对象等相关存储系统优先,开源社区活跃贡献者优先 投递...