AI 存储-高级研发工程师 武汉 社招 全职 职位 ID:A211036 职位描述 1. 负责内部文件/对象/块存储系统的研发迭代,打造业内一流的存储基建2. 支持大数据/云原生/AI 等业务场景,解决大规模、高吞吐、高性能存储需求挑战3. 探索存储新技术方向,推进存储技术在内部落地,助力业务提效降本 职位要求 1. 具有扎实的计算机专业基础,熟练掌握 Go/C++/Java 至少1门语言2. 具有优秀的自我驱动和学习能力,责任心强,追求卓越,对解决有挑战的问题充满热情3. 具有三年以上分布式存储研发经验,有较深的系统认知理解,有内核级别优化经验4. 熟悉 HDFS/JuiceFS/CubeFS/Ceph/Lustre/块/对象等相关存储系统优先,开源社区活跃贡献者优先 投递...
Canonicals Device Delivery Team works with tier-1 OEM and ODM customers to pre-load Ubuntu Desktop and Ubuntu Core, bringing Ubuntu directly to millions of users. As a Software Engineering Manager you will lead and manage the
高级基础架构工程师(存储&备份) 热招 深圳 全职 研发 热招职位 职位描述 1. 存储系统规划与运维: - 负责公司全球数据中心及分支机构的存储架构规划与实施,管理包括SAN(FC/iSCSI)、NAS(NFS/CIFS/SMB)及对象存储在内的多类型存储资源。 - 负责主流存储设备的日常配置、扩容、固件升级及健康监控。 - 针对高科技制造场景(如海量设计图纸、测试数据、各类日志),制定分级存储策略(冷热数据分离),平衡性能与成本。2. 备份系统与数据保护: - 主导企业级备份系统的建设与运营,确保核心业务系统(内网服务器资源池、数据库、文件服务器)的备份成功率达到100%。 - 制定并执行严格的数据备份策略(RPO/RTO指标管理),实施异地备份和防勒索病毒的不可变备份(Immutable Backup)机制。 - 定期组织数据恢复演练,验证备份数据的完整性与可用性,确保在紧急状况下能快速恢复业务。 3. 混合云存储管理: - 管理公有云(AWS/阿里云)上的存储资源(如S3、EBS、OSS),优化云上存储成本,设计并维护本地IDC到云端的数据归档与灾备链路。4. 性能调优与故障排查: - 通过性能监控工具分析IOPS、延迟、吞吐量等指标,解决存储层面的性能瓶颈。 - 作为二线/三线专家,处理存储相关的复杂故障,对接原厂技术支持进行根因分析并彻底解决。5. 容灾体系建设: - 参与公司业务连续性计划(BCP)的制定,主导存储层面的容灾(DR)方案设计(如存储双活、异步复制)并定期进行切换演练。 职位要求
智驾数据平台系统工程师(平台方向) 上海 全职 职位描述 1.管理大规模分布式存储系统(NAS/对象存储),保障海量智驾数据高效读写;2.负责 GPU/CPU 计算资源调度优化与 GPU 集群管理;3.维护平台 CI/CD 流水线,管理代码仓库、镜像仓库及发布流程;4.负责平台鉴权体系(IAM/OAuth2/LDAP)的部署与日常维护;5.建设全链路监控告警体系,制定应急响应预案,快速处理平台故障;6.跟踪云原生、GPU虚拟化等技术动态,推动基础设施架构演进。 职位要求 1.本科及以上学历,3年以上系统运维/平台工程经验;2.熟练掌握 Kubernetes,有集群部署、升级、故障排查与性能调优经验;3.熟悉分布式存储(Ceph/MinIO/对象存储/NAS),有存储选型与调优经验;4.熟悉 GPU 集群管理,了解 Device Plugin、MIG、GPU 共享等方案;5.熟悉 Linux 系统管理、网络配置,熟练编写 Shell/Python 脚本;6.熟悉 CI/CD 工具链与可观测性体系(Prometheus/Grafana/EFK); 投递...
AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合) 上海 全职 职位描述 1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。 职位要求 1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。加分项1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;2.Elasticsearch、Loki、Jaeger 等组件部署调优;3.智驾 / 大规模 AI