AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善
Minimum qualifications: Bachelor’s degree in Computer Science, a related technical field, or equivalent practical experience. 15 years of experience in a customer-facing technical role. Experience with core cloud computing concepts and enterprise architecture principles, (e.g., networking,
运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SRE、DevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...