MaaS-SRE/DBA 北京 全职 互联网 / 电子 / 网游 职位描述 【岗位职责】1. 稳定性保障(核心):负责MySQL、Redis等核心存储组件的稳定性,建设全方位的监控告警体系(Prometheus/Grafana),实现故障的早发现、快止损,保障MaaS平台在高并发场景下的99.99%可用性。2. 架构治理与演进: 主导数据库架构升级,包括读写分离、冷热分离、分库分表及异地多活(双活)容灾体系的建设。3. 深度调优与质量管控: 建立标准化的SQL审核与发布流程,负责慢 SQL 治理、大表治理及数据库参数深度调优,解决数据库性能瓶颈。4. 自动化平台建设: 基于SRE理念,开发数据库自动化运维平台(Python/Go),实现备份恢复、高可用切换、自动扩缩容及账号权限管理的自动化。5. 应急响应与预案: 负责突发故障(如宕机、带宽拥塞)的应急响应,制定并定期演练标准化恢复预案(SOP),降低故障平均恢复时间(MTTR)。6. 容量规划与成本管理: 结合业务增长模型进行容量预测与压测,优化资源利用率,制定降本增效策略。【岗位要求】1. 学历与经验: 本科及以上学历,计算机相关专业;3 年以上大规模互联网数据库管理(DBA)或 SRE 经验,有高并发、大流量系统保障经验者极佳。2. 数据库精通: 精通 MySQL 原理(InnoDB 引擎、事务锁机制、索引优化、主从复制),精通 Redis(集群模式、缓存一致性、热 Key/大 Key 处理);熟悉其高可用架构(MHA/Orchestrator/Sentinel/Cluster)。3. SRE 与编程能力: 具备良好的编码能力,熟练掌握
后端架构师 Beijing Full-time R&D - Back-end development Responsibilities 1. 负责公司核心后端系统的整体架构设计与技术演进,把控技术方向和落地路径2. 主导微服务体系建设:服务拆分、边界划分、服务治理(注册发现、配置中心、链路追踪、熔断限流)3. 负责系统稳定性治理:SLO/SLA 制定、容量规划、性能压测、故障演练、降级预案,持续降低线上事故率4. 主导高并发、高可用架构设计,解决大流量场景下的性能瓶颈与扩展性问题5. 建立并完善技术规范:编码规范、API 设计规范、代码 review 流程、技术文档体系6. 推动研发效能提升:CI/CD、可观测性(Logging / Metrics / Tracing)、自动化测试体系建设7. 技术选型与预研:跟踪业界前沿技术,评估引入成本与收益,为业务发展储备技术能力8. 培养和指导团队后端工程师,参与关键代码 review,把控代码质量9. 与产品、前端、算法、运维团队深度协作,从架构层面推动业务目标达成 Qualifications 1. 5 年以上后端开发经验,其中至少 2 年架构设计经验,有过从 0 到 1
运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SRE、DevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...