设计、部署和管理企业级阿里云基础架构环境。 主导或参与阿里云 Landing Zone 的规划、建设及治理工作。 确保云基础架构服务的可用性、安全性、合规性和运营稳定性。 负责 Windows Server 和 Linux 操作系统的管理与技术支持。 配置和管理网络、安全、存储、数据库及负载均衡等基础架构组件。 分析并解决复杂的基础设施、网络及应用相关问题。 通过基础设施即代码(Infrastructure as Code,IaC)推动自动化和标准化建设。 与安全、应用开发及业务团队紧密合作,提供符合企业架构标准的云解决方案。 支持灾备、备份、监控及运营持续改进相关工作。 为技术团队提供技术指导、培训和专业支持。 教育背景及认证要求 计算机科学、信息技术、软件工程或相关专业本科及以上学历。 持有阿里云专业认证(ACP)或专家认证(ACE)优先。 具备云计算、网络、安全等相关认证者优先。 工作经验要求 必备条件 3年以上阿里云平台实施和运维经验。 具备阿里云 Landing Zone 规划及落地实施经验。 熟练掌握 Windows 和 Linux 系统管理。
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /
Key responsibilities The Cloud and Data Engineer will be responsible for the development, implementation, operation, maintenance, and support of the data, middleware, and IT infrastructure used by R&D units across Novo Nordisk, both on-premises and in
Scrum Master WirelessCar’s Journey To give people the freedom to move in a safer, more sustainable, and smarter way, more shareable, connected, and software-enabled cars are needed. That is why we aim to accelerate the digital
Would you like to join one of the fastest-growing teams within Amazon Web Services (AWS)? Join us in helping customers across all industries to maximize the value and benefits of AWS services and Generative AI solutions. As a