Refine Reset All
Recent Searches clear
Sort by
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Devop Sre Jobs In Beijing (Peking) - 4 Job Positions Available

1 – 4 of 4 jobs
Li Auto jobs

AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善

Li Auto  29 days ago
Moonshot AI jobs

你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /

Moonshot AI  21 days ago
Xiaomi jobs

SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time AI
Xiaomi  4 days ago
Li Auto jobs

运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SREDevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...

Premium Full-time
Li Auto  29 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

devop sre jobs in beijing

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Type
Employer/Recruiter