Refine Reset All
Sort by
Location
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Sre Devops 1 Jobs In China - 11 Job Positions Available

Top Cities:
1 – 11 of 11 jobs
Li Auto jobs

AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善 AI

Li Auto  16 days ago
Bambu Lab jobs

SRE工程师 热招 深圳 全职 研发 热招职位 职位描述 1、负责业务基础环境建设与维护,保障系统稳定运行;2、推进DevSecOps,协同安全部门落实安全要求与政策,提升企业安全水平;3、维护容器平台稳定性,完善监控与应急机制,确保故障快速定位与恢复;4、建设与优化流量治理、可观测和应急响应体系;5、通过自动化工具链与平台的构建,持续优化并提升交付效率与质量。 职位要求 1. 本科及以上学历,计算机科学、软件工程或相关专业优先;2. 3年以上系统运维/SRE/DevOps经验;有大规模容器集群管理或云环境项目经验者优先,制造业/全球分布式系统背景加分;3. 容器与编排:精通K8s,具备大规模集群管理、升级/迁移经验(如100+节点环境),熟悉Helm/Kustomize包管理;4、掌握安全集成方法,如容器安全基线(CIS Benchmarks)、CI/CD安全插件(SonarQube、Trivy)、配置管理安全(Secrets管理、RBAC);5、熟悉AWS(EKS/ECS)、阿里云(ACK)或GCP(GKE)等主流服务,包括云网络、存储与安全配置;有混合云部署经验优先;6、掌握至少一门脚本语言(如Python/Go/Shell),用于工具开发、API集成与自动化运维(如Ansible playbook、Python监控脚本);7、软性素质: - 高度责任心:对系统可靠性有强主人翁感,能主动识别风险并推动改进; - 沟通协作能力:跨团队(开发、安全、业务)高效协调,善于根因分析与问题复盘; - 应对挑战:高压环境下保持冷静,快速学习新技术,支持24/7 on-call(轮值响应)。 投递...

Bambu Lab  27 days ago
Moonshot AI jobs

你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs / Traces),构建从业务指标到基础设施指标的全链路可观测性。

Moonshot AI  8 days ago
Xiaomi jobs

SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time AI
Xiaomi  6 days ago
小米科技 Xiaomi Technology jobs

SRE实习生-2027届 南京 校招 实习 软件研发类 职位描述 1、负责小米各业务的SRE工作,比如AIoT、小米商城、互联网业务、小米手机核心应用、视频技术等2、工作涵盖容量管理、灾备管理、活动重保、日常Oncall、troubleshooting、业务巡检、故障预案、架构优化、技术运营等;3、与DEVS共同设计产品后端架构,实现分布式、全球集群化运维管理,制定并实施相关运维技术方案,确保服务高效、稳定的运行; 4、研发设计自动化运维工具,减少日常重复性工作,用DevOps工具化思维解决业务问题,提升运维效率; 5、通过技术手段进行成本控制及优化,通过工具化及流程提升服务管理效率。 职位要求 1、熟练至少一种编程语言:Go/Python/Bash/C/C++/Java;2、熟悉Linux/Unix系统;3、乐于分享、开源,具备服务精神,良好的沟通能力和团队合作精神;4、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time
小米科技 Xiaomi Technology  5 days ago
Bambu Lab jobs

资深运维开发工程师 热招 上海 全职 研发 职位描述 我们正在寻找一位兼具 稳定性治理能力 与 运维开发能力 的资深工程师,加入云端 SRE 团队,负责支撑业务增长阶段下的多云、多集群云原生基础设施稳定运行与持续优化。你将面向业务增长带来的稳定性、性能、容量和成本挑战,参与 Kubernetes 集群治理、Elasticsearch 等关键基础组件优化、线上故障治理、容量规划和变更风险控制。同时,你也将推动自动化运维平台和工具链建设,将线上问题沉淀为平台能力、工程规范和长期机制,提升研发、数据、安全、合规等团队的协作效率。1. 稳定性治理:负责云端基础设施及关键基础组件的稳定性建设,定位并解决线上性能瓶颈、容量风险和可用性问题,保障业务系统稳定运行;2. 性能优化:针对 Elasticsearch 等核心组件开展性能调优、容量评估、资源治理和架构优化,提升系统吞吐、查询效率和服务可靠性;3. 云原生基础设施:负责 Kubernetes 集群及 CNCF 云原生生态组件的日常运维、架构优化和稳定性提升,支撑并保障多个 Kubernetes 集群的可靠运行;4. 多云平台治理:参与阿里云 ACK、AWS EKS、GCP GKE 等多云托管 Kubernetes 环境的运维、治理和优化,提升多云环境下的可观测性、弹性、成本效率和运维一致性;5. 故障与变更管理:负责线上告警处理、故障应急、根因分析、复盘改进和生产变更管理,建立可持续的稳定性改进机制;6. 自动化与平台建设:开发和维护自动化运维平台、工具链和流程系统,提升发布、变更、巡检、告警、权限、资源交付等环节的自动化水平;7. 跨团队协作:与后端研发、数据、安全、合规等团队紧密协作,推动基础设施问题定位、流程规范、权限治理、合规要求和稳定性改进落地。 职位要求

Bambu Lab  27 days ago
Automatically Get Matched to sre devops 1 Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
State Street jobs

State Street is seeking a highly motivated AWS Federated Cloud Platform Engineer. This role is responsible for the design, development, enhancement, and operational support of the enterprise AWS Federated Landing Zone platform especailly on AWS compute

State Street  19 days ago
Li Auto jobs

运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SREDevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...

Premium Full-time
Li Auto  16 days ago
Apple jobs

SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple

Apple  10 days ago
Xiaomi jobs

运维开发工程师 武汉、西安、上海 校招 正式 运维类 2027届校园招聘计划 职位描述 岗位描述: 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps 和 Google SRE的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 任职要求: 1、熟练C/C++/Java/【Go】至少一种编程语言,有Ruby/Python/Bash经验更好;2、熟悉Linux/Unix系统/【K8s 生态】;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括: 产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time
Xiaomi  6 days ago
MiniMax jobs

大模型系统研发工程师-应届生-TOP Talent 上海、北京 校招 正式 互联网 / 电子 / 网游 - 研发 MiniMax Top Talent人才计划 职位描述 部门介绍:https://vrfi1sk8a0.feishu.cn/wiki/HQq7wUuO3i2uKskL93jcCPCnnVg这是一个面向关键大模型系统演进的核心岗位,如果你对性能调优、极致可扩展性、系统稳定性有偏执般的追求,我们在这里等你:(对下列任意一个方向感兴趣即可投递)1. 参与构建高性能、高可用的大规模分布式训练与推理系统,支撑万卡规模的高效稳定训练,面向数万卡、多集群部署场景下的在线推理系统进行极致优化。系统需在低延迟、高吞吐、强鲁棒性之间取得工程最优解,将硬件性能榨取到极致,承载模型从训练到上线全流程的性能闭环。2. 参与性能相关的算法问题的解决,追求优化算法的实际落地和一定程度的可解释性。针对算法与工程的复合问题,可以在架构上给出能达到上限的解决方案。在算法上完成足够解决或者解释问题的实验。3. 在机器学习系统、云原生架构、编排调度、资源调优等多个技术方向持续攻坚,推动系统架构在规模化和复杂性中的不断演进。你需要具备系统视角和极强的工程实现能力,能够在跨层级、跨组件的协同中识别瓶颈、重构路径、突破边界。4. 参与自建公司级机房、SRE&Devops体系建设,保障多个核心系统的可靠性,包括但不限于GPU/CPU资源、存储、高性能网络研发、业务网关接入、组件稳定性、成本优化等方向 职位要求 1. 理工科背景,包括但不限于计算机科学与技术、软件工程、电子信息、数学、物理等;2. 扎实的计算机基础,具备优秀的工程实现能力和良好的代码风格;3. 理解深度学习基本原理,有相关系统的二次开发经验者优先;4. 对技术充满热情与好奇,具备责任心与良好的自驱力。加分项:1. 在相关竞赛中取得优异成绩(如 OI、MO、PhO、ICPC、CCPC、ASC、ISC、CHO、BO 等);2. 具有突出的开源项目贡献或社区参与经历。 投递...

Premium Full-time
MiniMax  4 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

sre devops 1

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Location
Job Type
Employer/Recruiter