Refine Reset All
Sort by
Company
Location
Job Type
Employer/Recruiter
Experience
Date Posted
Company
Job Title
Location
Employer/Recruiter
Experience
All Filters

You refined by

Full-time

Sre Linux Jobs In China - 36 Job Positions Available

Top Cities:
1 – 20 of 36 jobs
Li Auto jobs

AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4.

Li Auto  27 days ago
上海得物信息集团有限公司 jobs

【27届校招】SRE(系统可靠性工程师) 上海 正式 技术类 2027届秋季校园招聘项目 职位描述 1、负责公司业务系统运维工作,提升业务稳定性和工程效率,与业务方保持高效沟通,建立良好合作关系;2、负责应用上线评审、上线交付、配置变更、状态监控、容量管理、故障应急响应工作;3、参与业务服务端架构的高可用设计和性能优化,保证高效、可靠的业务迭代;4、负责线上重大问题排查,紧急事故处理,后续事故分析与优化;5、负责应用故障演练、应急预案、SOP手册编写工作,确保故障时业务能快速恢复;6、负责应用高可用建议及管理,包括限流、降级,容错、容灾,同城多活,确保应用质量;7、建立SLA评估标准,计算故障对SLA影响,并对SLA后续改进措施进行跟进;8、负责运维规范、流程文档编制,并将其工具化、平台化,确保运维安全,提升运维效率;9、探索 AI 在稳定性领域的应用,包括辅助故障根因分析、告警降噪运维工作智能化。 职位要求 1、2027届毕业生,本科以上学历,计算机类、软件类、通信类等相关专业优先;2、扎实的编程基础,至少掌握一门开发语言,熟悉Golang, python优先;3、对主流操作系统熟悉比如Linux,Debian等;4、熟悉容器技术、云原生;5、具备使用 AI 编程工具(如 Claude Code、Cursor)辅助开发和调试的实践经验;6、了解大模型/Agent 基本原理,对 AIOps、混沌工程自动化等方向有一定了解或探索优先。 投递...

Premium Full-time AI
上海得物信息集团有限公司  24 days ago
ZEGOCLOUD jobs

业务运维岗(SRE) 深圳 全职 互联网 / 电子 / 网游 职位描述 职位描述1. 负责实时音视频业务日常运维工作,对突发事件的快速响应、定位及处理,排除故障,保障系统稳定性;2. 负责实时音视频业务稳定性保障工作并持续优化,包括服务质量提升、架构优化、容灾预案、精细化监控、问题/故障处理及规避等;3. 负责运维工作的标准化,自动化和智能化实践;4. 负责业务系统客户问题持续跟进、分析和解决。 职位要求 职位要求1、计算机及相关专业本科及以上学历2、熟悉linux,掌握常用数据结构、算法、设计模式,熟练掌握编程语言者优先(Java、PHP、Golang、Python等)3、熟练使用shell,3-5年运维经验4、熟悉SRE的主要职责,对可用性保障工作有深刻理解和认同5、熟悉Jenkins、SaltStack、Ansible、prometheus、Grafana、ELK等主流开源软件6、对AI有一定的理解和实际场景的应用 投递...

Premium Full-time
ZEGOCLOUD  23 days ago
HSBC jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC  21 days ago
HSBC Group jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC Group  21 days ago
VAST jobs

SRE工程师 Shanghai Experienced Outsourced Responsibilities Vast 是一家专注于 3D AI 的独角兽公司,致力于构建能够理解和生成 3D 世界的基础模型。公司获得 NVIDIA、Lux Capital 等顶级机构投资,产品覆盖 3D 内容生成、机器人仿真训练、空间计算等前沿领域。SRE 团队是支撑这一切稳定运转的基础——你将直接参与构建服务于大规模 3D AI 模型训练与推理的基础设施体系。职位要求1、设计并维护 AWS / 阿里云的多账号体系(Organization / Landing Zone),规划账号结构与边界,制定并落地 IAM 权限策略,推行最小权限原则,管理角色、策略与 SCP2、建立云资源全生命周期管理规范,包括 Tagging 标准、资源审计与清理流程,推动 FinOps 实践:成本归因、预算告警、RI / SP 购买策略、Spot 实例优化3、通过

VAST  20 days ago
Automatically Get Matched to sre linux Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
Moonshot AI jobs

你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /

Moonshot AI  18 days ago
Apple jobs

SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple

Apple  16 days ago
MiniMax jobs

SRE运维研发实习生 北京 校招 实习 研发 - 基础架构 2028届实习生招聘 职位描述 负责大规模分布式系统及各类在线服务可靠、稳定、高效运行1. 参与在线系统和各类产品架构设计,主导服务可靠性相关自动化系统的实现,满足严格的质量与效率要求2. 参与国内外整体机房建设,为产品用户提供最优质的接入与使用体验布局3. 设计研发服务运维解决方案,包括网站加速、持续交付、容量管理、弹性计算、故障分析、流量分配、性能调优等4.关注业界前沿技术动态,负责大规模流量接入系统的优化,演进和新接入技术探索和应用5. 关注业界相关技术动态,对齐混部技术方向(Docker等)),贡献与引领业界技术趋势6. 使用AI技术解决超大规模互联网应用运维问题 职位要求 1. 2026届本科及以上学历在读,计算机、通信、数学等相关专业优先2. 深入理解Linux操作系统;具备较好的计算机网络和体系结构基础3. 熟练掌握C/C++/Python/Go/Shell等至少一种主流编程语言4. 良好的逻辑思维和分析能力,热衷于解决问题、追求极致5. 强烈的责任心、进取心、团队合作精神和Ownership具有以下条件者优先:1. 有大规模分布式程序设计开发经验2. 熟悉TCP/IP、HTTP/HTTPS等网络协议,精通Socket网络编程,有网络故障的Trace能力 投递...

Premium Full-time
MiniMax  15 days ago
Xiaomi jobs

SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time AI
Xiaomi  1 day ago
Apple jobs

SummaryThe people here at Apple don’t just build products — we craft the kind of wonder that’s revolutionized entire industries. It’s the diversity of those people and their ideas that supports the innovation that runs through

Apple  2 days ago
BridgeDP Robotics jobs

机器人系统测试开发工程师 6-8K 深圳 实习 职位描述 岗位职责:- 自动化测试体系建设:负责端侧系统软件(Runtime / SDK / 应用层)的测试框架设计与搭建,从 0 到 1 建立自动化测试能力。- 测试用例设计:深入理解被测系统,设计覆盖功能、性能、稳定性与长稳的测试用例,持续提升测试覆盖率与有效性。- 真机回归测试:负责将版本部署到真机执行回归测试,采集与判读运行数据,定位问题并推动闭环。- CI/CD 集成:将自动化测试接入持续集成/交付流水线,实现构建—测试—回归的自动化,保障交付质量。- 质量把控与度量:跟踪缺陷全生命周期,建立测试报告与质量度量体系,推动产品质量持续提升。- 跨部门协作:与 Runtime、SDK、SRE、算法团队紧密配合,完成系统级联调、测试与问题排查。 职位要求 任职要求:- 本科及以上学历,计算机、软件工程、自动化等相关专业(英雄不问出处,我们更看重实际动手能力与技术热情)。- 具备 软件测试开发(SDET) 能力:能独立设计并实现自动化测试框架,而非仅执行手工测试。- 具备 C++ 基础与基本的系统开发常识:能读懂端侧代码,理解多线程/进程/IPC,能看懂日志与基本的故障信息。- 熟悉 Linux 开发环境,具备优秀的脚本能力(Python / Shell)。- 熟悉 CI/CD

BridgeDP Robotics  28 days ago
Li Auto jobs

【人形机器人】系统服务工程师 北京 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 工作职责:1.整机服务启动拓扑、依赖声明、健康检查;进程守护、异常拉起、优雅降级;2.结构化日志、分布式 tracing(OpenTelemetry)、指标(Prometheus)与端云一体可观测;3.基于 eBPF / perf 的低开销运行时诊断,整机健康管理;4.身份认证与访问控制(PKI / X.509 / SROS2)、代码签名、密钥管理;5.OTA 升级通道(RAUC / Mender / SWUpdate)与 A/B 分区;急停 / 安全状态机上层软件对接。 职位要求 任职要求:1.本科及以上,计算机 / 信息安全相关专业;2.4 年以上系统软件 / 平台工程 /

Li Auto  27 days ago
Apple jobs

SummaryWe are hiring an SRE to own reliability, performance, data freshness, and operational readiness for our production ETL platform. The platform supports data ingestion, transformation, and loading workflows across Kubernetes-based environments — including Airflow-based loader jobs and

Apple  26 days ago
Apple jobs

SummaryThe AiDP Data Platforms team builds and operates data platforms at scale on the Cloud, helping Apple process, store, and access petabytes of data. We’re seeking an SRE to own the reliability, performance, and operability of our

Apple  23 days ago
Renesas Electronics jobs

Job Description Have clear and solid relationships with software development departments. Plan and document work and projects. Build and continuously optimize CI/CD process and streamline automation effort for server provisioning and applications deployment. Build a resilient

Renesas Electronics  21 days ago
Renesas Electronics jobs

Job Description Have clear and solid relationships with software development departments. Plan and document work and projects. Build and continuously optimize CI/CD process and streamline automation effort for server provisioning and applications deployment. Build a resilient

Renesas Electronics  20 days ago
BOKE Technology Co., Ltd jobs

资深云原生基础设施工程师(Kubernetes/云网络方向) 上海 全职 互联网 / 电子 / 网游 职位描述 岗位职责1. 负责公司云原生基础设施的架构治理、生产运维与稳定性保障,覆盖多云托管 Kubernetes 集群及相关网络、存储、调度、发布和故障恢复能力。2. 深入负责 Kubernetes 数据面与公有云基础设施,重点建设和治理 CNI、CSI、VPC、负载均衡、DNS、路由、安全组、ENI、NetworkPolicy等能力,解决跨节点、跨可用区及多云环境中的复杂网络与存储问题。3. 逐步承接业务运维侧的 VPC 网络职责,梳理从公网或内网入口、云 LB、VPC、节点到 Service、CNI及Pod的完整流量路径,建立自主排障和稳定性保障能力。4. 负责 ACK、TKE、EKS、GKE 等多云托管 Kubernetes 环境的运维、治理与优化,推动集群基线、容量管理、弹性扩缩容、发布回滚和资源治理标准化。5. 参与游戏业务的部署交付、线上保障和重大活动保障,承担必要的值班及应急响应,在复杂故障中负责核心定位与处置,推动问题复盘和闭环整改。6. 与平台工程、研发、安全等团队协作,完善监控、告警、日志、Event和链路追踪等排障闭环;推动多集群、安全治理及云原生能力的工程化落地。7. 沉淀云原生基础设施相关文档、SOP、排障手册和最佳实践,提升团队对云网络、容器网络及存储体系的接管能力。任职资格1. 全日制本科及以上学历,计算机相关专业,5 年及以上运维、SRE、平台工程或云原生基础设施经验,具备大型互联网、游戏或高并发业务生产经验。2. 具备扎实的 Linux 和 TCP/IP 基础,能够独立分析生产环境中的网络、存储、性能及稳定性问题。3. 具备完整的

BOKE Technology Co., Ltd  20 days ago
LIZHI jobs

高级DBA工程师(数据库可靠性方向) 广州 全职 研发 - 运维 职位描述 1. 负责 MySQL、Redis、MongoDB、Kafka、ZooKeeper 等数据库及中间件的稳定运行,包括监控、故障恢复、性能调优、备份恢复与容灾演练;2. 负责数据库容量规划与高可用架构设计,包括主从复制、分片、跨机房多活,保障核心业务 RPO/RTO;3. 主导数据库自动化运维平台的设计与开发,实现部署、扩缩容、迁移、巡检、自愈等全生命周期自动化;4. 建立 SLO/SLI/错误预算体系,为业务系统提供数据库选型、容量评估及数据架构支持,输出数据层规范,推动成本与性能优化;5. 负责重大故障应急响应与复盘,跟踪云原生数据库技术并推动落地。 职位要求 1. 本科及以上学历,5 年以上数据库/中间件相关经验,有大规模生产环境 SRE/DBRE 经验者优先,有公有云运维经验优先;2. 精通 MySQL/InnoDB 原理,熟练使用 MongoDB、Redis,熟悉 Kafka、ZooKeeper;3. 精通高可用架构与容灾,理解 CAP,有跨机房高可用或容灾经验者优先;4. 熟悉 Linux,掌握 Python/Go/Shell 中至少一种,有运维平台开发经验,熟悉 Kubernetes 有状态服务及存储、网络、调度;5. 熟悉 Prometheus/Grafana/VictoriaMetrics

LIZHI  17 days ago
Apple jobs

SummaryImagine what you could do here. At Apple, new ideas have a way of becoming extraordinary products, services, and customer experiences very quickly. We are looking for great Systems Reliability Engineers to design, build and operate

Apple  16 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

sre linux

You also might be interested in:

Site Reliability Engineer

Kubernetes

DevOps

Automation

Scripting

Release Engineering

Programming Languages

Load Balancing

Git

Craft

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Company
Location
Job Type
Employer/Recruiter
Experience