Refine Reset All
Recent Searches clear
Sort by
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Prometheus Jobs In Beijing (Peking) - 7 Job Positions Available

1 – 6 of 7 jobs
01.AI jobs

AI应用测试开发工程师 北京 全职 研发 - 测试 职位描述 1. 建立适配B端Agent的质量体系与发布门禁:稳定性、工具成功率、引用一致性、安全指标、性能与成本指标。2. 场景测试:多轮对话、工作流分支、工具链路(Tool Chain)、异步/长任务、并发、异常恢复、幂等与重试风暴。3. 自动化体系:API测试(Tool Schema、接口Schema)、E2E(React 管理台 / 编排器,Playwright)、测试数据与环境管理(SaaS vs 私有化 / 离线)。4. 评测体系:离线评测集(业务 + 对抗)、自动评分(规则 / LLM-as-judge / 人审)、版本对比与回归门禁、漂移监控。5. 安全合规测试:Prompt Injection、越权工具调用、RAG 权限绕过、敏感信息泄露、审计链路完整性、离线数据驻留与脱敏校验。6. 可观测与复现:基于Tracing / Metrics / Logs的失败分类、回放(Conversation +

01.AI  15 days ago
Xiaomi jobs

AI基建架构师 北京 社招 全职 职位 ID:A102209 职位描述 岗位职责1. Sandbox 安全与隔离架构设计并实现多租户、高隔离性的AI代码执行沙箱,支持动态资源限制、网络策略及文件系统隔离。优化沙箱启动速度与冷启动性能,满足在线推理、Agent工具调用及离线批处理场景需求。探索轻量级虚拟化技术(如gVisor、Firecracker、Wasm运行时)在AI场景下的最佳实践。2. AI Observability 可观测体系建设构建覆盖模型调用、Token消耗、推理延迟、Prompt/Response全链路的可观测体系。设计Trace、Metrics、Logging三位一体的数据采集与存储方案,支持实时监控与事后回溯。针对Agent场景,建立多步骤推理轨迹追踪、工具调用成功率统计及异常行为告警能力。3. Agent 全生态架构设计与落地主导Agent运行时架构设计,包括Agent生命周期管理、会话状态持久化、工具注册与发现机制。设计并实现Agent编排引擎,支持单Agent、多Agent协作及人机协同模式。构建Agent开发者工具链,包括调试CLI、可视化编排面板及自动化测试框架。推动Agent间通信协议标准化,对接主流编排框架。4. 架构演进与技术决策制定技术路线图,平衡稳定性、成本与迭代效率。输出架构设计文档,组织技术评审,指导中高级工程师落地。跟踪业界前沿技术趋势,推动AI基础设施的持续演进。 职位要求 1、本科及以上学历,计算机相关专业,8年以上后端/基础架构开发经验,其中至少2年AI基础设施领域经验。2、精通至少两种编程语言(Go / java / python / js)。3、深入理解容器化技术(Docker / containerd / kata)及Kubernetes调度原理,有大规模K8s集群开发经验。4、熟悉分布式追踪系统(OpenTelemetry / Jaeger / Zipkin)及时序数据库(Prometheus / VictoriaMetrics)。5、有实际参与过沙箱安全机制(如gVisor、Firecracker、Wasm运行时)的设计或二次开发。加分项1、有Agent框架(LangChain、openclaw、Hermes)源码阅读或二次开发经验。 投递...

Xiaomi  14 days ago
Z.ai jobs

AI院-GLM团队-SRE运维工程师 北京 全职 研发 - 运维 职位描述 岗位职责:1.负责TOC相关业务的稳定性建设,包括但不限于Web服务、APP后端、API网关2.负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、资源利用率优化3.设计高可用架构,解决APIServer性能瓶颈、etcd存储压力等大规模集群特有问题。4.主导容器化架构调优(如Pod调度策略、网络插件选型、存储方案设计),优化资源请求/限制配置以减少资源争用。5.建立容器安全防护体系,包括漏洞扫描、运行时安全监控(如Falco)、合规审计。5.深度参与自动化运维工具链建设,CI/CD流水线混沌工程测试、智能扩缩容(HPA/VPA)推动Al0ns落地,其于时字数据合析预洲售群负裁并实现自愈。7. 解决生产环境疑难问题(如 OOM、网络延迟、存储性能瓶颈),输出标准化SOP文档车8.协同研发团队优化微服务架构,推动ServiceMesh等新技术落地, 职位要求 1.教育背景-统招本科及以上学历,计算机、软件工程、云计算相关专业优先。2.工作经验-3年以上容器运维经验,主导或深度参与过千级 Pod规模的集群维护。-熟悉生产环境容器化全生命周期管理,包括部署、监控、扩缩容、故障恢复等场景。-有多云环境/混合云管理经验-头部互联网/云计算大厂优先3.技术能力精通Kubernetes架构及生态工具(如Etcd、Calico、Istio),具备集群性能调优经验(如APIServer负载均衡、节点调度优化);熟练使用Docker、Prometheus、Grafana、ELK、CI/CD等工具链,熟悉云原生安全体系(如镜像扫描、RBAC策略、网络策略);具备运维开发能力,能使用Python/Go开发自动化工具(如自定义Operator、监控告警脚本)。 投递...

Z.ai  7 days ago
Z.ai jobs

AI院-GLM团队-AI-Native 全栈工程师(偏后端) 北京 全职 研发 - 后端开发 职位描述 1、探索并创造基于大模型的工程级代码生成服务和产品,助力开发者迎接更高效的提效体验;2、关注AI领域的最新动态和趋势,结合开发者的实际需求,为我们提供高性能、适应性强的技术解决方案;3、对产品的稳定性和性能极致的追求,深入理解并致力于优化和重构,确保系统高效、稳定运作; 职位要求 1、本科及以上学历,计算机相关专业,有三年及以上相关工作经验;2、对前端或者后端至少精通一个方向:2.1)前端开发:熟悉 HTML、CSS、JavaScript、TypeScript 等 Web 前端技术;掌握 React/Vue 等 MDV 前端框架;熟悉基于 Next.js/Nuxt.js 等脚手架的项目开发;掌握 HTTP 协议、浏览器原理、性能优化等Web 前端核心知识;有扎实的 Node.js 基础,能解决前端工程化问题。2.2)后端开发:对 Python、Java、Go 等后端开发语言有深度的理解和实践经验,包括但不限于数据处理、服务器搭建和维护、数据库操作、API的设计和实现;对微服务架构、分布式计算,以及云服务等领域有了解或实际操作经验者优先;3、对探索大模型有极大热性,有大模型相关领域研发经验者优先。4、熟练使用 Linux,熟悉 Docker、Kubernetes 等容器技术的使用,了解其原理;熟悉云原生下的服务开发部署流程,熟悉 Prometheus + Grafana 的使用; 投递...

Z.ai  7 days ago
Z.ai jobs

MaaS-SRE/DBA 北京 全职 互联网 / 电子 / 网游 职位描述 【岗位职责】1. 稳定性保障(核心):负责MySQL、Redis等核心存储组件的稳定性,建设全方位的监控告警体系(Prometheus/Grafana),实现故障的早发现、快止损,保障MaaS平台在高并发场景下的99.99%可用性。2. 架构治理与演进: 主导数据库架构升级,包括读写分离、冷热分离、分库分表及异地多活(双活)容灾体系的建设。3. 深度调优与质量管控: 建立标准化的SQL审核与发布流程,负责慢 SQL 治理、大表治理及数据库参数深度调优,解决数据库性能瓶颈。4. 自动化平台建设: 基于SRE理念,开发数据库自动化运维平台(Python/Go),实现备份恢复、高可用切换、自动扩缩容及账号权限管理的自动化。5. 应急响应与预案: 负责突发故障(如宕机、带宽拥塞)的应急响应,制定并定期演练标准化恢复预案(SOP),降低故障平均恢复时间(MTTR)。6. 容量规划与成本管理: 结合业务增长模型进行容量预测与压测,优化资源利用率,制定降本增效策略。【岗位要求】1. 学历与经验: 本科及以上学历,计算机相关专业;3 年以上大规模互联网数据库管理(DBA)或 SRE 经验,有高并发、大流量系统保障经验者极佳。2. 数据库精通: 精通 MySQL 原理(InnoDB 引擎、事务锁机制、索引优化、主从复制),精通 Redis(集群模式、缓存一致性、热 Key/大 Key 处理);熟悉其高可用架构(MHA/Orchestrator/Sentinel/Cluster)。3.

Z.ai  7 days ago
Li Auto jobs

【人形机器人】系统服务工程师 北京 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 工作职责:1.整机服务启动拓扑、依赖声明、健康检查;进程守护、异常拉起、优雅降级;2.结构化日志、分布式 tracing(OpenTelemetry)、指标(Prometheus)与端云一体可观测;3.基于 eBPF / perf 的低开销运行时诊断,整机健康管理;4.身份认证与访问控制(PKI / X.509 / SROS2)、代码签名、密钥管理;5.OTA 升级通道(RAUC / Mender / SWUpdate)与 A/B 分区;急停 / 安全状态机上层软件对接。 职位要求 任职要求:1.本科及以上,计算机 / 信息安全相关专业;2.4 年以上系统软件 / 平台工程 / SRE

Li Auto  7 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

prometheus jobs in beijing

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Type
Employer/Recruiter