DevOps Engineer WirelessCars Journey WirelessCar empowers the future of mobility by connecting vehicles and delivering cutting-edge digital services. Founded in 1999 and headquartered in Sweden, we have a strong global presence with offices in the U.S., China,
AVEVA is a global leader in industrial software. Our cutting-edge solutions are used by thousands of enterprises to deliver the essentials of life – such as energy, infrastructure, chemicals and minerals – safely, efficiently and more
AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善
运维开发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 句子互动 DevOps 团队的使命是确保句子秒回和句客宝 24/7 的在不同的环境中高效和可持续性运转。以 ToB 业务为主的句子互动希望为客户提供流畅稳定的部署,使用和更新体验,这就要求 DevOps 团队能够从系统的可用性,扩张性和稳定性出发,组建和维护大规模、高可用、高效能的分布式系统,结合当下最流行的云原生技术,打造全流程自动化的体系。你需要深入句子互动各业务线,在确保基础设施在快速演进的同时,具备高可用以及扩展性,并从稳定性和效能的角度切入到业务研发,为业务研发团队提供高效的开发架构,同时通过建设完善的监控体系,保证业务系统的快速稳定迭代。岗位职责1. 参与句子 DevOps 平台的开发,以服务化、产品化的方式解决海量系统的自动化运维,故障智能定位和自修复2. 参与句子的监控系统的开发,提高监控有效性,覆盖率,提升监控系统的智能化3. 参与搭建句子 DevOps 自动化部署平台,减少因发布导致的业务可用性下降,缩短从代码提交到生产环境部署的时间周期,提高私有部署环境的搭建和维护效率 职位要求 1. 全日制本科,1 年以上工作经验,大型互联网公司或者大型IT企业应用运维经验者优先2. 熟悉 Docker 技术和对应的 PaaS 体系架构。有容器、调度相关经验或了解 Docker、Swarm、Kubernetes等相关技术3. 掌握一门服务端编程语言(Go / Java / Python /
About A1 There are over 5 billion users using basic applications today such email, notes, tasks that are not AI-native. Our mission is to build a proactive smart assistant for everyday users to bring intelligence to
整车控制器系统需求工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 对标与需求定义:负责整车控制器平台及趋势的对标分析、功能部署定义及业务划分,以及原始需求、系统需求、软硬件需求的收集、编写、分析与评审;2. 跨维度需求拆解:从智能驾驶、车辆控制、AI 算法、芯片、服务器等多维度拆解系统级需求,制订专业且灵活的系统级解决方案,覆盖底层功能定义与分配、通讯、诊断、功能安全、信息安全、资源配置、车云协同等方向;3. 系统架构与方案设计:牵头或深度参与整车控制器平台的系统架构设计、技术选型与技术方案研究,并推动落地实施;能与技术团队进行深度技术讨论(不需要写代码,但要理解方案取舍),同时能向非技术方清晰阐述产品价值;4. 开发交付闭环:负责系统需求的设计、开发、测试及 Jira 问题全闭环,管理控制器平台产品开发全生命周期,在高迭代节奏中平衡「快速交付」与「工程质量」;5. 跨团队协同对齐:对接软件架构、硬件、软件、测试 Team,以专题形式快节奏对齐各专业认知,形成共识;负责产品系统需求的解释与澄清拉齐;6. 需求体系建设:建设和维护控制器平台产品需求体系,持续对软、硬件架构设计提出系统性约束与建议,推动迭代质量提升;7. AI 领军:感知前沿 AI 发展,利用 AI 打破现有约束、构建 AI 虚拟团队,基于 LLM 设计高鲁棒性的多 Agent系统,探索记忆管理与上下文优化规则,重构现有系统工作流程。 职位要求 1. 基础背景- 本科及以上学历,人工智能、计算机、电气工程、自动化、机电一体化、车辆工程、电子、软件工程等相关专业;- 3年以上汽车电子系统或AI
系统运维工程师 北京 全职 金融 - 互联网金融 职位描述 保障生产环境系统网络的高可用性,确保业务稳定运作,迅速定位并解决故障。设计与开发自动化运维工具,推进运维工作的标准化、流程化与自动化,减少人工干预,降低误操作风险,提升运维工作效率。依据业务需求和技术发展趋势,设计具备高可靠性与可扩展性的系统网络架构方案,并持续优化现有架构以支持业务增长。评估系统性能和运行状态,建立量化指标,以数据为导向优化架构,提高资源利用率,降低成本。搭建运维管理平台,推动基础设施即代码和DevOps实践的实施。 具备强烈的责任心、自我驱动力强,关注细节,追求卓越。 职位要求 具备五年以上运维/DevOps工作经验,其中至少两年以上架构设计或运维开发经验,计算机相关专业者优先;熟练掌握Python、Shell,熟悉Django/Flask等框架,能够独立开发运维工具;熟练掌握Linux系统管理,熟悉内核调优、性能分析、安全加固等工作;熟练掌握虚拟化(KVM/VMware)、Docker、Kubernetes,具备大规模容器化集群管理经验;能够熟练运用负载均衡技术(HAProxy、Nginx、Keepalived、Pacemaker);具备两年网络维护经验。熟悉主流厂商路由器、交换机、防火墙配置,熟悉公有云网络相关服务。具备较强的排错能力,可以通过抓包分析定位业务问题。拥有高并发低时延系统网络架构设计经验,有开源社区贡献经验者优先;熟悉阿里云、华为云或者AWS 等云平台各类产品使用和维护管理工作优先。 投递...
AI运维工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述1.负责公司IDC、公有云(火山云/腾讯云等)的规划、部署、监控与优化,保障业务高可用性(SLA ≥ 99.9%);2.负责管理公司GPU集群,调配训练平台资源;3.设计并实施自动化运维体系(Ansible/Terraform/Jenkins等),提升系统部署、监控告警、故障处理效率;4.维护大规模Linux服务器集群(CentOS/Ubuntu)、Kubernetes/Docker容器平台及中间件(Nginx/MySQL/Redis等)、大规模数据存储;5.建立全链路监控体系(Zabbix/Prometheus/Grafana),实时分析系统性能瓶颈,预防潜在风险;6.制定并执行容灾备份、安全加固及合规策略,响应安全事件;7.编写运维文档及技术方案,推动DevOps文化落地; 职位要求 职位要求硬性条件:1.本科及以上学历,计算机/通信相关专业,3年以上人工智能科技公司运维经验;2.具备GPU集群管理经验,了解ROS/ROS2生态;3.精通Linux系统管理、Shell/Python脚本开发,熟悉TCP/IP、HTTP等网络协议;4.熟练使用至少一种公有云(火山云/腾讯云/阿里云),有PB级存储搭建经验,具备云资源编排及成本优化经验;5.掌握容器化技术(Docker/K8s)及CI/CD工具链(GitLab/Jenkins);6.熟悉监控日志系统(ELK/Prometheus)及自动化运维工具(Ansible/SaltStack)。加分项:1.有高并发、分布式系统运维经验者优先;2.熟悉网络安全防护(WAF/防火墙/漏洞扫描);3.持有AWS/AliCloud/K8s认证证书;4.有大模型相关基础设施搭建经验;5.了解Infrastructure as Code(IaC)实践。。 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /