后台开发实习生 北京 实习 数字技术 职位 ID:A238579 职位描述 职位描述:1. 负责智能辅助驾驶CICD平台的实现和交付,负责CICD平台日常维护;2. 参与测试拦截系统和测试工具及组件的设计及开发,协助测试平台的搭建及维护,提升工具平台稳定性,解决复杂业务问题;3. 负责AI相关的应用落地,探索AI在效率提升方面的应用; 职位要求 职位要求:全日制本科或硕博士在读,计算机、电气工程、自动化、汽车工程等相关专业;具备良好的编程习惯,掌握Go/python/shell等至少一种编程或脚本语言;熟悉Linux,Docker等基本操作,对主流中间件有基本了解;掌握CI/CD或devops等持续集成发布工具;逻辑思维良好,有较强的分析问题和解决问题的能力;实习时间:每周现场时间=4天;Base 北京;实习期=6个月;欢迎硕博士长期实习;欢迎27届毕业生长期实习;加分项:熟练掌握C++/C等编程;有智能辅助驾驶、互联网等方向实习经验者或热爱智能辅助驾驶者优先; 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /
设计、部署和管理企业级阿里云基础架构环境。 主导或参与阿里云 Landing Zone 的规划、建设及治理工作。 确保云基础架构服务的可用性、安全性、合规性和运营稳定性。 负责 Windows Server 和 Linux 操作系统的管理与技术支持。 配置和管理网络、安全、存储、数据库及负载均衡等基础架构组件。 分析并解决复杂的基础设施、网络及应用相关问题。 通过基础设施即代码(Infrastructure as Code,IaC)推动自动化和标准化建设。 与安全、应用开发及业务团队紧密合作,提供符合企业架构标准的云解决方案。 支持灾备、备份、监控及运营持续改进相关工作。 为技术团队提供技术指导、培训和专业支持。 教育背景及认证要求 计算机科学、信息技术、软件工程或相关专业本科及以上学历。 持有阿里云专业认证(ACP)或专家认证(ACE)优先。 具备云计算、网络、安全等相关认证者优先。 工作经验要求 必备条件 3年以上阿里云平台实施和运维经验。 具备阿里云 Landing Zone 规划及落地实施经验。 熟练掌握 Windows 和 Linux 系统管理。 熟悉数据库、云网络及安全架构设计。 具备云网络和安全组件配置经验,包括但不限于
产品经理 – 机器人端侧软件 北京 社招 全职 职位描述 1、运维工具产品设计与迭代的 - 调研现场运维团队、客户技术支持团队的工具需求,梳理机器人运维全流程的痛点与改进机会。 - 设计并定义运维工具功能,包括远程诊断、日志采集与分析、OTA升级、配置管理、健康监控、告警管理等。 - 输出运维工具的详细PRD,定义功能流程、交互界面、异常处理逻辑。2、基础端侧软件功能设计 - 负责机器人端侧基础软件功能的产品定义,包括系统启动流程、进程管理、资源监控、日志系统、通信管理等。 - 定义端侧软件的配置管理方案,支持不同机型、不同场景的灵活配置。 - 设计端侧软件的升级与回滚策略,确保OTA升级的安全性与可靠性。3、研发跟进与功能验证 - 跟进软件团队的开发进度,参与技术方案评审,确保实现符合产品设计。 - 设计功能测试用例与验收标准,组织功能验收与回归测试。 - 收集内部使用反馈与现场运维数据,驱动工具与功能的持续优化。4、用户体验与效率提升 - 关注运维工具的用户体验,确保运维人员能快速上手、高效操作。 - 分析运维效率数据(如平均故障定位时间、升级成功率等),设定优化目标并推动落地。 - 设计运维自动化方案,减少人工干预,提升运维规模化能力。5、文档与培训支持 - 编写运维工具的用户手册与操作指南,支持运维团队快速掌握工具使用。 - 沉淀常见故障处理流程,形成标准化的运维知识库。
SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...
NVIDIA is looking for Senior Solutions Architect in Beijing. This position is mainly responsible for providing comprehensive technical pre-sales support to CRISP customers. We are dedicated to the most cutting-edge computing hardware and software, leading the