【27届校招】算力平台运维开发工程师 广州 正式 研发 - 算法 职位描述 作为数据基础设施组的运维开发工程师,您将会了解前沿的自动驾驶数据和算法训练平台的基础架构以及有机会获得运维大规模人工智能训练平台的经验。1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求;2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务;3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求;2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务;3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求;2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务;3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。 职位要求 1、掌握一种以上的编程语言,如Python,Go或Java;3、掌握一种以上的Linux脚本,如bash;4、深入理解kubernetes,docker,containerd的相关内容,有使用helm管理kubernetes应用的经验的优先;5、有使用promethus及grafana进行服务监控的经验;6、使用过Jenkins,Spinnaker, gitlab等开发CICD;7、有一定的使用pytorch开发机器学习平台或算法的经验,了解pytorch深度学习框架; 投递...
技术中心 - 运维工程师(基建方向) 广州 技术类 职位描述 1. 负责基础软件服务(DNS/DHCP、SSO/LDAP/AD等)及内部平台(CI/CD、虚拟化、监控日志系统)的部署、维护与优化,保障高可用。2. 制定并执行系统备份、灾难恢复方案,确保数据安全和业务连续性;3. 监控系统运行状态,及时发现并处理故障,编写故障复盘报告,推动问题根因解决;4. 编写自动化运维脚本和工具,提升运维效率,减少人工操作;5. 负责服务器、网络设备、存储等基础设施的容量规划与性能调优,配合开发团队完成新服务的上线部署及环境搭建,提供技术支持;6. 编写和维护运维文档、操作手册及标准化流程; 职位要求 1. 本科及以上学历,3年以上运维经验,精通Linux系统;2. 熟悉 Docker、Kubernetes 等容器化技术,有实际集群运维经验优先;3. 熟悉至少一种自动化运维工具,如 Ansible、Terraform、Puppet 等;4. 熟悉常见中间件的部署与运维,如 Nginx、MySQL、Redis、RabbitMQ/Kafka、Elasticsearch 等;5. 熟悉监控告警体系(Prometheus、Grafana、Zabbix 等),有完整监控方案落地经验;6. 掌握至少一门脚本语言(Python/Shell/Go),具备自动化工具开发能力;7. 熟悉 Git、Jenkins/GitLab CI 等 CI/CD 工具,了解 DevOps 理念;8. 具备良好的沟通能力和团队协作精神,工作认真负责,有较强的问题排查和解决能力;9.
Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to