边缘基础设施运维工程师
腾讯
岗位职责
1.物理基础设施纳管;
2.负责边缘机房 GPU 服务器(NVIDIA A100/H100/L40S 等)、CPU 服务器、存储节点等物理设备的全生命周期管理,包括上架验收、固件/驱动升级、故障诊断与硬件替换;
3.建立和维护硬件资产台账与自动化纳管流程,保障设备信息准确、可追溯。制定并执行硬件巡检计划,定期输出设备健康度报告,对硬件 EOL/EOS 风险进行预警和替换规划;
4.边缘网络与机房运维;
5.负责边缘机房网络设备(交换机、路由器、防火墙等)的标准化配置、日常监控和故障处理,确保边缘节点到中心管控面的网络连通性与低延迟;
6.维护机房网络拓扑文档,参与带宽规划、链路冗余设计和网络割接;
7.与 IDC/运营商对接,处理机房环境(电力、制冷、机架空间)相关事宜,保障基础设施 SLA;
8.容器化平台与云原生运维;
9.管理和维护基于 Kubernetes 的边缘容器平台,负责集群部署、版本升级、节点扩缩容和资源调度策略优化;
10.实现 GPU 资源的容器化纳管:包括 GPU 驱动兼容性管理、GPU Operator 部署、MIG(多实例 GPU)配置、GPU 共享与隔离策略;
11.建设面向外部客户的算力交付流水线:容器镜像管理、Helm Chart 标准化、命名空间/租户隔离、配额管理、监控告警接入;
12.维护平台核心组件(包括但不限于 GPU Operator、Prometheus/Grafana 监控栈、Loki/ELK 日志系统、分布式存储 CSI 插件、Ingress Controller、Service Mesh 等);
13.服务保障与持续优化;
14.建立并维护 SLO/SLI/SLA 指标体系,保障服务的可用性、性能和容量;
15.编写运维自动化脚本和工具,推动运维操作代码化(Infrastructure as Code),减少人工操作;
16.参与 on-call 轮值,及时响应和处理生产环境故障,输出故障复盘报告;
17.持续关注云原生和边缘计算社区技术动态,推动基础设施架构演进。
任职要求
1.硬性条件;
学历:计算机、通信、电子信息等相关专业本科及以上学历;
经验:3 年以上运维/DevOps/SRE 相关工作经验,其中至少 1 年 Kubernetes 生产环境运维经验;
硬件能力:熟悉 x86 服务器硬件架构,具备 GPU 服务器运维经验,能独立完成硬件故障诊断和更换;
网络能力:理解 TCP/IP 协议栈、VLAN/VXLAN、BGP/OSPF 等路由协议,有交换机 CLI 配置经验;持有 CCNA/HCIA 或以上认证者优先;
2.云原生能力:;
熟练使用 Docker/containerd 等容器运行时;
熟练掌握 Kubernetes 核心原理与运维,有大规模集群管理经验(50+ 节点);
了解 GPU Operator、NVIDIA Device Plugin、GPU 调度方案;
3.编码能力:
熟练使用至少一种脚本语言(Python/Go/Shell),具备自动化工具开发能力;
监控与可观测性:熟悉 Prometheus、Grafana监控体系搭建和使用;
Linux:深入理解 Linux 操作系统,熟练掌握常用命令、性能分析工具(top/sar/perf/strace 等)和系统调优;
4.加分项;
有边缘计算场景(Edge Computing)或分布式云平台的运维经验;
有 Terraform/Ansible/SaltStack 等 IaC 工具实践经验;
了解 GPU 算力切分方案(MIG/vGPU/时分复用等),有 GPU 资源池化运营经验;
有面向外部客户(toB)的平台运维或技术支持经验;
熟悉国内主流 GPU 硬件(昇腾、寒武纪、海光等)生态者优先。