**********************
智算集群运维专家
  • 收藏职位
  • 分享职位
40-70万 西安 本科 8-10年 招聘 1 人 预计佣金 81.2K 15:39发布
72小时新发
JD基本信息
岗位职责
1. 智算集群独立运维与稳定性保障(核心职责) 1)负责大规模异构算力集群(包括GPU/NPU服务器、InfiniBand/RoCE高速网络、并行存储系统)的7×24小时日常运维、巡检与容量管理,对集群整体可用性(SLA)负责。 2)独立处理集群层面的复杂故障,快速响应并解决GPU掉卡、节点宕机、集群瘫痪、网络拥塞导致训练中断等重大问题,具备独立进行硬件级故障诊断与固件升级的能力。 2. 风险预防与深度优化 1)主导制定并完善集群的应急预案、风险排查机制和标准操作流程(SOP),通过巡检数据分析和主动运维,提前发现并消除潜在的系统性风险。 2)持续优化智算监控体系(如Prometheus+Grafana),对GPU利用率、温度、功耗、网络流量等全链路指标进行深度分析,编制专业分析报告并提出落地优化方案。 3. 自动化运维体系建设 1)利用Shell、Python或Go等语言开发自动化运维工具与脚本,实现集群批量部署、配置管理、故障自愈、日志分析等日常运维工作的平台化与自动化,提升运维效率。 2)参与算力调度系统(Slurm、Kubernetes)的运维与调优,优化资源调度策略,提升算力利用率和任务吞吐量。 4. 技术攻坚与协同 1)在重大故障处理中,作为甲方或业务侧的技术主导,与硬件厂商、IDC机房及研发团队高效协同,精准划定故障边界,推动问题根因修复,而非临时规避。 2)负责GPU服务器驱动、CUDA环境、NCCL通信库以及容器化环境(Docker/K8s)的配置、调优与版本管理。
任职要求
1. 基本条件 1)全日制本科及以上学历,计算机、网络工程、电子信息、自动化等相关专业。 2)8年以上大型数据中心或云计算平台运维经验,其中至少最近2年以上大规模GPU智算集群或HPC集群的一线运维经验。 2. 核心技术能力 1)硬件与系统: 精通Linux系统管理与内核调优,熟悉主流GPU服务器(如NVIDIA DGX、浪潮、华为等)硬件架构,能独立诊断处理服务器主板、内存、GPU卡(含显存错误、NVLINK降级)、PCIe链路等硬件故障。 2)网络与存储: 深入理解InfiniBand或RoCEv2高速网络协议,具备处理网络拥塞、丢包等问题的实战经验。熟悉分布式存储(如Ceph、Lustre)的运维与调优。 3)调度与容器: 精通Kubernetes或Slurm算力调度平台的部署、运维与策略配置。熟悉容器化技术,能解决GPU透传、RDMA网络插件等容器化部署难题。 4)自动化与脚本: 熟练掌握Shell、Python或Go,具备独立开发自动化运维脚本及工具的能力。 3. 综合素质 1)独立作战与问题解决能力: 具备极强的责任心与抗压能力,能在高压环境下快速响应并独立解决复杂技术问题。 2)风险意识与文档能力: 具备敏锐的风险预判意识,擅长编写故障处理报告、应急预案及运维SOP规范文档。 3)沟通与协作: 具备与厂商进行技术博弈的能力,能基于底层日志输出清晰的故障证据链,推动外部资源高效解决问题。
所属行业:
通信/网络设备
职能分类:
其他生产/制造/研发职位
工作城市:
西安,招聘1人,详细地址:西安市长安区西沣南路五星段1088号中兴通讯西安研发中心
职位要求
学历要求:
本科·统招·985/211
工作年限:
8-10年
技能/证书:
-
薪资福利
年薪范围:
40-70万*12薪
薪资福利:
具体面议
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
部长/经理/总工
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
两至三轮,人力-业务负责人-总经理。具体看人员情况是否进行技术分享
视频面试:
可以接受
为你推荐