🔥 主题:

高级 AI 数据中心网络工程师

💸 薪水:面议
🏢 地点:纽约州境内 纽约州, NY
🍻 分类:软件程序
🕕 时间:置顶🚀
💬 联系:[email protected]

应聘者请加招聘HR Cathy的微信号cathy2025sh进行沟通,简历发送至[email protected]
工作地点:base乔治亚,根据项目情况出差

岗位职责
日常运维与保障:负责 AI 数据中心、高性能计算(HPC)环境及大型算力基础设施网络的日常运行、监控、维护和故障处理,保障 GPU 集群及数据中心网络稳定、高效运行。
高性能网络架构:负责 AI 数据中心网络架构设计与部署,完成 InfiniBand(IB)、RoCE v2 高性能网络架构设计、拓扑规划、组网方案深化及实施交付。
标准与规范制定:根据客户业务需求和 AI 计算场景,输出网络架构方案、部署标准、交付规范及运维流程,确保网络具备高可用性、高扩展性、高性能及安全稳定性。
网络设备生命周期管理:负责交换机、路由器、AI 网络设备的安装、配置、升级、扩容及生命周期维护,覆盖 Cisco、Arista、Juniper、NVIDIA Networking(Mellanox)等主流设备。
AI 训练集群环境部署:负责 AI 训练集群网络环境的部署和运维,全面支持 InfiniBand 网络、RoCE v2 网络、RDMA 高性能通信网络及高速 Ethernet Fabric 网络。
排障与问题定位:负责网络故障分析和性能优化,包括网络中断、丢包、高延迟、链路异常、交换机故障、Fabric 异常等问题的精细化定位与解决。
集群性能测试与调优:负责 AI 集群网络性能测试与优化,涵盖 IB/RoCE 网络连通性验证、网络带宽与时延压测、NCCL 通信性能测试以及 GPU 集群通信性能优化。
AI 网络核心拥塞控制与调优:负责 AI 网络性能优化,包括带宽利用率优化、ECMP 优化、QoS 调优、VXLAN 网络优化及网络拥塞分析;深度负责 PFC(优先级流控)、ECN(显式拥塞通知)、Lossless Ethernet(无损以太网)设计与优化、网络拥塞控制与流量调优,实现低延迟、高吞吐网络性能。
自动化运维建设:使用自动化工具提升网络运维效率,熟练运用 Python、Bash、Ansible 实现自动化配置、巡检、配置备份及故障分析。
技术文档与应急响应:编写和维护网络拓扑图、IP 地址规划、配置文档、变更记录、故障报告及运维规范等技术文档;参与重大故障应急响应,快速定位问题并保障 AI 业务连续运行。

任职要求
一、 AI 高性能网络能力(核心要求 / 第一梯队)
AI 集群经验:具备 AI 集群网络实际部署和运维经验,熟练掌握 InfiniBand(IB)、RoCE v2、RDMA、NVIDIA NCCL(GPU 集群通信框架)。
架构与工程落地:能够独立完成 AI 网络环境的架构设计、网络部署、配置调试、连通性验证、性能压测(带宽与时延)及集群性能调优。
拥塞控制与无损网络:精通 AI 网络性能优化技术,深入理解 PFC(Priority Flow Control)、ECN(Explicit Congestion Notification)、Lossless Ethernet(无损以太网)、网络拥塞控制机制及低延迟、高吞吐网络优化方法。
NVIDIA 生态能力:熟悉 NVIDIA AI 网络解决方案,包括 NVIDIA Spectrum Ethernet 交换机、NVIDIA/Mellanox ConnectX 网卡、NVIDIA InfiniBand 产品及相关技术。
二、 网络基础能力
学历与经验:本科及以上学历,计算机科学、网络工程、通信工程、电子信息工程等相关专业优先(或具备同等工作经验);具有 4 年以上网络工程、数据中心网络或大型基础设施网络运维经验。
数据中心架构:熟悉数据中心网络架构,如 Spine-Leaf 架构、Clos Fabric、VXLAN EVPN 等。
网络协议精通:深入理解 TCP/IP、VLAN、STP、LACP、OSPF、BGP、VRRP、ECMP、IPv4/IPv6 等核心网络协议。
多厂商设备驾驭:熟悉主流数据中心网络设备(Cisco、Arista、Juniper、NVIDIA Networking / Mellanox、Fortinet)。
高速互联技术:熟悉 100G / 200G / 400G / 800G 高速 Ethernet 环境、光模块及 DAC/AOC 高速互联链路。
三、 系统与自动化能力
系统基础:熟悉 Linux 系统网络配置和基础系统管理。
自动化工具:具备编写 Python、Bash 脚本及使用 Ansible、REST API 的自动化运维能力,能够完成网络自动化部署、巡检和管理。
可观测性:熟悉 Prometheus、Grafana、Zabbix、SNMP、Streaming Telemetry 等网络监控与可观测性工具。
四、 其他综合要求
问题解决与文档:具备良好的故障分析能力、逻辑排查能力和规范的技术文档撰写能力。
语言与沟通:具备良好的英文沟通能力,能够无障碍阅读英文技术文档并进行基本日常/技术交流。
出差要求:接受美国境内长期出差,支持全美范围内 AI 数据中心项目的部署、交付与运维。
优先条件(Preferred Qualifications)
具备 NVIDIA DGX、SuperPOD、AI Factory 或 HPC 集群网络经验;
参与过大型 GPU 集群部署与交付项目;
具备主流云计算数据中心网络(AWS / Azure / GCP)经验;
具备 Kubernetes 网络插件及容器网络经验。

联系时请说是在美国工作网上看到的😎
分享