【工作职责】
1、负责400G/800G网卡的整体软硬件架构设计,定义RDMA引擎、PCIe接口等关键模块;
2、深度优化现有网卡与GPU之间的交互流程,实现跨机GPU间的高效网络通信;
3、主导NCCL集合通信库在自研网卡上的硬件卸载与加速,提升AI集群通信效率;
4、针对互联网典型场景(推荐/存储/微服务)设计RDMA传输策略与拥塞控制方案;
5、负责设计及实施GPU、网卡与存储之间的高效协同方案,提升智算推理解决方案的竞争力;
6、具备跨层协同分析能力,能够从应用层(CCL/PyTorch)到网卡硬件(PCIe/RDMA引擎)再到交换机(PFC/ECN)全链路定位性能瓶颈。
【任职要求】
1、硕士研究生8年以上工作经验,本科10年以上工作经验
2、精通200G/400G以太网RoCEv2/IB协议栈;
3、有实际GPUDirect RDMA开发与调优经验,熟悉NVIDIA Magnum IO或AMD ROCm;
4、深入理解NCCL源码或内部实现原理,有NCCL plugin或集合通信硬件卸载经验;
5、熟悉PCIe协议(TLP/Ordering/SR-IOV)及网卡内部DMA/缓存流水线;
6、理解PFC、ECN、DCQCN等流控机制,有大规模数据中心RDMA部署经验;
加分项:
1、有AI大模型公司或DPU厂商工作经验;
2、参与过万卡级以上集群网络设计;
3、熟悉UEC标准或NVLink/NVSwitch架构