【工作职责】
1.负责大型多模态模型的分布式学习训练框架与平台搭建,优化与开发;
2.面向多模态大模型训练场景,对算子进行端到端性能分析与调优,持续挖掘吞吐、延迟、显存利用率等指标的优化空间;
3.参与或主导 3D 并行(Data / Tensor / Pipeline Parallel 等)训练体系下的算子与通信方案设计与优化;
4.与分布式训练、系统、模型算法团队密切协作,共同提升大规模训练任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
【任职要求】
岗位要求
1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.熟悉 GPU 架构 & CUDA 编程、算子融合优化,并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
3.熟悉 DeepSpeed、Megatron-Core 等分布式训练框架,具备大型模型如MoE等(千卡级别以上)多种并行训练策略实战经验;
3.熟悉 vLLM、SGLang等大模型推理框架,有实际性能调优经验(如 KV Cache 优化、动态批处理、Attention 算子定制等);
4.熟悉大模型强化学习的工程技术,比如 OpenRLHF等框架。
加分项
1.有大规模分布式训练实践经验(千卡GPU 或更大规模);
2.对深度学习模型结构,尤其是MoE,视频生成模型等模型原理有一定了解(如 Transformer、DiT、 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛并取得优异成绩的经历;
4.有高性能计算(HPC)、编译器优化、系统级性能调优相关经验或论文/开源项目贡献。