【工作职责】
1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline;
2、研发支持多机多卡 RL的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决RL算法在超长时序下的显存通信瓶领;
3、构建端到端后训练工具链,主导框架与 MLOps 平台集成,提供训练可视化、自动超参搜索等生产级能力
4、与公司各算法部门深度合作,参与大语言模型 LLM.多模态大模型 MLLM等业务在 SFT/RL领域的算法探素和引警法代;
5、参与分析各业务 GPU利用率与饱和度等指标,结合业务场最持续优化训练框架能力,提升框架领先性。
【任职要求】
1、精通PyTorch 框架、veRL/OpenRLHF/Llama-Factory等后训练引擎,具有修改框架源码的实战经验
2、深入理解Megatron/DeepSpeed等框架的并行策略,能自主设计混合并行方案解决显存墙问题
3、掌握强化学习训练全流程优化,有基于PPO/DPO等算法的大模型训练调优经验4、具备模型训练调优分析经验,能够借助Nsight、nvpro等工具分析发现模型训练性能瓶颈,并进行针对性优化;5、有良好的沟通表达及团队协作能力,有强烈的责任心和使命感
【加分项】
1、熟悉TRL、DeepSpeed-RL等强化学习框架的底层实现机制
2、掌握LLM训练全链路技术栈,包括分布式数据预处理、序列并行、梯度累积策略
3、有干卡规模大模型训练实战经验,成功解决过跨机房通信、容错训练等生产问题
4、发表过SOSP/MLSys等系统顶会论文,或主导过开源训练框架核心模块开发
5、熟悉NCCL/RDMAVIB/RoCE相关知识,有高性能CUDAKernel相关研发经验;