【工作职责】
我们关注大规模分布式模型训练系统,服务于阿里巴巴核心业务场景,包括但不限于以下职责:
1. 性能优化:结合分布式系统、高性能计算、异构计算和编译优化,探索性能边界,分析和解决超大规模分布式计算的核心问题;
2. 框架研发:以淘天、海外等超大规模训练场景为抓手,研发和优化稀疏+稠密统一训练框架,参与开源共建;
3. 算法协同:深入工程和算法协同,结合大规模推荐、大语言、多模态算法,探索适合业务的创新训练范式。
【任职要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具;
2. 有极佳的工程实现能力,精通C/C++、Python;
3. 熟悉pytorch/tensorflow框架优先;
4. 熟悉cuda编程、RDMA高性能网络、编译优化优先。