【工作职责】
1、探索新一代大语言模型基座架构,完成扩散模型(diffusion model)在大语言模型的重塑,突破逐个token预测的方式,实现高效的推理模式,探索全新scaling law;
2、实现大模型训练的数据清洗、合成和评估;设计和实现大模型训练的AI Infra框架。
【任职要求】
任职资格:
1、本科及以上学历,计算机、人工智能和数学等相关专业,博士研究生优先;
2、熟练掌握扩散模型设计和使用技巧,在知名大模型公司/团队从事图像或视频生成者优先,有多模态/OMNI大模型理解&生成统一框架经验者优先;
3、有丰富的大模型预训练和后训练数据处理经验,熟练掌握数据收集、数据清洗、数据去重和数据合成等流程,能针对数据质量制定出评估指标和方法,在知名大模型公司/团队长期从事数据技术者优先;
4、MoE/Dense模型训练实战经验,包括模型预训练、RL Reasoning、SFT和RLHF等,熟练掌握各种模型训练和推理技巧,在大模型前沿技术领域有深度探索,发表过顶会论文、技术报告者优先;
5、熟悉大模型训练和推理框架,熟练掌握模型并行、数据并行和流水线设计等技巧,在知名大模型公司/团队长期从事AI Infra者优先;
6、熟悉各类评测基准和构造技巧,熟练掌握大模型客观评测和主观评测方法,在知名大模型公司/团队长期从事大模型评测者优先;
7、有良好代码能力,熟练掌握Python、C++和JAVA等编程技能,知名开源项目核心贡献者优先,ACM/ICPC竞赛获奖者优先,国内外知名数据挖掘比赛(例如KDD Cup等)中取得领先名次者优先。