【工作职责】
岗位职责
负责针影视任务的多模态大模型的相关技术研究和开发,包括跨模态对齐、音视频理解等任务,推动VLM与生成模型的深度协同与统一建模;
探索前沿技术(如原生多模态、理解生成统一,世界模型、多模态推理)在影视场景的研究和应用,攻克影视垂类场景的核心技术难题;
持续跟进业界最新的多模态大模型算法,参与多模态大模型的设计、训练、调优及评测工作,并推进多模态大模型在业务场景的应用落地。
【任职要求】
岗位要求
计算机科学、机器学习、人工智能等相关专业,硕士及以上学历;
在视觉语言模型(VLM)或多模态理解领域有扎实基础,熟悉主流VLM架构与后训练流程(SFT,RL),具备端到端模型训练经验;
熟悉生成模型相关技术,在图像、音视频等可控生成方向有具体实践经验者优先;
熟悉PyTorch及分布式训练框架(DeepSpeed、Megatron-LM等),具备多机多卡大模型训练实战经验;
具有扎实的计算机视觉或机器学习算法基础,有相关方向顶级论文者优先;
技术敏感度高,具备良好的团队协作与沟通能力。