【工作职责】
岗位定位:
本岗位侧重于构建大模型的 视觉与感知 能力。小红书拥有业界最独特的图文与短视频 UGC 数据生态,你将负责 VLM 的 Post-training,让模型深度理解,支撑小红书所有业务场景,包括且不限于搜索、广告、推荐、电商、客服及智能发布等核心场景。
你的工作内容:
多模态对齐与指令遵循: 负责 VLM 的 SFT 与 RL 流程,优化图文/视频与文本的语义对齐,提升模型在复杂多模态指令下的表现。
VLM Reasoning: 探索视觉场景下的逻辑推理能力(如视觉、复杂视频序列理解),让 VLM 具备 边看边思考 的能力。
多模态 Agent: 研发具备视觉反馈的智能体技术,利用 VLM 驱动复杂工具调用。
视频理解与长文本视觉: 针对小红书海量视频场景,优化长视频理解能力及多帧推理效率,挖掘视频数据的深层语义。
【任职要求】
我们希望你具备:
背景: 计算机、视觉、机器人等相关专业硕士/博士;熟悉主流 VLM 架构(如 LLaVA, Qwen-VL, InternVL 等)。
专业深耕: 在 计算机视觉(CV)、多模态学习 或 视频理解 领域有深入研究。
工程能力: 精通 PyTorch,熟悉多模态模型的数据预处理流水线及大规模多机多卡训练。
加分项:在 CVPR, ICCV, ECCV, NeurIPS 等顶会发表过视觉或多模态相关高质量论文。