职位详情
算法-其他算法
41.6-83.3K
上海-上海
不限
不限
更新 2026-07-28 浏览 88
职位详情
  • 招 2 人
  • 不限性别
【工作职责】 本岗位致力于构建大模型的 感官 核心,定义小红书下一代多模态智能基座。小红书拥有业界最独特的图文与短视频 UGC 数据生态,是多模态模型落地最肥沃的土壤。你将负责 VLM 的 Post-training(SFT/RL) 与 架构演进,让模型不仅能 看见 ,更能 洞察 与 推理 ,深度赋能搜索、广告、推荐、电商、智能创作等全链路业务场景。 你的工作内容: 1. 多模态推理与强化学习 (VLM Reasoning & RL): 探索视觉场景下的 Long-thought 推理范式,利用强化学习等技术提升模型在复杂视觉空间、数学、逻辑及长视频序列下的深度推理能力,实现 边看边思考 。 2. 极致指令遵循与对齐: 负责 VLM 的 SFT 与 RL 流程,针对小红书复杂图文/视频语义,优化多模态对齐质量,解决模型幻觉问题,提升指令遵循的鲁棒性。 3. 超长视频与复杂序列理解: 针对海量视频场景,研发高效的长视频编码与时空注意力机制,优化多帧推理效率,挖掘短视频及直播流中的深层交互语义。 4. 多模态Agent: 研发具备视觉反馈与自我修正能力的智能体技术,利用 VLM 驱动复杂工具链调用,探索 VLM 在自动化创作与交互式电商中的应用。 【任职要求】 1. 深厚的学术背景: 计算机、人工智能、视觉、机器人等相关专业硕士/博士;对主流 VLM 架构(如 LLaVA, Qwen-VL, InternVL)有底层深入理解。 2. 卓越的实战经验: 在 MLLM 推理优化、视觉对齐、视频语义理解 或 大规模预训练 领域有深入研究或成功落地经验。 3. 硬核的工程能力: 精通 PyTorch,熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,能够处理百亿/千亿级参数模型在大规模集群上的高效训练。 4. 数据洞察力: 对高质量多模态数据的构建、清洗及 Automated Data Mixing 策略有独特见解,能从海量无序数据中提炼知识。 5. 卓越的评测与诊断能力: 熟悉主流多模态评测集,能够针对业务痛点构建垂直领域的 Benchmark;具备深度的模型表现诊断能力,能通过评测结果反向驱动数据混合(Data Mixing)与算法优化。 加分项: 在 CVPR, ICCV, NeurIPS, ICML, ICLR 等顶会发表过高影响力论文,或在知名开源多模态项目中有核心贡献。
公司信息
行吟信息科技(上海)有限公司
· 上市公司 · 通信/电子/半导体/硬件
上海市黄浦区马当路388号SOHO复兴广场
职介网温馨提示
求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。 立即举报
公司问答
我要提问
对此职位有疑问?快来问问吧 !
相似职位
交通项目经理
18-22K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
交通事业部-项目经理/项目总工
20.8-29.1K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
前端/后端开发工程师-技术解决
13-18K
北京-北京 本科学历
五险一金 包吃住 年终奖金 销售奖金
抖音视界有限公司
2026-08-04
TS运维-边缘云运维工程师(外
7-10K
北京-北京 本科学历
五险一金 综合补贴 奖励计划
抖音视界有限公司
2026-08-04