职位详情
技术-算法
41.6-83.3K
上海-上海
不限
不限
更新 2026-07-28 浏览 44
职位详情
  • 招 2 人
  • 不限性别
【工作职责】 岗位介绍 我们正在探索流式视频大模型方向,致力于让模型从"看完再回答"进化为"边看边理解、实时响应"。你将参与构建面向真实世界的实时视觉理解系统,覆盖视频流理解、长时记忆建模、主动式交互等前沿课题,推动模型能力从离线走向在线。 流式理解核心研究 1. 跟踪流式视频理解领域最新进展,输出技术洞察,探索适合业务场景的创新方案 2. 设计高效的流式推理架构,包括记忆压缩模块、时序建模与位置编码方案 3. 构建流式视频训练数据集与训练框架,探索离线到在线的课程学习范式 视频内容理解落地 4. 研发视频内容理解模型:高光识别、场景分类、精彩度评分、人物/物体语义理解 5. 实现智能切片能力:从直播流/点播视频中自动定位高光片段,支持实时和离线两种模式 6. 将内容理解能力接入产品链路,包括直播封面、运营挖掘工具、创作者笔记诊断报告等 评测与工程 7. 构建流式视频评测体系,与人工标注对比,持续提升模型精度 8. 优化端到端推理延迟、显存占用和吞吐量,满足实时性要求 【任职要求】 - 计算机、电子工程、自动化等相关专业硕士及以上学历; - 扎实的深度学习基础,熟悉 Transformer 架构、注意力机制、位置编码等核心技术; - 熟练掌握 PyTorch,具备独立复现/改进论文的能力; - 良好的代码工程能力,有大规模分布式训练经验优先; 专业方向(满足其中一项即可): - 有视频理解相关研究或工程经验(VideoLLM、MLLM、Video QA、时序建模等),能独立跟进前沿工作; - 有长上下文/高效推理相关经验(KV Cache 优化、序列并行、量化、蒸馏等); - 有在线视频理解或流式系统相关经验,了解实时推理系统架构设计; 加分项: - 在 CVPR、ICCV、NeurIPS、ICLR、ECCV、AAAI 等顶会发表过相关论文,有一作或重要贡献者优先; - 有直播/视频平台内容理解落地经验(高光识别、精华切片、封面生成等具体场景); - 了解视频编解码基础(I/P/B 帧、码率、分辨率),能理解多媒体系统上下文; - 熟悉 RL/RLHF 在多模态模型上的应用
公司信息
行吟信息科技(上海)有限公司
· 上市公司 · 通信/电子/半导体/硬件
上海市黄浦区马当路388号SOHO复兴广场
职介网温馨提示
求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。 立即举报
公司问答
我要提问
对此职位有疑问?快来问问吧 !
相似职位
交通项目经理
18-22K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
交通事业部-项目经理/项目总工
20.8-29.1K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
前端/后端开发工程师-技术解决
13-18K
北京-北京 本科学历
五险一金 包吃住 年终奖金 销售奖金
抖音视界有限公司
2026-08-04
TS运维-边缘云运维工程师(外
7-10K
北京-北京 本科学历
五险一金 综合补贴 奖励计划
抖音视界有限公司
2026-08-04