职位详情
技术-算法
41.6-166.6K
北京-北京
不限
不限
更新 2026-07-28 浏览 96
职位详情
  • 招 1 人
  • 不限性别
【工作职责】 1、Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从"模型本身"抬升到"产生模型的研发流程",构建可递归的能力增益回路,持续寻找下一代能力增长曲线。 2、Lifelong Learning:探索模型"学会学习"的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。 3、Scalable Oversigh:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。 【任职要求】 基础要求 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解; 解决问题:逻辑严密的分析能力,能从复杂现象中抽象出底层问题并给出系统性方案; 专业能力:深刻理解并能解决 RL 训练中的核心问题,包括 Reward Hacking、Training Stability、Exploration Efficiency,以及长程信用分配、环境噪声 / 非-policy 负向 reward、训推一致性等真实工程化挑战; 动手能力:优秀的算法实现能力与工程性能感知,具备优秀的数据敏锐度,能从数据中提炼出让模型效果突破的 insight。 加分项 研究成果:在 NeurIPS、ICLR、ICML、CVPR、ACL 等顶级会议发表过高水平成果,或主导过知名开源项目者优先; 工程与系统:熟悉大规模 RL 训练基础设施(rollout / 采样加速、sandbox 与 trajectory replay、训推框架),或有 agent harness / 可验证环境搭建经验者优先; 敏锐的直觉和探索精神:具备极强的好奇心,能在高度不确定的无人区中通过严谨实验寻找确定性;不满足于优化已有 Benchmark,而对"模型是否真的在理解、在进化"保持极度敏感。
公司信息
行吟信息科技(上海)有限公司
· 上市公司 · 通信/电子/半导体/硬件
上海市黄浦区马当路388号SOHO复兴广场
职介网温馨提示
求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。 立即举报
公司问答
我要提问
对此职位有疑问?快来问问吧 !
相似职位
护理学院专职教师
6-10K
重庆-重庆 硕士学历 不限经验
重庆人文科技学院
2026-08-04
韩语-知识产权代理师
16.6-25K
广东-深圳 本科学历 5年以上经验
五险一金 年终奖金 销售奖金
紫藤知识产权运营(深圳)有限公司
2026-07-29
知识产权顾问(销售岗)
12.5-20.8K
广东-深圳 本科学历
紫藤知识产权运营(深圳)有限公司
2026-07-29
财富团队长
25-50K
江苏-南京 本科学历
紫金信托有限责任公司
2026-07-29