【工作职责】
1.主导Omni全模态模型架构设计与演进,结合行业前沿技术(如Transformer变体、MoE架构等),设计端到端原生统一的模型架构,打破传统多模态拼接式设计的局限,降低跨模态交互延迟,提升模型整体性能与扩展性,支撑文本、语音等多模态的统一处理需求;
2.聚焦语音与LLM的对齐核心模块,负责语音信号与LLM语义空间的对齐技术研发,包括但不限于语音编码器与LLM嵌入层的适配、跨模态特征投影、语音-文本双向对齐优化等,解决模态间语义损耗、对齐精度不足等关键问题,实现语音信息与文本语义的精准映射;
3.跟踪Omni全模态模型、语音处理、LLM领域的前沿技术与研究成果(如NeurIPS、ICLR、ICASSP等顶会论文),结合业务需求开展技术预研与创新,将前沿技术落地到模型架构设计与对齐模块优化中,形成可复用的技术方案与工程化能力;
4.与工程、产品等跨团队协作,明确技术需求,推动模型架构方案的工程化落地,配合完成模型部署、性能调优及问题排查,支撑业务场景的规模化应用;沉淀模型架构设计文档、对齐技术规范及算法优化手册,保障技术可传承、可复用。
【任职要求】
1.熟悉Omni全模态模型的核心原理与架构设计,深刻理解端到端原生统一架构的设计逻辑,熟悉主流Omni模型(如Qwen3.5-Omni等)的架构特点与优化思路,具备独立完成模型架构设计与迭代的能力;
2.扎实掌握语音信号处理技术,熟悉语音编码、声学特征提取、语音识别(ASR)、语音合成(TTS)等核心技术,了解主流语音模型(如Whisper等)的原理与应用,能独立设计语音相关算法模块;
3.掌握跨模态对齐核心技术,有语音与LLM对齐相关研发经验,熟悉连续编码、离散编码、混合编码等对齐方式,能解决模态间语义空间不一致、对齐误差等问题者优先;
4.熟练掌握至少一种深度学习框架(PyTorch/TensorFlow),具备扎实的编程能力(Python/C++),能独立完成算法代码开发、调试与优化;熟悉分布式训练、模型量化、推理加速等技术者优先,了解vLLM、Triton等推理框架更佳;
5.有相关领域开源项目及论文核心作者经历加分。