【工作职责】
智能运维:
1、负责运维团队智能运维相关业务场景分析与产品技术规划,运维平台数据与智能模块架构设计与演进,智能运维领域相关前沿技术研究,技术竞争力提升。
2、对大规模云平台进行异常检测、根因定位和故障预测,用AI方法建设智能化运维平台(AIOPS)。
3、对业务、平台和硬件的统计画像与建模,追求极致的软硬件匹配和定制化,提升整个平台的资源效率。
训推优化:
1、精通训练、推理框架,能够详细了解训练或推理框架上的性能瓶颈并给出解决方案。
2、精通智算训练/推理存算一体架构和分级存储系统,能够设计出低延迟的高性能分布式存储系统,支持冷热数据自动迁移等存储功能。
3、有万卡、十万卡集群的设计开发经验,深入了解大规模集群场景下分布式存储系统的性能瓶颈并给出优化方案。
4、关注行业动态,能够及时进行分析并指导项目落地。
【任职要求】
1.计算机、数学、数据科学或者相关专业,硕士及以上学历,8年以上工作经验;
2.熟悉时间序列分析,运筹优化,大模型,自然语言处理等相关算法,精通大模型技术及衍生的RAG工程、Agent工程技术、模型训练和精调、算法优化,并具有成功的工程化案例;
3.具备异常检测、根因定界定位、资源优化等智能运维业务场景实践经验;有智算云或通算云的业务背景,有大语言模型(LLM)在AIOPS领域的落地经验者优先;
4.精通Pytorch、Megatron、Deepspeed等至少一种深度学习框架,精通Hadoop、Flink等大数据处理框架;
5.要求具有良好的沟通与协作和表达能力,对新技术敏感,有强烈的求知和探索精神;
6.精通vLLM/SGLang等推理框架;
7.精通NVMe-oF、S3、POSIX、HDFS等协议与分布式存储调优;
8.精通内存计算技术。