【工作职责】
我们要寻找一位对数据安全和人工智能充满热情的大模型应用算法工程师加入我们的团队。在这里,你将加入一个充满热情的技术团队,参与构建智能化的数据安全防护体系,利用前沿的机器
数据挖掘技术,探索大模型在数据安全领域的深度应用。
具体职责包括但不限于:
● 大模型微调与实战 参与开源大模型的后训练(SFT、RL)与效果调优;针对具体的数据安全场景(如敏感词识别、API 风险检测),优化模型推理效果与性能。
● 数据处理与工程化 参与高质量训练数据集的构建,编写自动化脚本进行数据清洗、增强与合成(Synthetic Data);协助解决模型部署中的工程问题,提升服务稳定性。
● 算法落地与迭代 利用 NLP 技术(如 NER 实体识别、文本分类)解决实际业务中的隐私保护问题;持续跟踪测试最新的 RAG、Agent 技术,并在业务中尝试落地。
● 前沿技术复现 跟踪学界/业界在 LLM 与安全结合领域的最新论文与技术报告,快速复现并验证其在内部场景的有效性。
【任职要求】
● 学历背景:硕士研究生及以上学历,计算机、人工智能或相关专业,1-3 年算法相关工作经验。
● 编程基础:扎实的Python编程能力,代码风格良好;熟练使用PyTorch等框架,有从数据处理到模型训练的完整 Pipeline 实践经验。
● 数据处理能力:具备海量数据处理经验,熟悉 Pandas、Spark 或 SQL,能够独立完成数据清洗、标注策略制定及质量评估。
● NLP/大模型基础:熟悉Transformer原理,了解主流开源大模型技术,熟悉大模型预训练、后训练及推理优化流程;有LangChain或类似框架的实际开发经验。
● 学习与驱动力:对技术有强烈的好奇心,善于分析业务痛点,能够将抽象的算法理论转化为解决实际安全问题的工程方案。
【加分项】
● 安全领域经验:了解数据安全法、GDPR 等法规,或有敏感数据识别(PII)、内容风控等相关项目经验者优先。
● 竞赛与科研:在 ACL, EMNLP, CVPR, NeurIPS 等顶会发表过论文,或在 Kaggle、ACM 等高水平竞赛中获得优异成绩者优先。
● 全栈/工程化能力:熟悉模型部署(TensorRT, vLLM)、分布式训练(Deepspeed, Megatron)或拥有后端服务开发经验者优先。