【工作职责】
1、构建智能体评测体系与落地
1)构建覆盖 感知-分析-决策-执行 全链路的智能体评测体系,设计并实现包括准确性、安全性、幻觉率、指令遵循能力在内的多维评估框架;
2)推动建立公司级智能体准入机制,确保各类Agent在上线前通过标准化测试验证;
3)负责交付面向无线通信领域的AI评测智能体,并确保产品竞争力业内领先;
2、实施智能体闭环测试与多智能体协同验证
1)搭建仿真测试环境(含数字孪生网络),开展端到端闭环任务测试,评估智能体在真实或模拟场景下的任务完成率、响应时延与异常恢复能力;
2)验证多智能体间的通信效率、角色分工清晰度与协同流程稳定性,识别并防范幻觉传播、流程断点等问题;
3)支持 人机协同 模式下的自然语言交互测试,确保智能体能准确理解运维意图并合理调用工具。
3、建设AI驱动的自主测试能力
1)推动AI自动生成测试用例、自动执行回归测试、智能缺陷识别与根因定位,实现测试流程的 自测试、自优化 ;
2)构建模型漂移检测机制,定期对智能体输出质量进行监控与预警,保障其长期运行可靠性;
3)训练优化测试大模型,推进知识回收机制,将测试过程中发现的新场景、新问题沉淀至RAG知识库,支撑智能体持续学习与进化。
4、推动质量管理体系落地与改进,促进质量文化建设与经验共享
1)协助部门负责人及质量总监开展质量管理,履行质量否决权,组织质量风险识别、跟踪与闭环;
2)负责本部门质量KPI达成与绩效提升,推动质量管理要求(如质量红线、白皮书)在团队内部落地执行;
3)总结智能体评测与AI测试最佳实践,形成可复用的方法论与案例库;
5、前沿技术探索与落地
1)跟踪前沿技术,规划技术路线图,确保产品技术竞争力处于行业第一梯队。
2)转化关键技术为核心专利(5G-A、6G、AI/ML)、构建通信领域Agent及AI/ML技术壁垒,打造行业技术影响力。
3)领导跨部门技术攻关小组及方案推进,指导团队完成关键技术突破,建立人才培养梯队。
【任职要求】
1、教育背景与经验:
计算机、通信、人工智能等相关专业硕士及以上学历,8年以上大型系统架构或测试经验;
熟悉智能体评测,AI驱动测试,有实际落地经验者优先。
2、技术能力:
熟悉AI大模型原理、RAG架构、Agent行为机制;掌握AIOps、DevOps测试流程;
精通评测方法论: 熟悉业界主流评测集(如MMLU, C-Eval)及自动化评测框架(如 Ragas, TruLens, Arize Phoenix),能设计多维度评测指标(准确率、时延、安全性等)
数据敏感度: 能够设计高质量的测试数据集(Golden Datasets),并运用统计学方法分析评测结果,产出有指导意义的优化报告,具备数据建模与统计分析能力;
3、行业知识与解决问题能力:
具备端到端系统视角,能识别智能体在复杂环境中的潜在风险与失效模式;
了解6G-AIOps与自智网络发展趋势,理解ToB业务痛点,能将技术架构与业务交付紧密结合。
熟悉智能体生命周期管理方法论,包括版本控制、监控告警、安全审计与持续迭代机制。
4、软技能与团队合作:
良好的沟通与协作能力,能够跨团队协作并推动项目进展;
强烈的责任心和自驱力,具备在压力下完成高质量工作的能力。
5、加分项:
具备跨团队协作能力,能与数据科学家、网络工程师、产品团队高效协同;
对具身智能、自主AI程序员(如Devin)等新兴方向有深入思考,能推动智能体向真实环境执行任务演进;
在相关领域有论文发表、专利成果或开源项目经验者优先。