【工作职责】
【数据采集工程师】
1、负责分布式爬虫系统的设计与优化;;
2、负责大规模广域爬虫引擎的部署、开发、维护;
3、负责大规模网页数据采集系统开发,互联网资源清洗和结构化,网页转码,网页聚合,信息抽取,网页分类;
【数据解析工程师】
1、负责百亿级搜索内容解析系统建设,持续提升解析效果和性能;
2、应用大模型技术,提升数据解析质量和成功率;
3、负责互联网海量数据(网页、文档、富媒体等)的去重、清洗、结构化导入、分类、信息抽取与价值评估。
【任职要求】
【数据采集工程师】
1、3年以上爬虫 或 数据解析开发经验,熟练掌握 python、java、go 之一的语言;
2、熟悉分布式爬虫架构,熟悉常见的风控策略、JS混淆、浏览器引擎;
3、熟悉chromium内核/js/dom/html/css 等网页相关语言,能够完成数据解析工作,有大模型解析经验者优先;
4、熟悉Linux常用命令,独立完成日常部署更新等,熟悉SSH、redis、mongodb等工具的使用;
【数据解析工程师】
1、计算机相关专业,熟练掌握 Python/Go/Java 至少一种编程语言;
2、深入理解网站架构和内容组织方式,具备网页结构分析能力;
2、有全网万亿级优质内容采集和挖掘经验优先;
3、有头部搜索引擎公司 或 大模型公司 数据解析工作经验优先。