职位描述
1、熟练运用 Python 爬虫相关技术,负责多源数据采集工作,独立构建稳定的爬虫采集链路,为数据分析提供高质量数据源;
2、主导数据分析,挖掘数据价值,为业务诉求、痛点及问题提供建议;
3、深入理解业务场景,进行数据分析开展策略研究,利用数据分析手段,及时发现业务流程中存在的问题,进行原因分析,提出解决方案,发现业务增长点,输出高质量的洞察和判断,为决策提供引导;
4、与项目及产品团队紧密合作,理解业务 / 产品背景与需求,挖掘算法应用需求,形成解决方案,并进行可行性评估;
5、分析并应对网站反爬机制(如 IP 封锁、验证码、User-Agent 验证、动态加载),具备代理池搭建、验证码识别、模拟浏览器行为等反爬应对能力,优化爬虫策略降低采集风险;
6、熟练掌握 XPath、CSS Selectors、正则表达式等数据提取技术,完成采集数据的结构化处理,保障数据分析数据源质量;
7、负责爬虫采集系统的日常维护、迭代优化,监控采集数据质量,及时处理采集异常,保障数据采集的稳定性和准确性;
8、配合业务需求,优化数据采集节奏、采集维度,结合数据分析结果提升采集效率和数据价值。
任职要求:
1、统招大学本科;统计学、应用数学、计算机等专业背景;
2、3年以上数据采集 / 数据分析相关工作经验,有大规模分布式爬虫系统设计和开发经验者优先。
3、能够独立熟练使用 Python、R、Matlab 等至少一种编程语言进行独立建模;熟练使用 Python 处理网络请求、解析 HTML/XML、异步编程、多线程 / 协程等爬虫核心技术;
4、熟练使用 HIVE、Oracle、MySQL 等数据库,有 TB 级数据处理经验优先;熟悉 MongoDB、Redis 等 NoSQL 存储,具备大规模爬虫数据的结构化存储与高效查询能力;了解分布式数据采集与数据流处理架构;
5、掌握常用的机器学习算法原理、框架和应用;熟悉数理统计、数据挖掘理论知识,可熟练运用数据挖掘、数据分析、数据可视化等技术进行海量数据分析和处理;熟悉 Python 爬虫开发体系(Requests、BeautifulSoup、Scrapy、Playwright、Pyppeteer 等),能独立构建稳定可靠的采集系统;
6、了解爬虫分布式架构、任务调度机制,熟悉 Kafka/RabbitMQ 等消息队列、Docker/Kubernetes 容器化技术者优先;
7、熟悉 1 个或以上行业知名的 BI 软件,并有用于数据分析项目中的经验者优先;具备前端动态页面分析能力,了解 JS 逆向工程、反爬分析技术者优先;
8、能够独立负责采集模块开发、维护与迭代,具备应对复杂反爬场景的能力;
9、对数据敏感,具备良好的问题分析解决能力、语言表达能力和文档写作能力;能快速分析采集链路瓶颈、数据异常、采集失败原因等问题,并提出有效优化方案;
10、优秀的理解沟通能力,能快速理解业务背景,并协调推进执行落地;能与业务、开发、算法团队高效协作,推动采集系统落地与迭代;
以担保或任何理由索取财物,扣押证照,均涉嫌违法,请提高警惕