搜索与数据工程实习生(AI大模型方向) 北京 社招 实习 职位描述 1、参与互联网公开数据的采集、清洗、解析和结构化处理,建设高质量知识库与训练数据集;2、负责网页、文档、PDF等多种数据源的数据抓取与解析,持续提升数据覆盖率与更新时效;3、参与分布式爬虫系统建设,优化采集链路的稳定性、扩展性和运行效率;4、参与网站反爬机制分析与采集策略优化,包括动态页面解析、请求特征分析、访问频率控制等;5、参与代理池、任务调度、异常监控等基础能力建设,提升大规模数据采集成功率;6、参与搜索检索系统建设,包括索引构建、检索优化、数据更新等工作;7、参与大模型RAG(检索增强生成)系统的数据建设与效果优化;8、协助开展搜索质量评估、数据标注和效果分析工作,持续提升知识检索质量。 职位要求 1、本科及以上学历在读,计算机、软件工程、人工智能等相关专业;2、熟练掌握 Python,具备良好的编码能力和工程实践能力;3、熟悉 HTTP/HTTPS、Cookie、Session、Ajax、REST API 等网络基础知识;4、熟悉 HTML、XPath、CSS Selector、正则表达式等网页解析技术;5、熟悉 Linux 环境和常用开发工具;6、了解搜索引擎、知识库、大模型应用等相关技术;7、具备较强的问题分析能力和自主学习能力。加分项熟悉 Scrapy、Playwright、Selenium、BeautifulSoup 等采集框架;有反爬对抗、动态网页采集、分布式爬虫等项目经验;熟悉 Elasticsearch、OpenSearch 等搜索引擎;了解向量检索、Embedding、Milvus、Faiss等技术;熟悉 Redis、Kafka、MySQL、MongoDB 等中间件或数据库;有开源项目贡献、技术博客或竞赛经历。技术关键词Python|Scrapy|Playwright|Selenium|分布式爬虫|反爬对抗|代理池|Elasticsearch|RAG|知识库|向量检索|Redis|Kafka你将获得参与大模型核心知识库与搜索系统建设;接触海量互联网数据采集与搜索技术实践;学习RAG、知识库、向量检索等前沿AI技术;与搜索、数据、算法团队深度协作,了解大模型产品研发全流程。 投递...
爬虫工程师 深圳 社招 全职 职位描述 1. 负责根据业务需求/规划开展爬虫工作,同时对现有爬虫进行维护和完善;2. 持续进行爬虫核心技术研究和策略优化,攻克疑难技术问题,设计防屏蔽规则,提升数据抓取的效率和质量;3. 建立爬虫监测体系,及时监控及解决运行过程中出现的问题,确保数据的稳定性和准确性;4. 参与公司内部相关平台的架构设计与开发,并结合业务场景及NLP等技术,实现产品化。 职位要求 1. 计算机或相关专业毕业,本科及以上学历,有2年以上爬虫工作经验;2. 熟悉Java、Python、HTML、JavaScript等编程语言,了解Spring Boot框架,熟悉常见爬虫框架如Scrapy、Selenium等;3. 熟悉MySQL、MongoDB等主流数据库,熟练掌握SQL语句编写;4. 熟悉Linux环境,能使用常用的Linux命令;5. 熟悉网络基础,了解TCP/IP网络协议,熟悉HTTP协议;6. 掌握爬虫原理,掌握正则表达式、XPath的使用,掌握常见抓包分析工具如Fiddler、Charles、Wireshark、Postman等,熟悉常见反爬机制;7. 具备较强的抗压能力,有责任心,注重工作效率和代码质量。 投递...