Refine Reset All
Sort by
Location
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Scrapy Jobs In China - 7 Job Positions Available

Top Cities:
1 – 7 of 7 jobs
百川智能 jobs

搜索与数据工程实习生(AI大模型方向) 北京 社招 实习 职位描述 1、参与互联网公开数据的采集、清洗、解析和结构化处理,建设高质量知识库与训练数据集;2、负责网页、文档、PDF等多种数据源的数据抓取与解析,持续提升数据覆盖率与更新时效;3、参与分布式爬虫系统建设,优化采集链路的稳定性、扩展性和运行效率;4、参与网站反爬机制分析与采集策略优化,包括动态页面解析、请求特征分析、访问频率控制等;5、参与代理池、任务调度、异常监控等基础能力建设,提升大规模数据采集成功率;6、参与搜索检索系统建设,包括索引构建、检索优化、数据更新等工作;7、参与大模型RAG(检索增强生成)系统的数据建设与效果优化;8、协助开展搜索质量评估、数据标注和效果分析工作,持续提升知识检索质量。 职位要求 1、本科及以上学历在读,计算机、软件工程、人工智能等相关专业;2、熟练掌握 Python,具备良好的编码能力和工程实践能力;3、熟悉 HTTP/HTTPS、Cookie、Session、Ajax、REST API 等网络基础知识;4、熟悉 HTML、XPath、CSS Selector、正则表达式等网页解析技术;5、熟悉 Linux 环境和常用开发工具;6、了解搜索引擎、知识库、大模型应用等相关技术;7、具备较强的问题分析能力和自主学习能力。加分项熟悉 Scrapy、Playwright、Selenium、BeautifulSoup 等采集框架;有反爬对抗、动态网页采集、分布式爬虫等项目经验;熟悉 Elasticsearch、OpenSearch 等搜索引擎;了解向量检索、Embedding、Milvus、Faiss等技术;熟悉 Redis、Kafka、MySQL、MongoDB 等中间件或数据库;有开源项目贡献、技术博客或竞赛经历。技术关键词Python|Scrapy|Playwright|Selenium|分布式爬虫|反爬对抗|代理池|Elasticsearch|RAG|知识库|向量检索|Redis|Kafka你将获得参与大模型核心知识库与搜索系统建设;接触海量互联网数据采集与搜索技术实践;学习RAG、知识库、向量检索等前沿AI技术;与搜索、数据、算法团队深度协作,了解大模型产品研发全流程。 投递...

Premium Full-time Linux API
百川智能  22 days ago
Xiaomi jobs

大模型爬虫逆向工程师-MiMo 北京 社招 全职 职位 ID:A133586 职位描述 1. 结合大模型应用需求,设计和优化高效、智能化的爬虫系统,进行多源数据采集。2. 具备分布式、高并发系统经验,能突破各类技术限制实现稳定高效的数据获取。拥有扎实的Web/APP逆向工程能力,可完成复杂的定向采集任务3. 针对大模型数据预处理要求,优化爬虫数据格式和质量,提升爬取的数据对训练和推理的适用性。4. 结合大模型场景,自动化处理反爬机制变化,并提供灵活的技术解决方案。5. 与大模型研发团队紧密合作,确保爬虫采集的数据能够有效支持模型训练与应用。6. 跟进最新的反爬技术与反制策略,持续优化爬虫架构和性能。 职位要求 1. 本科及以上学历,计算机科学、人工智能、网络安全等相关专业。2. 3年以上爬虫开发及逆向工程经验,有大模型或AI相关领域的爬虫应用经验者优先。3. 精通Python或其他编程语言,熟悉爬虫框架(如Scrapy、Selenium、Playwright等)。4. 熟悉大模型训练和数据处理流程,能够根据模型需求调整数据抓取策略。5. 熟悉常见网络协议(HTTP/HTTPS)和接口抓取,能够对复杂数据进行高效提取和清洗。6. 具备良好的分析能力和解决问题的能力,能够应对复杂的反爬挑战。加分项:1. 有大规模数据抓取与处理经验,尤其是针对大模型训练数据的采集和优化。2. 熟悉数据加密与解密技术,能够破解复杂的加密算法。3. 具备AI或大模型领域的技术背景,能够理解和支持模型数据需求。我们提供:1. 具有竞争力的薪资待遇与丰富的福利。2. 与顶尖AI团队合作的机会,参与大模型应用开发与优化。3. 灵活的工作环境与技术创新的空间。4. 完善的职业发展和培训机会,助力技能提升和成长。 投递...

Premium Full-time
Xiaomi  11 days ago
易宝支付 YeePay jobs

数据采集工程师 北京 全职 金融 职位描述 1. 负责核心业务网络数据采集体系的架构设计、迭代优化与落地实施,支撑数据量的稳定采集需求。2. 攻克复杂网页与接口的访问限制、数据加密、动态渲染等技术难题,保障公开数据获取的持续性与成功率。3. 负责采集系统的性能调优,解决采集延迟、资源占用过高、数据重复/丢失等问题,提升采集效率与数据质量。4. 调研前沿网络数据获取、接口解析与合规采集技术、对抗技术,输出技术方案与最佳实践。 职位要求 1. 本科及以上学历,计算机、软件工程、通信工程、数学等相关专业,5年及以上专业数据获取开发与实战经验,有大型分布式数据获取系统搭建经验者优先。2. 精通Python/Go/Java至少一门主流开发语言,熟练使用Scrapy、BeautifulSoup、Playwright、Selenium、PySpider等主流爬虫框架与工具,具备自研数据获取框架或二次开发能力者优先。3. 精通HTTP/HTTPS协议、TCP/IP协议、Web前端技术(HTML/CSS/JS),熟练掌握抓包分析工具(Charles、Fiddler、Wireshark),具备深度逆向分析接口加密、JS混淆代码的能力。4. 具备丰富的对抗实战经验,能独立解决各类复杂数据获取场景,熟悉验证码平台、代理池搭建与优化、Cookie池管理、设备指纹等技术方案。5. 严格恪守数据合规与网络安全准则,无恶意数据采集、数据泄露等行为。 投递...

Premium Full-time
易宝支付 YeePay  11 days ago
Insta360 jobs

爬虫工程师 深圳 社招 全职 职位描述 1. 负责根据业务需求/规划开展爬虫工作,同时对现有爬虫进行维护和完善;2. 持续进行爬虫核心技术研究和策略优化,攻克疑难技术问题,设计防屏蔽规则,提升数据抓取的效率和质量;3. 建立爬虫监测体系,及时监控及解决运行过程中出现的问题,确保数据的稳定性和准确性;4. 参与公司内部相关平台的架构设计与开发,并结合业务场景及NLP等技术,实现产品化。 职位要求 1. 计算机或相关专业毕业,本科及以上学历,有2年以上爬虫工作经验;2. 熟悉Java、Python、HTML、JavaScript等编程语言,了解Spring Boot框架,熟悉常见爬虫框架如Scrapy、Selenium等;3. 熟悉MySQL、MongoDB等主流数据库,熟练掌握SQL语句编写;4. 熟悉Linux环境,能使用常用的Linux命令;5. 熟悉网络基础,了解TCP/IP网络协议,熟悉HTTP协议;6. 掌握爬虫原理,掌握正则表达式、XPath的使用,掌握常见抓包分析工具如Fiddler、Charles、Wireshark、Postman等,熟悉常见反爬机制;7. 具备较强的抗压能力,有责任心,注重工作效率和代码质量。 投递...

Premium Full-time
Insta360  10 days ago
Yeehai Global 易海创腾 jobs

AI应用工程师 广州 全职 互联网 / 电子 / 网游 职位描述 AI/ML工程师岗位描述:1. 负责设计与开发面向出海广告行业的垂类AI模型(AIAgent),基于企业级RAG整合训练实时在线、离线等多源数据。2. 构建多模态AI系统架构,优化模型在文本、图像、数据洞察等维度的协同能力,推动模型通过SFT、DPO实现持续迭代升级。将广告优化师分析逻辑转化为可落地的AI工作流,提升模型在广告投放效率、行业分析维度等场景的竞争力。3. 探索营销领域Agent协同机制,设计模块化、可扩展的AI解决方案,确保技术方案与业务需求高度匹配。 职位要求 岗位要求:1. 本科及以上学历,机器学习方向相关专业,985/211/海外名校学历优先。2. 熟练掌握LLM技术栈;精通RAG技术实现,具备企业级知识库构建与优化经验。3. 熟悉LangChain/LLamaIndex等框架,掌握LLM微调、提示词工程等优化方法。开发能力:1. 熟悉Ollama、vLLM等开源部署方案,掌握PyTorch/TensorFlow模型训练框架。2. 精通JSON数据结构及应用,具备数据序列化、反序列化、Schema设计及问题排查能力。3. 熟悉Flask、Scrapy等Python框架,具备面向对象开发及数据整合经验。 投递...

Premium Full-time
Yeehai Global 易海创腾  8 days ago
NIO jobs

数据分析实习生 上海 实习 职位 ID:A62467 职位描述 作为整车工程实习生支持工程研发数据分析以及项目运营管理数据开发&分析工作- 配合运营系统后端开发工程师,对接并支持系统数据库开发- 基于车联网云端数据,完成研发端的数据分析需求- 通过业务运营数据,搭建数据可视化看板进行多维度业务数据洞察- 测试车辆数据以及验证业务工作数据的汇总和分析工作 职位要求 - 本科及以上学历,在校生- 专业:数据科学与大数据技术,商业数据分析,大数据管理与应用,计算机科学,数学,统计学,自动化等相关专业- 有数据分析,数据可视化,数据挖掘等相关工作实习经验者优先- 能够熟练使用SQL进行增删改查,精通窗口函数等SQL函数- 掌握C++/Java/Python中的一门语言,精通Python pandas、numpy库者优先- 熟悉Powerbi/Tableau等BI工具者优先- 熟悉python Scrapy框架并能对数据进行收集者优先- 语言能力:中文/英文(书面及口语)能进行工作相关的基本英文沟通其他要求 Other Requirement- 有较好的逻辑思维能力以及对数据的高敏感度,拥有独立判断和思考的能力- 有较好的沟通与技术文档写作能力- 熟练使用Office办公软件进行数据分析结果展示和报告输出- 有团队合作精神,具备认真负责的工作态度- 能持续实习6个月,一周可工作5天者优先 投递...

Premium Full-time
NIO  4 days ago
JLL jobs

JLL empowers you to shape a brighter way. Our people at JLL are shaping the future of real estate for a better world by combining world class services, advisory and technology for our clients. We are

JLL  3 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

scrapy

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Location
Job Type
Employer/Recruiter