ICode9

精准搜索请尝试: 精确搜索
首页 > 其他分享> 文章详细

熟悉scrapy的基本使用(创建与运行,目录结构)---爬虫项目

2022-02-24 09:33:52  阅读:177  来源: 互联网

标签:project Terminal name 项目 爬虫 --- 命令 scrapy


1.创建爬虫项目命令,在Terminal命令窗口执行:scrapy startproject project_name(project_name代表项目名字)

2.在项目目录下的spiders文件如何创建爬虫项目文件的命令 ,在Terminal命令窗口执行:scrapy genspider get_data(项目的名字) baidu.com(要爬取数据的网址后缀)

3.1启动项目的命令,在Terminal命令窗口执行:scrapy crawl  project_name   (要先切换到项目路径,可以新建窗口打开项目,这样就不用了切换到项目的路径 project_name代表的是项目名字)

3.2也可以在项目下创建py文件begin.py

内容是: 

这样就可以右键执行不用输入命令这么麻烦。

4.切换到项目路径的命令,在Terminal命令窗口执行:  cd .\project_name\  按tab键自动会补全爬虫项目名

5.在settings.py文件中修改: ROBOTSTXT_OBEY = False  #硬要爬取数据修改方法

6.如何将爬取的内容保存为文档,命令为

scrapy crawl (project_name)-o (filename.type)支持的文件类型有:json、csv、xml

标签:project,Terminal,name,项目,爬虫,---,命令,scrapy
来源: https://blog.csdn.net/m0_59930653/article/details/123104177

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有