python爬虫基础

发布时间:2026/8/27 14:14:00
python爬虫基础 在开始爬虫之前我们要先下载两个库requests 和 BeautifulSouprequerts库我理解的就是用来发出请求的就像浏览器通过网络来请求页面的数据BeautifulSoup这个是HTMl的解析库用来解析HTML代码的首先我们要先引入这两个库然后通过requests.get来发出请求然后运行打印我们可以看到获取了状态码这个状态码就和网络请求一样200是OK的意思404是找不到的意思这时候一般就是网站开发者他们开发的网站是要给用户看的用户肯定是通过浏览器来请求数据查看的而爬虫是用代码程序来请求数据的开发者们通过是不是浏览器来判断是不是这是不是一个爬虫。开发者们肯定不想让你用程序来查看所以说这个时候我们需要在请求的前面加上一个headers请求头来模拟浏览器发出请求绕过这个判断。这个请求头你可以打开浏览器网络里面的随意一个请求来抄作业。headers { User-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/143.0.0.0 Safari/537.36 Edg/143.0.0.0 }之后传入get的方法里面这里的 .text是获取HTTP相应的文本内容也就是网页的HTML源代码不用.text的话在运行打印就是获取的状态码之后我们在用BeautifulSoup方法来解析HTML代码html.parser之后通过一个find_all方法来查找符合的标签列表第一个参数是标签第二个参数是标签的类名注意attrs不要写错了查找出来的标签列表肯定很多啊所以说我们要循环打印他打印出来是带标签的如果我们不需要标签可以加上string可以直接获取标签里面的字符去除标签。