news 2026/9/27 6:06:52

python爬虫(02)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
python爬虫(02)

爬虫的基础

在上期我们成功的安装了相关的python环境折起我们来讲解爬虫从讲解到反爬,讲解cookie,UA等,好了废话不多说我们开始吧

在上期我们成功运行一下测试代码,你已经超越很多人了

import requests r = requests.get("https://example.com") # 请求代码,网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码

我上期讲过.status_code==200的时候证明爬虫与服务器之间的通信是正常的

但是当我们拿这个请求去请求像百度这样没有robot.txt管理很松的网站是可以的,但是当我们请求一些常规的网站会直接返回403,这是因为你又很多参数没加,被服务器识别成了爬虫,那么又没有方法可以完成这样拿到请求呢。

爬虫的进阶

请求头

请求头(User-Agent),一般里面包含有Referer,cookie,主要是这俩个还有其他我们在就见到会说

聪明的你灵机一动把浏览器的f12(开发者模式)打开了在里面找到了user-agent把user-agent加里面了这时候请变了成了

import requests headers={"Usre-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64)"} #这是请求头 r = requests.get("https://example.com",headers=headers) # 请求代码,网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码

这时候聪明的你发现又可以请求了,兴致冲冲的你像一个里面有文章的页面发送请求但是又返回403(我滴乖乖!!,怎么回事),怎么访问不了了???

聪明的你又把我的博客往下扒了扒

防盗链

防盗链(Referer),顾名思义是常见的一种反爬手段一般常见是厂商为了防止Spider来的但是没啥大用,但是很重要的一个设置,那怎么获取呢,在刚刚的f12下滑里找到Referer把它复制下来之后粘贴到headers里代码如下

import requests headers={"Usre-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64)", "Referer ":" 你的防盗链 "}#这是请求头 r = requests.get("https://example.com",headers=headers) # 请求代码,网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码
这时候你再次兴致冲冲的去请求网页但是现实在次给你当头一棒依旧403,依旧拿不下来,这时候聪明的你在次在网页的f12往下扒了扒发现有一个叫cookie(曲奇)的一个东西

曲奇

曲奇(cookie)是一种检测Spider的一种手段之一,一般由后端生成比较复杂原理如下

正常浏览器:
请求A → 服务器种 Cookie → 浏览器保存 → 请求B 带上 Cookie → 通过 ✅

Spider(不带 Cookie):
请求A → 服务器种 Cookie → 没保存/没带回 → 请求B 没 Cookie → 拦截 ❌

当你的爬虫不能爬取的时候一般是这个原因导致的,但聪明的你把cookie复制下来添加进headers里代码如下

import requests # 2. 设置请求头 headers = { "User-Agent": ( "Mozilla/5.0 (Windows NT 10.0; Win64; x64) " "AppleWebKit/537.36 (KHTML, like Gecko) " "Chrome/120.0.0.0 Safari/537.36" ), # 防盗链 Referer:告诉服务器"我是从你的页面跳过来的" "Referer": "https://www.example.com/", # Cookie:携带登录状态或追踪标识 "Cookie": "session_id=abc123; token=xyz789; uid=10001", } # 3. 发送请求 url = "https://www.example.com/page" resp = requests.get(url, headers=headers) # 4. 检查结果 print(f"状态码: {resp.status_code}")

这样你就可以爬取到网页了

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/27 6:06:43

yahoo网站提交到底多少钱?3步搞定不花冤枉钱

yahoo网站提交到底多少钱?3步搞定不花冤枉钱 备案流程一头雾水,盯着后台那些条款看了三遍还是没搞懂,最让人头疼的是,到底要花多少钱才能把站推上去?很多刚入行的后端开发者或者独立站长,在Yahoo搜索推广这块容易踩坑。你以为注册个账号就能用,结果发现验证邮箱、配置DNS、甚至代码里的Meta标签全…

作者头像 李华
网站建设 2026/9/27 6:06:15

WordPress技术保姆级建站教程:5步搞定备案与部署

WordPress技术保姆级建站教程:5步搞定备案与部署 备案流程一头雾水?别慌,这份 WordPress 技术 保姆级建站教程 能救你的急。很多安徽的前端初学者,代码写得溜,一到服务器部署和域名备案就卡壳,明明知道要买主机、传文件,但面对电信的后台和 ICP 备案要求,心里直打鼓。…

作者头像 李华
网站建设 2026/9/27 6:06:08

国外做的比较的ppt网站有哪些方面多少钱

国外做的比较的ppt网站有哪些方面多少钱 很多老板自己不会代码,但急着要上线一个展示型官网,第一反应就是问:这玩意儿多少钱?别急,先别被报价单上的数字吓跑。如果你只盯着“多少钱”,大概率会踩坑。因为网站的价格就像买菜,白菜和有机蔬菜差十倍,但如果你不懂行,花大价钱买到的可能只是个换皮模板,连基本的移…

作者头像 李华
网站建设 2026/9/27 6:05:48

3个坑揭秘:旅游类网站开发设计报告与建站报价避坑指南

3个坑揭秘:旅游类网站开发设计报告与建站报价避坑指南 改个需求建站公司拖一周,这不仅是体验差,更是安全隐患。很多老板拿到一份厚厚的旅游类网站开发设计报告,看着精美,实则漏洞百出。更坑的是, 建站报价 里藏着无数隐形炸弹,比如“基础版”不含WAF防火墙,后期升级又得加钱。…

作者头像 李华
网站建设 2026/9/27 6:05:35

网站主机免备案吗?一文搞懂避坑指南

网站主机免备案吗?一文搞懂避坑指南 别被那些花里胡哨的模板骗了,看着好看,真用起来全是坑。 很多老板觉得,只要服务器选对了,网站就能直接跑,不用管什么备案。 今天咱就把【网站主机免备案吗】这事掰开了揉碎了讲清楚,让你 一文搞懂 其中的门道。 一、 到底什么是“免备案”?别被销售忽悠…

作者头像 李华