news 2026/9/22 12:18:32

3个坑搞定安居客二手数据抓取,一文搞懂

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
3个坑搞定安居客二手数据抓取,一文搞懂

3个坑搞定安居客二手数据抓取,一文搞懂

配置环境就卡半天?别急,这行代码救你。

很多兄弟一提到【安居客二手】房源数据抓取,第一反应就是头疼。不是被反爬拦截,就是解析出来的字段乱七八糟。我在掘金技术社区看到不少帖子吐槽,说用 Scrapy 跑半天,IP 封了,Cookie 失效了,最后连个完整的户型图都拿不全。

其实,问题往往不出在“抓”这个动作上,而出在你对“安居客二手”页面结构的理解上。这篇干货,带你从源码层面拆解它的核心逻辑,不整虚的,直接上代码,帮你把环境跑通,把数据拿稳。

入口定位:找到真正的数据源

很多人一上来就 requests.get(url),然后直接解析 HTML。这是最原始的做法,也是最容易挂的做法。

安居客的页面是前后端分离的架构,尤其是【安居客二手】板块。你打开浏览器 F12 看 Network 标签页,会发现页面初始加载的 HTML 里,很多动态数据其实是空壳,或者是通过 JS 渲染出来的。

真正的数据源,往往藏在 __NEXT_DATA__ 或者特定的 API 接口里。

关键点:

  1. 不要依赖初始 HTML:初始 HTML 可能只包含第一页的静态内容,或者关键数据被 JS 加密。
  2. 寻找 JSON 接口:安居客很多页面背后都有一个 /api/ 开头的接口,返回的是结构化的 JSON 数据,比解析 HTML 稳定得多。
  3. 观察 JS 逻辑:如果找不到直接的 API,就得看 JS 文件里是怎么组装请求参数的。

举个例子,你去抓【安居客二手】的列表页,URL 可能是 https://sh.anjuke.com/ershoufang/。如果你直接解析这个页面的 HTML,你可能会发现很多房源信息是缺失的,或者分页链接是动态生成的。

这时候,你需要打开浏览器开发者工具,切换到 Network,筛选 XHR 或 Fetch 请求。你会发现,当页面滚动或点击“下一页”时,会发起一个类似 /ershoufang/list/ 的异步请求,返回的 JSON 里包含了所有你需要的房源 ID、价格、面积等字段。

核心片段:解析 __NEXT_DATA__

安居客很多页面采用了 Next.js 框架,这意味着数据会嵌入在 HTML 中的一个 <script id="__NEXT_DATA__" type="application/json"> 标签里。这是最快、最稳定的数据来源。

下面是一段基于 Python 和 BeautifulSoup 的核心解析代码,专门针对【安居客二手】页面的这种结构:

import requests
import json
from bs4 import BeautifulSoup
import redef fetch_anjuke_data(url):"""获取安居客二手房源数据:param url: 目标URL:return: 解析后的数据列表"""headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36','Referer': url}# 1. 发送请求,注意设置超时和重试try:response = requests.get(url, headers=headers, timeout=10)response.raise_for_status()except requests.RequestException as e:print(f"请求失败: {e}")return []# 2. 解析 HTML,找到 __NEXT_DATA__ 标签soup = BeautifulSoup(response.text, 'html.parser')script_tag = soup.find('script', id='__NEXT_DATA__')if not script_tag:print("未找到 __NEXT_DATA__,页面结构可能已变化")return []# 3. 提取 JSON 字符串并解析try:data_json = json.loads(script_tag.string)except json.JSONDecodeError:print("JSON 解析错误")return []# 4. 深入字典结构,定位到房源列表# 注意:安居客的数据结构可能会变,这里以常见结构为例props = data_json.get('props', {}).get('pageProps', {})list_data = props.get('list', {}).get('list', [])return list_data# 使用示例
# url = "https://sh.anjuke.com/ershoufang/"
# data = fetch_anjuke_data(url)
# print(len(data))

逐行注释解析:

  • headers 设置:必须模拟浏览器请求,否则很容易被拦截。Referer 很重要,它告诉服务器你是从哪个页面跳转过来的。
  • response.raise_for_status():如果状态码不是 200,直接抛出异常,避免后续解析报错。
  • soup.find('script', id='__NEXT_DATA__'):这是核心。安居客把关键数据塞在这个 script 标签里,而不是普通的 div 或 span 中。
  • json.loads(script_tag.string)script_tag.string 获取的是标签内的文本内容,即 JSON 字符串。
  • data_json.get('props', {}).get('pageProps', {}):这是典型的 Next.js 数据结构。数据层层嵌套,你需要根据实际抓到的 JSON 结构来调整 key。如果这里取不到数据,用 print(data_json.keys()) 看看顶层有哪些 key,一步步往里挖。
  • list_data:最终的目标是拿到这个列表,里面每个元素就是一个房源对象。

设计思想:为什么选择 JSON 而非 HTML?

很多初学者喜欢用正则表达式或者 XPath 去匹配 HTML 里的标签,比如 <div class="price">。这种做法在【安居客二手】这种高变动频率的网站上,极其脆弱。

设计思想的核心是:数据与展示分离。

安居客的前端工程师在重构页面时,可能会把 class="price" 改成 class="item-price",或者把价格拆分成整数和小数两部分显示。你的 XPath 脚本瞬间就会失效,报错 no match

但是,API 接口的数据结构通常比前端展示层更稳定。因为后端要对接其他系统,接口的字段名一旦确定,不会轻易改动。即使前端页面大改版,只要后端 API 没变,你的数据抓取逻辑依然有效。

优势对比:

特性 HTML 解析 (XPath/BS4) JSON 解析 (API/Next Data)
稳定性 低,易受前端改版影响 高,依赖后端接口契约
数据完整性 可能缺失动态加载数据 通常包含完整数据集
解析速度 慢,需要解析整个 DOM 树 快,直接处理结构化数据
反爬难度 低,容易被识别为爬虫 高,需要模拟签名或 Cookie

所以,在写代码之前,先花 5 分钟研究一下页面的 Network 请求和 __NEXT_DATA__,这比写 100 行正则表达式要有价值得多。

手写简化版:构建一个健壮的抓取器

前面的代码只是基础,实际使用中,你需要处理分页、异常重试和数据清洗。下面是一个简化但实用的版本,包含了分页逻辑和简单的数据清洗:

import time
import randomdef extract_property_info(item):"""从单个房源字典中提取关键信息:param item: 房源字典:return: 清洗后的房源信息字典"""# 安居客的数据字段名可能略有不同,需根据实际情况调整title = item.get('title', '未知')price = item.get('price', 0)area = item.get('area', 0)rooms = item.get('rooms', '未知')orientation = item.get('orientation', '未知')floor = item.get('floor', '未知')link = item.get('detailUrl', '')# 简单清洗:去除标题中的多余空格和特殊符号title = re.sub(r'\s+', ' ', title).strip()return {'title': title,'price': price,'area': area,'rooms': rooms,'orientation': orientation,'floor': floor,'link': link}def crawl_anjuke_pages(base_url, max_pages=3):"""抓取多页数据:param base_url: 基础URL,不包含页码:param max_pages: 最大抓取页数:return: 所有房源数据的列表"""all_properties = []for page in range(1, max_pages + 1):# 构造带页码的 URL,安居客的页码通常在 URL 末尾current_url = f"{base_url}page{page}/" if page > 1 else base_urlprint(f"正在抓取第 {page} 页: {current_url}")# 调用之前的 fetch 函数获取原始数据raw_data = fetch_anjuke_data(current_url)if not raw_data:print(f"第 {page} 页抓取失败或无数据,停止")break# 处理数据for item in raw_data:cleaned_item = extract_property_info(item)all_properties.append(cleaned_item)# 模拟人工操作,随机等待 1-3 秒,避免被封wait_time = random.uniform(1, 3)print(f"等待 {wait_time:.2f} 秒...")time.sleep(wait_time)return all_properties# 使用示例
# base_url = "https://sh.anjuke.com/ershoufang/"
# results = crawl_anjuke_pages(base_url, max_pages=2)
# print(f"共抓取到 {len(results)} 条房源")

关键改进点:

  1. 数据清洗函数extract_property_info 将复杂的原始字典转换为干净的业务字段。这样后续存库或分析时,不需要每次都处理复杂的嵌套结构。
  2. 分页逻辑:通过循环生成不同页码的 URL。注意安居客的 URL 结构,有些是 ?page=2,有些是 /page2/,务必在浏览器里确认清楚。
  3. 随机延迟time.sleep(random.uniform(1, 3)) 是模拟人类浏览习惯。固定的 sleep(2) 很容易被反爬系统识别为机器人。
  4. 异常处理:如果某一页抓取失败,直接 break 退出循环,避免无效请求。

应用场景与避坑指南

这套方案适用于大多数基于 Next.js 或 Vue SSR 的前端框架网站。但对于【安居客二手】这种大型商业网站,你还会遇到几个典型的坑。

坑一:IP 封锁 安居客对高频访问非常敏感。如果你发现请求突然返回 403 或 429 状态码,说明 IP 被暂时封锁了。 解决方案

  • 使用代理 IP 池,每次请求换一个 IP。
  • 降低请求频率,增加随机延迟。
  • 不要并发请求,串行执行最安全。

坑二:Cookie 失效 有些数据需要登录才能看到,或者需要特定的 Cookie 才能访问完整接口。 解决方案

  • 手动登录浏览器,复制完整的 Cookie 字符串,放到 headers 里。
  • 使用 requests.Session() 对象,自动管理 Cookie。
  • 注意 Cookie 的有效期,定期更新。

坑三:数据字段变化 安居客可能会调整 JSON 里的字段名,比如把 price 改成 totalPrice解决方案

  • 在代码中加入字段存在性检查,如果关键字段缺失,记录日志并跳过该条数据,而不是直接报错崩溃。
  • 定期运行脚本,监控数据完整性。如果发现某个字段大量为空,说明接口可能变了,需要重新分析。

合规提醒: 抓取数据用于个人学习、研究或非商业用途是允许的。但如果用于商业盈利、大规模数据倒卖,或者对服务器造成严重负担,可能会触犯法律或违反网站服务条款。请遵守《网络安全法》和网站的用户协议,控制抓取频率,尊重开发者劳动成果。

你公司项目里是怎么处理这类动态页面的?是直接用 Selenium 模拟点击,还是像我这样深挖 JSON 接口?欢迎在评论区分享你的经验和踩过的坑,咱们一起交流。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/22 12:18:25

uu酷跑助手安卓性能优化避坑指南:3招解决卡顿与内存溢出

uu酷跑助手安卓性能优化避坑指南:3招解决卡顿与内存溢出 刚学会 Python 或 Java 语法,对着屏幕敲代码很顺手,但一搭真实项目就卡死、崩溃?别慌,这正是从“写 Demo”到“做产品”的鸿沟。在 Android 开发或相关工具链中, uu酷跑助手安卓…

作者头像 李华
网站建设 2026/9/22 12:18:19

别被忽悠了!安全技术类别证书避坑指南,从入门到精通只需这4步

别被忽悠了!安全技术类别证书避坑指南,从入门到精通只需这4步 刚毕业或者刚转行做水利工程的兄弟,是不是经常遇到这种尴尬:简历上写了精通 Python 或 Java,结果面试官问一句“你做过什么完整的安全项目”,你脑子直接一片空白。很多新人死磕语法,把 LeetCode…

作者头像 李华
网站建设 2026/9/22 12:18:15

9个九黎祠性能坑点:面试必问的源码级优化实战

9个九黎祠性能坑点:面试必问的源码级优化实战 面试被问“高并发下接口为什么慢”,你脑子里一片空白,只能背八股文。这不仅是技术短板,更是职业风险。在房建工程数字化领域,像九黎祠这样的BIM协同平台,一旦响应超时,现场进度数据丢失,工程师可能面临执业责任纠纷。面试官追问“原理”,答不上来,不仅丢工作,更…

作者头像 李华
网站建设 2026/9/22 12:17:48

3个死多头陷阱与完整示例:别再被K线骗了

3个死多头陷阱与完整示例:别再被K线骗了 刚学完K线形态,看着“死多头”三个字觉得高深莫测?其实90%的新手都栽在这里。你背下了所有语法,知道什么是均线、什么是MACD,但一到实盘,看着屏幕上的“死多头”形态,手抖着下单,结果第二天直接被套。为什么?因为你只看了形状,没看灵魂。今天不整虚的,直接上…

作者头像 李华
网站建设 2026/9/22 12:17:37

搞懂症结读音,3个实战项目让你面试不再挂科

搞懂症结读音,3个实战项目让你面试不再挂科 面试被问原理答不上来,这种尴尬你肯定遇到过。很多开发者在实战项目中卡壳,往往不是因为代码写不出来,而是对核心概念的底层逻辑一知半解。今天咱们不聊虚的,直接拆解“症结”这个词在技术语境下的真实含义与正确读音,结合三个真实实战项目,帮你把这块硬骨头啃下来。…

作者头像 李华
网站建设 2026/9/22 12:17:24

2026最新seo外链论坛避坑指南:5步搞定代码报错

2026最新seo外链论坛避坑指南:5步搞定代码报错 刚转行做开发,是不是也遇到过这种崩溃瞬间:从网上复制了一段Python代码,满怀期待地按下运行键,结果终端直接红字报错 IndentationError 或者 ModuleNotFoundError…

作者头像 李华