
百度图片搜索引擎面试保姆级教程:3个坑让你代码跑不通
复制来的爬虫代码跑不通?报错403或者返回一堆乱码JSON?别急着骂人,这通常是接口鉴权或参数构造出了问题。作为大厂面试官,我见过太多候选人卡在百度图片搜索的逆向工程上,今天这篇保姆级教程,直接带你拆解高频面试题,从原理到代码,彻底搞懂怎么调。
考点梳理:面试官到底在考什么?
很多候选人以为百度图片搜索就是个简单的HTTP GET请求,带上关键词就行。错!大错特错。面试官问这个,核心考察的是你对非标准API逆向能力、反爬机制应对以及数据结构解析的综合理解。
这里有个残酷的现实:百度官方并没有开放免费的、无限制的百度图片搜索API给普通开发者。你看到的那些“百度图片搜索接口”,绝大多数是第三方服务商通过逆向工程或者内部接口抓取封装而成的。因此,面试中提到的“百度图片搜索引擎”,往往指的是如何模拟浏览器行为去请求百度的图片列表页,并解析返回的HTML或JSON数据。
核心考点集中在三点:请求头伪装:如何构造合法的User-Agent、Referer和Cookie,避免被风控拦截。
分页逻辑:百度图片的分页参数(pn, rn, tn)是如何计算的?
数据清洗:返回的HTML中,图片真实URL往往隐藏在data-src属性或JSON字符串中,如何稳定提取?记住,面试官不关心你能不能背下百度的历史,他关心的是你能不能在一个没有文档的“黑盒”系统里,稳定地拿到数据。
标准答法:如何构建高可用请求
面对“如何实现百度图片搜索”这个问题,标准答法不能只说“用requests库发个请求”。你需要展示你的工程化思维。
第一步,明确数据源。百度图片搜索的结果页(image.baidu.com)是动态加载的,直接GET页面拿到的HTML里,图片数据是嵌在JavaScript变量里的。这意味着简单的HTML解析(如BeautifulSoup)可能不够,你需要解析JS中的JSON对象,或者拦截XHR请求。
第二步,构造请求参数。百度图片搜索的核心参数包括:word:搜索关键词
pn:当前页起始索引(从0开始,每页20张,所以第二页是20,第三页是40)
rn:每页返回数量(通常固定为20)
tn:图片类型(result为综合,photo为实拍等)第三步,处理鉴权与风控。这是最容易踩坑的地方。百度对频繁请求非常敏感。你需要:设置真实的浏览器User-Agent。
维护一个Cookie池,或者在首次请求时获取必要的Cookie(如BAIDUID, PMS)。
控制请求频率,加入随机Sleep。第四步,解析响应。响应体是HTML,但关键数据在script标签内的JSON中。你需要提取这个JSON,解析其中的thumbURL(缩略图)和middleURL(大图)。
注意:这里涉及到的数据交互协议,虽然百度没有公开RFC标准,但其内部数据格式遵循了RFC 8259(JSON数据交换格式)的定义。你在解析时,必须严格遵循JSON语法,处理转义字符和嵌套对象。很多候选人代码报错,就是因为直接把JS对象当JSON解析,忽略了JS特有的undefined或非标准字段。
代码实现:Python实战解析
下面这段代码是一个精简但实用的示例,展示了如何请求百度图片并解析数据。请注意,这段代码仅用于技术学习,实际生产环境需严格遵守robots.txt和版权法规。
import requests
import re
import json
import time
import randomclass BaiduImageScraper:def __init__(self):self.base_url = https://image.baidu.com/search/acjsonself.headers = {User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36,Referer: https://image.baidu.com/,Accept: application/json, text/javascript, */*; q=0.01,X-Requested-With: XMLHttpRequest}self.session = requests.Session()# 初始化Session,获取基础Cookieself.session.get(https://image.baidu.com/, headers=self.headers)def get_image_list(self, keyword, pn=0, rn=20):获取百度图片列表:param keyword: 搜索关键词:param pn: 页码偏移量 (0, 20, 40...):param rn: 每页数量:return: 图片URL列表params = {query: keyword,pn: pn,rn: rn,tn: result,ie: utf-8,fp: result,ipn: r,z: 0}try:response = self.session.get(self.base_url,headers=self.headers,params=params,timeout=10)response.raise_for_status()# 百度返回的是JSONP格式,需要剥离外层函数调用text = response.text# 匹配 { ... } 之间的内容match = re.search(r'\{.*\}', text, re.DOTALL)if not match:print(未找到JSON数据)return []json_data = json.loads(match.group())image_urls = []if data in json_data and json_data[data]:for item in json_data[data]:# 优先取thumbURL,如果为空则跳过if thumbURL in item and item[thumbURL]:image_urls.append(item[thumbURL])elif middleURL in item and item[middleURL]:image_urls.append(item[middleURL])return image_urlsexcept requests.RequestException as e:print(f请求出错: {e})return []def scrape_images(self, keyword, total_pages=3):抓取多页图片all_urls = []for page in range(total_pages):pn = page * 20print(f正在抓取第 {page + 1} 页...)urls = self.get_image_list(keyword, pn=pn)all_urls.extend(urls)# 随机休眠,避免触发风控sleep_time = random.uniform(1.0, 2.5)time.sleep(sleep_time)if not urls:print(当前页无数据,可能已到底部或被限制)breakreturn all_urlsif __name__ == __main__:scraper = BaiduImageScraper()# 注意:实际测试时请更换为合法的测试关键词images = scraper.scrape_images(python programming, total_pages=2)print(f共获取 {len(images)} 张图片链接)for url in images[:5]:print(url)代码逐行解析与避坑指南:self.session.get(https://image.baidu.com/):这一步至关重要。直接发POST或GET请求到acjson接口,如果Cookie不全,很容易返回空数据或报错。先访问首页,让服务器下发基础Cookie(如BAIDUID),能大幅提高成功率。
re.search(r'\{.*\}', text, re.DOTALL):百度返回的不是纯JSON,而是seeXxx({...})这样的JSONP格式。直接json.loads(response.text)会报错。必须用正则提取中间的JSON对象。这是90%候选人代码跑不通的原因。
thumbURL vs middleURL:thumbURL通常是缩略图,速度快但分辨率低;middleURL是大图,但有时为空。生产环境中建议两者都尝试,或者根据业务需求选择。
随机Sleep:固定间隔请求极易被识别为机器行为。random.uniform(1.0, 2.5)模拟人类操作的不规律性。追问与延伸:面试官的“灵魂拷问”
当你写完上述代码,面试官通常会追问两个问题,这才是区分初级和高级的地方。
追问1:如果百度返回的数据被加密或混淆了怎么办?
答法:
如果数据被加密,通常是在JavaScript层面。你需要:浏览器调试:打开Chrome DevTools,查看Network标签,找到返回数据的请求。
断点调试:在Sources标签中找到生成加密参数的JS函数,打断点,查看明文到密文的转换过程。
算法复现:常见的加密方式有MD5、SHA1、AES等。如果是简单的MD5拼接,用Python的hashlib库复现即可。如果是复杂的AES,需要提取密钥(Key)和初始化向量(IV)。
调用JS:如果算法太复杂,可以用node.js环境执行JS代码,或者用Python的py_mini_racer库直接在Python中运行JS。追问2:如何保证大规模爬取时的稳定性和效率?
答法:IP代理池:单一IP必死。需要接入动态IP代理池,每次请求更换IP。
异步并发:使用aiohttp + asyncio替代同步requests,提升吞吐量。
重试机制:加入指数退避重试策略。遇到429(Too Many Requests)或503时,等待更长时间再重试。
分布式架构:使用Redis作为任务队列,多Worker节点并发抓取。
数据去重:使用布隆过滤器(Bloom Filter)对图片URL进行去重,避免重复存储。关于RFC规范的一点细节:
在处理HTTP请求时,我们常提到RFC 7231(Hypertext Transfer Protocol (HTTP/1.1): Semantics and Content)。其中关于缓存头(Cache-Control, ETag)的处理,对于判断数据是否过期很有帮助。百度图片的URL通常带有时间戳参数,这意味着图片资源是动态生成的,传统的HTTP缓存策略(如304 Not Modified)在这里几乎无效。因此,在存储层,建议以图片内容的MD5哈希值作为唯一标识,而不是URL。
记忆口诀:三步走,稳过面试
为了让你在大脑里形成肌肉记忆,我总结了一个口诀:“一Cookie,二正则,三反爬”。一Cookie:先访问首页,拿全Cookie,再发请求。不要裸奔。
二正则:返回JSONP,正则提取花括号,json.loads别急,先清洗。
三反爬:UA要真,Referer要对,频率要随机,IP要轮换。案例驱动的思考:
我曾面试过一个候选人,他代码写得非常漂亮,用了Selenium。但当他被问到“如果并发1000个请求,Selenium能撑住吗?”时,他愣住了。Selenium是浏览器自动化,资源消耗极大,1000并发直接炸内存。而基于HTTP请求的方案,配合代理池,可以轻松扩展到万级并发。这就是效率与稳定性的权衡。
你公司项目里是怎么处理的?欢迎评论
你们在实际项目中,是倾向于用Selenium模拟浏览器,还是逆向JS算法直接发HTTP请求?有没有遇到过百度接口突然变更导致服务瘫痪的情况?当时是怎么应急的?欢迎在评论区分享你的踩坑经历,我们下期接着聊。