0

0

Python反爬识别原理_行为分析解析【教程】

舞姬之光

舞姬之光

发布时间:2026-01-05 12:34:02

|

644人浏览过

|

来源于php中文网

原创

python爬虫被识别的核心在于行为不像真人。服务器通过请求特征、交互节奏、js指纹、会话状态等多维度判断;需伪装完整请求头、模拟人类操作节奏、隐藏自动化痕迹、维护动态会话,细节比工具选择更重要。

python反爬识别原理_行为分析解析【教程】

Python爬虫被识别,核心不在于用了什么库,而在于行为是否像真人。服务器通过分析请求特征、交互节奏、环境指纹等维度,判断访问者是程序还是用户。关键不是“能不能发请求”,而是“发得像不像人”。

请求头伪装:最基础也最容易露馅的环节

默认的requests请求头带有明显的Python和requests标识,比如User-Agent: python-requests/2.xx,服务器一扫就知是脚本。光换一个User-Agent还不够——真实浏览器会携带Accept、Accept-Language、Referer、Sec-Ch-Ua等十余个头部字段,且字段值之间存在逻辑关联(例如Chrome版本号与Sec-Ch-Ua中的版本需一致)。缺失或错配这些字段,容易触发初级风控。

  • 用fake_useragent动态生成主流浏览器UA,避免长期固定同一UA
  • 按目标站点常用浏览器补全Accept、Sec-Fetch-*系列头部(如Sec-Fetch-Dest: document)
  • Referer应与上一页URL逻辑匹配,比如从列表页跳详情页,Referer不能为空或乱填

请求频率与操作节奏:机器行为的“心跳”漏洞

人类翻页有停顿、滚动有快慢、点击有犹豫;爬虫则常表现为匀速高频请求(如每1秒精准抓1页),或毫秒级完成点击→加载→提取全流程。服务端通过IP粒度统计单位时间请求数、相邻请求间隔的标准差、页面停留时长分布等,能有效识别异常节奏。

  • 避免time.sleep(1)式机械等待,改用随机区间(如random.uniform(1.2, 4.8))
  • 模拟页面停留:对详情页可延迟1.5–6秒再提取内容,非必须立即处理
  • 同IP并发控制在1–2个会话内,切勿多线程猛攻同一域名

JavaScript行为指纹:现代反爬的重点防御区

越来越多网站要求执行JS生成token、校验canvas指纹、监听鼠标轨迹或WebGL参数。Requests无法执行JS,Selenium虽能运行但自带webdriver痕迹(如navigator.webdriver恒为true)、启动慢、资源重。无头浏览器若未清除自动化特征,极易被检测。

九歌
九歌

九歌--人工智能诗歌写作系统

下载

立即学习Python免费学习笔记(深入)”;

  • 用undetected-chromedriver3或playwright启用stealth插件,隐藏webdriver标志
  • 禁用自动化相关属性:--disable-blink-features=AutomationControlled
  • 注入JS绕过canvas指纹检测(如覆盖HTMLCanvasElement.prototype.toDataURL)

Cookies与会话状态:断连即暴露身份

登录态、CSRF Token、加密sign参数往往依赖完整会话链路。Requests手动维护cookie易遗漏HttpOnly字段,Selenium自动携带却可能因页面JS更新了token而未同步。一次token失效或cookie过期,后续请求就会批量返回403或跳转登录页。

  • 优先复用浏览器驱动实例,让JS自动管理cookie和storage
  • 对关键接口,在请求前主动调用page.evaluate('document.cookie')确认最新态
  • 捕获302跳转和401响应,触发重新登录或token刷新流程,而非硬编码固定cookie

反爬本质是行为博弈,没有一劳永逸的方案。重点在于理解目标站的检测逻辑,针对性补足行为缺口,而不是堆砌技术工具。细节到位,比换库更管用。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
chrome什么意思
chrome什么意思

chrome是浏览器的意思,由Google开发的网络浏览器,它在2008年首次发布,并迅速成为全球最受欢迎的浏览器之一。本专题为大家提供chrome相关的文章、下载、课程内容,供大家免费下载体验。

1018

2023.08.11

chrome无法加载插件怎么办
chrome无法加载插件怎么办

chrome无法加载插件可以通过检查插件是否已正确安装、禁用和启用插件、清除插件缓存、更新浏览器和插件、检查网络连接和尝试在隐身模式下加载插件方法解决。更多关于chrome相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

815

2023.11.06

cookie
cookie

Cookie 是一种在用户计算机上存储小型文本文件的技术,用于在用户与网站进行交互时收集和存储有关用户的信息。当用户访问一个网站时,网站会将一个包含特定信息的 Cookie 文件发送到用户的浏览器,浏览器会将该 Cookie 存储在用户的计算机上。之后,当用户再次访问该网站时,浏览器会向服务器发送 Cookie,服务器可以根据 Cookie 中的信息来识别用户、跟踪用户行为等。

6491

2023.06.30

document.cookie获取不到怎么解决
document.cookie获取不到怎么解决

document.cookie获取不到的解决办法:1、浏览器的隐私设置;2、Same-origin policy;3、HTTPOnly Cookie;4、JavaScript代码错误;5、Cookie不存在或过期等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

366

2023.11.23

阻止所有cookie什么意思
阻止所有cookie什么意思

阻止所有cookie意味着在浏览器中禁止接受和存储网站发送的cookie。阻止所有cookie可能会影响许多网站的使用体验,因为许多网站使用cookie来提供个性化服务、存储用户信息或跟踪用户行为。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

440

2024.02.23

cookie与session的区别
cookie与session的区别

本专题整合了cookie与session的区别和使用方法等相关内容,阅读专题下面的文章了解更详细的内容。

97

2025.08.19

登录token无效
登录token无效

登录token无效解决方法:1、检查token的有效期限,如果token已经过期,需要重新获取一个新的token;2、检查token的签名,如果签名不正确,需要重新获取一个新的token;3、检查密钥的正确性,如果密钥不正确,需要重新获取一个新的token;4、使用HTTPS协议传输token,建议使用HTTPS协议进行传输 ;5、使用双因素认证,双因素认证可以提高账户的安全性。

6511

2023.09.14

登录token无效怎么办
登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容,供大家免费下载体验。

840

2023.09.14

Swift iOS架构设计与MVVM模式实战
Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践,系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例,帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

3

2026.03.03

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 5.7万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 3.3万人学习

Bootstrap 5教程
Bootstrap 5教程

共46课时 | 3.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号