Python爬虫实现验证码登录代码实例

(编辑：jimmy 日期: 2024/9/28 浏览：2)

很多网站为了避免被恶意访问，需要设置验证码登录，避免非人类的访问，Python爬虫实现验证码登录的原理则是先到登录页面将生成的验证码保存下来，然后人为输入后，包装后再POST给服务器，实现验证，这里还涉及到了Cookie，其实Cookie保存在本地主机上，避免用户重复输入用户名和密码，在连接服务器的时候将访问连接和Cookie组装起来POST给服务器。

这里涉及到了两次向服务器POST，一次是Cookie,这里还自行设计想要Cookie的内容，由于是要登录，Cookie中存放的则是用户名和密码。第二次POST则是向服务器提交验证。

这里用到Python3,主要用到的包是re urllib.request http.cookiejar

上代码，借鉴了别人的代码~~~

import re
import urllib.request
import http.cookiejar
#from http.comkie import CookieJar 上面那句和这句等同
 
loginurl='https://www.douban.com/accounts/login'
cookie = http.cookiejar.CookieJar()
opener = urllib.request.build_opener(urllib.request.HTTPCookieProcessor)#在已存的Cookie下建立连接
 
params={}
params['form_email']='用户名'
params['form_password']='密码'#这里写上已有的用户名和密码
params['source']='http://www.douban.com/accounts/login'
 
#从首页提交登陆
response = opener.open(loginurl,urllib.parse.urlencode(params).encode('utf-8'))#urllib.parse.urlencode(params).encode('utf-8')这个是向服务
#器POST的内容，可以打印一下response.geturl()请求的连接看一下
#print(response.geturl()[0:33])
#验证成功跳转至登陆页
if response.geturl()[0:33]=='https://accounts.douban.com/login':
    html = response.read().decode('utf-8')
    #print(html)，可以先打印一下文件内容，为了看到网页元素更方便的写正则，可以复制下来，在需要获取的地方用(.+"captcha_image" src="/UploadFiles/2021-04-08/(.+">

以上所述是小编给大家介绍的Python爬虫实现验证码登录详解整合，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对网站的支持！

上一篇：基于python实现百度翻译功能

下一篇：python使用time、datetime返回工作日列表实例代码