python使用sessions模拟登录淘宝的方式

(编辑：jimmy 日期: 2024/9/26 浏览：2)

之前想爬取一些淘宝的数据，后来发现需要登录，找了很多的资料，有个使用request的sessions加上cookie来登录的，cookie的获取在登录后使用开发者工具可以找到。不过这个登录后获得的网页的代码是静态的，获取动态网页还得另寻他法，一般需要的数据可以在网页的源码中得到，但是你知道的，有些动态加载的就不是那么简单了，而且我发现这样获得的源码中，有些想要获取的数据的格式是经过改动的，比如我要某个商品的具体链接，发现并不能直接使用。总体而言，这是一次失败的尝试，不过倒是了解到使用sessions和cookies可以进到需要登录的网页，也算是一种方式吧。

记录一下失败的一次

import requests
import os
import json
from pyquery import PyQuery as pq
import re
import time
sessions = requests.session()
url = 'https://s.taobao.com/search"risk"')   
  garbage=re.compile(r'itemlist(.*"risk"')
  gb=garbage.findall(doc,re.S|re.M)
  finhtml=htmls.findall(doc,re.S|re.M)
  finhtml=finhtml+gb
  print(len(finhtml))
  #提取信息的正则表达式
  raw_title=r'"raw_title":"(.*"'
  view_price= r'"view_price":"(.*"' #价格
  view_fee=r'"view_fee":"(.*"'   #折扣
  item_loc = r'"item_loc":"(.*"' #地区
  view_sales = r'"view_sales":"(.*"' #付款人数
  comment_count = r'"comment_count":"(.*"' #评论数
  detail_url=r'"detail_url":"(.*"'   #url    
  for html in finhtml:
    rtitle=re.findall(raw_title,html)
    price=re.findall(view_price,html)
    fee=re.findall(view_fee,html)
    loc=re.findall(item_loc,html)
    sales= re.findall(view_sales,html)
    comment=re.findall(comment_count,html)
    deurl=re.findall(detail_url,html)
    for rt,p,f,l,s,c,u in zip(rtitle,price,fee,loc,sales,comment,deurl):
      contentss.append({"raw_title":rt,"view_price":p,"view_fee":f,"item_loc":l,"view_sales":s,"comment_count":c,"detail_url":u})  
  with open('ipad.json','a',encoding='utf-8') as file:
    file.write(json.dumps(contentss,indent=2,ensure_ascii=False))
  time.sleep(2)#访问间隔

总结

以上所述是小编给大家介绍的python使用sessions模拟登录淘宝,希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对网站的支持！
如果你觉得本文对你有帮助，欢迎转载，烦请注明出处，谢谢！

上一篇：详解PyTorch手写数字识别(MNIST数据集)

下一篇：Django错误：TypeError at / 'bool' object is not callable解决