Python 爬虫专栏我爱编程@IT·互联网

Python爬虫——selenium模拟登陆新浪微博(网页)

2017-05-10  本文已影响608人  loading_miracle

上一篇文章Python爬虫——新浪微博(网页版)中提到cookie过期问题,想了一下可以通过selenium+chrome模拟登陆获取登陆成功后的cookies,然后构造字典返回,这样在主程序进行判断如果抓不到正确的数据,就重新模拟登陆获取新的cookies并返回(个人想法,测试可行)
URL入口+xpath定位
URL:http://weibo.com/login.php

输入框位置

** selenium+chrome**
这里如果没有安装相关的包,可以自行百度解决环境问题,主程序主要使用selenium相关的函数去模拟点击和输入事件,最后获取登录后的cookies,废话不多说,直接上代码供大家参考。
模拟登录Demo

import time
from selenium import webdriver

class COOKIE(object):
    url = 'http://weibo.com/login.php'
    def __init__(self):
        self.browser = webdriver.Chrome()
    def getcookie(self):
        self.browser.get(self.url)
        self.browser.implicitly_wait(15)
        self.browser.find_element_by_xpath('//*[@id="loginname"]').clear()
        self.browser.find_element_by_xpath('//*[@id="loginname"]').send_keys('你的用户名')
        self.browser.find_element_by_xpath('//*[@id="pl_login_form"]/div/div[3]/div[2]/div/input').clear()
        time.sleep(1)
        self.browser.find_element_by_xpath('//*[@id="pl_login_form"]/div/div[3]/div[2]/div/input').send_keys('密码')
        time.sleep(1)
        self.browser.find_element_by_xpath('//*[@id="pl_login_form"]/div/div[3]/div[6]/a').click()
        cookie_dic={}
        cookies = self.browser.get_cookies()
        self.browser.close()
        for cookie in cookies:
            if cookie.has_key('name') and cookie.has_key('value'):
                cookie_dic[cookie['name'].encode('utf-8')]=cookie['value'].encode('utf-8')
        return cookie_dic

遇到的问题

selenium使用案例
想对selenium进一步了解的可以自行查相关的资料,然后就是在模拟登录的时候要找到正确URL入口和账户和密码的输入框的位置,这里给一个58同城登录的示例作为参考。

58同城登录界面

很显然我们用工具去抓的时候,给我的位置是第一个密码框的位置,但是这个位置是填充不进去值的,接着看下边同样也是密码输入框,但是display:none(隐藏了),然后我就想如果定位到这个位置能否成功填充密码,经测试果然可以,我们可以更改这个网页元素属性来看一下有怎样的变化。

更改属性后
我们可以看到我讲display的none属性去掉后,主页面多了一个密码框,所以这个才是真正的密码填充框,只不过一开始隐藏了。
总结
selenium模拟登录这块还是要找到正确的URL入口和正确的输入框位置,解决了这些差不多就可以完成模拟登录一个网站。
上一篇 下一篇

猜你喜欢

热点阅读