爬虫-处理验证码

前言

这两天在看相关于模拟登录的案例,不可避免的遇到了一些验证码相关的问题,在此之前一直使用的是将验证码下载到本地,然后人工肉眼识别的方式。但是效果可想而知,精确度倒是还可以,然而却变得不是很智能了。于是今天来学习一下如何自动识别验证码。

环境

我的实验环境为:

  • Python3.6
  • Pycharm2016.2 Professional
  • Tesseract-OCR-3.0
  • Windows 10 64位

在开始之前确保安装了tesseract引擎,然后是pytesseract这个第三方库。

如果没有安装其实也是可以使用的,那就是借助Python调用系统命令的方式来实现将验证码图片中的内容读入到文本文件,在通过代码读取文本文件得到验证码内容。 但是pytesseract使得这样的一个过程更加简便,所以没有安装的话还是建议安装一下。

pip install pytesseract

读取图片的时候需要PIL库的支持,没有安装的话还是建议先安装一下,否则程序无法进行下去的。

实施

简易示例

import pytesseract
from PIL import Image

image = Image.open(r'checkcode.gif', mode='r')
vcode = pytesseract.image_to_string(image)
print(vcode)

结果为:


图片验证码识别

之所以不在PyCharm中运行, 就是因为会出现一些让人不明所以的错误信息。比如什么

  • FileNotFoundError
  • Permission Denyed
  • .TesseractError: (1, 'Error opening data file \Software\tesseract\Tesseract-OCR\tessdata/eng.traineddata')

我也查了相关的资料,发现确实没有什么好点的解决办法,或许可以通过修改pytesseract.py的源码来解决吧, 谁知道呢?

实战校园图书馆登录

# coding: utf8

# @Author: 郭 璞
# @File: DLUTLibraryLogin.py                                                                 
# @Time: 2017/4/7                                   
# @Contact: 1064319632@qq.com
# @blog: http://blog.csdn.net/marksinoberg
# @Description: 大连理工大学图书馆模拟登陆,添加了验证码识别脚本

import requests
import BeautifulSoup
import os, sys
import pytesseract
from PIL import Image


loginurl = 'http://opac.lib.dlut.edu.cn/reader/redr_verify.php'
captchaurl = 'http://opac.lib.dlut.edu.cn/reader/captcha.php'

headers = {
    'Referer': 'http://opac.lib.dlut.edu.cn/reader/login.php',
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.87 Safari/537.36",
}

session = requests.Session()
##### 获取到验证码并保存
checkcodecontent = session.get(captchaurl, headers=headers)
with open('checkcode.jpg', 'wb') as f:
    f.write(checkcodecontent.content)
    f.close()
print('验证码已写入到本地!', '下面开始调用tesseract-OCR引擎识别验证码!')

img = Image.open('checkcode.gif', mode='r')
result = pytesseract.image_to_string(image=img)
checkcode = result
print('验证码为:', checkcode)

# os.startfile('checkcode.jpg')
# checkcode = input('请输入验证码:')
##### 准备登陆图书馆系统
payload = {
    'number':'学号',
    'passwd':'密码',
    'captcha': checkcode,
    'select':'cert_no'
}

response = session.post(loginurl, headers=headers, data=payload)
print('服务器端返回码: ', response.status_code)
soup = BeautifulSoup(response.text, 'html.parser')
## 打印当前用户
username = soup.find('font', {'color': 'blue'})
print(username.get_text())
## 打印积分信息
jifen = soup.find_all('span', {'class': 'bigger-170'})[3]
jifen = str(jifen.get_text())
print('当前登录用户总积分:', jifen)


效果演示

大连理工大学图书馆系统

恩,用户名那点确实出现了乱码,但是从积分那块我们也可以发现确实是登录成功了。相比于第一个版本,使用了pytesseract来处理验证码问题,还真的是比较方便的,最起码不用再手动输入了,这也算是一个进步吧。

最后,需要说明的是在Pycharm中不好用,还非得到CMD中去运行,真的是很无语。

总结

最后又发现一个问题那就是Python36对于Pillow4.1.0不能兼容,安装上去之后会出现各种各样的问题,比如:ImportError: DLL load failed: from . import _imaging as core

解决办法就是安装Pillow4.0.0,反正我是这么解决的了。

对于验证码问题,使用tesseract基本上已经满足需求了。但是很多时候还是不能正确的获取到真实的验证码内容。

而现在网上也有很多专门的服务,通过接口的形式在线处理验证码问题,精准度还是很不错的,有兴趣的话可以尝试一下。

最后编辑于
?著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 214,172评论 6 493
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,346评论 3 389
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事?!?“怎么了?”我有些...
    开封第一讲书人阅读 159,788评论 0 349
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,299评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,409评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,467评论 1 292
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,476评论 3 412
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,262评论 0 269
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,699评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,994评论 2 328
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,167评论 1 343
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,827评论 4 337
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,499评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,149评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,387评论 1 267
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,028评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,055评论 2 352

推荐阅读更多精彩内容