python爬虫如何识别图片验证码？_随笔

python爬虫如何识别图片验证码？

爬虫真的像别人说的那么强大，可以获取很多信息，帮助或者参考别人的内容，补全自己吗？实际上确实是可以实现的，但是大家不了解的是，除了被动让爬虫去爬取，很多网站都可有主动防御技能，比如，现在跟大家说的图片验证问题，爬虫必须得去解决，不然没有办法可以进行下一步，解决 *** 作如下所示：

1、先安装一个pytesseract

2、接着我们就打开一张图片，使用 pytesseract 识别。

代码如下：

captcha = Image.open("captcha1.png")result = pytesseract.image_to_string(captcha)print(result)

输出结果：没有问题。

3、我们在试试其他图片，如下所示

代码所示：

captcha = Image.open("claptcha2.png")result = pytesseract.image_to_string(captcha)print(result)

处理结果是有问题，也许是pytesseract没有办法处理噪点比较大的内容。

4、首先进行图片灰度处理

captcha = Image.open("captcha2.png")result = captcha.convert('L')result.show()

5、在进行二值化

def convert_img(img,threshold):    img = img.convert("L")  # 处理灰度    pixels = img.load()    for x in range(img.width):        for y in range(img.height):            if pixels[x, y] > threshold:                pixels[x, y] = 255            else:                pixels[x, y] = 0    return img

6、调用一下

convert_img(captcha,150）

7、之后再跟第一个图片处理方式一样，就可以解决了哦~

好啦，一般情况下，第一种方式，几行代码就可以处理完成，还有一些情况可以调用第二种方式，如果大家还想了解更多的学习知识，点击进入python学习网即可。

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/zaji/3014317.html

python爬虫如何识别图片验证码？

发表评论

评论列表（0条）