Pytesser设置角色白名单

Min*_*o10 4 python ocr tesseract pytesser

有谁知道如何为Pytesseract设置角色白名单?我希望它只输出Az和0-9.这可能吗?我有以下内容:

img = Image.open('test.jpg')
result = pytesseract.image_to_string(img, config='-psm 6')
Run Code Online (Sandbox Code Playgroud)

我得到其他字符像/为1所以我想限制可能的字符的选项.

小智 12

您可以使用以下行完成此操作.或者您可以设置tesseract的配置文件来执行相同的操作限制字符tesseract正在寻找

pytesseract.image_to_string(question_img, config="-c tessedit_char_whitelist=0123456789abcdefghijklmnopqrstuvwxyz -psm 6")
Run Code Online (Sandbox Code Playgroud)

我相信还有其他方法可以让它发挥作用,但这对我有用.

  • 供将来参考:tessedit_char_whitelist的值区分大小写,因此要捕获aa-zZ0-9,您需要完整的01234567890ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyz` (3认同)
  • @Cole 上述答案仍然有效吗?我尝试了`pyt.image_to_data(im_gray_res, lang='eng', config='-c tessedit_char_whitelist=0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZ --psm 11 --oem 3')`,但仍然得到`|`的结果`I`和`l`对于“我”? (2认同)