我还是Tesseract OCR的新手,在我的脚本中使用它后发现它对于我试图从中提取文本的图像有一个相对较大的错误率.我遇到了Tesseract培训,据说可以降低您使用的特定字体的错误率.我遇到了一个网站(http://ocr7.com/),这是一个由Anyline提供支持的工具,可以对您指定的字体进行所有培训.所以我收到了一个.traineddata文件,我不太清楚如何处理它.任何人都可以解释我与这个文件有什么关系吗?或者我应该学习如何以手动方式进行Tesseract训练,根据Anyline网站可能需要一天的工作.提前致谢.
Gab*_*cia 13
我制作了一个视频教程,解释了最新版 Tesseract(LSTM 模型)的过程,希望对您有所帮助。https://www.youtube.com/watch?v=TpD76k2HYms
use*_*235 10
对于仍然要阅读此内容的任何人,您可以使用此工具获取您想要的任何字体的训练数据文件.之后,在tessdata文件夹中移动训练的数据文件.要使用Python中的新字体或任何其他语言的tesseract(我认为?)lang = "Font"作为第二个参数放在image_to_string函数中.它显着提高了准确性,但仍然可以犯错误.或者您可以通过本指南了解如何手动训练tesseract以获取新字体:http://pretius.com/how-to-prepare-training-files-for-tesseract-ocr-and-improve-characters-recognition/.