小编M.R*_*ama的帖子

用图像而不是字体训练 tesseract 4

我有一些关于为 tesseract 4 制作 tiff/box 文件的问题。在 TrainingTesseract 4.00 文档中写道:

制作盒子文件 与基础 Tesseract 一样,可以选择从字体渲染合成训练数据,或标记一些预先存在的图像(例如古代手稿)。

但它没有解释如何使用预先存在的图像进行训练。

我想在 tesseract 4 (lstm) 中训练波斯语。我有一些来自古代手稿的图像,想用图像和文本而不是字体进行训练。所以我不能使用text2image命令。我知道旧格式的盒子文件不适用于 LSTM 训练。

  1. 如何为 tessearct 4 lstm 制作 tif/box 然后标记它们以及如何更改 tesseract 命令?
  2. 我是否应该使用其他工具来生成框文件(鉴于波斯语是从右到左)?
  3. 我应该使用微调还是从头开始训练?

tesseract

10
推荐指数
1
解决办法
1万
查看次数

标签 统计

tesseract ×1