相关疑难解决方法(0)

如何自动将pdf表单字段导出到xml

我有一个pdf包含表单字段的文件,需要将数据导出到AUTOMATICALLYxml文件中.这是我为测试创建的示例表单的屏幕:

在此输入图像描述

注意:通过单击手动使用Acrobat Professional 手动导出它Tools > Form > Export Form Data,最后选择xml扩展名进行文件输出.这是我手动导出时得到的结果:

<?xml version="1.0" encoding="UTF-8"?>
<fields>
    <first_name>John</first_name>
    <last_name>Doe</last_name>
</fields>
Run Code Online (Sandbox Code Playgroud)

但是,我需要自动化它,例如使用python脚本,Java实现或一些命令行工具.我可以使用哪些库或工具将表单字段数据导出到xml?该工具或库应该是开源的,我可以将它集成到我的工作流程中.

我已经尝试过python pdfminer库,它帮助我导出pdf文件的静态部分(比如Static form header,First name:Last name:):但是如何导出表单字段数据(在我的情况下是表单字段的内容first_namelast_name)?

编辑:随意下载sample.pdf文件在这里.

java xml acrobat python-2.7 pdf-extraction

10
推荐指数
1
解决办法
2万
查看次数

使用java将PDF转换为CSV

我已经尝试了堆栈溢出和外部的大部分内容

问题:我有一个包含内容和表格的 pdf。我还需要解析表格和内容。

APIs: https : //github.com/tabulapdf/tabula-java 我正在使用tabula-java它忽略了表格单元格内的某些内容和内容没有以正确的方式分离。

我的 PDF 有这样的内容

 DATE :1/1/2018         ABCD                   SCODE:FFFT
                       --ACCEPTED--
    USER:ADMIN         BATCH:RR               EEE
    CON BATCH
    =======================================================================
    MAIN SNO SUB  VALUE DIS %
    R    12   rr1 0125  24.5
            SLNO  DESC  QTY  TOTAL  CODE   FREE
            1     ABD   12   90     BBNEW  -NILL-
            2     XDF   45   55     GHT55  MRP
            3     QWE   08   77     CAT    -NILL-
    =======================================================================
    MAIN SNO SUB  VALUE DIS %
    QW    14   rr2 0122  24.5
            SLNO  DESC  QTY  TOTAL  CODE   FREE
            1     ABD …
Run Code Online (Sandbox Code Playgroud)

java csv pdf tabula

5
推荐指数
1
解决办法
5537
查看次数

标签 统计

java ×2

acrobat ×1

csv ×1

pdf ×1

pdf-extraction ×1

python-2.7 ×1

tabula ×1

xml ×1