我有一个pdf包含表单字段的文件,需要将数据导出到AUTOMATICALLYxml文件中.这是我为测试创建的示例表单的屏幕:

注意:通过单击手动使用Acrobat Professional 手动导出它Tools > Form > Export Form Data,最后选择xml扩展名进行文件输出.这是我手动导出时得到的结果:
<?xml version="1.0" encoding="UTF-8"?>
<fields>
<first_name>John</first_name>
<last_name>Doe</last_name>
</fields>
Run Code Online (Sandbox Code Playgroud)
但是,我需要自动化它,例如使用python脚本,Java实现或一些命令行工具.我可以使用哪些库或工具将表单字段数据导出到xml?该工具或库应该是开源的,我可以将它集成到我的工作流程中.
我已经尝试过python pdfminer库,它帮助我导出pdf文件的静态部分(比如Static form header,First name:和Last name:):但是如何导出表单字段数据(在我的情况下是表单字段的内容first_name和last_name)?
编辑:随意下载sample.pdf文件在这里.
我已经尝试了堆栈溢出和外部的大部分内容
问题:我有一个包含内容和表格的 pdf。我还需要解析表格和内容。
APIs:
https : //github.com/tabulapdf/tabula-java
我正在使用tabula-java它忽略了表格单元格内的某些内容和内容没有以正确的方式分离。
我的 PDF 有这样的内容
DATE :1/1/2018 ABCD SCODE:FFFT
--ACCEPTED--
USER:ADMIN BATCH:RR EEE
CON BATCH
=======================================================================
MAIN SNO SUB VALUE DIS %
R 12 rr1 0125 24.5
SLNO DESC QTY TOTAL CODE FREE
1 ABD 12 90 BBNEW -NILL-
2 XDF 45 55 GHT55 MRP
3 QWE 08 77 CAT -NILL-
=======================================================================
MAIN SNO SUB VALUE DIS %
QW 14 rr2 0122 24.5
SLNO DESC QTY TOTAL CODE FREE
1 ABD …Run Code Online (Sandbox Code Playgroud)