相关疑难解决方法(0)

如何自动将pdf表单字段导出到xml

我有一个pdf包含表单字段的文件,需要将数据导出到AUTOMATICALLYxml文件中.这是我为测试创建的示例表单的屏幕:

在此输入图像描述

注意:通过单击手动使用Acrobat Professional 手动导出它Tools > Form > Export Form Data,最后选择xml扩展名进行文件输出.这是我手动导出时得到的结果:

<?xml version="1.0" encoding="UTF-8"?>
<fields>
    <first_name>John</first_name>
    <last_name>Doe</last_name>
</fields>

Run Code Online (Sandbox Code Playgroud)

但是,我需要自动化它,例如使用python脚本,Java实现或一些命令行工具.我可以使用哪些库或工具将表单字段数据导出到xml？该工具或库应该是开源的,我可以将它集成到我的工作流程中.

我已经尝试过python pdfminer库,它帮助我导出pdf文件的静态部分(比如Static form header,First name:和Last name:):但是如何导出表单字段数据(在我的情况下是表单字段的内容first_name和last_name)？

编辑:随意下载sample.pdf文件在这里.

java xml acrobat python-2.7 pdf-extraction

Mic*_*ael

2014 01-23

10
推荐指数

1
解决办法

2万
查看次数

将 .pdf 转换为 .txt

这个问题在 Stackoverflow 上并不新鲜，但我很确定我遗漏了一些明显的东西。

我正在尝试将一些 .pdf 文件转换为 .txt 文件，以便挖掘它们的文本。我的方法基于这个优秀的脚本。.pdf 文件中的文本不是由图像组成的，因此不需要 OCR。

# Load tm package
library(tm)

# The folder containing my PDFs
dest <- "./pdfs"

# Correctly installed xpdf from http://www.foolabs.com/xpdf/download.html

file.exists(Sys.which(c("pdfinfo", "pdftotext")))
[1] TRUE TRUE

# Delete white spaces from pdfs' names
sapply(myfiles, FUN = function(i){
  file.rename(from = i, to =  paste0(dirname(i), "/", gsub(" ", "", basename(i))))
})

# make a vector of PDF file names
myfiles <- list.files(path = dest, pattern = "pdf",  full.names = …

Run Code Online (Sandbox Code Playgroud)

pdf r tm

Wor*_*ice

2017 08-31

5
推荐指数

1
解决办法

2907
查看次数