是否有.dll我可以使用.pdf文件作为输入和.html文件作为输出?我想将.pdf转换为.html.我的同事说,逐步进行,从pdf获取文本/字体/图像/边距/链接等,然后创建具有相同内容的新html文件非常困难.他说这几乎是不可能的.所以我在想 - 如果有一些dll我可以作为参考来做到这一点?
我有以下示例代码,我从欧洲议会网站上下载了一份特定立法提案的pdf:
编辑:我最终只是获取链接并将其提供给adobes在线转换工具(请参阅下面的代码):
import mechanize
import urllib2
import re
from BeautifulSoup import *
adobe = "http://www.adobe.com/products/acrobat/access_onlinetools.html"
url = "http://www.europarl.europa.eu/oeil/search_reference_procedure.jsp"
def get_pdf(soup2):
link = soup2.findAll("a", "com_acronym")
new_link = []
amendments = []
for i in link:
if "REPORT" in i["href"]:
new_link.append(i["href"])
if new_link == None:
print "No A number"
else:
for i in new_link:
page = br.open(str(i)).read()
bs = BeautifulSoup(page)
text = bs.findAll("a")
for i in text:
if re.search("PDF", str(i)) != None:
pdf_link = "http://www.europarl.europa.eu/" + i["href"]
pdf = urllib2.urlopen(pdf_link)
name_pdf = …Run Code Online (Sandbox Code Playgroud)