相关疑难解决方法(0)

c#将pdf转换为html

是否有.dll我可以使用.pdf文件作为输入和.html文件作为输出?我想将.pdf转换为.html.我的同事说,逐步进行,从pdf获取文本/字体/图像/边距/链接等,然后创建具有相同内容的新html文件非常困难.他说这几乎是不可能的.所以我在想 - 如果有一些dll我可以作为参考来做到这一点?

html c# pdf dll

23
推荐指数
3
解决办法
4万
查看次数

如何使用Perl将HTML转换为PDF?

我需要使用Perl将一些HTML报告转换为PDF.这项工作最好的CPAN模块是什么?

html pdf perl

10
推荐指数
2
解决办法
2万
查看次数

在python中将pdf转换为text/html,以便我可以解析它

我有以下示例代码,我从欧洲议会网站上下载了一份特定立法提案的pdf:

编辑:我最终只是获取链接并将其提供给adobes在线转换工具(请参阅下面的代码):

import mechanize
import urllib2
import re
from BeautifulSoup import *

adobe = "http://www.adobe.com/products/acrobat/access_onlinetools.html"

url = "http://www.europarl.europa.eu/oeil/search_reference_procedure.jsp"

def get_pdf(soup2):
    link = soup2.findAll("a", "com_acronym")
    new_link = []
    amendments = []
    for i in link:
        if "REPORT" in i["href"]:
            new_link.append(i["href"])
    if new_link == None:
        print "No A number"
    else:
        for i in new_link:
            page = br.open(str(i)).read()
            bs = BeautifulSoup(page)
            text = bs.findAll("a")
            for i in text:
                if re.search("PDF", str(i)) != None:
                    pdf_link = "http://www.europarl.europa.eu/" + i["href"]
            pdf = urllib2.urlopen(pdf_link)
            name_pdf = …
Run Code Online (Sandbox Code Playgroud)

python pdf parsing text

4
推荐指数
2
解决办法
2万
查看次数

标签 统计

pdf ×3

html ×2

c# ×1

dll ×1

parsing ×1

perl ×1

python ×1

text ×1