标签: pdf

主存储的容量优化/重复数据删除选项

我正在探索更有效地利用我们的主存储的选项。

我们当前的 NAS 是带有 HP Storageworks MSA20 的 HP ProLiant DL380 G5 和另一个我不确定它是什么的磁盘架。

我们的绝大多数文件都是 PDF 文件(数以亿计),具有高度的相似性。

George Crump专家意见中(参考Data DomainDedupe Central),在关于粒度的部分中,他说:“要有效地重复数据删除,需要使用可变长度段在子文件级别完成。”

这很难找到,但正是我需要的。大多数重复数据删除选项似乎都是基于块的,这对于最小化备份占用的空间非常有效,因为只有更改的块会被存储,但是基于块的技术不会在我们的块内找到位于不同偏移处的相同段。 PDF。

前几天我遇到了Ocarina Networks,它看起来正是我们所需要的。

Storage Switzerland 的实验室报告概述 - 主存储重复数据删除将 Ocarina Networks 和NetApp比较为“主存储重复数据删除领域的两大领导者”。

理想情况下,我们希望继续使用我们当前的 NAS,但效率更高。

我遇到的另一个解决方案是Storwize,它似乎对单个文件执行内联压缩,并与重复数据删除解决方案集成。

还有哪些其他解决方案和信息资源?

optimization storage network-attached-storage pdf deduplication

5
推荐指数
1
解决办法
653
查看次数

在 Ubuntu 上索引 PDF 文件

我正在 Ubuntu 中寻找一种解决方案,该解决方案可以为 PDF(和 ps?)文件编制索引以供以后搜索。

标准是:

  1. 兼容性:通常提取文本会有所不同,具体取决于用于创建 PDF 的软件。某些 PDF 也可以“锁定”,我想人们应该尊重这一点。
  2. 搜索功能:通配符、正则表达式、“模糊”匹配。
  3. 搜索速度

在我的情况下,我想索引学术期刊文章的文件夹,因此要求无论使用什么软件创建 PDF,它都能始终如一地工作。我已经在使用参考管理器,所以不想替换它。

例如:一个好的 Beagle 前端,以及一个允许它索引 PDF 的插件将是完美的。

ubuntu pdf indexing

5
推荐指数
1
解决办法
4537
查看次数

从命令行将 SharePoint Wiki 导出为 PDF

我们在办公室使用 SharePoint wiki* 作为我们 IT 运营的知识库。最近我们进行了一次灾难恢复练习,我们意识到我们的计划中有一个关键漏洞:如果您的说明手册因为某些服务离线而停机,您如何恢复服务?

无论如何,我们确实意识到 wiki 角度绝对是我们想要保留的东西,而是我们应该探索一种方法来创建 wiki 的离线备份,使用我们应该能够在没有任何知识的情况下设置的通用软件轻松读取该备份维基。

那么,有没有人知道一个很好的实用程序,可以轻松地从命令行获取 SharePoint wiki 并将其转储到 PDF/Word/RTF/[INSERT HUMAN FRIENDLY FORMAT]?

*-是的,有更好的解决方案。但是这很容易并且使用了现有的基础设施,并且通常可以完成我们需要它做的事情。

sharepoint pdf wiki wss-3.0 export

5
推荐指数
1
解决办法
4431
查看次数

我应该提供压缩的 PDF 吗?

我想知道是否有一个通用的经验法则来启用 PDF 文件的 gzip 压缩。我使用 NGINX,但我认为这对 Apache 用户也有帮助。

谢谢。

http pdf gzip

4
推荐指数
1
解决办法
1072
查看次数

我将如何创建 PDF 打印服务器?

我有一些装有 WindowsXP 的旧工作站,几乎可以安装任何东西,一个大约有 80 人的办公室,一个 wintel 环境,一个现有的 Server 2003 文件/打印机服务器,每个人都希望能够打印 PDF,最好是彩色的,最好选择为这些 PDF 添加密码加密。哦,Adobe 的 PDF 打印服务器的许可费用高得令人望而却步。

我宁愿不必编写代码,我更像是一个脚本编写者而不是一个有能力的程序员。所以基于 PHP 或 Perl 的解决方案可能是首选,尽管我愿意尝试几次。

最理想的是,我想要一个系统,其中 PDF 处理由这些旧工作站中的一个(或多个)处理。任何人都可以安装的打印服务器上的共享 PDF 打印机会将发送到它的作业定向到这个旧工作站,该工作站将处理文件、创建 PDF 并在需要时添加安全性,然后将生成的文件放入个人网络目录中打印文件的人。

文件名并不重要,为了防止处理重复项,我宁愿它们只是基于日期和时间的字符串。

我应该查看哪些类型的库或脚本?如果你做过这样的事情,你是怎么做的?我应该远离什么,为什么?

scripting windows-server-2003 windows-xp pdf print-server

4
推荐指数
1
解决办法
3846
查看次数

打印 PDF - 从 1Mb PDF 文件打印 50Mb ..

我有这个只有 1Mb-30 页的 PDF 文件。

因此,当我将其发送到打印机(HP 1320)时,我看到计算机向打印机发送了近 50Mb。这怎么可能?我知道 PDF 是压缩格式,但是当我尝试命令行程序 pdf2ps 时 - 我可以生成只有 2.5Mb 的 postscript 。我不认为它压缩到 50/1 会是什么.. 有什么想法吗?

该文件是由php tcpdf生成的,它与它有什么关系。PDF有什么神奇的功能吗?

php printing pdf

4
推荐指数
1
解决办法
8570
查看次数

pdftk:就地编辑 PDF 文件

使用PDFtk Server,我想旋转 PDF 文件 90\xcb\x9a 并将其保存到位,以覆盖输入文件。我尝试了以下操作,但失败了,可能是因为它在文件完成读取之前开始写入。

\n\n
pdftk in.pdf cat 1-endright output - > in.pdf\n
Run Code Online (Sandbox Code Playgroud)\n

pdf

4
推荐指数
1
解决办法
4015
查看次数

如何在 Windows 10 上的命令行上将纯文本文件转换为 PDF,而无需付费?

我想要的只是将具有比例字体(monospace/Courier New/Fixedsys/whatever)和固定列宽(80 个字符)的 .txt 转换为正确的 PDF 文档,以便可以将其打印或共享为PDF。

要求:

  1. 它必须在命令行上运行(无手动步骤)。
  2. 必须是免费的。
  3. 必须实际工作!最后一点非常重要。

多年来我为此尝试了许多开源工具,尽管我曾经天真地认为我可以将带有半高级CSS的HTML转换为PDF——现在对我来说这似乎很可笑——而我的要求现在无限小了,当我拥有现有最基本的文档类型时:纯文本!

pandoc看起来非常有前途,但是在投入了无数个小时,尝试了它支持的每个“PDF 转换器引擎”以及一百万种不同的参数变体之后,它根本不会尊重我选择的字体,而是退回到某些默认字体完全搞乱了生成的 PDF。因此,我必须得出结论,它是另一个损坏的工具,根本无法兑现将纯文本转换为 PDF 的承诺。

这似乎是一个基本的、常见的任务,我几乎期望它由操作系统而不是某些第三方软件提供,但显然不是......

虽然不是必需的,但如果它也可以在其他操作系统上运行,那就更好了。

windows command-line-interface terminal pdf convert

3
推荐指数
1
解决办法
3741
查看次数

从 Microsoft Office Word 导出为 pdf

许多人可能知道 Microsoft Office(至少 2003 年)不支持导出 pdf 的诞生,那里有什么好的软件可以轻松地将 word 文档导出为 pdf 格式。

pdf microsoft-office

2
推荐指数
1
解决办法
347
查看次数

如何自动化PDF打印

我希望将 PDF 从 Windows 2008 服务器自动打印到 IPP 打印机。

  • 是否有直接内置于操作系统中的 PDF 打印选项?
  • 有没有人有使用良好的 PDF 打印命令行实用程序的经验?
  • 是否可以使用 Adob​​e Reader 自动执行此操作?

automation printing pdf

2
推荐指数
1
解决办法
2728
查看次数