Eka*_*ata 5 java file download amazon-s3 amazon-web-services
我有 n 个文件上传到亚马逊 S3,我需要*搜索*这些文件基于其内容中字符串的出现,我尝试了一种从 S3 存储桶下载文件的方法,将输入流转换为字符串,然后搜索中的单词内容,但如果它们超过五到六个文件,则需要花费大量时间来执行上述过程,
他们还有其他方法可以做到这一点,请帮忙提前致谢。
thk*_*ala -5
我不熟悉 Amazon S3,但处理搜索远程文件的一般方法是使用索引,索引本身存储在远程服务器上。这样,每次搜索都将使用索引来推断出相对较少数量的潜在匹配文件,并且只有那些文件将被直接扫描以验证它们是否确实匹配。根据您的搜索词和模式的复杂性,甚至可以完全避免直接文件扫描。
也就是说,我不知道 Amazon S3 是否有一个可供您使用的索引引擎,或者是否有补充库可以为您执行此操作,但这个概念很简单,您应该能够自己完成某些工作,而无需太多操作工作。
编辑:
一般来说,每个文件中存在的标记就是被索引的标记。例如,如果您想搜索“foo bar”,索引将告诉您哪些文件包含“foo”,哪些文件包含“bar”。这些结果的横截面将是同时包含"foo"和"bar"的文件。您必须直接扫描这些文件以选择“foo”和“bar”以正确顺序彼此相邻的文件(如果有)。
无论如何,下载到客户端的数据量将远远少于下载和扫描所有内容,尽管这也取决于文件的结构以及搜索模式。
| 归档时间: |
|
| 查看次数: |
21015 次 |
| 最近记录: |