是否可以使用Tika从URL中提取文本?任何链接将不胜感激.或者TIKA仅适用于pdf,word和任何其他媒体文档?
检查文档 - 是的,你可以.
例
java -jar tika-app-0.9.jar -t http://stackoverflow.com/questions/6656849/extract-the-text-from-url-using-tika
Run Code Online (Sandbox Code Playgroud)
将显示此页面上的文字.
这是清醒的:
InputStream input = new FileInputStream(new File(resourceLocation));
ContentHandler textHandler = new BodyContentHandler();
Metadata metadata = new Metadata();
PDFParser parser = new PDFParser();
parser.parse(input, textHandler, metadata);
input.close();
out.println("Title: " + metadata.get("title"));
out.println("Author: " + metadata.get("Author"));
out.println("content: " + textHandler.toString());
Run Code Online (Sandbox Code Playgroud)
PDFParser您可以使用Tika AutoDetectParser自动处理差异类型的文件,而不是创建一个:
Parser parser = new AutoDetectParser();
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
6200 次 |
| 最近记录: |