使用TIKA从URL中提取文本

ars*_*nal 7 java apache-tika

是否可以使用Tika从URL中提取文本?任何链接将不胜感激.或者TIKA仅适用于pdf,word和任何其他媒体文档?

fvu*_*fvu 7

检查文档 - 是的,你可以.

例

java -jar tika-app-0.9.jar -t http://stackoverflow.com/questions/6656849/extract-the-text-from-url-using-tika
Run Code Online (Sandbox Code Playgroud)

将显示此页面上的文字.


sur*_*ajz 6

这是清醒的:

InputStream input = new FileInputStream(new File(resourceLocation));
ContentHandler textHandler = new BodyContentHandler();
Metadata metadata = new Metadata();
PDFParser parser = new PDFParser();
parser.parse(input, textHandler, metadata);
input.close();
out.println("Title: " + metadata.get("title"));
out.println("Author: " + metadata.get("Author"));
out.println("content: " + textHandler.toString());
Run Code Online (Sandbox Code Playgroud)

PDFParser您可以使用Tika AutoDetectParser自动处理差异类型的文件,而不是创建一个:

Parser parser = new AutoDetectParser();
Run Code Online (Sandbox Code Playgroud)