使用java从文本文件中提取特定URL

ano*_*428 1 java regex web-crawler text-parsing

我有一个文本文档,其中我有一堆形式的/courses/......./.../.. 网址,从这些网址中,我只想提取那些形式的网址/courses/.../lecture-notes.意思是以开头/courses和结尾的网址/lecture-notes.有没有人知道用正则表达式或字符串匹配这样做的好方法?

aio*_*obe 5

这是另一种选择:

Scanner s = new Scanner(new FileReader("filename.txt"));

String str;
while (null != (str = s.findWithinHorizon("/courses/\\S*/lecture-notes", 0)))
    System.out.println(str);
Run Code Online (Sandbox Code Playgroud)

给出一个filename.txt内容

Here /courses/lorem/lecture-notes and
here /courses/ipsum/dolor/lecture-notes perhaps.
Run Code Online (Sandbox Code Playgroud)

以上片段打印

/courses/lorem/lecture-notes
/courses/ipsum/dolor/lecture-notes
Run Code Online (Sandbox Code Playgroud)