ano*_*428 1 java regex web-crawler text-parsing
我有一个文本文档,其中我有一堆形式的/courses/......./.../..
网址,从这些网址中,我只想提取那些形式的网址/courses/.../lecture-notes.意思是以开头/courses和结尾的网址/lecture-notes.有没有人知道用正则表达式或字符串匹配这样做的好方法?
这是另一种选择:
Scanner s = new Scanner(new FileReader("filename.txt"));
String str;
while (null != (str = s.findWithinHorizon("/courses/\\S*/lecture-notes", 0)))
System.out.println(str);
Run Code Online (Sandbox Code Playgroud)
给出一个filename.txt内容
Here /courses/lorem/lecture-notes and
here /courses/ipsum/dolor/lecture-notes perhaps.
Run Code Online (Sandbox Code Playgroud)
以上片段打印
/courses/lorem/lecture-notes
/courses/ipsum/dolor/lecture-notes
Run Code Online (Sandbox Code Playgroud)