RegEx在HTML标记之间提取文本

Sri*_*ram 4 java regex

我正在寻找一个正则表达式,它必须在不同类型的HTML标记之间提取文本.

例如:

<span>Span 1</span> - O/p:跨度1

<div onclick="callMe()">Span 2</div>- O/p:跨度2

<a href="#">HyperText</a>- O/p:超文本

我<([A-Z][A-Z0-9]*)\b[^>]*>(.*?)</\1>从这里找到了这个特别的东西但是这个没有用.

Mik*_*keM 8

您的注释显示您忽略了逃避正则表达式字符串中的反斜杠.

如果你想匹配小写字母添加a-z到字符类或使用Pattern.CASE_INSENSITIVE(或添加(?i)到正则表达式的开头)

"<([A-Za-z][A-Za-z0-9]*)\\b[^>]*>(.*?)</\\1>"
Run Code Online (Sandbox Code Playgroud)

如果标记内容可能包含换行符,则使用Pattern.DOTALL或添加(?s)到正则表达式的开头以打开dotall/singleline模式.