Python正则表达式 - 提取每个表格单元格内容

Rei*_*rne 1 python regex

可能重复:
RegEx匹配除XHTML自包含标记之外的开放标记

如果我有一个看起来像......的字符串

"<tr><td>123</td><td>234</td>...<td>697</td></tr>"
Run Code Online (Sandbox Code Playgroud)

基本上是一个包含n个单元格的表格行.

python中获取每个单元格值的最简单方法是什么.那就是我只想将值"123","234","697"存储在列表或数组中,或者是最简单的.

当我使用时,我试图使用正则表达式

re.match
Run Code Online (Sandbox Code Playgroud)

我无法找到任何东西.如果我尝试

re.search 
Run Code Online (Sandbox Code Playgroud)

我只能得到第一个细胞.但我想得到所有的细胞.如果我不能用n个单元格做这个,你会用固定数量的单元格做到这一点?

ber*_*nie 5

如果该标记是更大的标记集的一部分,您应该更喜欢具有HTML解析器的工具.
一个这样的工具是BeautifulSoup.
这是使用该工具找到所需内容的一种方法:

>>> markup = '''"<tr><td>123</td><td>234</td>...<td>697</td></tr>"'''
>>> from bs4 import BeautifulSoup as bs
>>> soup = bs(markup)
>>> for i in soup.find_all('td'):
...     print(i.text)
Run Code Online (Sandbox Code Playgroud)

结果:

123
234
697