如果我有一个看起来像......的字符串
"<tr><td>123</td><td>234</td>...<td>697</td></tr>"
Run Code Online (Sandbox Code Playgroud)
基本上是一个包含n个单元格的表格行.
python中获取每个单元格值的最简单方法是什么.那就是我只想将值"123","234","697"存储在列表或数组中,或者是最简单的.
当我使用时,我试图使用正则表达式
re.match
Run Code Online (Sandbox Code Playgroud)
我无法找到任何东西.如果我尝试
re.search
Run Code Online (Sandbox Code Playgroud)
我只能得到第一个细胞.但我想得到所有的细胞.如果我不能用n个单元格做这个,你会用固定数量的单元格做到这一点?
如果该标记是更大的标记集的一部分,您应该更喜欢具有HTML解析器的工具.
一个这样的工具是BeautifulSoup.
这是使用该工具找到所需内容的一种方法:
>>> markup = '''"<tr><td>123</td><td>234</td>...<td>697</td></tr>"'''
>>> from bs4 import BeautifulSoup as bs
>>> soup = bs(markup)
>>> for i in soup.find_all('td'):
... print(i.text)
Run Code Online (Sandbox Code Playgroud)
结果:
123 234 697