lxml xpath返回一个空列表

jhh*_*Phi 5 python xpath lxml web-scraping

<!DOCTYPE html><html xmlns="http://www.w3.org/1999/xhtml" class="pc chrome win psc_dir-ltr psc_form-xlarge" dir="ltr" lang="en">
<title>Some Title</title>
</html>
Run Code Online (Sandbox Code Playgroud)

如果我跑:

from lxml import etree
html = etree.parse('text.txt')
result = html.xpath('//title')
print(result)
Run Code Online (Sandbox Code Playgroud)

我会得到一个空列表.我想它与命名空间有关,但我无法弄清楚如何解决它.

Jam*_*ner 2

尝试使用 html 解析器创建树。另请注意,如果text.txt是文件,则需要先读取它。

with open('text.txt', 'r', encoding='utf8') as f:
    text_html = f.read()
Run Code Online (Sandbox Code Playgroud)

像这样:

from lxml import etree, html

def build_lxml_tree(_html):
    tree = html.fromstring(_html)
    tree = etree.ElementTree(tree)
    return tree

tree = build_lxml_tree(text_html)
result = tree.xpath('//title')
print(result)
Run Code Online (Sandbox Code Playgroud)