Python爬虫常用之HtmlParser - Java321技术网

handle_starttag(tag, attrs) ，处理开始标签，比如<div>；这里的attrs获取到的是属性列表，属性以元组的方式展示
　　　　handle_endtag(tag) ，处理结束标签,比如</div>
　　　　handle_startendtag(tag, attrs) ，处理自己结束的标签，如<img />
　　　　handle_data(data) ，处理数据，标签之间的文本
　　　　handle_comment(data) ，处理注释，之间的文本

from html.parser import HTMLParser
class MyHTMLParser(HTMLParser):
def handle_starttag(self, tag, attrs):
"""
recognize start tag, like <div>
:param tag:
:param attrs:
:return:
"""
print("Encountered a start tag:", tag)
def handle_endtag(self, tag):
"""
recognize end tag, like </div>
:param tag:
:return:
"""
print("Encountered an end tag :", tag)
def handle_data(self, data):
"""
recognize data, html content string
:param data:
:return:
"""
print("Encountered some data :", data)
def handle_startendtag(self, tag, attrs):
"""
recognize tag that without endtag, like <img />
:param tag:
:param attrs:
:return:
"""
print("Encountered startendtag :", tag)
def handle_comment(self,data):
"""
:param data:
:return:
"""
print("Encountered comment :", data)
parser = MyHTMLParser()
parser.feed('<html><head><title>Test</title></head>'
'<body><h1>Parse me!</h1><img src = "" />'
'</body></html>')

复制代码

<html>
<head>
<title>Test</title>
</head>
<body>
<h1>Parse me!</h1>
<img src = "" />
<p>A paragraph.</p>
<p class = "p_font">A paragraph with class.</p>
<div>
<p>A paragraph in div.</p>
</div>
</body>
</html>

复制代码

def _attr(attrlist, attrname):
for attr in attrlist:
if attr[0] == attrname:
return attr[1]
return None

复制代码

def handle_data(self, data):
if self.lasttag == 'p':
print("Encountered p data :", data)

复制代码

def __init__(self):
HTMLParser.__init__(self)
self.flag = False
def handle_starttag(self, tag, attrs):
if tag == 'p' and _attr(attrs, 'class') == 'p_font':
self.flag = True
def handle_data(self, data):
if self.flag == True:
print("Encountered p data :", data)

复制代码

def handle_starttag(self, tag, attrs):
if tag == 'p':
print("Encountered p attrs :", attrs)

复制代码

def handle_starttag(self, tag, attrs):
if tag == 'p' and _attr(attrs, 'class'):
print("Encountered p class :", _attr(attrs, 'class'))

复制代码

def __init__(self):
HTMLParser.__init__(self)
self.in_div = False
def handle_starttag(self, tag, attrs):
if tag == 'div':
self.in_div = True
def handle_data(self, data):
if self.in_div == True and self.lasttag == 'p':
print("Encountered p data :", data)

复制代码