用python解析html--SGMLParser -

pako

浏览: 311108 次
性别:
来自: 上海

最近访客更多访客>>

lizerealize

teli_eurydice

laosg

ghh0000

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

用python解析html--SGMLParser

博客分类：

python

HTML Python .net

sgmllib.py 包含一个重要的类: SGMLParser。SGMLParser 将 HTML 分解成有用的片段，比如开始标记和结束标记。一旦它成功地分解出某个数据为一个有用的片段，它会根据所发现的数据，调用一个自身内部的方法。为了使用这个分析器，您需要子类化 SGML- Parser类，并且覆盖这些方法。

SGMLParser类里面包含了很多内部方法，开始读取html后，遇到相应的数据就会调用其对应的方法，最重要的方法有三个：

start_tagname(self, attrs)
end_tagname(self)
handle_data(self, text)
tagname就是标签名称，比如当遇到<pre>，就会调用start_pre，遇到</pre>，就会调用 end_pre，attrs即为标签的参数，以[(attribute, value), (attribute, value), ...]的形式传回，我们要做的就是在其子类重载自己感兴趣标签对应的函数。

一个经典的例子：

from sgmllib import SGMLParser
class URLLister(SGMLParser):
    self.urls = []
    def start_a(self, attrs):                     
        href = [v for k, v in attrs if k=='href'] 
        if href:
            self.urls.extend(href)

顾名思义，这个类的作用就是把html中的所有连接（<a>标签）中的地址（href属性的值）提取出来，放到一个list里面，很实用的功能。^^

比如处理下面的html：

<tr>
<td height="207" colspan="2" align="left" valign="top" class="normal">
<p>Damien Rice - 《0》 </p>
<a href="http://galeki.xy568.net/music/Delicate.mp3">1. Delicate</a><br />
<a href="http://galeki.xy568.net/music/Volcano.mp3">2. Volcano</a><br />
<a href="http://galeki.xy568.net/music/The Blower's Daughter.mp3">3. The Blower's Daughter</a><br />
<a href="http://galeki.xy568.net/music/Cannonball.mp3">4. Cannonball </a><br />
<a href="http://galeki.xy568.net/music/Older Chests.mp3">5. Order Chests</a><br />
<a href="http://galeki.xy568.net/music/Amie.mp3">6. Amie</a><br />
<a href="http://galeki.xy568.net/music/Cheers Darlin'.mp3">7. Cheers Darling</a><br />
<a href="http://galeki.xy568.net/music/Cold Water.mp3">8. Cold water</a><br />
<a href="http://galeki.xy568.net/music/I Remember.mp3">9. I remember</a><br />
<a href="http://galeki.xy568.net/music/Eskimo.mp3">10. Eskimo</a></p>
</td>
</tr>

很乱对吧？下面让举个例子利用URLLister提取出上面mp3下载的地址：

date="上面那一堆…………"
lister=URLLister()
lister.feed(date)
用feed()把要处理的html传递给对象实体，然后我们来看看处理结果：

print lister.urls
显示：

['http://galeki.xy568.net/music/Delicate.mp3',
'http://galeki.xy568.net/music/Volcano.mp3',
"http://galeki.xy568.net/music/The Blower's Daughter.mp3",
'http://galeki.xy568.net/music/Cannonball.mp3',
'http://galeki.xy568.net/music/Older Chests.mp3',
'http://galeki.xy568.net/music/Amie.mp3',
"http://galeki.xy568.net/music/Cheers Darlin'.mp3",
'http://galeki.xy568.net/music/Cold Water.mp3',
'http://galeki.xy568.net/music/I Remember.mp3',
'http://galeki.xy568.net/music/Eskimo.mp3']
好了，是不是很方便？现在我们知道了如何处理标签中的属性，那么如何处理标签包含的文字呢？就是上面列出的handle_data(self, text)，当遇到标签内的内容，就会调用这个函数，传入的text自然就是标签内的内容了，不过，如何筛选出感兴趣标签内的内容呢？比如上面歌曲的列表，这时候就要配合start_tagname、end_tagname，用做标记的方法来达到这个目的：

class ListName(SGMLParser):
    is_a=""
    name=[]
    def start_a(self, attrs):
        self.is_a=1
    def end_a(self):
        self.is_a=""
    def handle_data(self, text):
        if self.is_a:
                self.name.append(text)

这里添加了一个is_a标记，再在handle_date中添加一个if，也就是说，仅仅在a标签内，才会把标签里的内容加到name[]里去。

看看结果：

listname=ListName()
listname.feed(date)
print listname.name

显示:

['1.Delicate', '2.Volcano', "3.The Blower's Daughter",
'4.Cannonball ', '5.Order Chests', '6.Amie',
'7.Cheers Darling', '8.Cold water', '9.I remember',
'10.Eskimo']
OK，搞定～

SGMLParser内置的方法不仅仅只有这三个，还有处理注释的handle_comment，还有处理声明的handle_decl等等等等，不过使用方法和上面的基本相同，不再多写了。

分享到：

[转]Python 网络爬虫 | 太弱了,写个calculator写了2天...

2010-02-09 11:42
浏览 17043
评论(2)
分类:编程语言
查看更多

2 楼郭玉成 2013-02-19

一定要有SGMLParser.__init__(self) 否则初学者会迷糊的！

1 楼 obamaxys2011 2012-09-27

学习了，非常感谢

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

用python解析html--SGMLParser

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

用python解析html--SGMLParser

评论

发表评论

相关推荐

一句话反射shell

微信公共平台框架-python(支持多账号)

进程管理工具 supervisor

tornado 问题小计

django1.4 问题记录

聊聊 tornado 的异步回调

小谈django 的 cookie和session

小记 django 1.4的变化

使用redisco轻松将python内置数据类型存入redis内

python使用redis 神器 ---redisco（一）

redis set轻松做排行榜应用

永久修改python默认的字符编码为utf-8

ubuntu 上安装pycurl

使用Twisted Application 框架

用twisted创建tcp socket长链接amf server服务

twisted:调用deferredlist多线程并发执行任务然后收集结果

对twisted 中deferred异步的理解

twisted简单实现多线程，轮询，后台daemon运行

《django web开发指南》在v1.2.4版本上的出入

django.utils._os 中 safe_join 函数 windows下总报ValueError异常

最近访客更多访客>>