JAVA中使用Htmlparse解析HTML文档

浏览 7829 次

锁定老帖子主题：JAVA中使用Htmlparse解析HTML文档该帖已经被评为新手帖
作者	正文
yymmiinngg 等级: 性别: 文章: 15 积分: 130 来自: 北京	发表时间：2008-01-09 相关推荐: JAVA中使用Htmlparse解析HTML文档，使用htmlparse遍历出HTML文档的所有超链接（标记） html文档解析程序,Htmlparse解析HTML文档（例） java xpath 解析html_Java爬虫利器HTML解析工具-Jsoup html parser java库_Java解析HTML之HTMLParser使用与详解 JAVA中利用Htmlparse解析HTM… 更多相关推荐 import java.util.HashMap; import java.util.Map; import org.htmlparser.Node; import org.htmlparser.NodeFilter; import org.htmlparser.Parser; import org.htmlparser.tags.LinkTag; import org.htmlparser.util.NodeList; import com.yao.http.HttpRequester; import com.yao.http.HttpRespons; /** * JAVA中使用Htmlparse解析HTML文档，使用htmlparse遍历出HTML文档的所有超链接（<a>标记）。 * * @author YYmmiinngg / public class Test { public static void main(String[] args) { try { / 首先我们先使用HttpRequester类和HttpRespons类获得一个HTTP请求中的数据（HTML文档）。可以从(http://download.csdn.net/source/321516)中下载htmlloader，该库中有上述类；或从我的《JAVA发送HTTP请求，返回HTTP响应内容，实例及应用》一文中摘取上述两JAVA类的代码。htmlparse可以从(http://download.csdn.net/source/321507)中下载 */ Map<String, String> map = new HashMap<String, String>(); HttpRequester request = new HttpRequester(); HttpRespons hr = request.sendGet("http://www.baidu.com"); Parser parser = Parser.createParser(hr.getContent(), hr .getContentEncoding()); try { // 通过过滤器过滤出<A>标签 NodeList nodeList = parser .extractAllNodesThatMatch(new NodeFilter() { //实现该方法,用以过滤标签 public boolean accept(Node node) { if (node instanceof LinkTag)//<A>标记 return true; return false; } }); // 打印 for (int i = 0; i < nodeList.size(); i++) { LinkTag n = (LinkTag) nodeList.elementAt(i); System.out.print(n.getStringText() + " ==>> "); System.out.println(n.extractLink()); } } catch (Exception e) { e.printStackTrace(); } } catch (Exception e) { e.printStackTrace(); } } } 声明：ITeye文章版权属于作者，受法律保护。没有作者书面许可不得转载。推荐链接
返回顶楼

racnow 等级: 初级会员性别: 文章: 91 积分: 30 来自: 杭州	发表时间：2008-07-25 哇靠，用不着到处发吧！！！我想找点这方面的资料看都不行！！！一搜就搜到你这篇！！！！！！
返回顶楼	回帖地址 1 0 请登录后投票

racnow 等级: 初级会员性别: 文章: 91 积分: 30 来自: 杭州	发表时间：2008-07-25 日，又搜到！！！！！！！！！！！！！！！！！！！！！！！！！！！
返回顶楼	回帖地址 0 0 请登录后投票

论坛首页 → 入门技术版

跳转论坛: