`

Jsoup

 
阅读更多
Jsoup官网:https://jsoup.org/

Jsoup中文开发指南:http://www.open-open.com/jsoup/


示例代码抓取微信公众号中的文章简单实现:
package jsoup;

import java.io.IOException;
import java.nio.charset.Charset;
import java.util.List;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.nodes.Node;
import org.jsoup.select.Elements;

public class Test {
	public static void main(String[] args) {
		send2();
	}
	//Parse a document from a String
	public static void send(){
		String html = "<html><head><title>First parse</title></head>"
				  + "<body><p>Parsed HTML into a doc.</p></body></html>";
				Document doc = Jsoup.parse(html);
				System.out.println(doc);
	}
	//Parsing a body fragment
	public static void send1(){
		String html = "<div><p>Lorem ipsum.</p>";
		Document doc = Jsoup.parseBodyFragment(html);
		Element body = doc.body();
		System.out.println(body);
	}
	
	
	//抓取微信文章
	public static void send2(){
		Document doc;
		try {
			String url = "http://mp.weixin.qq.com/s/baaxvXgDVMo8DwnEUO9QVQ";
			doc = Jsoup.connect(url).timeout(3000000).get();
			String title = "";
			//标题   class="rich_media_title" 的标签中的内容就是文章的标题
			Elements rich_media_titles = doc.getElementsByClass("rich_media_title");
			if(null != rich_media_titles && rich_media_titles.size() > 0 ){
				//第一个
				title = rich_media_titles.get(0).html();
			}
			System.out.println("标题是:"+title);
			//抓取文本
			String content = "";
			Elements pses = doc.getElementsByTag("p");
			if(null != pses && pses.size() > 0){
				for (Element element : pses) {
					if(element.hasText()){
						System.out.println(element.text());
					}
				}
			}
			//抓取图片
			Elements imgs = doc.getElementsByTag("img");
			if(null != imgs && imgs.size() > 0){
				for (Element element : imgs) {
					if(element.attr("data-src") != null){
						System.out.println(element.attr("data-src"));
					}
				}
			}
			
			
			
			
		} catch (IOException e) {
			e.printStackTrace();
		}
	}

}

运行结果:
   标题是:这组照片99%的男人看了都会想...只有1%的人会做,有你吗?!
微信号 bopaijs
功能介绍 分享最全面的健身知识.一起来塑造强健的体魄、完美的形体以及强大的意志力!
▲点击上方蓝字,一键关注
如果你是一个男人
无论高矮胖瘦
这组照片都会让你想...
但是只有1%的才会去做
看看有你吗?
▼
20岁之前不漂亮可以怪父母
20岁之后不漂亮要怪自己
▼
男人就要有男人的样子
不要做连自己都讨厌的娘炮
▼
对于男人来说
身材比脸更重要
▼
一个人的身材
可以透露出一个人的修养
▼
健壮,结实,匀称
性感,舔屏...美好的词永远都是在说这样的男人
▼
胖点可爱是别人安慰你
扪心自问,你会和现在的自己搞对象吗?
▼
改变就要从现在开始
多少人都输在等字上面
等工作,等开学,等发工资,等下次,
等有时间,等来了脂肪,等掉了青春
等没了男人的气质
▼
人不能因为胖才开始健身
而是因为不健身才变胖
▼
健身虽然痛苦
改变却可以脱胎换骨
▼
最好的健身时间是8年前
另外一个就是现在
▼
没有改变不了的身体
只有不想改变的人
▼
比你身材差的人都可以逆袭
比你不好的人都在努力
你又有什么理由放弃?
▼
当人忍无可忍的时候
请再忍一忍
每一点改变都在累积
▼
照下镜子,发誓不要再成为镜子里的那个人!
不管为了梦想,为了一个人...
▼
54岁的pete和60岁的steve
男人的一生都有男人味!
这是一种态度
▼
当你想要改变
付诸于行动
不要停止
等结果发生
他们都活出了你想要的样子
该文章作者已设置需关注才可以留言
写留言
写留言
了解留言功能详情
微信扫一扫 关注该公众号

http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRL6qVIg7IibL9B8hn6ib6TzsZecvCegNsOJD7kKQ9yK6VT4qEhC7bDPMA/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyR2IcsaAgAXI7tWf2ibdjhzZXNPhIe09p4VFMmDhaMB8L8wib8xFtHuw6w/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyR9jlMJ9GJqkLXBicMVDe1zEticDAN4MNp2qdG60KZW651HMmIpCIcTKpQ/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyREV7q3icTYFEzoFeHDl4T2nBFWwnZQRTcwl4I8kibjzgcWG3ib23P5bUlA/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRY3SesDdHzMueRyQe2TeFqRj74rbkBp4icPtrtk5lPCLQAqSk5yRW7Yg/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRjNqxITONVwFd5FCQU1bZnMiaRelZaM5Fkp8A5OLW8WgrfwibAoVlH1Ig/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRVH7wqYybe6zoTh0vdRDODaJ8sw6jc5l6OMy94o6XGj7dz8M6zzGMMg/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRBHy7iaqKBqnMxtbGdNpzdSWbiasicgPjZIUVq1JlicKEib5utgT1u3PLPlQ/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRFlRAY894yQ2JiacNTCZKxKoSasJCHp45cYZWDvWTX1csgREt2q0N0ug/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRwRIxkeTCRCFSfmqkYB0NR23JMiam4icP7qd3FFLpKgpjrh5MgNFNUGCA/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRu76Z9VTkEuOjK75fSbiauzMpu3ibgZ0c5QaBcwgL0KVR0iawkqH5oD76w/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRK6ia0kBnNiaG8J7picWa3Bib31nvErKJiajPH8Brc8L3VrQezLJg8qw1P1w/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRITITMtXLtCkTmGmQ81SPOnq8Om53ibY0bDETbTJDq8syiaFVgTgKibPfg/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyR0u3zqiaalibv44cn61ryich53vGGwLpCWI3Oy9ibqBZIFfMXG5W4qdchmg/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRUk04NOe35micrI1POhyFShms3He1hP8JqALH080fDY9XnQ8kOAF2h9A/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRlY6rb3k3Ss2xLe1hKqsLaRI9licic1uEJf6PY7fTx9XZI57aBibw5qB6Q/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRpdhBsTibYgyGUO564GfdibUusKKRP2WDQluw2SboDKXKuFZZq1hknK2g/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRZicw8IoKPIRMuMz4DicBdV8nyWfJXlZoAq16AsD3l6OZPmia6PoSMmEBw/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRd7GrySoPrWDrkRyc034B9Ribicb8CSufJ3ssYt6YjKvXibUHjrCHSxeFA/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRz5fAXSbIoOzv2zYwAcbTWYOdna0Y4iclD0FymILL6YpSZWoUyzDbibjQ/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyR96lvWcHo0aOGgtoYbWrK2cKzJJYic1FqUlG1eGR5a9icX3yh9gtVNMhw/0?wx_fmt=jpeg
http://mmbiz.qpic.cn/mmbiz_jpg/5FWgG57qlRJTTTswPGxYW6zJlo8MhXyRIX2TTgw7bUGMtSSicDKEbFUGx154hzQXJBFFib14WkLfeEqm6a24lK8Q/0?wx_fmt=jpeg






分享到:
评论

相关推荐

    JsoupAPI(jsoup帮助文档)

    **Jsoup API 深入解析** Jsoup 是一个用于处理和解析HTML的Java库,它提供了强大的功能,使得在Java程序中操作HTML文档变得简单而直观。在Jsoup 1.10.2版本中,这个API进一步优化了对HTML的处理能力,提供了丰富的...

    jsoup中文帮助文档

    Jsoup 提供 DOM 风格的方法(如 `getElementById()`, `getElementsByTag()`, `select(String cssQuery)` 等)来遍历 Document 对象并抽取所需数据。例如,你可以通过 CSS 选择器选取元素,然后提取它们的属性、文本...

    jsoup-1.15.3.jar

    jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jar,jsoup-1.15.3.jarjsoup-...

    jsoup-1.14.3-API文档-中文版.zip

    赠送jar包:jsoup-1.14.3.jar; 赠送原API文档:jsoup-1.14.3-javadoc.jar; 赠送源代码:jsoup-1.14.3-sources.jar; 赠送Maven依赖信息文件:jsoup-1.14.3.pom; 包含翻译后的API文档:jsoup-1.14.3-javadoc-API...

    jsoup-1.11.3.jar

    `jsoup-1.11.3-javadoc.jar`包含了该版本的API文档,方便开发者查阅和理解每个方法的功能和用法,而`jsoup-1.11.3-sources.jar`则包含源代码,对于学习和调试Jsoup的内部实现非常有帮助。 Jsoup 的核心功能主要包括...

    使用jsoup获取网页内容并修改

    **使用Jsoup获取网页内容并修改** Jsoup是一款强大的Java库,它允许开发者方便地解析、操作和提取HTML内容。在Android开发中,Jsoup常用于网页数据抓取和页面内容的处理。以下将详细解释如何使用Jsoup来实现这个...

    Jsoup.jar 包及说明文档

    **Jsoup.jar 包及说明文档** Jsoup是一款在Java平台上广泛使用的HTML解析库,它的主要功能是解析HTML文档,并提供了强大的数据提取和操作能力。Jsoup的核心特性在于其能够模拟浏览器的行为,对HTML进行理解和解析,...

    IText、Jsoup jar包

    这两个库在Java开发中都有着广泛的应用,例如,IText常用于报表生成、文档自动化处理,而Jsoup则常见于网页抓取、数据解析以及网页内容的提取。将它们引入项目,可以极大地提高处理文本和文档的效率。在Java环境中,...

    Jsoup 1.5.2 和jsoup 1.6

    Jsoup在Web抓取、数据分析和网页爬虫项目中广泛应用。本文将深入探讨Jsoup 1.5.2和1.6这两个版本的主要特性、变化以及如何在项目中使用它们。 首先,让我们了解Jsoup的基本功能。Jsoup的核心功能包括: 1. **HTML...

    Jsoup-网络爬虫项目

    **Jsoup网络爬虫项目详解** Jsoup是一个Java库,设计用于处理真实世界的HTML,它提供了非常方便的API,用于提取和操作数据,遵循DOM、CSS以及jQuery选择器。这个项目是基于Jsoup来实现的网络爬虫,非常适合初学者...

    jsoup-jsoup-1.6.1.zip

    在jsoup 1.6.1版本中,我们可以看到这个库已经相当成熟,提供了丰富的功能和优化。以下是一些关于jsoup的关键知识点: 1. **HTML解析**:jsoup的核心能力在于它强大的HTML解析机制。它使用了名为"Jsoup Parser"的...

    java org jar包 以及 org.jsoup开发包合一

    Jsoup模仿了DOM解析器的工作方式,但同时也考虑到了性能和易用性,使得在Java中处理网页内容变得更加方便。其主要功能包括: 1. HTML解析:Jsoup可以解析HTML字符串或者从URL加载HTML,生成一个可操作的DOM树。 2. ...

    Jsoup库文件;Jsoup解析Java包

    1. `jsoup.jar`:Jsoup的主要库文件,包含了所有的类和方法,导入此文件即可在项目中使用Jsoup。 2. `README.md`或`README.txt`:文件说明,介绍如何使用Jsoup以及可能的注意事项。 3. `LICENSE`:Jsoup的许可协议,...

    SpringBoot+jsoup爬虫

    **SpringBoot+Jsoup爬虫详解** 在现代Web开发中,数据抓取(或称爬虫)是一项重要的技能,尤其对于数据分析、市场研究和自动化任务。SpringBoot与Jsoup的结合提供了一个高效、灵活的解决方案来实现这个目标。本文将...

    jsoup基于java爬虫项目

    Jsoup的主要功能 1)从一个URL,文件或字符串中解析HTML 2)使用DOM或CSS选择器来查找、取出数据 3)可操作HTML元素、属性、文本 注意:jsoup是基于MIT协议发布的,可放心使用于商业项目。 Jsoup的主要功能 1)...

    Java爬虫Jsoup+httpclient获取动态生成的数据

    本文主要讲述如何利用Java编程语言中的Jsoup库和HttpClient工具包来获取和解析动态生成的数据,特别是那些通过JavaScript动态加载的数据。 ### Java爬虫基础 Java爬虫是指使用Java语言编写的一类程序,这些程序...

    jsoup1.10.3包和jsoupApi帮助文档

    **jsoup1.10.3包和jsoupApi帮助文档** Jsoup是一个非常流行的Java库,用于处理和解析HTML。在IT行业中,特别是在Web爬虫和数据抓取领域,jsoup扮演着至关重要的角色。jsoup1.10.3是这个库的一个稳定版本,提供了...

    org.jsoup.jar

    《深入理解Java库:Jsoup解析与应用》 在Java编程世界中,Jsoup是一个非常重要的库,尤其在处理HTML文档和数据抓取时。标题中的"org.jsoup.jar"是Jsoup库的核心组件,它是Jsoup项目的二进制发布形式,包含了所有...

    jsoup的jar包

    **jsoup库详解** jsoup是一个Java库,它专注于处理HTML和XML文档,提供了一种简单、优雅的方式来抓取和操作网页数据。这个库的名字来源于"JavaScript Object Soup"的缩写,暗示了它能将HTML文档转化为易于操作的...

Global site tag (gtag.js) - Google Analytics