pycetr: 从html文档中提取文档内容

xiaoming2xiaohong

浏览: 42067 次

最近访客更多访客>>

aaron198

xkq96

huang5203728

13303862966

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

java
pycetr: 从html文档中提取文档内容

pycetr: 从html文档中提取文档内容 java 工作

html文档中通常夹杂着各种广告，相关性链接等，提取正文比较困难。

pycetr是一个开源项目，用python语言实现了html文档的正文提取。算法基于文章

http://www.cs.uiuc.edu/~hanj/pdf/www10_tweninger.pdf

Content Extraction via Tag Ratios

基本思想是将html分成行，计算每行的文本内容和html tag的比值，显然比值越大的，更倾向于是正文内容，而不是广告神马的。

源代码在https://github.com/superisaac/pycetr

实验执行方法为
python -m cetr <url>

由于python的HTMLParser太不健壮，很多网站都无法执行，是件憾事。

0
顶

0
踩

分享到：

[jquery]IE与Chrome下text()方法获取textar ... | Jsp文件中播发视频文件

2012-02-07 13:39
浏览 960
评论(0)
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

(源码)基于C语言的SmartPlugModbus固件项目.zip: # 基于C语言的SmartPlugModbus固件项目 ## 项目简介该项目是一个基于C语言的固件项目，旨在实现一个支持Modbus RTU通信协议的智能设备固件。该固件被设计为与SmartPlugModbus设备配合使用，用于控制和管理多个电源插座，提供过流、欠流、过压、欠压和过热保护，同时监控插座状态和电压、电流等参数。 ## 项目的主要特性和功能 1. Modbus RTU通信协议支持固件实现了Modbus RTU通信协议，允许通过Modbus协议与设备进行通信，包括读取和写入设备参数、状态和控制命令。 2. 多插座控制固件支持控制多个电源插座，包括开启、关闭、查询状态等。 3. 保护功能设备提供过流、欠流、过压、欠压和过热保护，防止设备损坏和安全事故。 4. 参数配置通过Modbus协议，用户可以配置设备的保护参数，如电流、电压限制等。

毕设单片机实战项目基于ESP8266 Mesh SDK开发，通过HSPI与STM32通讯.zip: 【项目资源】：单片机项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

毕业设计物联网实战项目基于龙芯派的物联网食品仓储监测系统.zip: 【项目资源】：物联网项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

(源码)基于嵌入式系统的StackAttack游戏项目.zip: # 基于嵌入式系统的StackAttack游戏项目 ## 项目简介 StackAttack是一个基于嵌入式系统的游戏项目，设计用于SPI TFT彩色液晶显示面板上运行。游戏的核心玩法是操控一个名为“Claw”（爪子）的游戏角色，在由格子组成的地图上移动并抓取箱子。玩家通过操纵杆控制游戏角色，成功抓取并移动箱子到目标位置后得分。游戏地图由二维数组表示，每个格子代表一个位置。当玩家成功将所有箱子移动到目标行时，游戏结束。 ## 项目的主要特性和功能 1. 游戏角色控制玩家通过操纵杆控制Claw（爪子）角色移动。 2. 地图和箱子管理游戏地图由二维数组表示，每个格子代表一个位置。箱子在游戏地图上的位置由数组中的值表示。 3. 游戏逻辑包括角色的移动、箱子的抓取和移动、得分计算等。 4. 图形显示使用SPITFTILI9341图形库控制SPI TFT显示屏，实现游戏的图形输出。 5. 暂停功能游戏支持暂停功能，方便玩家随时暂停游戏。

【嵌入式系统与计算机视觉】基于STM32、OpenCV和CNN的车牌识别系统：社区车辆管理与收费应用: 内容概要：本文档提供了基于STM32、OpenCV和卷积神经网络的车牌识别系统的完整代码示例。系统通过摄像头捕捉视频流，利用OpenCV进行图像处理（如灰度化、二值化、轮廓检测等）以定位车牌区域，并使用预训练的ONNX模型对车牌字符进行识别。之后，系统将识别到的车牌号与预先存储在CSV文件中的居民车牌数据库进行匹配，以判断车辆是否为小区居民所有，从而实现对外来车辆的收费管理。; 适合人群：对嵌入式系统开发、计算机视觉和深度学习感兴趣的开发者，尤其是有一定C++编程基础和技术背景的研究人员或工程师。; 使用场景及目标：①适用于社区、停车场等场所的车辆管理；②帮助开发者理解车牌识别的基本流程，包括图像预处理、车牌定位、字符识别以及与数据库的交互；③提供一个可扩展的基础框架，便于后续优化和功能增加。; 阅读建议：读者应确保具备基本的OpenCV库使用经验和C++编程能力。在学习过程中，建议同时参考相关文献资料，深入理解每个步骤背后的原理，并尝试调整参数或替换模型以提高识别精度。此外，还需准备相应的硬件设备（如摄像头）和软件环境（如安装OpenCV库），以便实际运行代码并观察效果。

fregefffewfw: efwfw

基于S7-200 PLC与MCGS组态的智能交通灯控制系统设计与实现: 内容概要：本文详细介绍了利用西门子S7-200 PLC和MCGS组态软件构建智能交通灯控制系统的方法。首先阐述了系统的硬件配置，包括PLC的选择、IO分配、光电开关的应用等。接着深入探讨了梯形图编程的核心逻辑，如定时器嵌套、车流判断、紧急模式处理等。同时，还讲解了MCGS组态界面的设计要点，如动态指示灯、车流统计曲线、急停按钮等功能的实现。此外，文中分享了一些调试经验和优化技巧，如信号隔离、通信参数设置、夜间模式优化等。适合人群：对PLC编程和工业自动化感兴趣的工程技术人员、高校相关专业学生。使用场景及目标：适用于城市交通管理部门进行智能交通灯系统的规划与实施，旨在提高交通效率，减少拥堵。通过学习本文，读者能够掌握PLC编程的基本方法和MCGS组态软件的使用技巧。其他说明：文中提供了详细的接线图、梯形图代码片段和组态界面截图，便于读者理解和实践。同时，作者还分享了许多实际操作中的注意事项和经验教训，有助于初学者少走弯路。

毕业设计物联网实战项目基于物联网的气象台站系统.zip: 【项目资源】：物联网项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

VB珠宝首饰店管理系统设计(源代码+系统+开题报告+答辩PPT).zip: 摘要面对信息时代的机遇与挑战，利用高科技手段来提高企业的管理水平无疑是一条行之有效的途径。利用计算机管理可以最大限度的发挥准确、快捷、高效等作用, 在越来越激烈的珠宝行业中，计算机管理技术对珠宝首饰公司的服务管理提供强有力的支持。因此，利用全新的计算机网络和珠宝首饰管理系统，已成为提高珠宝首饰公司的管理效率，改进服务水准的重要手段之一。本系统应用Visual Basic 6.0 中文版开发前台，用Microsoft Access 作后台服务器，采用客户机/服务器（C/S）管理思想来对珠宝首饰进销存管理。关键词：管理水平，管理效率，服务水准，珠宝首饰管理系统，客户机/服务器，管理思想

稀疏分解方法在信号去噪中的应用研究_内含源码数据论文.zip: 稀疏分解方法在信号去噪中的应用研究_内含源码数据论文.zip

2008年领导力发展年度报告: 本书由吉姆·诺埃尔和大卫·多蒂奇编辑，旨在探讨领导力发展领域的最新趋势和实践。书中不仅提供了领导力发展领域的历史回顾，还挑战了组织对领导力发展的战略视角，详细介绍了如何培养全球领导者，并提供了关于领导力发展方法、策略和系统、高潜力人才发展、高层管理参与、有效学习方法以及领导力指标等方面的深入案例研究和理论分析。此外，书中还探讨了创新的领导力发展方法，并对未来的发展趋势进行了展望。

一种基于 QR 二维码的彩色二维码编码译码设计及其软件实现.zip: 一种基于 QR 二维码的彩色二维码编码译码设计及其软件实现.zip

毕设单片机实战项目基于机智云和 esp8266-12F WIFI 模块的智能插座控制安卓APP.zip: 【项目资源】：单片机项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

毕业设计物联网实战项目基于mqttd-centos7-v2.3.11.zip 配置的emqtt服务器，配套金大万翔物联网管理平台.zip: 【项目资源】：物联网项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

【光子晶体模拟】基于COMSOL弱形式PDE的三维光子晶体能带结构计算与优化：电磁场切向连续性处理及带隙分析系统设计使用COMSOL: 内容概要：本文详细介绍了使用COMSOL Multiphysics的弱形式接口对三维光子晶体进行数值模拟的方法和技巧。文章通过具体的代码示例，解释了如何构建光子晶体的介电常数分布、设置弱形式PDE、处理电磁场切向连续性、应用Floquet周期边界条件以及特征值求解等关键步骤。特别强调了弱形式接口相比传统物理场接口的优势，如灵活性和对复杂边界的处理能力。文中还分享了一些实用的经验和注意事项，如布洛赫边界条件的实现、特征值求解器参数的优化配置以及网格划分的技巧。适合人群：具备一定电磁学和数值模拟基础的研究人员或工程师，尤其是对光子晶体仿真感兴趣的读者。使用场景及目标：①理解并掌握COMSOL弱形式接口在光子晶体仿真中的应用；②学习如何通过弱形式设置处理复杂的电磁场问题；③提高对光子晶体能带结构和带隙特性的认识；④掌握特征值求解和网格划分的最佳实践。阅读建议：由于本文涉及较多的具体代码和物理概念，建议读者在阅读过程中结合COMSOL软件进行实际操作，同时查阅相关电磁理论书籍以加深理解。此外，对于文中提到的一些具体参数设置和技巧，可以通过尝试不同的配置来巩固所学知识。

机械工程PT5000汽轮机滑动轴承系统模拟试验台：动态行为与振动控制研究: 内容概要：PT5000汽轮机滑动轴承系统模拟试验台是一个类似于电厂汽轮机发电机的缩小模型，旨在帮助用户获取汽轮机转子动态行为和滑动轴承油膜现象的实际经验，并研究振动控制方法。该试验台模拟两级涡轮机（低压和中压），每级转子两侧各有8个叶片，共计16个叶片。通过电机驱动而非涡轮发电机，可以进行启停机测试，识别共振现象。试验台还支持多种实验，如不平衡/现场动平衡、轴不对中实验、摩擦实验、油膜故障试验、轴颈轴承实验以及根据油压和温度进行的转子动力学试验。试验台配备了多种传感器和控制系统，包括电涡流传感器、温度传感器、压力传感器等，用于监测和记录实验数据。适合人群：从事汽轮机设计、制造、维护的技术人员，以及相关专业的高校师生和研究人员。使用场景及目标：①研究汽轮机转子的动态行为和滑动轴承的油膜现象；②进行振动控制方法的研究；③模拟再现油膜涡动转和油膜震荡，研究其控制条件；④进行不平衡、不对中、摩擦等常见故障的模拟和分析；⑤通过调整油压、温度和预加载力，研究轴的行为变化。其他说明：该试验台不仅适用于教学和科研，还可用于工业领域的培训和技术验证。试验台具有丰富的配置和可选配件，可以根据具体需求进行定制。试验台的机械和电气参数详细列出，确保用户能够全面了解设备性能。

知识图谱，电影领域，知识图谱构建: 电影类型知识图谱构建，包含相关数据集

(源码)基于C++的Minimal BASIC解释器.zip: # 基于C++的Minimal BASIC解释器 ## 项目简介本项目是一个C++实现的Minimal BASIC解释器。该解释器能够解释并执行一些基本的BASIC语言命令，如赋值、打印、输入、条件跳转等。用户可以通过命令行交互地输入命令，或者编写一个按行数升序依次运行的大程序。 ## 项目的主要特性和功能 1. 解释执行能够解释并执行简单的BASIC语言命令。 2. 变量定义与赋值支持定义变量并为其赋值。 3. 打印输出支持将表达式的值打印到控制台。 4. 输入支持从用户获取输入值并赋值给变量。 5. 条件跳转支持基于条件的跳转语句。 6. 注释支持注释语句，使程序更加易读。 ## 安装使用步骤 1. 准备环境确保你的开发环境已经安装了C++编译器，如GCC。 3. 编译使用CMake工具编译源代码。 4. 运行编译成功后，运行可执行文件，即可与解释器交互。 ## 注意事项

自适应神经进化编程解决暂态稳定性最优潮流问题: 本文提出了一种结合自适应进化编程（AEP）与神经网络的方法，用于解决暂态稳定性约束最优潮流（TSCOPF）问题。AEP在优化过程中能够自动调整种群大小，以获得TSCOPF问题的解决方案。神经网络的嵌入能够降低由暂态稳定性约束引起的计算负担。文章通过在IEEE 30节点系统上测试，使用两种不同的燃料成本函数，验证了AEP方法在搜索全局解方面的有效性，并且当结合神经网络后，显著提高了计算速度。此外，本文还对神经网络的架构进行了研究和讨论。

毕设单片机实战项目基于ESP8266组建的智能安防系统.zip: 【项目资源】：单片机项目适用于从基础到高级的各种项目，特别是在性能要求较高的场景中，比如操作系统开发、嵌入式编程和底层系统编程。如果您是初学者，可以从简单的控制台程序开始练习；如果是进阶开发者，可以尝试涉及硬件或网络的项目。【项目质量】：所有源码都经过严格测试，可以直接运行。功能在确认正常工作后才上传。【适用人群】：适用于希望学习不同技术领域的小白或进阶学习者。可作为毕设项目、课程设计、大作业、工程实训或初期项目立项。【附加价值】：项目具有较高的学习借鉴价值，也可直接拿来修改复刻。对于有一定基础或热衷于研究的人来说，可以在这些基础代码上进行修改和扩展，实现其他功能。【沟通交流】：有任何使用上的问题，欢迎随时与博主沟通，博主会及时解答。鼓励下载和使用，并欢迎大家互相学习，共同进步。 # 注意 1. 本资源仅用于开源学习和技术交流。不可商用等，一切后果由使用者承担。 2. 部分字体以及插图等来自网络，若是侵权请联系删除。

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

pycetr: 从html文档中提取文档内容

评论

发表评论

相关推荐

[jquery]IE与Chrome下text()方法获取textarea值不一致

Jsp文件中播发视频文件

gson

【转】深入浅出Node.js 持续更新中

Java NIO ByteBuffer

iBATIS报ORA-01745: 无效的主机/绑定变量名 异常

remount failed: Operation not permitted

javascript图片库

length &amp; substr

linux命令

详解C#中访问私有成员

iPhone消息推送机制实现与探讨

一边播放RM文件 一边播放相应的PPT文件 编程实现

做了几天关于地理信息系统的软件测试工作

项目管理规范 RUP管理实施中角色的划分

newInstance() 和 new 有什么区别？

Websphere6.1静默安装（转）

ios UITableViewCell 文字缩进

Melkman凸包算法的Java实现

Java网络编程

最近访客更多访客>>

iBATIS报ORA-01745: 无效的主机/绑定变量名异常

length & substr

一边播放RM文件一边播放相应的PPT文件编程实现