天涯论坛

 找回密码
 立即注册
搜索
查看: 94|回复: 2

HtmlParse:一款超轻量级的HTML文件解析和爬取工具

[复制链接]

2969

主题

412

回帖

9117万

积分

论坛元老

Rank: 8Rank: 8

积分
91179203
发表于 2024-6-29 15:54:08 | 显示全部楼层 |阅读模式

HtmlParse 是一款基于windwos平台的HTML文档解析工具,可快速构建DOM树,从而容易实现网页元素的爬取工作。DOM树便是一个HTML文档的节点树,每一个节点由:标签(Tag)、属性(Attribute)、文本(Text)三个值来描述。

所说的HTML文档解析,指的便是怎样构建一颗DOM树,仅有成功构建出DOM树,才有可能进行后续的数据爬取和分析工作。显然,构建DOM树是比较繁杂的过程,由于不是每一个HTML文档都会严格根据规范来书写,因此呢解析过程必须拥有必定容错能力。另外,解析效率是一个必须思虑原因便是说最好经过一次文档扫描就可创立起DOM树,而不是反复扫描。

下面是HtmlParse介绍。

1、工具特点

1、绿色纯天然,任何第三方依赖库,文件体积不到150K;

2、解析速度快,拥有必定的HTML语法容错能力,可快速将HMTL文档解析为DOM树;

3、基于命令行参数,可经过区别参数获取指定TAG的属性值和文本内容,从而实现网页爬取功能;

4、可将爬取数据输出为json格式,方便第三方程序进一步分析和运用

5、可爬取script脚本到指定的js文件中;

下载位置http://softlee.cn/HtmlParse.zip

2、运用办法

HtmlParse HtmlPathFile -tag TagName [-attr] [Attribute] [-o] [JsonPathFile]

解析指定的HTML文档,并将文档中指定的标签及属性输出到指定文件中。

HtmlPathFile:必选参数,要解析的HTML文档路径名,倘若文件路径中有空格,可运用双引号将文件路径包括

-tag:必选参数,用于指定要抓取的HTML标签名叫作

-attr:可选参数,用于指定标签的属性值,倘若不指定,则返回该标签的所有属性值;

-o:可选参数,用于指定抓取内容输出的文件,可将抓取的内容保留为json格式的文件。 倘若该参数不指定,则进行掌控台输出。 倘若抓取的是script、style则会保留为js格式文件。

倘若要抓取doctype,可运用-tag doctype,将全部doctype内容获取。此时将会忽略-attr指定的任何属性值。

3、举例说明

1、爬取网页中所有超链接

HtmlParse c:/sina.html -tag a -attr href -o c:/sina.json

解析C盘下的sina.html文档,并提取该文档中的所有超链接到sina.json文件中。其中**-tag a -attr href**,用于指定获取超链接标签a的href属性。

2、爬取网页中所有照片链接

HtmlParse c:/sina.html -tag img -attr src -o c:/sina.json

解析C盘下的sina.html文档,并提取该文档中的所有照片链接到sina.json文件中。

3、爬取网页中所有脚本

HtmlParse c:/sina.html -tag script -o c:/sina.js

解析C盘下的sina.html文档,并提取该文档中的所有脚本函数到sina.js文件中。

4、输出内容

倘若经过-o参数指定输出文件,则会生成一个json格式的文档。

TagName为爬取的标签名叫作例如超链接的a,其值是一个json数组,数组中的每一个内容为Json对象,每一个Json对象,有属性和文本形成倘若-attr 指定了要爬取的属性,则AttrName为指定的属性名叫作例如href或src。text为该标签的文本内容,有些标签不存在文本内容,例如img、meta等,则该值为空。json格式如下:

{ "TagName": [ {"AttrName":"AttrValue1", "text":"text1"} {"AttrName":"AttrValue1", "text":"text2"} ] }

下面是一个sina网页的所有超链接json

{ "a": [{ "href": "javascript:;", "text": "设为首页" }, { "hre




上一篇:请问,有什么能在手机上打html代码的软件?
下一篇:举荐几款好用的手机编程APP!
回复

使用道具 举报

3058

主题

2万

回帖

9913万

积分

论坛元老

Rank: 8Rank: 8

积分
99139064
发表于 2024-10-8 00:29:26 | 显示全部楼层
回顾过去一年,是艰难的一年;展望未来,是辉煌的一年。
回复

使用道具 举报

3044

主题

2万

回帖

9910万

积分

论坛元老

Rank: 8Rank: 8

积分
99109054
发表于 2024-10-23 12:22:07 | 显示全部楼层
系统提示我验证码错误1500次 \~゛,
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

站点统计|Archiver|手机版|小黑屋|天涯论坛 ( 非经营性网站 )|网站地图

GMT+8, 2024-11-22 13:29 , Processed in 0.101552 second(s), 21 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.