频道导航

perl 处理HTML

2020-09-11 Perl 前端之家

前端之家收集整理的这篇文章主要介绍了perl 处理HTML，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

perl_html

Table of Contents

1 perl代码中的web处理

1 perl代码中的web处理

1.1 常用模块

Mojo::UserAgent WWW::Mechanize anyevent::http LWP

1.2 基本过程

扒站最基本的：经过一个网页，把页面上的链接都解析出来放到一个数组里，把页面上的表单解析出来放到一个散列里，并且hidden字段自动填好，你只需填剩下的字段。下面，把我用到的最基本的东西总结在下面：

1.3 获取并解析网页

使用LWP::Simple模块的get方法下载网页

然后使用HTML::FormatText创建新的格式器

格式器只能处理已解析的HTML，所以我们使用HTML::TreeBuilder解析HTML

已经解析的HTML位于$tree_{builder对象中，所以在这个对象上使formatter} 对象的format方法，把网页的格式设置为普通文本，并输出。

 1:  use LWP::Simple;
 2:  HTML::Treebuilder;
 3:  HTML::FormatText;
 4:  
 5:  $html = get("http://www.cpan.org/");  
 6:  $formatter = HTML::FormatText->new;
 7:  $tree_builder =HTML::TreeBuilder->new;
 8:  $tree_builder->parse($html);
 9:  $text = $formatter->format($tree_builder);
10:  print $text;

上面的方法是perl技术内幕中提到的方法。

Date: 2013-05-12 16:44:00 CST

Author: gaorongchao

Org version 7.8.11 with Emacs version 24

Validate XHTML 1.0

上一篇：perl中语句种类下一篇：perl基础

猜你在找的Perl相关文章

漫谈 Perl 的 web 应用开发框架

忍不住在 PerlChina 邮件列表中盘点了一下 Perl 里的 Web 应用框架（巧的是 PerlBuzz 最近...

作者：前端之家时间：2020-08-13

perl中bless的理解

bless有两个参数：对象的引用、类的名称。类的名称是一个字符串，代表了类的类型信息，这...

作者：前端之家时间：2020-08-13

PERL GB2312 UTF-8 编码转换

gb2312转Utf的方法： use Encode; my $str = "中文"; $str_cnsoftware = encode(&...

作者：前端之家时间：2020-08-13

perl 计算硬盘利用率

perl 计算硬盘利用率，以%来查看硬盘资源是否存在IO消耗cpu资源情况；部份代码参考了...

作者：前端之家时间：2020-08-13

1 简单变量 Perl 的 Hello World 是怎么写的呢？请看下面的程序： #!/usr/bin/perl print ...

作者：前端之家时间：2020-08-13

Perl 中的正则表达式

正则表达式是 Perl 语言的一大特色，也是 Perl 程序中的一点难点，不过如果大家能够很好的...

作者：前端之家时间：2020-08-13

Perl和Shell区别

在学习Perl和Shell时，有很多人可能会问这样一个问题，到底先学习哪个或者学习哪个更好！ ...

作者：前端之家时间：2020-08-13

Perl命令行应用介绍

Perl 有很多命令行参数. 通过它, 我们有机会写出更简单的程序. 在这篇文章里我们来了解...

作者：前端之家时间：2020-08-13

perl的特殊变量

转自： http://bbs.chinaunix.net/thread-1191868-1-1.html# 让你的perl代码看起来更像per...

作者：前端之家时间：2020-08-13

Perl BackConnectShell + Rootlab t00l

2009-02-02 13:07 #!/usr/bin/perl # D.O.M TEAM - 2007 # anonyph; arp; ka0x; xarnuz # ...

作者：前端之家时间：2020-08-13

编程分类

PHP Java Java SE Python C#C&C++Ruby VB asp.Net Go Perl netty Django Delphi Jsp .NET Core Spring Flask Springboot SpringMVC Lua Laravel Mybatis Asp Groovy ThinkPHP Yii swoole

最新文章