频道导航

正则表达式 – 用于从html页面提取数据的正则表达式

2020-08-20 正则表达式前端之家

前端之家收集整理的这篇文章主要介绍了正则表达式 – 用于从html页面提取数据的正则表达式，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

我想从html页面中提取所有锚标签.我在 Linux中使用它.

lynx --source http://www.imdb.com | egrep "<a[^>]*>"

但是这没有按预期工作,因为结果包含不需要的结果

<a class="amazon-affiliate-site-name" href="http://www.fabric.com">Fabric</a><br>

我想要的

<a href >...</a>

有什么好办法吗？

解决方法

如果grep中有-P选项以便它接受PCRE模式,那么你应该能够使用更好的正则表达式.有时像*这样的最小量词？帮助.而且,你得到整个输入线,而不仅仅是匹配本身;如果grep有-o选项,它将仅列出匹配的部分.

egrep -Po '<a[^<>]*>'

如果您的grep没有这些选项,请尝试

perl -00 -nle 'print $1 while /(<a[^<>]*>)/gi'

现在越过线边界.

要对HTML进行真正的解析,要求正则表达式比您希望在命令行中输入要复杂得多. Here’s one example和here’s another.这些可能无法说服你尝试非正则表达式方法,但它们至少应该告诉你在一般情况下比在特定情况下更难.

这个答案显示了为什么all things are possible,but not all are expedient.

上一篇：如果使用正则表达式连续出现1个以上下一篇：正则表达式 – 使用正则表达式去除

猜你在找的正则表达式相关文章

常用正则表达式-手机号、身份证、邮箱

一、校验数字的表达式 1 数字：^[0-9]*$ 2 n位的数字：^d{n}$ 3 至少n位的数字：^d{n,}$ 4...

作者：前端之家时间：2021-01-10

JS正则表达式详解

正则表达式非常有用，查找、匹配、处理字符串、替换和转换字符串，输入输出等。下面整理一...

作者：前端之家时间：2020-12-29

组内正则培训记录

0. 注：不同语言中的正则表达式实现都会有一些不同。下文中的代码示例除特别说明的外，都...

作者：前端之家时间：2020-12-20

高级正则表达式技术（Python版）

正则表达式是从信息中搜索特定的模式的一把瑞士军刀。它们是一个巨大的工具库，其中的...

作者：前端之家时间：2020-07-22

史上最全最常用的正则表达式

一、校验数字的表达式数字：^[0-9]*$ n位的数字：^\d{n}$ 至少n位的数字：^\d{n,...

作者：前端之家时间：2020-07-22

正则表达式工具

作者：前端之家时间：2020-07-22

正则表达式初步

作者：前端之家时间：2020-07-22

分享5个可视化的正则表达式编辑工具

　　正则表达式使用单个字符串来描述、匹配一系列符合某个句法规则的字符串。在很多文本编...

作者：前端之家时间：2020-07-22

分享5个可视化的正则表达式编辑工具

正则表达式使用单个字符串来描述、匹配一系列符合某个句法规则的字符串。在很多文本编辑器...

作者：前端之家时间：2020-07-22

[知识积累]--正则表达式记忆表

在工作中常常遇到正则表达式问题，有时候又会忘记这则的语法。下面就分享一份正则表达式记...

作者：前端之家时间：2020-07-22

编程分类

算法设计模式多媒体技术正则表达式 Elasticsearch Flink Hadoop IDE

最新文章