如何提取网页中链接和标题的正则表达式

正则匹配提取文档各级标题--标题提取 从政府报告等文档中直接提取标题复制到xmind思维导图中。exec内的赋值是局部变量。修改list勾选标题格式。中文标点需要单独转码匹配。 阅读详情

 

1.远程抓取:

using System.Text.RegularExpressions;
using System.IO; 

WebClient   w   =   new   WebClient();  
  byte[]   bytes   =   w.DownloadData("http://news.sina.com.cn/");  
  string   strHtml   =   System.Text.Encoding.Default.GetString(bytes);  
   
  string   p   =@"/<a.*href/s*=/s*(?:""(?<url>[^""]*)""|'(?<url>[^']*)'|(?<url>[^/>^/s]+)).*/>(?<title>[^/<^/>]*)/<[^/</a/>]*/a/>";  
   
  Regex   reg   =   new   Regex(p,   RegexOptions.IgnoreCase);  
  MatchCollection   ms   =   reg.Matches(strHtml);  
   
  Console.WriteLine("总共抓取了:{0}条链接。",ms.Count);  
   
  foreach(Match   m   in   ms)  
  {  
  Console.WriteLine("{0}/n{1}/n",   m.Groups["title"].Value,   m.Groups["url"].Value);  
  }  

2.本地测试:

using System.Text.RegularExpressions;
using System.IO; 

 string mystr=@"<A HREF=""http://www.csdn.net"">aaaa</A>";
            string p = @"/<a.*href/s*=/s*(?:""(?<url>[^""]*)""|'(?<url>[^']*)'|(?<url>[^/>^/s]+)).*/>(?<title>[^/<^/>]*)/<[^/</a/>]*/a/>";
            Regex reg = new Regex(p, RegexOptions.IgnoreCase);
            MatchCollection ms = reg.Matches(mystr);
            foreach(Match   m   in   ms)  
              {  
                  MessageBox.Show (m.Groups["title"].Value);
                  MessageBox.Show(m.Groups["url"].Value);  
              }  

python爬取虎嗅网首页新闻超链接、图片链接标题 要求:爬取该网站首页内容,即获取每一个超链接、图片链接标题,以.CSV存储(一行就是一个新闻的超链接、图片链接标题) 文章目录用不上的思考过程正文1.观察新闻页面源码2.编写代码提取信息3.观察首页源码并编写正则表达式源码 建议直接点正文???? 用不上的思考过程 1.新闻超链接存在于a的herf属性中,/article/408795.html,前面要加上https://www.huxiu.com 2.图片链接暂时还不知道存在哪 https://img.huxiucdn.com/article/cove 阅读详情

相关推荐

正则表达式,提取网页中的链接地址

<td u00a0class=cate width u201d45%” style=”word-break:break-all”>       <a>江门市蓬江区凤彩工艺厂</a>         <br> 代码如上.我请问如何用正则表达式,把”http://j

正则表达式获取网页链接

设计目的要使获取的资源尽可能的被直接利用,以提高后续程序运行的效率。网页上的链接主要可以分为两类:1. 链接2. 图片链接 首先来分析链接,该链接基本可以分为以下四种情况:1 普通链接链接到外部网页 链接到内部网页链接到图片空链接 获取该类型的连接时用如下的表达式:(?]*/s*(href)=)[^>]+?(?="|)(?#>[^>]+)//获得//(?//(?

K3的专栏 1万+

正则表达式获取链接标题

标题2

github_66624340的博客 452

正则获取文本中链接

之前也写过一篇,不知道什么原因,原贴被删除,这里重新补上。 从文本中获取网址正则表达式获取url, 正表达式获取文本中的url正则获取文本中的链接第一种:[A-Za-z]+://[A-Za-z0-9_\-\+~.:?&@=/%#,;\{\}\\(\)\[\]\|\*\!\\]+ 第二种:[a-zA-z]+://[^\s]*

WowCool 2657

php用正则表达式获取网站标题内容

已知网站网址,用php获取网站的内容。 编写正则表达式。 用preg_match_all函数获取标题内容。 1 $url='http://www.m-ivi.com'; 2 $content=file_get_contents($url); 3 $match='/<title>.*<\/title>/i...

weixin_34267123的博客 427

提取网页链接标题正则表达式

1.远程抓取: using System.Text.RegularExpressions;using System.IO;  WebClient   w   =   new   WebClient();     byte[]   bytes   =   w.DownloadData("http://news.sina.com.cn/");     string   strHtml   =   Sy

ranmer的专栏 1536

在C#中如何利用正则表达式来获取网页中的所有链接链接标题

在C#中如何利用正则表达式来获取网页中的所有链接链接标题,急!谢谢。

Jason1500的专栏 1614

java转换链接地址,JAVA获取网页所有网址链接标题

/ 通过指定URL,获取网页上所有的“链接URL链接文字”。package catch_url;import java.io.BufferedReader;import java.io.InputStreamReader;import java.net.URL;import java.util.regex.Matcher;import java.util.regex.Pattern;publ...

weixin_36277530的博客 598

asp.net正则表达式提取网址标题、图片等

<br />asp.net正则表达式提取网页网址标题、图片实例以及过滤所有HTML标签实例(1)2011-01-21 21:11<br />无论你用什么语言,正则表达式的处理方法都是非常灵活、高效的,尤其是对某些字符串的抓取、过滤方面,更显其优势。<br /> <br /> <br />1、asp.net正则表达式提取网址标题、图片等<br />例如,有如下的字符串:<br /><li><a href="http://www.webkaka.com/blog/archives/how-to-add-li

程序与人生 1765

PHP正则提取链接地址及标题,PHP正则表达式提取链接及其标题

WebjxCom提示:PHP正则表达式提取链接及其标题.有这么一段HTML,比较不规则的,如果要提取其中的链接地址链接名称,怎么弄?//HTML$str = '歌曲列表中文金曲榜•轻音乐';利用正则表达式是最简单的,其它的办法,偶米去想。。。$pat = '/(.*?)/i';preg_match_all($pat, $str, $m);输出方法:print_r($m[2]);print_r...

weixin_28689969的博客 218

java 爬取网页内容。 标题、图片等

package com.fh.util; import java.io.BufferedReader; import java.io.IOException; import java.io.InputStream; import java.io.InputStreamReader; import java.net.URL; import java.net.URLConnection; import java.util.ArrayList; import java.util.List; import ja.

qfchenjunbo的博客 625

java 正则网址_java正则表达式匹配网页所有网址链接文字的示例

import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;import java.net.URL;import java.util.ArrayList;import java.util.HashMap;...

weixin_39880895的博客 762

正则表达式匹配网页标签内容

推荐一个在线正则表示试测试网站:http://tool.oschina.net/regex/# 1,得到网页上的链接地址: string matchString = @"&lt;a[^&gt;]+href=\s*(?:'(?&lt;href&gt;[^']+)'|""(?&lt;href&gt;[^""]+)""|(?&lt;href&gt;[^&gt;\s]+))

qq_40604853的博客 9957

python 正则表达式 re 爬取网页及分析总结

来源于此为了方便自己查找,进行了简化与整理。 本文涉及内容如下: 获取< tr>< /tr>标签之间内容 获取< a href…>< /a>超链接之间内容 获取URL最后一个参数命名图片或传递参数 爬取网页中所有URL链接 爬取网页标题title两种方法 定位table位置并爬取属性-属性值 过滤< span>< /span>等标签 获取< script>< /script>等标签内容 通过replace函数过

因为我是ZR 的博客 6405

java 获取网页标题_java 网页页面抓取标题正文

import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;import java.net.URL;import java.util.ArrayList;import java.util.HashMap;...

weixin_42300435的博客 687

java读取(正则表达式分析)网页内容

  由于原来的“插入代码”复制方法要把转义符过滤掉,所以下面用文本粘贴:package com.xiaofeng.picup;import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;impor

ice_spar的专栏 5413

python实验selenium爬取网页链接

真的是自己找点资料好痛苦,这个东西是我自己想出来的,已经验证了可以使用,反正我会一点就立刻发出来一点 from selenium import webdriver #打开一个浏览器 from selenium.webdriver.common.by import By import re,time from urllib.request import urlopen from bs4 import BeautifulSoup from lxml import etree browser =

m0_55234643的博客 1927
上一篇: 打开另存为,属性打印等14个JS代码
下一篇: order by 与 group by 同时使用的情况
flashasp
博客等级 码龄24年 35粉丝 42原创
评论 2
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值