提取网页中链接和标题的正则表达式

python爬取虎嗅网首页新闻超链接、图片链接标题 要求:爬取该网站首页内容,即获取每一个超链接、图片链接标题,以.CSV存储(一行就是一个新闻的超链接、图片链接标题) 文章目录用不上的思考过程正文1.观察新闻页面源码2.编写代码提取信息3.观察首页源码并编写正则表达式源码 建议直接点正文???? 用不上的思考过程 1.新闻超链接存在于a的herf属性中,/article/408795.html,前面要加上https://www.huxiu.com 2.图片链接暂时还不知道存在哪 https://img.huxiucdn.com/article/cove 阅读详情
1.远程抓取: using System.Text.RegularExpressions;using System.IO;  WebClient   w   =   new   WebClient();     byte[]   bytes   =   w.DownloadData("http://news.sina.com.cn/");     string   strHtml   =   System.Text.Encoding.Default.GetString(bytes);         string   p   =@"/<a.*href/s*=/s*(?:""(?<url>[^""]*)""|'(?<url>[^']*)'|(?<url>[^/>^/s]+)).*/>(?<title>[^/<^/>]*)/<[^/</a/>]*/a/>";         Regex   reg   =   new   Regex(p,   RegexOptions.IgnoreCase);     MatchCollection   ms   =   reg.Matches(strHtml);         Console.WriteLine("总共抓取了:{0}条链接。",ms.Count);         foreach(Match   m   in   ms)     {     Console.WriteLine("{0}/n{1}/n",   m.Groups["title"].Value,   m.Groups["url"].Value);     }   2.本地测试: using System.Text.RegularExpressions;using System.IO;   string mystr=@"<A HREF=""aaaahttp://www.csdn.net"">aaaa</A>";            string p = @"/<a.*href/s*=/s*(?:""(?<url>[^""]*)""|'(?<url>[^']*)'|(?<url>[^/>^/s]+)).*/>(?<title>[^/<^/>]*)/<[^/</a/>]*/a/>";            Regex reg = new Regex(p, RegexOptions.IgnoreCase);            MatchCollection ms = reg.Matches(mystr);            foreach(Match   m   in   ms)                 {                     MessageBox.Show (m.Groups["title"].Value);                  MessageBox.Show(m.Groups["url"].Value);                 }
正则表达式爬取链接标题 1.爬取中国大数据首页的链接标题 2.出现好多错误,特别是正则表达式#coding:utf-8 import re import urllib #获取网页 def getHtml(url): page=urllib.urlopen(url) html=page.read() return html #用正则匹配相应的链接标题 def getText(html): 阅读详情

相关推荐

利用正则获取当前网页所有链接

<!DOCTYPE html> <html> <head> <meta charset="utf-8" /> <title></title> <link rel="stylesheet" type="text/css" href="./css/Test.css"/> </head> <body> 友情链接 <ol> <li><a hre

weixin_48732879的博客 912

正则提取html6,C# 正则获取网页内容, 抓取html源代码里的 title

C# 正则获取网页内容, 抓取html源代码里的 titleusing System.Text.RegularExpressions;static void Main(string[] args){// 注意文本编码, 建议选择utf-8格式编码, 要不容易出现乱码string content = System.IO.File.ReadAllText("html源代码.txt");// 建立正则匹...

weixin_39717121的博客 298

c#正则获取html里面a标签href的值

获取单个a中href的值:   string str = "&lt;a href=\"http://www.itsve.com\"&gt;下载&lt;/a&gt;"; string reg = @"&lt;a[^&gt;]*href=([""'])?(?&lt;href&gt;[^'""]+)\1[^&gt;]*&

weixin_34150830的博客 767

使用正则表达式 提取 html中 【title】【title】之间的字段

使用正则表达式 提取 html中 <title></title> 的字段

qu6zhi 3357

如何提取网页链接标题正则表达式

 1.远程抓取:using System.Text.RegularExpressions;using System.IO; WebClient   w   =   new   WebClient();     byte[]   bytes   =   w.DownloadData("http://news.sina.com.cn/");     string   strHtml   =

1250

在C#中如何利用正则表达式获取网页中的所有链接链接标题

在C#中如何利用正则表达式获取网页中的所有链接链接标题,急!谢谢。

Jason1500的专栏 1613

java转换链接地址,JAVA获取网页所有网址链接标题

/ 通过指定URL,获取网页上所有的“链接URL链接文字”。package catch_url;import java.io.BufferedReader;import java.io.InputStreamReader;import java.net.URL;import java.util.regex.Matcher;import java.util.regex.Pattern;publ...

weixin_36277530的博客 598

asp.net正则表达式提取网址、标题、图片等

<br />asp.net正则表达式提取网页网址、标题、图片实例以及过滤所有HTML标签实例(1)2011-01-21 21:11<br />无论你用什么语言,正则表达式的处理方法都是非常灵活、高效的,尤其是对某些字符串的抓取、过滤方面,更显其优势。<br /> <br /> <br />1、asp.net正则表达式提取网址、标题、图片等<br />例如,有如下的字符串:<br /><li><a href="http://www.webkaka.com/blog/archives/how-to-add-li

程序与人生 1765

PHP正则提取链接地址及标题,PHP正则表达式提取链接及其标题

WebjxCom提示:PHP正则表达式提取链接及其标题.有这么一段HTML,比较不规则的,如果要提取中的链接地址链接名称,怎么弄?//HTML$str = '歌曲列表中文金曲榜•轻音乐';利用正则表达式是最简单的,其它的办法,偶米去想。。。$pat = '/(.*?)/i';preg_match_all($pat, $str, $m);输出方法:print_r($m[2]);print_r...

weixin_28689969的博客 218

java 正则网址_java正则表达式匹配网页所有网址链接文字的示例

import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;import java.net.URL;import java.util.ArrayList;import java.util.HashMap;...

weixin_39880895的博客 762

java 爬取网页内容。 标题、图片等

package com.fh.util; import java.io.BufferedReader; import java.io.IOException; import java.io.InputStream; import java.io.InputStreamReader; import java.net.URL; import java.net.URLConnection; import java.util.ArrayList; import java.util.List; import ja.

qfchenjunbo的博客 625

正则表达式匹配网页标签内容

推荐一个在线正则表示试测试网站:http://tool.oschina.net/regex/# 1,得到网页上的链接地址: string matchString = @"&lt;a[^&gt;]+href=\s*(?:'(?&lt;href&gt;[^']+)'|""(?&lt;href&gt;[^""]+)""|(?&lt;href&gt;[^&gt;\s]+))

qq_40604853的博客 9957

python 正则表达式 re 爬取网页及分析总结

来源于此为了方便自己查找,进行了简化与整理。 本文涉及内容如下: 获取< tr>< /tr>标签之间内容 获取< a href…>< /a>超链接之间内容 获取URL最后一个参数命名图片或传递参数 爬取网页中所有URL链接 爬取网页标题title两种方法 定位table位置并爬取属性-属性值 过滤< span>< /span>等标签 获取< script>< /script>等标签内容 通过replace函数过

因为我是ZR 的博客 6405

java 获取网页标题_java 网页页面抓取标题正文

import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;import java.net.URL;import java.util.ArrayList;import java.util.HashMap;...

weixin_42300435的博客 687

java读取(正则表达式分析)网页内容

  由于原来的“插入代码”复制方法要把转义符过滤掉,所以下面用文本粘贴:package com.xiaofeng.picup;import java.io.BufferedReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;impor

ice_spar的专栏 5413

python实验selenium爬取网页链接

真的是自己找点资料好痛苦,这个东西是我自己想出来的,已经验证了可以使用,反正我会一点就立刻发出来一点 from selenium import webdriver #打开一个浏览器 from selenium.webdriver.common.by import By import re,time from urllib.request import urlopen from bs4 import BeautifulSoup from lxml import etree browser =

m0_55234643的博客 1927

抓取分析网页的类源代码

抓取分析网页的类。 主要功能有: 1、提取网页的纯文本,去所有html标签javascript代码 2、提取网页链接,包括hrefframe及iframe 3、提取网页title等(其它的标签可依此类推,正则是一样的) 4、可以实现简单的表单提交及cookie保存 using System;using System.Data;using System.Configuratio

jxufewbt的专栏 6664
上一篇: 经典SQL语句集锦
下一篇: 数据库设计
ranmer
博客等级 码龄19年 40粉丝 1原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值