C#.Net使用正则表达式抓取百度百家文章列表
2014-09-20 10:23
507 查看
工作之余,学习了一下正则表达式,鉴于实践是检验真理的唯一标准,于是便写了一个利用正则表达式抓取百度百家文章的例子,具体过程请看下面源码:
一:获取百度百家网页内容
二:通过正则表达式筛选
源码下载
一:获取百度百家网页内容
public List<string[]> GetUrl() { try { string url = "http://baijia.baidu.com/"; WebRequest webRequest = WebRequest.Create(url); WebResponse webResponse = webRequest.GetResponse(); StreamReader reader = new StreamReader(webResponse.GetResponseStream()); string result = reader.ReadToEnd(); reader.Close(); webResponse.Close(); return AnalysisHtml(result); } catch (Exception ex) { throw ex; } }
二:通过正则表达式筛选
public List<string[]> AnalysisHtml(string htmlContent) { List<string[]> list = new List<string[]>(); string strPattern = "<h3><a\\s*.*>(?<Title>[^<]+)</a></h3>.*\\s*<p\\s*class=\"feeds-item-text\">(?<Abstract>[^<]+)<a\\s*href=\"(?<Url>.*)\"\\s*target=\"_blank\"\\s*class=\"feeds-item-more\"\\s*mon=\".*\\s*\">.*\\s*</a></p>"; Regex regex = new Regex(strPattern, RegexOptions.IgnoreCase | RegexOptions.Multiline | RegexOptions.CultureInvariant); if (regex.IsMatch(htmlContent)) { MatchCollection matchCollection = regex.Matches(htmlContent); foreach (Match match in matchCollection) { string[] str = new string[3]; str[0] = match.Groups[1].Value;//获取到的是列表数据的标题 str[1] = match.Groups[2].Value;//获取到的是内容 str[2] = match.Groups[3].Value;//获取到的是链接到的地址 list.Add(str); } } return list; }
源码下载
相关文章推荐
- C#.Net基于正则表达式抓取百度百家文章列表的方法示例
- c#.net使用正则表达式验证文本中是否包含手机号码或电话号码?
- 【推荐】c# .net 使用正则表达式匹配嵌套Html标签
- 使用C#与正则表达式分析hao123.com的网址列表
- C#.net正则表达式使用集锦
- 在C#.net中使用正则表达式检验输入是否为数字
- C#使用正则表达式抓取网站信息示例
- 通过代码学习C#&.NET——委托使用(正则表达式替换)
- c#.net如何使用正则表达式
- asp.net+正则表达式抓取QQ空间文章
- 使用正则表达式抓取博客园列表数据
- c#使用正则表达式抓取a标签的链接和innerhtml
- (转)c# .net 使用正则表达式匹配嵌套Html标签
- C# .Net使用正则表达式去除HTML标记和空格
- C# .net 使用正则表达式去掉字符串中的数字
- [原创]在C#.net中使用正则表达式检验输入是否为数字
- 正则表达式在.Net中的使用(C#)
- 在C#中使用正则表达式自动匹配并获取所需要的数据
- 用正则表达式过滤脚本的一些研究(asp.net+C#)
- .net中使用正则表达式