初学正则表达式 -- Java
2007-08-04 21:12
239 查看
基本介绍请参照 http://www.blogjava.net/lbx19822004/archive/2007/05/28/120423.html 写的比较详细了
也可以参考http://msdn.microsoft.com/library/chs/default.asp?url=/library/CHS/jscript7/html/jsjsgrpregexpsyntax.asp
这里就我个人试验的结果进行一些补充说明:
1) "." 匹配除了换行符以外的所有字符, 包括空格, 但是不包括换行符. 这点一定要注意
2) 对于新手, 正则表达式的使用经常会有一些很灵异的现象发生, 例如"." 和 "[.]" 就不是一样的效果, 具体原因,俺还不清楚
3) 如果要匹配包括换行符在内的所有字符, 可以考虑使用"(.|//s)" ,但是"[.//s]"和"[.|//s]"不行,也不知道为什么.
4) 注意"^"的用法: 它有两种用法: 1."[^]",当他与"["搭配使用时,代表除此之外, 例如: [^abc] 代表除了a,b,c以外的其他所有字符,请注意,这里不是字符串, 请不要误解为: 除了字符串"abc"以外的其他字符 . 2.代表一行的开始
5) 如果想要去掉文档中的连续多个空行, 可以考虑,将"//s+/r/n" 替换为"/r/n"
暂时就用到这么多, 以后再总结哈
补充2:
对于以上的3) 可以使用"[//s//S]"
新发现: http://tim.mackey.ie/CleanWordHTMLUsingRegularExpressions.aspx 两个很有用的正则表达式
也可以参考http://msdn.microsoft.com/library/chs/default.asp?url=/library/CHS/jscript7/html/jsjsgrpregexpsyntax.asp
这里就我个人试验的结果进行一些补充说明:
1) "." 匹配除了换行符以外的所有字符, 包括空格, 但是不包括换行符. 这点一定要注意
2) 对于新手, 正则表达式的使用经常会有一些很灵异的现象发生, 例如"." 和 "[.]" 就不是一样的效果, 具体原因,俺还不清楚
3) 如果要匹配包括换行符在内的所有字符, 可以考虑使用"(.|//s)" ,但是"[.//s]"和"[.|//s]"不行,也不知道为什么.
4) 注意"^"的用法: 它有两种用法: 1."[^]",当他与"["搭配使用时,代表除此之外, 例如: [^abc] 代表除了a,b,c以外的其他所有字符,请注意,这里不是字符串, 请不要误解为: 除了字符串"abc"以外的其他字符 . 2.代表一行的开始
5) 如果想要去掉文档中的连续多个空行, 可以考虑,将"//s+/r/n" 替换为"/r/n"
暂时就用到这么多, 以后再总结哈
补充2:
对于以上的3) 可以使用"[//s//S]"
新发现: http://tim.mackey.ie/CleanWordHTMLUsingRegularExpressions.aspx 两个很有用的正则表达式
/// <summary> /// Removes all FONT and SPAN tags, and all Class and Style attributes. /// Designed to get rid of non-standard Microsoft Word HTML tags. /// </summary> private string CleanHtml(string html) { // start by completely removing all unwanted tags html = Regex.Replace(html, @"<[/]?(font|span|xml|del|ins|[ovwxp]:/w+)[^>]*?>", "", RegexOptions.IgnoreCase); // then run another pass over the html (twice), removing unwanted attributes html = Regex.Replace(html, @"<([^>]*)(?:class|lang|style|size|face|[ovwxp]:/w+)=(?:'[^']*'|""[^""]*""|[^/s>]+)([^>]*)>","<$1$2>", RegexOptions.IgnoreCase); html = Regex.Replace(html, @"<([^>]*)(?:class|lang|style|size|face|[ovwxp]:/w+)=(?:'[^']*'|""[^""]*""|[^/s>]+)([^>]*)>","<$1$2>", RegexOptions.IgnoreCase); return html; }
相关文章推荐
- Java初学习 - 正则表达式检查邮箱有效性
- 【Java正则表达式】理解和开发中常用
- Java - 正则表达式的运用(Pattern模式和Matcher匹配)
- java正则表达式
- 黑马程序员——java学习15(毕25)——正则表达式
- java 正则表达式的使用Pattern和Matcher
- java正则表达式 非捕获组详解
- java正则表达式
- python 初学正则表达式
- java 正则表达式
- JAVA 正则表达式、汉字正则、 java正则代码
- Java正则表达式详解
- java正则表达式(二)
- Java正则表达式匹配、替换HTML内容[使用Jakarta ORO]
- Java生涯——Java基础---正则表达式
- Java中正则表达式及Pattern和Matcher类详解
- Java正则表达式详解
- java正则表达式常用验证
- 利用一个正则表达式的一个例子来讲解Java中的两种for循环。
- Java正则表达式之语法规则