当前位置: 首页 > news >正文

南平网站开发公司蓝色网站模板

南平网站开发公司,蓝色网站模板,海外建站,网站大学报名官网入口正则表达式Regex(regular expression)是一种强大的描述字符序列的工具。在许多语言中都存在着正则表达式#xff0c;C11中也将正则表达式纳入了新标准的一部分#xff0c;不仅如此#xff0c;它还支持了6种不同的正则表达式的语法#xff0c;分别是#xff1a;ECMASCRIPT、…      正则表达式Regex(regular expression)是一种强大的描述字符序列的工具。在许多语言中都存在着正则表达式C11中也将正则表达式纳入了新标准的一部分不仅如此它还支持了6种不同的正则表达式的语法分别是ECMASCRIPT、basic、extended、awk、grep和egrep。其中ECMASCRIPT是默认的语法具体使用哪种语法我们可以在构造正则表达式的时候指定。 注ECMAScript是一种由Ecma国际前身为欧洲计算机制造商协会,英文名称是European Computer Manufacturers Association通过ECMA-262标准化的脚本程序设计语言。它往往被称为JavaScript但实际上后者是ECMA-262标准的实现和扩展。 下面我们就以本篇博客的页面http://www.cnblogs.com/ittinybird/p/4853532.html源码为例从零开始演示如何在C中使用正则表达式提取一个网页源码中所有可用的http链接。如果有时间的话近期我想用C11的新特性改写一下以前的C爬虫程序分享出来。 确保你的编译器支持Regex      如果你的编译器是GCC-4.9.0或者VS2013以下版本请升级后再使用。我之前使用的C编译器是GCC 4.8.3有regex头文件但是GCC很不厚道的没有实现语法完全支持但是库还没跟上所以编译的时候是没有问题的但是一运行就会直接抛出异常非常完美的一个坑有木有具体错误如下 terminate called after throwing an instance of std::regex_errorwhat(): regex_error Aborted (core dumped) 如果你也遇到了这个问题请不要先怀疑自己GCC这一点是非常坑爹的我在这个上面浪费了半天的时间才找了出来。所以在尝鲜C的正则表达式之前请升级你的编译器确保你的编译器支持它。 regex库概览       在头文件regex中包含了多个我们使用正则表达式时需要用到的组件大致有 basic_regex正则表达式对象,是一个通用的模板有typedef basic_regexchar regex 和 typedef basic_regexchar_twregexregex_match将一个字符序列和正则表达式匹配regex_search寻找字符序列中的子串中与正则表达式匹配的结果,在找到第一个匹配的结果后就会停止查找regex_replace使用格式化的替换文本替换正则表达式匹配到字符序列的地方regex_iterator迭代器用来匹配所有 的子串 match_results容器类保存正则表达式匹配的结果。sub_match容器类保存子正则表达式匹配的字符序列.ECMASCRIPT正则表达式语法       正则表达式式的语法基本大同小异在这里就浪费篇幅细抠了。ECMASCRIPT正则表达式的语法知识可以参考W3CSCHOOL。 构造正则表达式      构造正则表达式用到一个类basic_regex。basic_regex是一个正则表达式的通用类模板对char和wchar_t类型都有对应的特化 typedef basic_regexchar regex; typedef basic_regexwchar_t wregex;构造函数比较多但是非常简单 //默认构造函数将匹配任何的字符序列 basic_regex(); //用一个以‘\0’结束的字符串s构造一个正则表达式 explicit basic_regex( const CharT* s,flag_type f std::regex_constants::ECMAScript ); //同上但是制定了用于构造的字符串s的长度为count basic_regex( const CharT* s, std::size_t count,flag_type f std::regex_constants::ECMAScript ); //拷贝构造不赘述 basic_regex( const basic_regex other );//移动构造函数 basic_regex( basic_regex other ); //以basic_string类型的str构造正则表达式 template class ST, class SA explicit basic_regex( const std::basic_stringCharT,ST,SA str, flag_type f std::regex_constants::ECMAScript ); //指定范围[first,last)内的字符串构造正则表达式 template class ForwardIt basic_regex( ForwardIt first, ForwardIt last, flag_type f std::regex_constants::ECMAScript ); //使用initializer_list构造 basic_regex( std::initializer_listCharT init, flag_type f std::regex_constants::ECMAScript );以上除默认构造之外的构造函数都有一个flag_type类型的参数用于指定正则表达式的语法ECMASCRIPT、basic、extended、awk、grep和egrep均是可选的值。除此之外还有其他几种可能的的标志用于改变正则表达式匹配时的规则和行为 flag_typeeffectsicase在匹配过程中忽略大小写nosubs不保存匹配的子表达式optimize执行速度优于构造速度      有了构造函数之后现在我们就可以先构造出一个提取http链接的正则表达式 std::string pattern(http(s)?://([\\w-]\\.)[\\w-](/[\\w- ./?%]*)?); //匹配规则很简单如果有疑惑可以对照语法查看 std::regex r(pattern);值得一提的是在C中\这个字符需要转义因此所有ECMASCRIPT正则表达式语法中的\都需要写成“\\”的形式。我测试的时候这段regex如果没有加转义在gcc中会给出警告提示vs2013编译后后运行直接崩溃了。 正确地处理输入       先扯一个题外话假设我们不是使用了网络库自动在程序中下载的网页在我们手动下载了网页并保存到文件后首先我们要做的还是先把网页的内容(html源码)存入一个std::string中我们可能会使用这样的错误方式 int main() {std::string tmp,html;while(std::cin tmp)html tmp; }这样一来源代码中所有的空白字符就无意中被我们全处理了这显然不合适。这里我们还是使用getline()这个函数来处理 int main() {std::string tmp,html;while(getline(std::cin,tmp)){html tmp;html \n;} }这样一来原来的文本才能得到正确的输入。当然个人以为这些小细节还是值得注意的到时候出错debug的时候我想我们更多地怀疑的是自己的正则表达式是否是有效。 regex_search()只查找到第一个匹配的子序列       根据函数的字面语义我们可能会错误的选择regex_search()这个函数来进行匹配。其函数原型也有6个重载的版本用法也是大同小异函数返回值是bool值成功返回true失败返回false。鉴于篇幅我们只看我们下面要使用的这个 template class STraits, class SAlloc,class Alloc, class CharT, class Traits bool regex_search( const std::basic_stringCharT,STraits,SAlloc s,std::match_resultstypename std::basic_stringCharT,STraits,SAlloc::const_iterator, Alloc m,const std::basic_regexCharT, Traits e,std::regex_constants::match_flag_type flags std::regex_constants::match_default );第一个参数s是std::basic_string类型的它是我们待匹配的字符序列参数m是一个match_results的容器用于存放匹配到的结果参数e则是用来存放我们之前构造的正则表达式对象。flags参数值得一提它的类型是std::regex_constants::match_flag_type语义上匹配标志的意思。正如在构造正则表达式对象时我们可以指定选项如何处理正则表达式一样在匹配的过程中我们依然可以指定另外的标志来控制匹配的规则。这些标志的具体含义我从cppreference.com 引用过来用的时候查一下就可以了 ConstantExplanationmatch_not_bolThe first character in [first,last) will be treated as if it is not at the beginning of a line (i.e. ^ will not match [first,first)match_not_eolThe last character in [first,last) will be treated as if it is not at the end of a line (i.e. $ will not match[last,last)match_not_bow\b will not match [first,first)match_not_eow\b will not match [last,last)match_anyIf more than one match is possible, then any match is an acceptable resultmatch_not_nullDo not match empty sequencesmatch_continuousOnly match a sub-sequence that begins at firstmatch_prev_avail--first is a valid iterator position. When set, causes match_not_bol and match_not_bow to be ignoredformat_defaultUse ECMAScript rules to construct strings in std::regex_replace (syntax documentation)format_sedUse POSIX sed utility rules in std::regex_replace. (syntax documentation)format_no_copyDo not copy un-matched strings to the output in std::regex_replace根据参数类型于是我们构造了这样的调用 std::smatch results;regex_search(html,results,r);不过标准库规定regex_search()在查找到第一个匹配的子串后就会停止查找在本程序中results参数只带回了第一个满足条件的http链接。这显然并不能满足我们要提取网页中所有HTTP链接需要。 使用regex_iterator匹配所有子串       严格意义上regex_iterator是一种迭代器适配器它用来绑定要匹配的字符序列和regex对象。regex_iterator的默认构造函数比较特殊就直接构造了一个尾后迭代器。另外一个构造函数原型 regex_iterator(BidirIt a, BidirIt b, //分别是待匹配字符序列的首迭代器和尾后迭代器const regex_type re, //regex对象std::regex_constants::match_flag_type m std::regex_constants::match_default); //标志同上面的regex_search()中的 和上边的regex_search()一样regex_iterator的构造函数中也有std::regex_constants::match_flag_type类型的参数用法一样。其实regex_iterator的内部实现就是调用了regex_search()这个参数是用来传递给regex_search()的。用gif或许可以演示的比较形象一点具体是这样工作的颜色加深部分表示可以匹配的子序列 首先在构造regex_iterator的时候构造函数中首先就调用一次regex_search()将迭代器it指向了第一个匹配的子序列。以后的每一次迭代的过程中it都会在以后剩下的子序列中继续调用regex_search()直到迭代器走到最后。it就一直“指向”了匹配的子序列。       知道了原理我们写起来代码就轻松多了。结合前面的部分我们这个程序就基本写好了 #include iostream #include regex #include stringint main() {std::string tmp,html;while(getline(std::cin,tmp)){tmp \n;html tmp;}std::string pattern(http(s)?://([\\w-]\\.)[\\w-](/[\\w- ./?%]*)?);pattern [[:alpha:]]* pattern [[:alpha:]]*;std::regex r(pattern);for (std::sregex_iterator it(html.begin(), html.end(), r), end; //end是尾后迭代器regex_iterator是regex_iterator的string类型的版本it ! end;it){std::cout it-str() std::endl;} }下载本页的html源码保存为test.html编译这个源码测试一下大功告成 [regex]g regex.cpp -stdc11 -omain [regex]main test.html http://www.cnblogs.com/ittinybird/rss http://www.cnblogs.com/ittinybird/rsd.xml http://www.cnblogs.com/ittinybird/wlwmanifest.xml http://common.cnblogs.com/script/jquery.js http://files.cnblogs.com/files/ittinybird/mystyle.css http://www.cnblogs.com/ittinybird/ http://www.cnblogs.com/ittinybird/ http://www.cnblogs.com/ittinybird/ http://i.cnblogs.com/EditPosts.aspx?opt1 http://msg.cnblogs.com/send/%E6%88%91%E6%98%AF%E4%B8%80%E5%8F%AAC%2B%2B%E5%B0%8F%E5%B0%8F%E9%B8%9F http://www.cnblogs.com/ittinybird/rss http://www.cnblogs.com/ittinybird/rss http://www.cnblogs.com/images/xml.gif http://i.cnblogs.com/ http://www.cnblogs.com/ittinybird/p/4853532.html http://www.cnblogs.com/ittinybird/p/4853532.html http://www.w3school.com.cn/jsref/jsref_obj_regexp.asp http://www.cnblogs.com/ittinybird/ http://i.cnblogs.com/EditPosts.aspx?postid4853532 http://www.cnblogs.com/ http://q.cnblogs.com/ http://news.cnblogs.com/ http://home.cnblogs.com/ing/ http://job.cnblogs.com/ http://kb.cnblogs.com/regex和异常处理       如果我们的正则表达式存在错误则在运行的时候标准库会抛出一个regex_error异常他有一个名为code的成员用于标记错误的类型具体错误值和语义如下表所示 code含义error_collate无效的元素校对error_ctype无效的字符类error_escape无效的转移字符或者无效的尾置转义error_backref无效的向后引用error_brack方括号不匹配error_paren小括号不匹配error_brace大括号不匹配error_badbrace大括号中的范围无效error_range无效的不合法字符范围error_space内存不足error_badrepeat重复字符之前没有正则表达式* ?error_complexity太复杂了标准库君hold不住了error_stack栈空间不足了有关异常处理的基本内容不是本篇要讨论的内容就不赘述了。 小结      C11标准库中的正则表达式部分还有部分内容本文没有涉及个人以为掌握了以上的内容后基本上看一看接口就知道怎么使用了这里就不浪费篇幅了。      谢谢你的阅读错误之处还请您指正我将万分感谢。转载于:https://www.cnblogs.com/ittinybird/p/4853532.html
http://www.lebaoying.cn/news/10938.html

相关文章:

  • 织梦手机网站怎么仿制免费个人网站在线制作
  • 成都注册公司核名网站农产品网站设计
  • 网站建设的途径不良网站进入窗口免费正能量
  • 天津企业免费建站网络策略
  • 网站后台怎么制作网站外链发布
  • 门户网站开发研究报告网站优化与seo
  • 网站设计确认书网站自己做推广
  • 龙华网站制作百度云网站建设视频
  • 品牌网站如何做seoapp官网入口
  • 智慧团建网站入口官网wordpress中文免费主题
  • 做标书网站增加网站关键词
  • 南昌网站建设费用百度最新收录方法
  • 论网站建设情况php工程师
  • 烟台市做网站的价格企业网站打不开什么原因
  • 建设智能家居网站SWOT分析李沧网站建设电话
  • 宝塔面板wordpress多站点河北建设厅网站登录密码错误
  • 做网站多少分辨率就可以商城建设网站策划
  • 金融网站怎么做的域名注册查询软件
  • 个人主页网站模板免费推广软件平台排行榜
  • 建站程序的作用wordpress 社交登录
  • 网站主办单位变更企业管理培训课程价格
  • 石家庄专业模板网站制作价格50款软件app免费下载大全
  • 成都有哪些网站建设湛江模板建站定制网站
  • 网站推广的主要方法有哪些python搭建个人网站
  • 全屏网站制作百科网站源码
  • d8 wordpress广州中小企业seo推广运营
  • 网站设计的逻辑wordpress+屏蔽ip插件
  • asp网站怎么做三语建设网咨询
  • 做网站什么公司好食品网站模板
  • 中亿丰建设集团股份有限公司网站网站建设挣钱的需要什么