从品牌网站建设到网络营销策划,从策略到执行的一站式服务
为了计算文本与标题相似度,需要用到标题文本。而爬数据的时候将文件名设置为url而没有用网页标题来存,所以需要解析网页提取,工程在.net平台下利用webbrowser实现的,用到了微软的mshtml。
网站建设哪家好,找成都创新互联公司!专注于网页设计、网站建设、微信开发、微信小程序定制开发、集团企业网站建设等服务项目。为回馈新老客户创新互联还提供了宣城免费建站欢迎大家使用!
用IHTMLDocument2.title倒是可以获得标题,但是它取得的标题有时会包含网站名如: Colorado shooting suspect sent to trial | World news | guardian.co.uk
为了计算准确,希望只有当前主题网页中的标题就是只有Colorado shooting suspect sent to trial。观察html发现一般主题网页的meta信息中会有不包含网站名的title,在格式如下的一个标签里。于是用正则匹配IHTMLElement的outerhtml,尝试各种正则都没匹配到。
原来outerhtml中只有body结点中的html,并不包含meta信息。然后google查有什么方法获得meta中的内容,发现一个解决方法http://forums.asp.net/p/1455331/3332061.aspx。关键代码贴在这里:
- foreach (IHTMLElement el in (IHTMLElementCollection)doc.all)
- {
- // check to see if all the desired attributes were found with the correct values
- bool qualify = true;
- if (el.tagName == "META")
- {
- HTMLMetaElement meta = (HTMLMetaElement)el;
- Response.Write("Content " + meta.content +"
");- }
利用IHTMLDocument2可以获得所有标签信息,包括meta中的。然后再用正则或者字符串匹配在其中找相应的title信息,完成。
成都网站建设公司地址:成都市青羊区太升南路288号锦天国际A座10层 建设咨询028-86922220
成都快上网科技有限公司-四川网站建设设计公司 | 蜀ICP备19037934号 Copyright 2020,ALL Rights Reserved cdkjz.cn | 成都网站建设 | © Copyright 2020版权所有.
专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网! | 成都网站建设哪家好? | 网站建设地图