今天又看到lifehacker这几种word 2 clean htm方法:
1.使用这个HTML Tidy Library Project开源软件来处理。
2.微软官方站点也有个office 2000 HTML Filter 2.0工具,可以用来处理掉word2000转html时出现的多余代码。
3.使用这个word HTML Cleaner在线工具来处理。只能处理word2000以下版本。
4.有人给出了正则表达式(其实,上面的各种软件也都是用正则来解决的)
删除不需要的标签
<[/]?(fontspanXML[ovwXP]:w+)[^>]*?>
- replace any matches with the empty string
删除class,style...等不需要的属性
<([^>]*)(?:classlangstylesizeface[ovwxp]:w+)=(?:'[^']*'""[^""]*""[^>]+)([^>]*)>
- replace any matches with <$1$2>