标题: 把Word转为简洁的html的若干种方法
ljjk5
元帅
Rank: 1


荣誉会员奖章
UID 46706
精华 1
积分 99426
帖子 49690
威望 554
金币 48489
热心 505
阅读权限 100
注册 2007-2-25
状态 离线
把Word转为简洁的html的若干种方法

  word可以直接另存为 htm,但即使是 另存为 html 也会有大量的废代码。以前我一般用 dreamweaver 的 clean up html 来处理,先处理 word 特有标签,然后删除一些 font,b,span 等。进一步,在 editplus 里面用正则进行处理,最后得到我想要的干净的html 代码。当然最完美的办法就是拷贝文字出来,自己用文本编辑器书写htm标签,:)
  今天又看到lifehacker这几种word 2 clean htm方法:
  1.使用这个HTML Tidy Library Project开源软件来处理。
  2.微软官方站点也有个Office 2000 HTML Filter 2.0工具,可以用来处理掉word2000转html时出现的多余代码。
  3.使用这个Word HTML Cleaner 在线工具来处理。只能处理word2000以下版本。
  4.有人给出了正则表达式(其实,上面的各种软件也都是用正则来解决的)
  删除不需要的标签
  <[/]?(font|span|xml|[ovwxp]:w+)[^>]*?>
- replace any matches with the empty string
  删除class,style...等不需要的属性
  <([^>]*)(?:class|lang|style|size|face|[ovwxp]:w+)=(?:'[^']*'|""[^""]*""|[^>]+)([^>]*)>
- replace any matches with <$1$2>
  详细解释在Clean Word HTML using Regular Expressions

网友 ljjk5 签名 - 网友社区 ===
顶部
[广告] 免费域名(Free Subdomain) 免费空间(Free hosting) PR查询(Google Pagerank)



当前时区 GMT+8, 现在时间是 2008-10-8 15:53
信产部ICP备案:京ICP备05066424号 北京市公安局网监备案:1101050648号

Powered by Discuz! 5.5.0
清除 Cookies - 联系我们 - 网友俱乐部 - Archiver - WAP