.docx 里面到底有什么
Word 文件是一个由 XML 部件组成的 ZIP 包。正文在 word/document.xml,样式在 word/styles.xml,编号定义在 word/numbering.xml,每张图片在 word/media/。document.xml 里没有任何地方直接写出另一个部件的路径——它写的是关系 ID,由 word/_rels/document.xml.rels 把这个 ID 映射到路径上。手工追踪 r:embed="rId7" 是阅读 DOCX 最枯燥的部分,所以这里把解析后的目标做成了按钮,而打开的部件又会列出所有指向它的关系 ID。
带标注的样式表
Word 生成的文档,其 styles.xml 里往往有一百多个样式,而文档实际用到的可能只有八个。真正值得问的是:用了哪几个。每个样式都会列出 ID、显示名称、类型和继承来源,并附上一个使用次数,该次数取自正文中的 w:pStyle、w:rStyle 和 w:tblStyle 引用。切换到"已使用""未使用""自定义",文档的排版结构一目了然。
会提示哪些内容
word/vbaProject.bin——文档带有宏项目。- 外部关系,指向文件之外的地址。
- 修订记录:
w:ins与w:del的数量,这是判断一份"终稿"是否还带着修订历史最快的办法。 - 批注、脚注和尾注。
- 域。Word 有两种写法:简单域的指令放在属性里,而复杂域的指令分散在若干个
w:instrText元素中,Word 甚至会把INCLUDEPICTURE拆成三段。两种写法都会被读取并按类型统计,以INCLUDEPICTURE、INCLUDETEXT、LINK、DDE、DDEAUTO、IMPORT开头的指令会被单独列出,因为它们会从别处拉取内容。 word/webSettings.xml中的w:div元素,这是经 HTML 往返转换后留下的痕迹。
还适合用来
弄清一个文档为什么有 40 MB(通常是一张未压缩的照片)、在分发模板前做检查、确认涂黑是否真的删除了内容,以及对着真实文件学习 OOXML 的组织方式。
隐私
一切都在浏览器中运行,文档不会被上传。
Tiny Online Tools






