这个工具能做什么、不能做什么
Microsoft Publisher 没有公开的格式规范。 微软从未公开过 .pub 是如何存储页面、文本框、参考线和版面的。任何声称能打开它的工具,要么背后就装着 Publisher,要么就是在猜。
所以本工具对自己的能力范围保持诚实。它只做两件事,而且都建立在有文档的基础上:
- 读取 OLE 复合文件容器——也就是
.doc、.xls、.ppt内部那种类 FAT 结构,规范见 MS-CFB——以及它的属性集,规范见 MS-OLEPS 和 MS-OSHARED。 - 通过在各个流中扫描图像特征码来恢复内嵌图片:PNG 从文件头一直到
IEND块,JPEG 从FFD8到FFD9,GIF 从文件头到结束符。
它不渲染页面,在有人公开该格式之前也不会渲染。这正是它被称为"检查器"的原因。
你实际能得到什么
文档属性是真正有用的部分,而且相当完整:标题、主题、作者、最后保存者、关键词、备注、修订号、编辑时长、创建/修改/最后打印时间、页数与字数、写入该文件的应用程序,以及来自第二个属性集的类别、经理、公司、内容类型与状态。
对于一个打不开的 .pub,这足以回答人们的大多数疑问:谁做的、什么时候做的、用哪个版本、有多长、是干什么用的。
你还会得到完整的存储与流树,包含每个流的大小、CLSID 和时间戳——其中就有 Publisher 的 Quill、Escher 和 Contents 流——以及所有可恢复的图片,可预览、可单独下载或打包为 ZIP。
图片恢复是尽力而为,并且如实说明
Publisher 保存图片时并没有任何公开文档描述的逐图封装结构,因此这里是靠扫描特征码来定位,而不是读取某个清单。这种方式能可靠地找到常见的 PNG、JPEG 和 GIF 数据,但会漏掉封装在无法识别容器里的内容——尤其是 WMF 和 EMF 图元文件。显示的数量是"找到了多少",而不是对"里面有多少"的断言。
名为 .pub 但并非 Publisher 文件
格式是按文件开头的字节判断的,而不是按文件名。一个 .pub 实际上是 ZIP、MHTML 存档或别的复合文档,是很常见的情况,本工具会明确指出,并给出真正能打开它的工具链接。
隐私
文件在你的浏览器中读取,不会上传任何内容。
Tiny Online Tools







