Was eine MHT-Datei ist
Als Internet Explorer, Word oder Chromes Als MHTML speichern eine Seite in eine einzige Datei schrieben, entstand eine E-Mail-Nachricht nach RFC 2557. Ein multipart/related-Körper enthält das HTML und dazu jedes Bild, jedes Stylesheet und jedes Skript, auf das die Seite verwies — jede Teilnachricht mit der URL beschriftet, aus der sie stammt. Ein völlig vernünftiges Format, das kaum noch etwas öffnet.
Wie die Seite dargestellt wird
Die Teile werden getrennt, jeder wird aus seiner Transferkodierung dekodiert (bei Text meist quoted-printable, bei Bildern Base64), und dann werden die Verweise des Wurzel-HTML umgeschrieben. Dieser letzte Schritt ist die ganze Arbeit: Jedes src, href und CSS-url() zeigt noch auf die ursprüngliche absolute Adresse, ohne Umschreiben erschiene die Seite also nackt. Jeder Verweis wird dem dafür gespeicherten Teil zugeordnet — über Content-Location, bei cid:-Verweisen über Content-ID — und zeigt danach auf dessen Bytes.
Nichts wird geholt, nichts wird ausgeführt
Die wiederhergestellte Seite landet in einem iframe mit sandbox="allow-same-origin" und sonst nichts. Es gibt kein allow-scripts, also kann kein Skript aus dem Archiv laufen.
Zusätzlich wird eine Content-Security-Policy mit default-src 'none' in die Seite eingefügt. Das ist wichtiger, als es klingt: Jeder Verweis, den das Archiv nicht gespeichert hat, bleibt nach dem Umschreiben eine absolute http-URL, und ein Browser würde sie beim Darstellen still nachladen. Die Richtlinie verhindert das. Nur blob:- und data:-URLs — also die Teile in der Datei selbst — dürfen laden.
Unvollständige Archive
Webarchive werden ständig unvollständig gespeichert: ein Hintergrundbild aus einem Stylesheet, dem der Speichervorgang nicht gefolgt ist, ein nachgeladenes Bild, eine Schrift auf einer anderen Domain. Diese Verweise werden gezählt und aufgelistet. Wenn die Seite falsch aussieht, erklärt diese Liste meist warum — eine weit bessere Antwort als ein kaputtes Bildsymbol.
Ebenfalls angezeigt
Betreff, Speicherdatum und die ursprüngliche URL — das Content-Location des Wurzelteils, also die tatsächliche Herkunft der Seite. Dazu jeder Teil mit MIME-Typ, Transferkodierung, deklariertem Zeichensatz und dekodierter Größe sowie ein Umschalter auf den HTML-Quelltext.
Datenschutz
Das Archiv wird im Browser geöffnet. Es wird nicht hochgeladen, und weder es noch das Werkzeug nehmen Kontakt zum Netz auf.
Tiny Online Tools







