ما ملف MHT
حين كتب Internet Explorer أو Word أو خيار الحفظ بصيغة MHTML في Chrome صفحةً في ملف واحد، أنتج رسالة بريد وفق RFC 2557. يحوي جسم multipart/related شيفرة HTML مع كل صورة وورقة أنماط ونص برمجي أشارت إليه الصفحة، ويحمل كل جزء وسم العنوان الذي جاء منه. صيغة معقولة تماماً لم يعد يفتحها شيء تقريباً.
كيف تُعرَض الصفحة
تُفصَل الأجزاء، ويُفَكّ ترميز النقل لكل جزء (غالباً quoted-printable للنصوص وbase64 للصور)، ثم تُعاد كتابة مراجع شيفرة HTML الجذرية. وهذه الخطوة الأخيرة هي العمل كله: فكل src وhref وurl() في CSS ما زال يشير إلى العنوان المطلق الأصلي، ومن دون إعادة كتابتها تظهر الصفحة عارية. يُطابَق كل مرجع بالجزء الذي حُفظ من أجله — عبر Content-Location، أو عبر Content-ID في مراجع cid: — ثم يُوجَّه إلى بايتات ذلك الجزء.
لا شيء يُجلَب ولا شيء يُنفَّذ
تُوضع الصفحة المعاد بناؤها في إطار iframe بخاصية sandbox="allow-same-origin" فقط. لا وجود لـallow-scripts، فلا يستطيع أي نص برمجي في الأرشيف أن يعمل.
كما تُحقَن في الصفحة سياسة أمان محتوى default-src 'none'. وهذا أهم مما يبدو: فأي مرجع لم يحفظه الأرشيف يبقى عنوان http مطلقاً بعد إعادة الكتابة، وأي متصفح يعرضه سيجلبه بصمت. تمنع السياسة ذلك، ولا يُسمَح بالتحميل إلا لعناوين blob: وdata: أي الأجزاء الموجودة داخل الملف نفسه.
الأرشيفات الناقصة
تُحفَظ أرشيفات الويب ناقصة باستمرار: صورة خلفية معلَنة في ورقة أنماط لم يتتبّعها برنامج الحفظ، أو صورة تُحمَّل لاحقاً، أو خط على نطاق آخر. تُحصى هذه المراجع وتُسرَد. فإن بدت الصفحة خاطئة فغالباً تفسّر تلك القائمة السبب، وهي جواب أفضل بكثير من أيقونة صورة مكسورة.
يُعرَض كذلك
الموضوع، وتاريخ حفظ الصفحة، والعنوان الأصلي — أي Content-Location للجزء الجذري، وهو المصدر الحقيقي للصفحة. وإلى جانب ذلك كل جزء بنوع MIME وترميز النقل ومجموعة المحارف المعلَنة والحجم بعد فكّ الترميز، مع مبدّل لقراءة شيفرة HTML المصدرية.
الخصوصية
يُفتَح الأرشيف في متصفحك، ولا يُرفَع، ولا يتصل هو ولا الأداة بالشبكة.
Tiny Online Tools







