Converti webarchive in html

Converti WEBARCHIVE in HTML

Estrai il contenuto di Safari WEBARCHIVE come HTML modificabile e compatibile con il browser.

Crea file HTML online

Non sappiamo ancora leggere i file WEBARCHIVE, quindi questa conversione non è disponibile. Se puoi esportare il tuo lavoro in uno di questi formati o in altri, ne ricaviamo un HTML:

Come convertire webarchive in html file

  • Internet

Un archivio Safari può richiedere una conversione quando un editor, un web server o un browser non Apple richiede un normale file .html. La conversione rende inoltre il documento più facile da esaminare, modificare o condividere senza Safari.

Cos'è il formato .webarchive

Un file .webarchive è generalmente un archivio binario Apple di tipo property-list creato da Safari o da un'altra applicazione basata su WebKit. Può contenere l'HTML della pagina, immagini, fogli di stile, script, font e metadati in un unico file, consentendo di riaprire una copia offline mantenendo gran parte dell'aspetto originale.

Safari ne crea uno tramite File → Save As quando Web Archive è selezionato come formato. WEBARCHIVE è un contenitore associato ad Apple, non un formato standard supportato da tutti i browser o web server.

Cos'è il formato .html

HTML è il markup standard utilizzato per le pagine web. Un file .html può essere aperto nei browser moderni, modificato in un editor di codice, pubblicato su un web server ed elaborato da strumenti di indicizzazione o gestione dei documenti senza Safari.

HTML contiene normalmente riferimenti a file separati di immagini, CSS, JavaScript e font. Cambiare l'estensione o estrarre solo la risorsa principale non crea automaticamente una copia offline completa.

Convertirlo con Safari su macOS

  1. Apri il file .webarchive in Safari.
  2. Seleziona File → Save As.
  3. Nel menu del formato, scegli Page Source o Page Source HTML, a seconda della versione di Safari.
  4. Salva il file con un'estensione .html.

Questo è il metodo desktop più rapido, ma le versioni di Safari possono differire. In alcune installazioni nella finestra di dialogo per il salvataggio è disponibile solo Web Archive; in tal caso, utilizza il metodo di estrazione riportato di seguito. Il codice sorgente esportato potrebbe non includere ogni sotto-risorsa archiviata in una directory locale separata.

Estrarre la risorsa principale con Python

La libreria standard di Python può leggere la struttura property-list binaria senza installare un convertitore. Salva il codice seguente come extract_webarchive.py:

import plistlib
import sys

source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
    archive = plistlib.load(file)

main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
    raise TypeError('WebResourceData is not binary data')

with open(destination, 'wb') as file:
    file.write(data)

Eseguilo da Terminal, Command Prompt o PowerShell con Python 3:

python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"

L'output è normalmente la risorsa HTML principale dell'archivio. Controlla WebResourceMIMEType dell'archivio se l'output non è testo leggibile; la risorsa principale potrebbe invece essere un PDF, un'immagine o un altro tipo di file.

Conversione online e alternative desktop

Safari è adatto per una conversione occasionale su macOS, mentre il metodo Python è ripetibile e funziona su altri sistemi con Python 3. Per un file non sensibile, CloudConvert o Zamzar possono essere presi in considerazione solo se l'elenco dei formati attualmente supportati dal servizio offre esplicitamente .webarchive come input e HTML come output. Il caricamento di un archivio può divulgare il contenuto della pagina, dati incorporati, URL o informazioni relative all'autenticazione, e il supporto online per questo formato specifico di Apple è incostante.

Limiti di qualità e compatibilità

  • L'HTML estratto potrebbe continuare a fare riferimento al sito web originale, quindi le immagini e gli stili possono scomparire offline o dopo modifiche al sito.
  • Il JavaScript che dipende dalle API di Safari, dai cookie, dall'archiviazione locale, dall'autenticazione, dalle richieste lato server o da servizi esterni potrebbe non funzionare dopo l'estrazione.
  • Una copia offline completa richiede l'estrazione delle sotto-risorse elencate nell'array WebSubresources dell'archivio, il loro salvataggio in una directory per gli asset e la riscrittura dei riferimenti HTML. Lo script semplice estrae solo WebMainResource.
  • La risorsa principale può rappresentare il codice sorgente del documento originale anziché il DOM finale prodotto da JavaScript. Verifica il risultato in un browser ed esamina i collegamenti a immagini, fogli di stile e script.
  • Il salvataggio in HTML modifica il formato del contenitore; non conserva tutti i metadati dell'archivio Safari né garantisce un rendering identico a livello di pixel.

Confronto formato: WEBARCHIVE vs HTML

Come i formati WEBARCHIVE e HTML si confrontano sulle proprietà più importanti per questa conversione.

Confronto dei formati WEBARCHIVE e HTML
Proprietà .WEBARCHIVE Safari Web Archive .HTML HyperText Markup Language
Si apre in un browser web No Sì, nativamente
Leggibile come testo semplice — Sì
Formattazione del testo Base Estesa
Immagini Sì Sì
Elementi interattivi Limitato Sì
Modifica successiva Limitato Facile
Dimensione tipica del file Grande Piccolo
Standard aperto No Sì
Introdotto 2003 1993
Sviluppatore Apple Inc. W3C / WHATWG
Tipo MIME application/x-webarchive text/html

Altre conversioni di file .webarchive

Conversione in .html
da altri formati

Condividi sui social media: