Converti WEBARCHIVE in HTML
Estrai il contenuto di Safari WEBARCHIVE come HTML modificabile e compatibile con il browser.
Crea file HTML online
Non sappiamo ancora leggere i file WEBARCHIVE, quindi questa conversione non è disponibile. Se puoi esportare il tuo lavoro in uno di questi formati o in altri, ne ricaviamo un HTML:
Come convertire webarchive in html file
- Internet
- Ancora nessuna valutazione.
Un archivio Safari può richiedere una conversione quando un editor, un web server o un browser non Apple richiede un normale file .html. La conversione rende inoltre il documento più facile da esaminare, modificare o condividere senza Safari.
Cos'è il formato .webarchive
Un file .webarchive è generalmente un archivio binario Apple di tipo property-list creato da Safari o da un'altra applicazione basata su WebKit. Può contenere l'HTML della pagina, immagini, fogli di stile, script, font e metadati in un unico file, consentendo di riaprire una copia offline mantenendo gran parte dell'aspetto originale.
Safari ne crea uno tramite File → Save As quando Web Archive è selezionato come formato. WEBARCHIVE è un contenitore associato ad Apple, non un formato standard supportato da tutti i browser o web server.
Cos'è il formato .html
HTML è il markup standard utilizzato per le pagine web. Un file .html può essere aperto nei browser moderni, modificato in un editor di codice, pubblicato su un web server ed elaborato da strumenti di indicizzazione o gestione dei documenti senza Safari.
HTML contiene normalmente riferimenti a file separati di immagini, CSS, JavaScript e font. Cambiare l'estensione o estrarre solo la risorsa principale non crea automaticamente una copia offline completa.
Convertirlo con Safari su macOS
- Apri il file
.webarchivein Safari. - Seleziona File → Save As.
- Nel menu del formato, scegli Page Source o Page Source HTML, a seconda della versione di Safari.
- Salva il file con un'estensione
.html.
Questo è il metodo desktop più rapido, ma le versioni di Safari possono differire. In alcune installazioni nella finestra di dialogo per il salvataggio è disponibile solo Web Archive; in tal caso, utilizza il metodo di estrazione riportato di seguito. Il codice sorgente esportato potrebbe non includere ogni sotto-risorsa archiviata in una directory locale separata.
Estrarre la risorsa principale con Python
La libreria standard di Python può leggere la struttura property-list binaria senza installare un convertitore. Salva il codice seguente come extract_webarchive.py:
import plistlib
import sys
source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
archive = plistlib.load(file)
main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
raise TypeError('WebResourceData is not binary data')
with open(destination, 'wb') as file:
file.write(data)
Eseguilo da Terminal, Command Prompt o PowerShell con Python 3:
python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"
L'output è normalmente la risorsa HTML principale dell'archivio. Controlla WebResourceMIMEType dell'archivio se l'output non è testo leggibile; la risorsa principale potrebbe invece essere un PDF, un'immagine o un altro tipo di file.
Conversione online e alternative desktop
Safari è adatto per una conversione occasionale su macOS, mentre il metodo Python è ripetibile e funziona su altri sistemi con Python 3. Per un file non sensibile, CloudConvert o Zamzar possono essere presi in considerazione solo se l'elenco dei formati attualmente supportati dal servizio offre esplicitamente .webarchive come input e HTML come output. Il caricamento di un archivio può divulgare il contenuto della pagina, dati incorporati, URL o informazioni relative all'autenticazione, e il supporto online per questo formato specifico di Apple è incostante.
Limiti di qualità e compatibilità
- L'HTML estratto potrebbe continuare a fare riferimento al sito web originale, quindi le immagini e gli stili possono scomparire offline o dopo modifiche al sito.
- Il JavaScript che dipende dalle API di Safari, dai cookie, dall'archiviazione locale, dall'autenticazione, dalle richieste lato server o da servizi esterni potrebbe non funzionare dopo l'estrazione.
- Una copia offline completa richiede l'estrazione delle sotto-risorse elencate nell'array
WebSubresourcesdell'archivio, il loro salvataggio in una directory per gli asset e la riscrittura dei riferimenti HTML. Lo script semplice estrae soloWebMainResource. - La risorsa principale può rappresentare il codice sorgente del documento originale anziché il DOM finale prodotto da JavaScript. Verifica il risultato in un browser ed esamina i collegamenti a immagini, fogli di stile e script.
- Il salvataggio in HTML modifica il formato del contenitore; non conserva tutti i metadati dell'archivio Safari né garantisce un rendering identico a livello di pixel.
Confronto formato: WEBARCHIVE vs HTML
Come i formati WEBARCHIVE e HTML si confrontano sulle proprietà più importanti per questa conversione.
| Proprietà | .WEBARCHIVE Safari Web Archive | .HTML HyperText Markup Language |
|---|---|---|
| Si apre in un browser web | No | Sì, nativamente |
| Leggibile come testo semplice | — | Sì |
| Formattazione del testo | Base | Estesa |
| Immagini | Sì | Sì |
| Elementi interattivi | Limitato | Sì |
| Modifica successiva | Limitato | Facile |
| Dimensione tipica del file | Grande | Piccolo |
| Standard aperto | No | Sì |
| Introdotto | 2003 | 1993 |
| Sviluppatore | Apple Inc. | W3C / WHATWG |
| Tipo MIME | application/x-webarchive | text/html |