Extracteur de site web

Le Ripper de site web est un outil de mirroring hors ligne dans l'esprit de HTTrack : il explore un ou plusieurs sites à partir d'une URL de départ, télécharge les pages et ressources dans la limite du domaine choisi, et réécrit les liens du HTML/CSS téléchargé pour que le résultat reste navigable entièrement hors ligne. Par défaut, l'outil respecte le fichier robots.txt du site et espace ses requêtes d'un délai de politesse — c'est un outil d'archivage pour des sites qu'on est autorisé à copier, pas un moyen de contourner leur politique d'exploration.

53Capture d'écran à venir — fenêtre principale avec réglages de portée et journal de copie

Réglages de la copie

Le panneau de réglages permet de contrôler la profondeur maximale de l'exploration, de rester ou non sur le domaine de départ, et de choisir séparément si les images, feuilles de style, scripts et autres ressources doivent être réellement téléchargées ou simplement référencées par leur URL distante. Des filtres avancés (extensions et motifs d'URL à inclure/exclure) et des réglages de performance (concurrence, délai entre requêtes, taille et nombre maximum de fichiers, délai d'expiration, agent utilisateur, proxy) affinent la copie.

Projets et suivi

Un assistant « Nouveau projet », inspiré de celui de HTTrack, guide la création (nom, catégorie, dossier, URL de départ) et permet un démarrage immédiat, différé, ou une extinction automatique du PC à la fin. Pendant la copie, des compteurs (pages, fichiers, erreurs, taille, vitesse, temps écoulé) et un onglet Fichiers détaillent la progression, et un onglet Aperçu affiche une miniature de la page d'accueil déjà mirroirée. Le contenu aspiré peut ensuite être converti en nouveau projet VisualGUI éditable.