Sembra che questo servizio sia in sospeso

Estraerò e pulirò HTML offline in file di testo strutturati txt MD jsonl

Alcune informazioni sono state tradotte automaticamente.

Messico

Parlo Inglese, Spagnolo

7 ordini completati

Sono Alejandro, specialista in Web Scraping e Data Extraction. Raccogli, pulisco e consegno dati strutturati da siti web in CSV/Excel/Google Sheets—pronti all'uso. Stack tecnologico: Python (Beautiful...
Informazioni su questo servizio

Trasformerò il tuo esportazione di sito web scaricata/offline (HTTrack, SiteSucker o simili) in file di testo puliti e leggibili adatti per analisi, migrazione di documentazione, indicizzazione di ricerca o basi di conoscenza AI/RAG.

Ciò che ottieni:

  • Output TXT (UTF-8) pulito (un file per ogni pagina HTML)
  • Opzionale output Markdown (MD)
  • Struttura delle cartelle rispecchiata (organizzata come il tuo export)
  • Rimozione di boilerplate (menu, navigazione, intestazioni/piedi, barre laterali, blocchi ripetuti)
  • Rilevamento del contenuto principale (main/articolo o estrazione euristica)
  • Log di elaborazione + rapporto finale (elaborato/scritto/saltato/fallito)

Ciò di cui ho bisogno da te:

  • Un file ZIP con la cartella del tuo sito offline (file HTML)
  • Indicami il formato di output preferito: TXT / MD / JSONL
  • Sezioni che vuoi escludere (pagine legali, login, carrello, ecc.)

Note importanti:

  • Questo servizio funziona con esportazioni HTML offline. Non richiedo accesso all'hosting.
  • Non effettuo web scraping di siti live in questo servizio (solo elaborazione offline).
  • Assicurati di avere i diritti per processare i contenuti che fornisci.

Se vuoi un dataset pronto per RAG, scegli Premium (JSONL + metadati + deduplica).

Tecnologia:

Python

Expertise:

Acquisizione dati

Estrazione dati

Manipolazione dati

Il mio portfolio