Sembra che questo servizio sia in sospeso

Estraerò siti web e documenti in dati Markdown puliti per llm e rag

Alcune informazioni sono state tradotte automaticamente.

Paesi Bassi

Parlo Ucraino, Inglese

Sviluppatore Python per Web Scraping ed estrazione dati

Sviluppatore Python specializzato in web scraping e estrazione dati. Trasformo siti web in dati puliti e strutturati — dataset CSV, corpora Markdown per progetti llm/RAG, e pipeline di scraping ripeti...
Informazioni su questo servizio

Hai bisogno di trasformare un sito web o una documentazione in dati puliti e strutturati? È quello che faccio.


Creo scraper personalizzati in Python che navigano un sito e trasformano ogni pagina in Markdown, CSV o JSON puliti, con metadati, un manifesto e un rapporto di copertura, così sai esattamente cosa è stato catturato. Ideale per dataset di llm e rag, basi di conoscenza, ricerche e migrazioni.


Cosa ottieni:

- Dati puliti e strutturati nel formato preferito

- Deduplicazione + rapporto di copertura (niente spazzatura, niente pagine mancanti)

- Siti renderizzati con JavaScript gestiti con Playwright, non solo HTML statico

- Dati che eseguo e verifico personalmente prima della consegna


Come lavoro, onestamente:

- Rispetto robots.txt, limiti di velocità e termini del sito

- Niente bypass di anti-bot o CAPTCHA. Se un sito è protetto attivamente, te lo dico prima di ordinare

- Gli scraper dipendono dalla struttura attuale del sito; eventuali modifiche future sono un compito separato


Vuoi il codice sorgente o aggiornamenti ricorrenti dei dati? Entrambi disponibili come extra.


Scrivimi con il sito e i dati di cui hai bisogno, e ti dirò onestamente se è una soluzione adatta e come la affronterei.

Tecnologia:

Python

Beautiful soup

Playwright

Pandas

Tipo di informazioni:

Ricerca competitor

Content marketing

Tecnica:

Automatizzato