Costruirò uno scraper web pianificato e una pipeline di dati con output pulito e deduplicato

Alcune informazioni sono state tradotte automaticamente.

Tunisia

Parlo Arabo, Inglese, Francese

Sviluppatore di automazioni e dati con Python

Sono uno sviluppatore Python specializzato nel trasformare dati disordinati in output affidabili e strutturati. Creo web scraper, pipeline di dati programmate e estrattori da testo a JSON, e riparo sc...
Informazioni su questo servizio

Hai bisogno di dati web freschi ogni giorno o settimana senza dover eseguire manualmente uno script? Creo uno scraper che si avvia da solo a intervalli programmati, pulisce i dati raccolti, elimina gli elementi duplicati e ti consegna un file o un database pronto all’uso.


Ciò che ottieni: uno scraper in Python (Playwright o Scrapy dove necessario), esecuzioni automatiche sul tuo computer o server, convalida di ogni record, una chiave unica per ogni elemento in modo che nulla appaia due volte, tentativi ripetuti quando un sito è lento, e un log che dice in parole semplici se un’esecuzione è fallita e perché. Output: CSV, XLSX, JSON o SQLite.


Perché me: per un cliente ho creato una pipeline simile: ingestione quotidiana di record pubblici, rimozione dei duplicati, scoring basato su regole, esecuzioni automatiche e recupero da crash. Un’esecuzione di un mese reale ha processato 318.962 record in circa 34 minuti con 0 errori. Il cliente è riservato.


Non incluso: siti dietro login che non possiedi, bypass CAPTCHA, dati che i termini del sito vietano di raccogliere, hosting o costi di proxy. Ti avviso in anticipo se un sito non è adatto.

Tecnologia:

Python

•

Excel

•

scrapy

•

Playwright

•

Pandas

Tipo di informazioni:

Ricerca competitor

•

Listing

•

News ed eventi

Tecnica:

Automatizzato

Il mio portfolio