Costruirò uno scraper web pianificato e una pipeline di dati con output pulito e deduplicato
Sviluppatore di automazioni e dati con Python
Informazioni su questo servizio
Hai bisogno di dati web freschi ogni giorno o settimana senza dover eseguire manualmente uno script? Creo uno scraper che si avvia da solo a intervalli programmati, pulisce i dati raccolti, elimina gli elementi duplicati e ti consegna un file o un database pronto all’uso.
Ciò che ottieni: uno scraper in Python (Playwright o Scrapy dove necessario), esecuzioni automatiche sul tuo computer o server, convalida di ogni record, una chiave unica per ogni elemento in modo che nulla appaia due volte, tentativi ripetuti quando un sito è lento, e un log che dice in parole semplici se un’esecuzione è fallita e perché. Output: CSV, XLSX, JSON o SQLite.
Perché me: per un cliente ho creato una pipeline simile: ingestione quotidiana di record pubblici, rimozione dei duplicati, scoring basato su regole, esecuzioni automatiche e recupero da crash. Un’esecuzione di un mese reale ha processato 318.962 record in circa 34 minuti con 0 errori. Il cliente è riservato.
Non incluso: siti dietro login che non possiedi, bypass CAPTCHA, dati che i termini del sito vietano di raccogliere, hosting o costi di proxy. Ti avviso in anticipo se un sito non è adatto.
Tecnologia:
Python
•
Excel
•
scrapy
•
Playwright
•
Pandas
Tecnica:
Automatizzato
Il mio portfolio
FAQ
Traduzione automatica.
Quali siti web puoi estrarre?
Pagine pubbliche, incluse quelle con molto JavaScript. Controllo prima il sito e i suoi termini. Siti dietro login che non possiedi o che vietano lo scraping non sono adatti.
Come si impostano le esecuzioni programmate?
Con cron (Linux/Mac) o Task Scheduler (Windows) sul tuo computer o server, o un container Docker in Premium. I costi di hosting sono a tuo carico.
Cosa succede se il sito cambia in seguito?
Le modifiche al layout possono rompere uno scraper. Durante la finestra di revisione riparo ciò che ho consegnato; riparazioni successive sono un nuovo piccolo ordine. Il log degli errori ti dice quando un’esecuzione non produce nulla.
Cosa significa 'pagine scrape'?
Fiverr richiede un limite di pagine per ogni pacchetto. Qui indica il numero di pagine che ogni esecuzione programmata può recuperare: 100 in Basic, 500 in Standard, 1.500 in Premium. Per lavori più grandi, contattami prima.
