Costruirò uno scraper personalizzato per siti web con esecuzioni programmate e esportazione CSV pulita
sviluppo web
Informazioni su questo servizio
Costruisco scraper Python puliti che prelevano dati dal web per te secondo un programma. Prezzi di prodotti, annunci immobiliari, cataloghi di concorrenti, recensioni o lead.
Ciò che ottieni. Uno scraper funzionante realizzato con Python e Playwright. Gestisce siti con rendering JavaScript, paginazione, casi limite anti bot e estrazione strutturata tramite JSON LD o selettori CSS configurabili. Output come CSV, JSON, Excel, Google Sheets o direttamente nel tuo database.
Usi comuni. Monitoraggio dei prezzi dei concorrenti con avvisi giornalieri su Slack in caso di diminuzioni. Aggregazione di annunci immobiliari su vari portali. Estrazione di cataloghi e recensioni di prodotti e-commerce. Generazione di lead da directory e siti di annunci. Notizie e articoli per analisi o pipeline RAG.
Premium include automazione completa. Cron di GitHub Actions, confronto di CSV e avvisi su modifiche. Stessa architettura del mio repo pubblico di monitoraggio prezzi concorrenti su GitHub.
Sono onesto sui limiti. Siti con protezioni anti bot aggressive come Cloudflare Turnstile, muri di login o accesso solo residenziale possono richiedere proxy a pagamento o non valere la pena di essere scrappati. Ti dirò subito se il tuo target rientra in questa categoria.
Il mio portfolio
FAQ
Traduzione automatica.
Di quali informazioni hai bisogno per iniziare?
L'URL o gli URL del sito(s) che vuoi scrappare, i campi esatti di cui hai bisogno (ad esempio nome prodotto, prezzo, SKU, URL immagine), il formato di output (CSV/JSON/Excel/Sheets/DB) e la frequenza di esecuzione desiderata (una tantum, giornaliera, oraria).
Il web scraping è legale?
In generale sì per dati accessibili pubblicamente, ma dipende dai Termini di servizio del sito e da come usi i dati (GDPR per dati personali, copyright per riutilizzo dei contenuti). Scrappo solo dati pubblici, rispetto robots.txt quando possibile e inserisco ritardi cortesi. Per target in zona grigia segnalerò il rischio.
Cosa succede se il sito cambia layout e rompe lo scraper?
I miei scraper usano estrazioni a livelli (JSON-LD prima, microdati, CSS selectors come fallback) quindi la maggior parte delle redesign non li rompe. I selettori sono in config, non nel codice, quindi piccoli cambiamenti sono riparazioni di una riga. Se si rompe entro 14 giorni e si può sistemare in config, lo riparo gratis.
Puoi gestire login, captcha o protezioni anti-bot?
Login: sì se fornisci credenziali e non ci sono captcha difficili. Anti-bot di base (UA, limiti di rate): sì tramite headers e ritardi. Anti-bot difficile (Cloudflare Turnstile, hCaptcha, accesso residenziale): possibile con proxy a pagamento, ma il costo aumenta e l'affidabilità diminuisce. Ti avviserò subito.
Dove viene eseguito lo scraper dopo la consegna?
Base/Standard: lo esegui sul tuo computer o server (ti fornisco istruzioni). Premium: lo deployo su GitHub Actions (gratuito per pubblico, generoso per privato), funziona secondo un programma senza il tuo intervento. AWS Lambda, Render o il tuo VPS su richiesta.
E i costi ricorrenti?
GitHub Actions: gratuito per la maggior parte dei casi. Storage: file CSV (gratuito). Proxy (solo se richiesti dal sito): da 30$/mese con provider come Bright Data o Smartproxy. Non addebito nulla dopo la consegna, a meno che tu voglia che mantenga o estenda lo scraper.

