Costruirò una pipeline di web scraping o automazione AI in Python
Ingegnere di automazione AI e backend, Python FastAPI RAG
Informazioni su questo servizio
Costruisco pipeline di dati che continuano a funzionare anche dopo la consegna, non script che si rompono in una settimana.
Quello che faccio:
- Raccogli dati di aziende, prodotti e contatti da siti e API (Google Places, directory pubbliche, siti personalizzati)
- Pulisco i dati correttamente: numeri di telefono in E.164, deduplica con fuzzy matching, verifica email (MX/SMTP), elimino record obsoleti
- Li memorizzo in un database reale (PostgreSQL/Supabase) con esecuzioni programmate o su richiesta
- Opzionale livello AI: valuta e qualifica ogni record con un LLM più una motivazione in una riga, o estrae dati strutturati da testi disordinati e PDF
Utilizzo API ufficiali quando disponibili e ricorro al web scraping solo quando non ci sono API, e ti dico quale è quale invece di consegnare qualcosa che si rompe al prossimo cambio di layout.
Lavoro recente: un motore di lead a griglia che copre quasi tutta la città invece dei 60 risultati troncati che la maggior parte degli scraper perde silenziosamente.
Stack: Python, httpx, BeautifulSoup, Playwright, Pandas, PostgreSQL, API LLM.
Scrivimi i siti target e i campi prima di ordinare così posso confermare che sia fattibile e fare un preventivo preciso.
Tecnologia:
scrapy
•
selenium
•
Beautiful soup
•
Playwright
•
Pandas
Tecnica:
Automatizzato

