Pulirò e preprocesserò il tuo dataset disordinato usando Python e Pandas

Alcune informazioni sono state tradotte automaticamente.

Pakistan

Parlo Inglese, Urdu
Studente di ingegneria del software all'ultimo anno in Pakistan, con esperienza in Python, Pandas e scikit-learn su progetti reali di ML. Recentemente ho completato uno stage in ML, durante il quale ...
Informazioni su questo servizio

I dati disordinati rallentano tutto, tipi di dato sbagliati, valori mancanti, righe duplicate, formattazione incoerente. Pulirò il tuo dataset usando Python e Pandas così sarà pronto per analisi o modellazione.

Recentemente ho affrontato questo problema su larga scala durante uno stage in ML, pulendo e preparando dati su 18 file mensili (~79 milioni di righe in totale) per un modello di scoring in stile produzione, incluso il recupero di un bug complicato dove una colonna numerica veniva silenziosamente memorizzata come un tipo non valido e doveva essere convertita correttamente prima di poter essere usata.

Ciò che consegnerò:

  • Righe duplicate e irrilevanti rimosse
  • Valori mancanti gestiti correttamente (non solo eliminati a caso)
  • Tipi di dato corretti e validati
  • Output CSV/Excel pulito e pronto all’uso
  • Una breve nota su cosa ho sistemato e perché

Inviami il tuo file e dimmi cosa vuoi farci, penserò io al resto.