Abbinerei, unirei e eliminerei i duplicati dai tuoi dataset disordinati

Alcune informazioni sono state tradotte automaticamente.

Messico

Parlo Spagnolo, Inglese, Francese

Dottorando in Astrofisica, Consulenza Statistica

Dottorando in astrofisica. Passo le mie giornate a fare statistica su dati disordinati, incompleti e correlati — cataloghi di galassie dove niente è pulito e ogni errore deve essere difeso. Porto que...
Informazioni su questo servizio

Due liste di persone, prodotti o luoghi, senza ID condiviso: nomi scritti diversamente, errori di battitura, campi mancanti. La funzione VLOOKUP di Excel si arrende subito.


Faccio record linkage probabilistico: invece di "abbinamento / nessun abbinamento", ogni coppia candidata ottiene un punteggio sulla probabilità che siano la stessa entità, basato su quanto l’accordo su ogni campo valga realmente. Concordare su un cognome raro è una forte prova; concordare su uno comune è debole. Il metodo distingue questa differenza.


Perché questo ti interessa: puoi scegliere tu la soglia. Alta fiducia per un unione automatica, e una lista separata di coppie ambigue per un controllo umano, invece di unire silenziosamente due clienti diversi o mantenere due volte lo stesso.


Lo uso su cataloghi astronomici, dove unire due oggetti sbagliati invalida la scienza. I tuoi dati meritano la stessa cura.


Ciò che consegno: il tuo dataset unito con un punteggio di fiducia su ogni abbinamento; una lista separata "da revisionare" per i casi ambigui; un rapporto di qualità su quanti sono stati abbinati, quanti no e perché; e i duplicati trovati all’interno di ogni file, non solo tra di essi.


Inviami prima un campione piccolo se vuoi vederlo funzionare prima di ordinare.

Tecnologia:

Python

Expertise:

Manipolazione dati

Convalida dati

etl

Normalizzazione