Raccolgo e pulisco dati QA per l'addestramento di llm e AI
Sviluppatore Python, esperto di Web Scraping e analisi dei dati
Informazioni su questo servizio
Hai bisogno di dati Q&A puliti e strutturati per perfezionare o addestrare un modello AI/LLM?
Creo pipeline di raccolta dati che estraggono coppie domanda-risposta da fonti pubbliche basate su API (niente scraping HTML fragile), puliscono il testo, filtrano contenuti di bassa qualità o contenenti PII e consegnano JSONL di istruzioni/riposte pronti all'uso nel formato esatto usato per perfezionare modelli come GPT e Llama.
Ciò che ottieni:
- Coppie Q&A pulite e deduplicate in formato JSONL
- HTML rimosso, blocchi di codice preservati, spaziatura normalizzata
- Filtraggio di qualità (soglie di punteggio, lunghezza minima, screening PII)
- Attribuzione completa della fonte per conformità alle licenze
- Un rapporto statistico (dimensione del dataset, lunghezza media, distribuzione dei punteggi)
Utilizzo API pubbliche ufficiali invece di scraping di siti che lo vietano (come Reddit/Quora), così il tuo dataset è pulito, legale e affidabile.
Dimmi il tuo argomento/dominio e quanti record ti servono, e ti confermerò la portata prima di ordinare.
Expertise:
Altro
Linguaggio di programmazione:
Python
Strumenti:
Quaderno jupyter
FAQ
Traduzione automatica.
Da quali fonti raccogli?
API pubbliche e documentate (ad esempio Stack Exchange) che consentono esplicitamente questo tipo di raccolta — niente piattaforme di scraping che lo vietano.
In quale formato viene consegnato il dato?
JSONL (coppie istruzione/riposta), il formato standard per il fine-tuning di LLM. Disponibile anche CSV/JSON su richiesta.
Puoi fare un argomento/dominio personalizzato?
Sì — scrivimi il tuo argomento e il numero di record desiderati prima di ordinare, così posso confermare la fattibilità.

