Raccolgo e pulisco dati QA per l'addestramento di llm e AI

Alcune informazioni sono state tradotte automaticamente.

Pakistan

Parlo Urdu, Inglese

Sviluppatore Python, esperto di Web Scraping e analisi dei dati

Hai bisogno di estrarre dati dal web o di pulire fogli di calcolo disordinati per ottenere intuizioni chiare? Sono uno sviluppatore Python specializzato in web scraping, pulizia e analisi dei dati u...
Informazioni su questo servizio

Hai bisogno di dati Q&A puliti e strutturati per perfezionare o addestrare un modello AI/LLM?

Creo pipeline di raccolta dati che estraggono coppie domanda-risposta da fonti pubbliche basate su API (niente scraping HTML fragile), puliscono il testo, filtrano contenuti di bassa qualità o contenenti PII e consegnano JSONL di istruzioni/riposte pronti all'uso nel formato esatto usato per perfezionare modelli come GPT e Llama.

Ciò che ottieni:

  • Coppie Q&A pulite e deduplicate in formato JSONL
  • HTML rimosso, blocchi di codice preservati, spaziatura normalizzata
  • Filtraggio di qualità (soglie di punteggio, lunghezza minima, screening PII)
  • Attribuzione completa della fonte per conformità alle licenze
  • Un rapporto statistico (dimensione del dataset, lunghezza media, distribuzione dei punteggi)

Utilizzo API pubbliche ufficiali invece di scraping di siti che lo vietano (come Reddit/Quora), così il tuo dataset è pulito, legale e affidabile.

Dimmi il tuo argomento/dominio e quanti record ti servono, e ti confermerò la portata prima di ordinare.

Expertise:

Altro

Linguaggio di programmazione:

Python

Strumenti:

Quaderno jupyter