Creerò grandi dataset per l'addestramento AI
Sviluppatore Python, specialista in estrazione dati
Selezionato da Fiverr Pro
Kawsar selezionato dal team Fiverr Pro per la sua esperienza.
Selezionato per
Data scraping
Elaborazione dati
Informazioni su questo servizio
Hai bisogno di un dataset grande e pulito per addestrare o perfezionare un modello AI, non di un dump di scraping disordinato o di un file di esempio minuscolo.
Questo è il lavoro che faccio. Sono Kawsar, uno sviluppatore Python che costruisce scraping di dati per grandi dataset per l'addestramento AI da fonti pubbliche, generazione sintetica e esportazioni strutturate in CSV o JSON.
Cosa consegno:
- Dataset personalizzati per l'addestramento AI, dimensionati secondo il tuo pacchetto e schema
- Raccolta di dati pubblici e/o righe sintetiche quando sono necessari dati sicuri sulla privacy
- CSV, JSON o Excel puliti pronti per il pre-processing di ML e LLM
- Mappatura dei campi, deduplica di base e un breve dizionario dei dati
- Script di raccolta Python opzionale su Premium
- Campioni gratuiti di righe prima della costruzione completa, così puoi approvare lo schema prima
- Esportazione JSONL pronta per il fine-tuning di LLM (formati OpenAI, Hugging Face e Llama)
Costruisco dataset personalizzati per team di ML e AI. La quantità dipende dal pacchetto e dalla difficoltà della fonte. Solo dati pubblici.
Scrivimi il tuo schema, il volume target e il caso d'uso prima di ordinare.
NOTA:
- Solo dati pubblici. L'acquirente fornisce schema e URL target durante lo scraping
- Costruzione personalizzata per ordine
- Nessun raccolta di dati personali
- Nessun compito scolastico o universitario
Piattaforma:
MySQL
•
PL/SQL
•
PostgreSQL
•
SQLite
•
SQL server
Expertise:
Design
•
Normalizzazione
•
SQL
•
NoSQL
•
Performance
Clienti con cui ho lavorato
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
mag 2022-mag 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
lug 2024
Il mio portfolio
FAQ
Traduzione automatica.
Che tipo di set di dati crei?
Dataset strutturati per l'addestramento AI per ML e LLM: CSV/JSON tabellare, corpora di testo e collezioni da fonti pubbliche. La labeling di CV ricca di immagini può essere pianificata se si adatta.
Scrivi sul web o generi dati sintetici?
Entrambi. Scegliamo tra raccolta pubblica, generazione sintetica o una combinazione in base al tuo schema, alle esigenze di privacy e al volume target.
Addestrerai anche il mio modello?
Questo servizio è per creare il dataset. L'addestramento del modello e il fine-tuning di LLM sono servizi separati se ne hai bisogno.
Quali file ottengo?
CSV, JSON, JSONL o Excel più un breve dizionario dei dati. Premium può includere uno script Python usato per costruire o aggiornare il set.
Devo fornire uno schema?
Sì. Invia i nomi delle colonne, le etichette, i formati e le righe di esempio se le hai. Così il dataset sarà pronto per il modello.
Il lavoro con LoRA o dataset di influencer AI è incluso?
No. Questo servizio è per dati di addestramento ML/AI, non per pacchetti LoRA di influencer.
È per compiti scolastici o universitari?
No. Non faccio compiti scolastici o universitari.

