Costruirò una pipeline RAG di produzione con database vettoriale e valutazione


Level 1
Informazioni su questo servizio
Traduzione automatica.
La maggior parte delle demo RAG funziona su pochi PDF e si sgretola con dati reali. Io costruisco la versione che resiste in produzione.
Ciò che costruisco:
Ingestione e suddivisione dei documenti ottimizzate per il tuo contenuto, non per impostazioni predefinite
Configurazione del database vettoriale: Pinecone, Qdrant, Weaviate, pgvector o Chroma
Ricerca ibrida (semantica più keyword) con reranking per maggiore precisione
Citazioni delle fonti in ogni risposta così gli utenti possono verificare
Suite di valutazione che misura la precisione del retrieval prima e dopo
API di chat o query che la tua app può chiamare, con autenticazione e limiti di velocità
Re-indicizzazione incrementale per mantenere i dati aggiornati
Controllo dei token e dei costi, caching, monitoraggio e logging
Stack: Python, FastAPI, LangChain, LlamaIndex, OpenAI, Claude, PostgreSQL, Redis, Docker, AWS e GCP.
Perché me: oltre 6 anni di esperienza nella creazione di backend di produzione, 36 ordini completati su Fiverr con una valutazione di 4.9 e consegna puntuale al 100%. Consegno sistemi che funzionano anche dopo il passaggio, con documentazione e test, non solo notebook.
Hai documenti, un database o una knowledge base che vuoi rendere interrogabile? Scrivimi una breve descrizione e ti dirò sinceramente se RAG è l’approccio giusto e quanto costerà.
Scopri di più su Mudassar Ali
Full Stack Engineer
Level 1
- DaPakistan
- Membro dadic 2020
- Tempo di risposta medio1 ora
- Ultima consegna1 settimana
Lingue
Urdu, Punjabi, Inglese
Traduzione automatica.
Il mio portfolio
Altri servizi della categoria Sviluppo AI offerti da me
FAQ
Traduzione automatica.
Quale pacchetto si adatta al mio progetto?
Dimmi più o meno quanta roba hai e dove si trova. Starter è adatto a una singola fonte sotto le 500 pagine. Production serve un corpus completo dove l’accuratezza delle risposte conta. Platform è per sistemi multipli che cambiano continuamente.
Quale vector database usi?
Qualunque sia la tua scelta: Pinecone, Qdrant, Weaviate, Chroma o pgvector. Se già usi PostgreSQL, pgvector spesso evita di dover usare un nuovo servizio e costi aggiuntivi. Consiglio in base a scala e budget, non preferenze.
Quanto saranno precise le risposte?
Non prometto un numero prima di aver visto i tuoi dati. Quello che prometto è la misurazione: Standard e Premium includono un set di valutazione così puoi vedere l’accuratezza del retrieval come un dato, e ogni risposta ha citazioni per tracciare eventuali errori.
Chi paga per l'uso dell'API di OpenAI o Claude?
Lo fai tu, con i tuoi account, così mantieni il controllo e la visibilità totale sui costi. I costi di embedding e query sono i principali fattori. Stimo il costo mensile realistico prima di iniziare e inserisco caching e limiti di token per ridurli.
I miei dati rimangono privati?
Tutto gira sulla tua infrastruttura e sui tuoi account provider. Uso endpoint API che non addestrano sui tuoi dati, e firmerò un NDA. Se i tuoi documenti non possono lasciare i tuoi server, posso creare una soluzione completamente self-hosted con modelli open.
Cosa ti serve da me per iniziare?
Un esempio dei tuoi documenti o accesso al database, 10-20 domande di esempio che gli utenti faranno, e la tua API key del provider. Le domande di esempio sono le più importanti: diventano il set di valutazione contro cui ottimizzo il retrieval.
