La nostra agenzia deployerà AI self-hosted con open webui e rag


Agenzia
Informazioni su questo servizio
Traduzione automatica.
Hai bisogno di un assistente AI che funzioni sulla tua infrastruttura, con i tuoi documenti?
WZ-IT deploya stack di LLM e RAG self-hosted per aziende che non possono inviare dati interni a un API statunitense. Open WebUI come interfaccia, LiteLLM come gateway, Qdrant o pgvector per il retrieval, Langfuse per tracing e controllo dei costi.
In base all'ambito, copriamo:
- Open WebUI con SSO, gruppi di utenti e accesso ai modelli per team
- Gateway LiteLLM: un'API per modelli locali ed esterni, budget per team
- inferenza vLLM o Ollama, dimensionata in base al budget GPU o CPU
- pipeline RAG: ingestion, chunking, embeddings, Qdrant o pgvector
- retrieval consapevole delle permissioni, così gli utenti vedono solo i documenti a cui hanno accesso
- Langfuse per tracing, valutazione e costi per team
- deployment sul tuo server GPU, cloud europeo o on-premises
La parte più difficile non è la finestra di chat. È far sì che il retrieval rispetti le permissioni già in atto e conoscere il costo mensile reale.
Inizia con la consulenza: un'ora con entrambi i fondatori di WZ-IT, più una raccomandazione scritta che conservi comunque. Tutto il resto più grande viene quotato come offerta personalizzata, in base a ciò che ti serve davvero.
Altri nostri lavori: wz-it.com
Informazioni su questa agenzia

Agenzia
3 dipendenti
- DaGermania
- Membro daott 2019
- Tempo di risposta medio1 ora
- Ultima consegna1 anno
Lingue
Tedesco, Inglese, Olandese
Traduzione automatica.
Portfolio
FAQ
Traduzione automatica.
Quale modello dovremmo usare?
Dipende dal compito, dalla lingua e dall'hardware. I modelli open-weight piccoli gestiscono la maggior parte degli assistenti interni; un modello da 70B richiede un budget GPU serio. Lo dimensioniamo in base al tuo caso d'uso.
Rispettano il nostro sistema di permessi con RAG?
Solo se è costruito in quel modo. Il filtro deve avvenire prima della ricerca vettoriale, non chiedendo al modello di comportarsi diversamente. Questo è il cuore del pacchetto RAG Platform.
Abbiamo bisogno di una GPU?
Non sempre. Modelli piccoli e inferenza CPU sono fattibili con bassa concorrenza. Ti diciamo quale caso hai prima di comprare hardware.
Puoi collegarlo a Nextcloud o a un file share?
Sì, come fonte di documenti nel pipeline di ingestion, inclusa la mappatura delle permissioni.
4 recensioni per questo servizio
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Valutazione dettagliata
- Livello di comunicazione del venditore
- Consiglia a un amico
- Servizio conforme alla descrizione
Ordina per
P pawelpavlo

Germania
Very well and quickly executed order :) I recommend !!!
Utile?D dnlnrx
Cliente abituale

Germania
Exzellente Arbeit. 1A Kommunikation.
Utile?S sbroderman

Svezia
Perfect delivery!
Utile?S 
sangeorgean2
Cliente abituale

Germania
Super, thank you!
Utile?
4 recensioni per questo servizio
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Valutazione dettagliata
- Livello di comunicazione del venditore
- Consiglia a un amico
- Servizio conforme alla descrizione
Ordina per
P pawelpavlo

Germania
Very well and quickly executed order :) I recommend !!!
Utile?D dnlnrx
Cliente abituale

Germania
Exzellente Arbeit. 1A Kommunikation.
Utile?S sbroderman

Svezia
Perfect delivery!
Utile?S 
sangeorgean2
Cliente abituale

Germania
Super, thank you!
Utile?
