Farò red team al tuo agente LLM per prompt injection e attacchi alla memoria


Informazioni su questo servizio
Traduzione automatica.
Il tuo agente LLM è sicuro da mettere davanti a utenti reali? Lo attaccherò come farebbe un vero adversary e ti dirò esattamente cosa si rompe e come sistemarlo.
Sono un ricercatore sulla sicurezza dell'AI con pubblicazioni a ICML e IJCNLP e lavori su arXiv riguardo attacchi alla memoria contro agenti LLM. Ho anche creato benchmark di valutazione LLM-judge, quindi i miei test sono sistematici e riproducibili, non solo una manciata di prompt intelligenti.
Cosa testo:
- Prompt injection (diretta e tramite documenti, pagine web o output di strumenti)
- Jailbreak e bypass delle policy
- Uso improprio di strumenti e chiamate di funzione
- Inquinamento della memoria e del contesto in agenti con memoria a lungo termine
- Fuga di prompt di sistema e dati
Cosa ottieni:
Un rapporto scritto chiaro con ogni scoperta, un esempio riproducibile, una valutazione di gravità e una soluzione concreta. I pacchetti più avanzati includono la suite di attacco come codice così puoi rifarla, più un retest dopo aver applicato le patch.
Compatibile con OpenAI, Anthropic, modelli open-source, LangChain, LlamaIndex e stack di agenti personalizzati. Scrivimi prima con una breve descrizione del tuo agente e confermerò il campo di applicazione. Testo solo sistemi di cui sei proprietario o autorizzato a testare.
Scopri di più su Sidharth P
AI Safety Researcher and LLM Fine Tuning Expert
- DaIndia
- Membro daapr 2017
Lingue
Telugu, Inglese, Hindi
Traduzione automatica.
Il mio portfolio
Altri servizi della categoria Sviluppo AI offerti da me
FAQ
Traduzione automatica.
Hai bisogno di accesso al mio sistema di produzione?
No. Posso testare una copia di staging, un endpoint API con una chiave di test, o uno specifico prompt e strumento che condividi. Testo solo sistemi di cui sei proprietario o autorizzato a testare, e non ho mai bisogno di dati di utenti reali.
Cosa devo condividere per iniziare?
Un endpoint di test o una build di staging del tuo agente, il prompt di sistema, gli strumenti che può chiamare e cosa non deve mai fare. Se ha memoria a lungo termine o legge documenti o pagine web, dimmelo, perché sono percorsi di attacco comuni.
Mantieni riservatezza sul mio sistema e sui risultati?
Sì. I tuoi prompt, codice, dati e risultati sono usati solo per il tuo progetto e condivisi solo con te. Non pubblico né riutilizzo nulla di specifico del tuo sistema.
Quali modelli e framework supporti?
Agenti costruiti su OpenAI, Anthropic, Gemini o modelli open-source (Llama, Qwen, Mistral e altri), usando LangChain, LlamaIndex, CrewAI, MCP tools o uno stack personalizzato. Se riceve testo, posso testarlo.

