Testerò il tuo chatbot o agente AI per l'injection di prompt

A
azmol_haque
A
azmol_haque
Md. Azmol Haque
Alcune informazioni sono state tradotte automaticamente.

Informazioni su questo servizio

Traduzione automatica.

La maggior parte dei consigli sulla sicurezza dell'AI si ferma a "aggiungi un filtro". Ma questo non basta a fermare un attacco su un agente.


Un chatbot produce testo, quindi il peggior caso è un output sbagliato. Un agente compie azioni, quindi il peggior caso è un'azione sbagliata. Riporto ciò che il tuo sistema può essere indotto a FARE, non solo ciò che dice.


Ciò che testo:

- Iniezione diretta di prompt: sovrascrittura delle istruzioni, confusione di ruolo, estrazione del prompt di sistema

- Iniezione indiretta: istruzioni ostili nascoste in documenti o pagine che il tuo AI legge

- Abuso di tool e chiamate di funzione: può l'input far chiamare uno strumento che non dovrebbe?

- Perdita di dati: prompt di sistema, chiavi, contesto di altri utenti

- Superamento delle barriere di sicurezza: dove un filtro è una trappola, non un controllo


Ricevi un rapporto scritto: ogni scoperta confermata con passaggi di riproduzione, gravità e una soluzione specifica. Scritto per ingegneri, non un semplice dump di scanner.


Costruisco anche questi sistemi. Il mio pipeline open-source per agenti difende dall'injection a livello architetturale - la fase di estrazione non contiene strumenti di rete. Il mio scanner segreto utilizza 108 pattern in 805 test.


Crediti nel Google's Vulnerability Reward Program e da UNICEF.


Contattami prima di ordinare e ti dirò sinceramente se è in scope.

Scopri di più su Md. Azmol Haque

Md. Azmol Haque

AI Safety Security Researcher

  • DaBangladesh
  • Membro dagen 2023
  • Tempo di risposta medio17 ore
  • Lingue

    Bengali, Inglese
Security researcher and LLM systems engineer. Google VRP-credited for a disclosed authentication bypass, and acknowledged by UNICEF for a high-severity exposure affecting 13,000+ accounts. I build my own tooling - an exposure scanner and an LLM security guardrail - so results are fast and reproducible. Every finding is verified before you see it: signal, not false positives. I work only with written authorization. English (fluent) - Bengali (native)

Traduzione automatica.

Il mio portfolio