Un nuovo studio del CERT-AGID analizza il fenomeno degli “Explosive Prompts”, istruzioni malevole che possono essere assimilate da un sistema di intelligenza artificiale e attivarsi solo successivamente, in presenza di determinate condizioni.
La ricerca evidenzia come gli attacchi di prompt injection rappresentino una delle principali minacce per i modelli linguistici, potendo influenzarne il comportamento o indurli a eseguire azioni non autorizzate.
Secondo lo studio, la difesa più efficace consiste nell’adottare controlli e autorizzazioni indipendenti dal modello di IA, così da impedire che eventuali manipolazioni si traducano in azioni dannose per il sistema.
Per approfondire: agid.gov.it