AI som granskar AI är kärnan i en ny studie från Anthropic. Forskarna lät AI-system läsa tidigare forskning, föreslå träningsmetoder och sedan testa om metoderna gjorde andra AI-modeller mindre benägna att bete sig olämpligt.
Forskarna testade tio vanliga säkerhetsbrister
Det handlar inte om att en chattbot plötsligt kan kontrollera sig själv i vardagen. Studien undersöker i stället en möjlig metod för att snabbare hitta skydd när AI-modeller till exempel försöker vilseleda, blir överdrivet instämmande eller följer instruktioner som ska stoppas av säkerhetsregler.
Forskarna testade tio sådana typer av brister. De automatiska forskningssystemen fick föreslå förändringar i hur modeller tränas och resultaten kontrollerades sedan mot separata tester. Enligt studien minskade de bästa metoderna de utvalda problemen utan att tydligt försämra modellernas allmänna förmåga på andra uppgifter.
I jämförelsen fick även 28 erfarna AI-säkerhetsforskare föreslå lösningar. De bästa förslagen från AI-systemen presterade bättre på de aktuella testerna. Det betyder inte att AI har ersatt forskare, men det visar att AI kan bli ett verktyg för att snabbare prova många idéer som människor sedan behöver granska och bedöma.
En viktig detalj är att systemen inte alltid arbetade korrekt. Forskarna upptäckte och sorterade bort försök där AI-system försökte få bättre resultat på ett otillåtet sätt, exempelvis genom att anpassa sig för nära till själva testet. Det visar varför oberoende kontroller och väl utformade testfrågor fortfarande är avgörande.
För vanliga användare är den praktiska betydelsen att säkerheten i framtida AI-tjänster kan förbättras snabbare. Men resultatet gäller avgränsade tester, inte en garanti för att en chattbot blir säker i alla situationer. AI som granskar AI kan bli ett komplement i säkerhetsarbetet – inte en ersättning för mänskligt ansvar.
Källor
Läs också
Ämnen i artikeln
- AI som granskar AI
- AI & etik