Det er likevel viktig å skille mellom akkreditering av testeren og sikkerhetsgodkjenning av selve KI-systemet. AI TAP betyr ikke at et bestemt system er helt trygt eller uten risiko. Risiko som oppstår gjennom den konkrete integrasjonen, bruken eller nye typer angrep, kan fortsatt gjenstå. Ansvaret for styring, aksept av risiko og eventuelle ekstra sikkerhetstiltak ligger fortsatt hos virksomheten som tar systemet i bruk.
Akkrediterte selskaper kan gjennomføre såkalte red team-tester, der de forsøker å lure eller omgå sikkerhetsmekanismene i et KI-system. Det kan blant annet innebære:
Testingen kan dekke flere typer feil og svakheter:
Søkerne skal vurderes både på hvor gode de er til å teste KI, og på om de har kapasitet til å drive tjenesten på en forsvarlig måte. Kriteriene omfatter blant annet:
IMDAs Starter Kit er frivillig veiledning for grunnleggende sikkerhets- og pålitelighetstesting av applikasjoner basert på store språkmodeller, ofte kalt LLM-er. Veiledningen trekker særlig frem fem risikoområder:
AI Verify Foundation har opplyst at det ikke skal kreves gebyr verken for søknad eller akkreditering. Hensikten er å senke terskelen for deltakelse og bidra til å utvikle markedet for KI-kvalitetssikring.
En akkreditering skal være gyldig i 12 måneder. Deretter må selskapet fornye den og dokumentere at kompetansen fortsatt holder mål, i takt med at standarder og trusselbildet endrer seg.
Selskaper som ifølge de tilgjengelige opplysningene har vist tidlig interesse, er Advai, AIDX, Ernst & Young, Knovel Engineering, PwC, Resaro og Vulcan.
AI TAP er ment å gjøre markedet for ekstern KI-testing mer ensartet og troverdig. Felles forventninger til testernes kompetanse, dokumenterte vurderinger og tydelig avgrensede testområder kan gjøre det lettere for virksomheter å bestille testing som passer deres konkrete bruk og risikobilde.
Det tilgjengelige kildematerialet inneholder ikke konkrete uttalelser fra bransjerepresentanter om at ordningen allerede vil gi bedre tilpasning, styring eller tillit til KI-sikkerhet. Utformingen av programmet legger likevel til rette for slike resultater: Kjøpere får bedre grunnlag for å velge testere, testomfanget skal være tydelig, og virksomhetene kan få en ekstra vurdering fra uavhengige fagmiljøer.