En gruppe af RAND Corporation-forskere fandt ud af, at maskinlæringsmodeller (ML) kan identificere tegn på bedrag under nationale sikkerhedsinterviews. Den mest præcise tilgang til at opdage bedrag er en ML- model, der tæller antallet af gange, interviewpersoner bruger almindelige ord.
Hvordan eksperimentet fungerede #
- De 103 deltagere læste en historie om Edward Snowden, der lækkede klassificerede oplysninger fra National Security Agency i 2013.
- Deltagerne blev tilfældigt tildelt til at læse den samme historie, men historien blev præsenteret som enten en nyhedsreportage eller et notat med markeringer, der indikerer, at den indeholdt følsomme oplysninger.
- Deltagerne blev tildelt en af to grupper til interviews: Den ene gruppe fik besked på at lyve om, hvad de havde læst, og den anden fik besked på at fortælle sandheden.
- Tidligere retshåndhævere interviewede deltagere via videotelekonference (VTC) og tekstbaseret chat i randomiseret rækkefølge.
- RAND-forskere brugte interviewet og chat-udskrifterne til at træne flere ML- modeller for at se, om modellerne kunne skelne løgnerne fra sandhedssigerne.

Fire modeller blev testet for at se, hvor nøjagtigt de opdagede bedrag #
- Ord vektorer
- Denne model talte antallet af gange, interviewpersonerne brugte almindelige ord.
- Sproglig holdning
- Denne model testede brugen af holdningsvektorer – sortering af ord i kategorier.
- Metadata
- Denne model undersøgte andre funktioner på metaniveau ved tale, såsom talekadence, gennemsnitlig unik ordlængde og brøkdelen af ord med mere end seks bogstaver.
- Chat- og VTC- ordvektorer
- Denne model så på ordvektorer i transskriptionerne af interviews udført via tekstbaseret chat og VTC .

Tre store takeaways #
- Det er ikke kun hvad man siger, men hvordan man siger det. Ordfrekvens, talekadence, ordvalg og andre sproglige signaler om potentielle løgne.
- ML- modeller kan opdage signaler om bedrag i, hvordan folk udtrykker sig selv – selv i tekstbaserede chats uden tilstedeværelse af en menneskelig interviewer.
- Modellerne er værktøjer, der kan supplere eksisterende interviewteknikker; de kan ikke helt erstatte sådanne teknikker.
Bias kan gøre modellerne mindre nøjagtige for visse grupper #
Alle modeller på nær én opdagede bedrag mere præcist blandt mænd end kvinder, hvilket tyder på, at der var kønsbias i modellens output. Hvis der eksisterer kønsbias, kan der være andre skævheder, såsom race og etnicitet. De følgende grafer viser et eksempel på forskellen i nøjagtighed efter køn – i dette tilfælde for ordet vektormodel.
Da modellen blev trænet på både mænd og kvinder, var den 76 procent præcis til at opdage bedrag. Når modellerne blev trænet ud fra deltagernes køn, var de mere præcise for mænd.

Andre forskelle mellem mænd og kvinder #
Modellerne fandt ud af, at mænd og kvinder brugte forskellige ord til at bedrage (andre forskere har gjort lignende resultater). Mænd var mindre tilbøjelige til at bruge ordet jeg, når de lyver, og mere tilbøjelige til at bruge det, når de fortalte sandheden.
Et andet bemærkelsesværdigt talemønster – selvom det ikke havde nogen forbindelse til at lyve eller sige sandheden – var, at kvinder var mere tilbøjelige end mænd til at bruge ordet mand (for eksempel til at beskrive Edward Snowden). Dette er en vigtig sondring, fordi den antyder, at forsøgspersonens køn var mere fremtrædende for kvinder end mænd. Det rejser også spørgsmålet om, hvorvidt forsøgspersonens eller interviewerens køn kunne have påvirket en forsøgspersons svar på interviewspørgsmål.
Implikationer for national sikkerhed #
- Mænd udfører mange af baggrundsundersøgelserne for sikkerhedsgodkendelser, og mindst en fjerdedel af sikkerhedsgodkendelsesansøgerne er kvinder. Det er vigtigt at forstå, hvordan interviewerens køn kan påvirke modelleringsresultater.
- Brug af ML- værktøjer uhensigtsmæssigt kan føre til uligheder i accept- og afvisningsprocenter for ansøgere til sikkerhedsgodkendelser.
- På grund af potentielle skævheder i ML -modellens output – og mennesker – er det vigtigt at opretholde et system af checks and balances, der inkluderer både mennesker og maskiner.
Fund og anbefalinger #
Sproglige værktøjer fungerer #
- Finde
- Der er sproglige signaler, når folk forsøger at bedrage, og ML- værktøjer kan opdage nogle af disse signaler til interviews foretaget via VTC og chat.
- Henstilling
- Den føderale regering bør teste ML- modellering af interviewdata, der bruger ordvektorer til at identificere forsøg på bedrag.
Interviewalternativer #
- Finde
- Nøjagtighedsraterne for at opdage bedrag var ens for interviews udført over VTC og chat.
- Henstilling
- Den føderale regering bør teste VTC- og chat-baserede interviews som alternativer til personlige sikkerhedsgodkendelsesinterviews i visse tilfælde.
- Henstilling
- Den føderale regering bør teste chat-baserede spørgeskemaer uden en menneskelig interviewer til stede for at udvide eksisterende personlige interviews. Efterforskere kunne bruge data fra chat og et ansigt-til-ansigt (eller virtuelt) interview til at identificere bekymringer, der fortjener yderligere undersøgelse.
Transskriptionsarbejdsgang #
- Finde
- Denne sonderende undersøgelse udviklede en arbejdsgang til transskribering og analyse af interviews, der var lydoptaget: (1) Amazon Web Services Transcribe brugte ML til automatisk at transskribere hver interviewoptagelse, (2) et medlem af forskerholdet lyttede til lyden og rettede transskriptionerne, og (3) modellerne analyserede de korrigerede transskriptioner.
- Henstilling
- Den føderale regering bør bruge ML- værktøjer til at udvide eksisterende undersøgelsesprocesser ved at udføre yderligere analyser på pilotdata, men regeringen bør ikke erstatte eksisterende teknikker med disse værktøjer, før de er tilstrækkeligt validerede.
Nøjagtighed varierer efter køn #
- Finde
- De fleste modeller var mere præcise for mænd end kvinder. Dette fund tyder på, at andre kilder til skævheder også kunne eksistere.
- Henstilling
- Den føderale regering bør validere alle ML- modeller, som den bruger til sikkerhedsgodkendelsesundersøgelser for at begrænse skævhed på grundlag af tilskrevne karakteristika (f.eks. race, køn, alder) hos de interviewede.
- Henstilling
- Regeringen bør have et menneske-i-løkken til løbende at kalibrere alle ML- modeller, der bruges til at opdage bedrag under sikkerhedsgodkendelsesprocessen.
Source: https://www.rand.org/pubs/research_briefs/RBA873-1.html