AI-funksjoner som ikke lekker.
Har du koblet en språkmodell til noe som betyr noe, er den en ny angrepsflate. Jeg tester den som en angriper og bygger forsvaret som skal stå igjen etterpå.
DETTE INNGÅR
- Prompt injection-testing mot dine egne funksjoner, ikke mot et eksempel
- Jailbreak- og rollebytte-motstand: får modellen til å forlate reglene sine?
- Systemprompt-ekstraksjon: hva kan hentes ut av instruksjonene dine
- Gjennomgang av hva modellen har tilgang til, og hva den ikke burde ha
- Guardrails i koden, ikke bare i prompten — grensen må håndheves der den ikke kan overtales
- Logging av avviste forsøk, så du ser at det skjer
- Skriftlig rapport med funn, alvorlighetsgrad og konkrete tiltak
HVEM DET PASSER FOR
For alle som har koblet en språkmodell til noe som betyr noe. En chatbot som kan lese kundedata, en agent som kan skrive til en database, en assistent som kan sende e-post i firmaets navn.
SLIK GÅR DET FOR SEG
- KartleggingGratis. Hva er koblet til hva, hvilke data kan modellen nå, og hva skjer i verste fall.
- AngrepJeg kjører vektorene mot din egen oppsett og dokumenterer hva som slipper gjennom.
- ForsvarGuardrails settes der de ikke kan snakkes bort — i koden rundt modellen, ikke i instruksjonene til den.
- Rapport og gjentestDu får funnene skriftlig, og jeg kjører de samme angrepene på nytt etter at tiltakene er på plass.
PRIS
Sikkerhetsarbeid prises etter omfang. Kartleggingen er gratis, og den er det som avgjør omfanget.
Se prisene →BEVISET
Konsollen på forsiden er ikke en illustrasjon — den kjører fire ekte angrepsvektorer mot en språkmodell, live, og viser hva et usikret system svarer ved siden av hva et sikret system gjør i stedet. Bacheloroppgaven min handler om nøyaktig dette, på oppdrag fra Telenor, testet mot Gemini, ChatGPT, Copilot og LLaMA 3.1.