At modvirke skadelige mønstre i kunstig intelligens kræver en flerlaget indsats, der starter længe før modellen er færdigudviklet. Den primære metode er kuratering af træningsdata, hvor man aktivt filtrerer eksplicit indhold, hadefuld tale og misinformation fra for at sikre et så rent grundlag som muligt.
Efter træningen anvendes teknikker som Reinforcement Learning from Human Feedback (RLHF). Her instrueres modellen af mennesker, der evaluerer dens svar. Hvis modellen genererer et upassende eller uetisk svar, får den en negativ feedback, hvilket lærer den at undgå lignende mønstre i fremtiden. Dette hjælper med at finjustere modellens adfærd mod menneskelige værdier.
Desuden implementeres omfattende sikkerhedsfiltre og