Het vier-ogen-principe behoort tot de meest gebruikte beheersmaatregelen in moderne organisaties. Van financiële transacties en kredietbeslissingen tot IT-wijzigingen, aanbestedingen en beleidsdocumenten: een tweede beoordelaar moet fouten, fraude en onzorgvuldigheid voorkomen. Het principe is zo vanzelfsprekend geworden dat het nog zelden wordt onderzocht. Met de technologie van vandaag wordt het tijd om dat wel te doen.
De opkomst van generatieve AI en agentische systemen roept namelijk een ongemakkelijke vraag op: is menselijke dubbele controle nog steeds de meest effectieve manier om kwaliteit en betrouwbaarheid te vergroten? Het antwoord is minder comfortabel dan de praktijk suggereert. Twee menselijke beoordelaars vormden nooit de sterkste tegenspraak die een organisatie kon organiseren. Ze waren de goedkoopste.
De aantrekkingskracht van het vier-ogen-principe is eenvoudig te begrijpen. Het uitgangspunt is dat twee beoordelaars minder fouten maken dan één. De rekenkundige logica is elegant: missen twee beoordelaars elk onafhankelijk 5% van de fouten, dan missen zij gezamenlijk slechts 0,25%. Op dat ene woord, onafhankelijk, rust de hele constructie.
Juist daar ontstaat de imperfectie die jarenlang voor lief is genomen. Onderzoek naar menselijk gedrag laat al decennia zien dat volledige onafhankelijkheid in de praktijk moeilijk te realiseren is. Mensen delen vaak dezelfde context, dezelfde aannames, dezelfde tijdsdruk en vaak zelfs dezelfde opleiding.
Solomon Asch toonde in 1951 met zijn conformiteitsexperimenten dat zelfs bij waarnemingstaken met een overduidelijk juist antwoord ongeveer een derde van de proefpersonen meeboog met een unaniem maar fout groepsoordeel. De literatuur over automation bias (Skitka, Mosier en Burdick vanaf eind jaren negentig, sindsdien herhaald in de zorg, de luchtvaart en de financiële sector) laat een hardnekkig patroon zien: zodra een systeem of een collega een eerste antwoord levert, zakt de toegevoegde waarde van de tweede beoordelaar. Menselijke bias, tijdsdruk en de informatiekloof tussen maker en checker duwen allemaal dezelfde kant op.
In de bankwereld is het bewijs nog scherper. Brown en collega's analyseerden in The Dark Side of the Four-Eyes Principle: Evidence from Bank Lending 10.568 interne ratings van 3.661 mkb-klanten bij zes retailbanken. Hun bevinding: kredietbeoordelaars verhogen hun rating bewust, juist omdat ze rekenen op correctie door de tweede lijn. Ervaren beoordelaars leerden precies díé parameters op te blazen die het minst werden tegengesproken. De dubbele controle nam de strategische vertekening niet weg. Ze lokte haar uit.
Buiten het laboratorium is het beeld niet vriendelijker. Knight Capital verloor in augustus 2012 $440 miljoen ondanks meerdere goedkeuringen op de doorgevoerde wijziging. Wirecard hield vier ogen overeind over functies en accountant heen, terwijl €1,9 miljard jarenlang zoek was. In beide gevallen was de dubbele controle formeel aanwezig en materieel afwezig.
Dat betekent niet dat dubbele controle geen waarde heeft. Het bevordert discipline, maakt processen toetsbaar en kan fraude ontmoedigen. Maar de vraag is of het nog steeds de sterkste vorm van tegenspraak biedt die organisaties kunnen organiseren, want dat is waar het vier-ogen-principe uiteindelijk om draait.
Organisaties willen voorkomen dat één perspectief dominant wordt en onopgemerkt fouten produceert. Het doel is niet een tweede persoon, maar een tweede onafhankelijke blik.
In veel hedendaagse processen ontstaat echter een paradox. Naarmate volumes toenemen, groeit de druk op beoordelaars. Meer transacties, meer dossiers, meer rapportages en meer regelgeving leiden tot grotere controlelasten. Daardoor verschuift het werk van diepgaande beoordeling naar het verwerken van wachtrijen. Het kritisch vermogen van de tweede beoordelaar verdwijnt langzamerhand door hoge werkdruk en het aantal beoordelingen dat gemaakt moet worden.
Hier ontstaat ruimte voor een andere aanpak. In de AI-wereld wordt steeds vaker gewerkt met systemen waarin meerdere modellen elkaar beoordelen. Een AI genereert een voorstel, terwijl andere AI-systemen specifiek zijn ontworpen om fouten, inconsistenties of risico's te identificeren. In plaats van samenwerking staat daarbij doelbewuste tegenspraak centraal.
Onderzoek naar self-critique en multi-agentbenaderingen (Saunders e.a., 2022) laat zien dat de kwaliteit van uitkomsten verbetert wanneer systemen worden blootgesteld aan gestructureerde tegenargumenten. Anthropic's Constitutional AI (Bai e.a., 2022) traint een apart criticusmodel om problemen in de output van een generator bloot te leggen. Madaan e.a. toonden in Self-Refine (NeurIPS 2023) dat zelfs één model, gevraagd zijn eigen werk te bekritiseren en te herzien, beter scoort op de meeste benchmarks. De waarde zit niet alleen in foutdetectie, maar vooral in het creëren van verschillende perspectieven op hetzelfde vraagstuk.
Voor risicomanagers is dat een interessante ontwikkeling. Waar traditionele controles afhankelijk zijn van beschikbare capaciteit, kunnen digitale critici parallel opereren, verschillende aannames hanteren en voortdurend worden gemonitord op hun prestaties. Bovendien ontstaat iets wat bij menselijke controles lastig meetbaar is: de mate van daadwerkelijke tegenspraak kan zichtbaar worden gemaakt.
Wanneer een controleur vrijwel altijd akkoord geeft, is dat een relevant signaal. Bij AI-systemen kan die informatie expliciet worden vastgelegd en geanalyseerd. Bij menselijke processen blijft dit vaak verborgen.
De meest fundamentele verandering ligt elders.
Traditionele maker-checkerprocessen zijn primair bedoeld om bestaande problemen te detecteren. De controleur wijst een probleem aan, waarna het werk teruggaat naar de oorspronkelijke maker voor herstel. Dat creëert extra doorlooptijd en vaak meerdere iteraties voordat een definitief resultaat ontstaat.
Agentische systemen maken een alternatieve aanpak mogelijk. Een digitale criticus kan niet alleen een fout signaleren, maar ook een gecorrigeerd voorstel genereren. Een onjuiste berekening wordt opnieuw uitgevoerd. Een gebrekkige rapportage wordt herschreven. Een afwijking in data wordt voorzien van een herstelvoorstel. De menselijke beoordelaar controleert vervolgens niet langer het oorspronkelijke werk, maar de voorgestelde correctie.
Daarmee verschuift de functie van controle van detectie naar correctie. Dat is geen kleine verbetering. Dat is een sprong in categorie. De waarde van een controle wordt immers niet alleen bepaald door het vermogen fouten te vinden, maar vooral door de snelheid waarmee ze worden hersteld.
Hoewel deze discussie vaak wordt gevoerd binnen de financiële sector, zijn de implicaties veel breder.
In de zorg kunnen AI-critici medische documentatie controleren op volledigheid, inconsistenties signaleren en verbetervoorstellen doen voordat dossiers worden afgerond. In het onderwijs kunnen kwaliteitscontroles van toetsing, accreditatieprocessen of subsidieverantwoording worden ondersteund door digitale tegenlezers. Binnen de overheid kunnen beleidsstukken, vergunningverlening en besluitvorming worden verrijkt met aanvullende kritische analyses vanuit verschillende perspectieven.
Ook in cybersecurity, compliance en interne audit ligt een vergelijkbare ontwikkeling voor de hand. De vraag verschuift van "heeft iemand dit gecontroleerd?" naar "welke onafhankelijke vormen van tegenspraak zijn toegepast?" Dat lijkt een subtiel verschil, maar het verandert de inrichting van governance fundamenteel.
Juist hier ontstaat vaak weerstand. Critici vrezen dat AI-controles leiden tot minder menselijke verantwoordelijkheid en meer afhankelijkheid van technologie.
Die zorg verdient serieuze aandacht. Geen enkel AI-systeem is foutloos. Modellen kunnen hallucineren, dezelfde blinde vlekken delen of gevoelig zijn voor manipulatie. Ook ontstaat een nieuw risico rond afhankelijkheid van een beperkt aantal technologieleveranciers. AFM en DNB wijzen daar nadrukkelijk op.
Toch volgt daaruit niet dat menselijke controleurs iedere stap zelf moeten blijven uitvoeren. De SAFEST-principes van DNB, het gezamenlijke AFM/DNB-rapport over AI in de financiële sector en de bepalingen over menselijk toezicht in de AI-verordening leggen alle de nadruk op verantwoordelijkheid, transparantie en effectief toezicht op uitkomsten. Dat is iets anders dan het verplicht inzetten van een bepaald aantal menselijke beoordelaars.
De meest realistische ontwikkeling is daarom niet volledige automatisering, maar hybride controle. AI-systemen verzorgen een groot deel van de operationele tegenspraak, terwijl mensen verantwoordelijk blijven voor escalaties, interpretatie, uitzonderingen en uiteindelijke aansprakelijkheid.
Voor auditors, compliance officers en risicomanagers ontstaat daarmee een nieuwe opgave.
Wanneer controles worden uitgevoerd door samenwerkende of elkaar uitdagende AI-systemen, verschuift ook het object van toezicht. De vraag is niet langer uitsluitend of een proces is gevolgd, maar of de controlearchitectuur zelf betrouwbaar functioneert.
Dat vraagt om nieuwe beoordelingscriteria. Organisaties zullen onder meer moeten aantonen:
Voor de Nederlandse praktijk ligt de route via ISAE 3000, toegepast op deze criteria, met praktijkrichtlijnen onder regie van NOREA. Die stap is nog niet gezet.
Deze ontwikkeling maakt de rol van de tweede en derde lijn niet kleiner, maar juist complexer. Professionele oordeelsvorming verschuift van het controleren van individuele transacties naar het beoordelen van de kwaliteit van controlemechanismen.
De kern van deze discussie gaat uiteindelijk niet over AI, maar over de toekomst van governance.
Veel bestaande beheersmaatregelen zijn ontworpen in een tijd waarin menselijke capaciteit schaars was en automatisering beperkt. Het vier-ogen-principe was toen een logische oplossing. De vraag die organisaties nu moeten stellen, is of nieuwe technologie betere vormen van tegenspraak mogelijk maakt dan voorheen denkbaar waren.
Dat betekent niet dat bekende principes overboord moeten. Verantwoordelijkheid, transparantie, proportionaliteit en toetsbaarheid blijven essentieel. Wat verandert, is de manier waarop deze principes worden gerealiseerd.
De vraag voor de komende jaren is niet of AI menselijke controleurs vervangt. De vraag is of organisaties bereid zijn hun definitie van controle te herzien. Wanneer effectieve tegenspraak, meetbare onafhankelijkheid en snelle correctie belangrijker worden dan het toevoegen van extra handtekeningen, ontstaat een nieuw model van beheersing.
Waar te beginnen is geen mysterie. Kies één proces met hoog volume en zichtbare controlelast, laat twee verschillende AI-critici drie maanden in adviesstand meelopen naast de bestaande menselijke controle, en meet hoe vaak zij het oneens zijn. Wie dat één keer doet, weet meer over de werkelijke waarde van zijn controles dan tien jaar procesbeschrijvingen hebben opgeleverd.
Het vier-ogen-principe verdient geen afscheid. Het verdient een opvolger.
Bronnen:
Asch, Conformity (1951);
Skitka, Mosier & Burdick, Does automation bias decision-making (1999);
Brown e.a., The Dark Side of the Four-Eyes Principle: Evidence from Bank Lending (2015);
Bai e.a., Constitutional AI (Anthropic, 2022);
Saunders e.a., Self-critiquing models for assisting human evaluators (OpenAI, 2022);
Madaan e.a., Self-Refine (NeurIPS 2023);
© Copyright 2014 - 2026 Riskworld | Alle rechten voorbehouden | Privacy en veiligheid | Cookies | Disclaimer | Sitemap