AI-agents: 62% experimenteert, 23% schaalt in minstens één bedrijfsfunctie
AI Specialist & Strategisch Adviseur
AI-agents kennen een brede verkenningsfase, geen brede uitrol
AI-agents trekken veel aandacht omdat zij, anders dan een losse chatinterface, stappen in een werkproces kunnen plannen en uitvoeren met koppelingen naar andere systemen. Dat maakt de mogelijke bedrijfswaarde interessant, maar het vergroot ook de eisen aan data, processen, autorisaties en toezicht. De stap van een demo naar een beheerst werkproces is daarom wezenlijk groter dan de stap van een prototype naar een werkende gebruikersinterface.
De veel aangehaalde verhouding van 62% experimenteren en 11% implementeren vraagt correctie. In de McKinsey Global Survey van 2025 zegt 62% van de respondenten dat hun organisatie ten minste experimenteert met AI-agents. Daarbinnen meldt 23% dat de organisatie een agentic AI-systeem opschaalt binnen ten minste één bedrijfsfunctie; nog eens 39% is begonnen met experimenteren. McKinsey definieert opschalen hier als het uitbreiden van inzet en adoptie in minstens één functie. Dat is niet hetzelfde als bedrijfsbrede uitrol, en evenmin een universeel bewijs dat een agent volledig autonoom productiehandelingen verricht. In een afzonderlijke bedrijfsfunctie rapporteert maximaal 10% opschaling. De survey liep van 25 juni tot 29 juli 2025 en omvatte 1.993 deelnemers uit 105 landen; de cijfers zijn dus zelfrapportages van respondenten, geen volledige marktmeting.[1]
De juiste conclusie is niet dat AI-agents mislukken. De data laten zien dat de belangstelling groot is, terwijl de uitrol meestal nog smal blijft. Dat patroon past bij een technologie die organisaties eerst binnen een afgebakend proces moeten bewijzen, beheersen en inbedden voordat zij breder kunnen opschalen.
Wat het verschil tussen experiment en opschalen werkelijk meet
Een experiment laat doorgaans zien dat een model een taak technisch kan ondersteunen. Opschaling vraagt meer. De organisatie moet bepalen welk procesresultaat wordt verbeterd, welke gegevens betrouwbaar beschikbaar zijn, welke systemen de agent mag benaderen en wie ingrijpt wanneer de uitkomst afwijkt. Ook moet duidelijk zijn hoe kwaliteit, kosten, doorlooptijd en risico worden gemeten. Zonder die afspraken is een pilot vooral een demonstratie van mogelijkheid.
McKinsey ziet een vergelijkbare kloof bij AI in brede zin. Hoewel 88% van de respondenten regelmatig AI gebruikt in minstens één bedrijfsfunctie, zegt slechts ongeveer een derde dat de organisatie haar AI-programma’s opschaalt. Van de respondenten schrijft 39% enige invloed op het bedrijfsbrede bedrijfsresultaat vóór rente en belastingen (EBIT) aan AI toe; voor de meesten in die groep bedraagt die bijdrage minder dan 5%. Dit zijn geen uitspraken over één individueel bedrijf, maar zij onderstrepen dat veel gebruik nog niet automatisch tot aantoonbare organisatiebrede waarde leidt.[1]
Ook andere surveys wijzen op dezelfde implementatieopgave, al gebruiken zij andere definities en steekproeven. Deloitte meldde in januari 2025 dat meer dan twee derde van de ondervraagde organisaties verwachtte dat in de volgende drie tot zes maanden hooguit 30% van hun generatieve-AI-experimenten volledig zou opschalen. In dezelfde studie verkende 26% autonome-agentontwikkeling in grote mate en 42% in enige mate. Regelgeving, risicobeheer, tekortschietende data en arbeidsvraagstukken werden als belemmeringen genoemd.[2]
De percentages van verschillende onderzoeken zijn niet uitwisselbaar. Een bestuurder doet er daarom goed aan altijd te vragen: wie is bevraagd, hoe is een agent gedefinieerd, betekent ‘opschalen’ één functie of de hele onderneming, en gaat het om verwachting of gerealiseerd gebruik? Zonder die afbakening verandert een marktcijfer al snel in een misleidende benchmark.
Waar implementaties doorgaans vastlopen
De eerste drempel is procesontwerp. Een agent is geen doel op zichzelf. Een bruikbare toepassing begint met een terugkerend proces, een benoemde proceseigenaar en een expliciete uitkomst. Denk aan de doorlooptijd van een interne aanvraag, het aandeel dossiers dat zonder herstelwerk wordt afgehandeld of de tijd die een medewerker kwijt is aan een voorbereidingsstap. Pas daarna volgt de vraag welke taken een agent wel en niet mag uitvoeren.
De tweede drempel is context en gegevenskwaliteit. IBM rapporteerde in 2025, op basis van twee enquêtes onder in totaal 2.900 leidinggevenden, dat zorgen over data voor 49% van de respondenten een adoptiebarrière waren. Vertrouwen werd door 46% genoemd en tekorten aan vaardigheden door 42%. Dit zijn percepties van leidinggevenden, geen technische foutpercentages, maar ze maken duidelijk waarom een model alleen niet voldoende is. Een agent heeft actuele, toegankelijke en begrijpelijke informatie nodig, plus heldere grenzen voor gegevensgebruik.[3]
De Organisatie voor Economische Samenwerking en Ontwikkeling (OESO) beschrijft gebrek aan datavolwassenheid en onzekerheid over rendement als fundamentele obstakels voor invoering van AI. De OESO signaleert bovendien dat managers vaak moeite hebben om concrete werkproblemen aan AI te koppelen en de organisatiebrede gevolgen voor werkwijze en cultuur onderschatten.[4] Voor agents is dat extra relevant: zodra een systeem een stap in een proces uitvoert, veranderen rollen, uitzonderingsafhandeling en verantwoordelijkheden mee.
De derde drempel is beheersing van bevoegdheden. Een agent die alleen een samenvatting voorstelt, heeft een ander risicoprofiel dan een agent die een record wijzigt, een bestelling voorbereidt of een bericht verstuurt. De World Economic Forum wijst erop dat organisaties de voorwaarden moeten vastleggen waaronder agents mogen handelen, en die bevoegdheid moeten blijven afdwingen wanneer systemen veranderen. Het Forum benadrukt ook dat agents die een fundamenteel model delen gezamenlijke kwetsbaarheden kunnen hebben; autorisatie en monitoring zijn daarom per inzet nodig.[5]
Feiten: opschalen vraagt om een samenhangend besturingsmodel
Er is geen openbare bron die bewijst dat één vaste technische keuze alle organisaties van experiment naar opschaling brengt. Wel wijst het beschikbare onderzoek consequent naar een combinatie van werkproces, leiderschap, data, uitvoering en risicobeheersing. McKinsey rapporteert bijvoorbeeld dat organisaties met de hoogste gerapporteerde AI-waarde vaker workflows fundamenteel herontwerpen, processen voor menselijke validatie van modeluitkomsten vastleggen, KPI’s volgen en betrokken leiderschap tonen. De samenhang is geen bewijs dat één van deze maatregelen op zichzelf waarde veroorzaakt, maar wel een bruikbare richting voor implementatieontwerp.[1]
Een operationeel besturingsmodel maakt daarom vijf zaken expliciet. Ten eerste: het beoogde procesresultaat en de eigenaar. Ten tweede: de toegestane gegevens, systemen en acties. Ten derde: de situaties waarin menselijke goedkeuring nodig is. Ten vierde: de meetpunten voor kwaliteit, doorlooptijd, kosten en uitzonderingen. Ten vijfde: de procedure om de inzet te pauzeren, terug te draaien of te herstellen wanneer gedrag, data of een gekoppeld systeem verandert.
Het NIST AI Risk Management Framework biedt hiervoor een vrijwillig, algemeen kader om betrouwbaarheid en risico’s in ontwerp, ontwikkeling, gebruik en evaluatie van AI-systemen te betrekken. Het bijbehorende profiel voor generatieve AI helpt organisaties specifieke generatieve-AI-risico’s te herkennen en passende acties te kiezen. Het framework vervangt geen sectorspecifieke wetgeving of contractuele afspraken, maar kan wel structuur geven aan de besluitvorming.[6]
Voor organisaties in de Europese Unie is de juridische classificatie van de beoogde toepassing daarnaast relevant. De Europese Commissie beschrijft dat de AI Act een risicogebaseerd kader voor aanbieders en gebruiksverantwoordelijken bevat. De transparantieregels zijn sinds augustus 2026 van toepassing. Voor hoogrisicosystemen gelden vanaf 2 december 2027 onder meer eisen rond risicobeoordeling, datakwaliteit, logging, documentatie, menselijke controle, robuustheid, cyberbeveiliging en nauwkeurigheid. Niet elke agent is een hoogrisicosysteem; dat hangt af van de beoogde toepassing. Classificatie verdient daarom aandacht vóórdat een proces wordt ingericht.[7]
Edgars analyse: maak van een pilot een gecontroleerde beslispoort
De praktische les is om een agent niet te beoordelen op een overtuigende demo, maar op een gecontroleerde procesverbetering. Kies eerst één proces met voldoende volume, duidelijke uitzonderingen en een eigenaar die de uitkomst kan beoordelen. Bepaal vooraf welke beslissing of handeling de agent mag voorbereiden, welke actie verboden blijft en wanneer een medewerker het werk overneemt. Dit is geen argument om overal menselijke goedkeuring toe te voegen; het is een ontwerpkeuze die moet passen bij de impact van de handeling.
Leg vervolgens een nulmeting vast. Zonder uitgangswaarde voor doorlooptijd, herstelwerk, fouten, kosten of klantimpact is achteraf niet vast te stellen of een agent iets verbetert. Test met representatieve gevallen, inclusief uitzonderingen en onvolledige invoer. Beoordeel niet alleen de tekstuele kwaliteit van een antwoord, maar ook of de agent de juiste bron gebruikt, binnen zijn autorisatie blijft en een uitzondering correct doorspeelt.
Ontwerp de integratie klein genoeg om te kunnen leren. Een eerste inzet kan gegevens ophalen, een voorstel maken en de uitkomst aanbieden aan een medewerker. Uitbreiding naar schrijven, versturen of uitvoeren volgt pas wanneer het team de kwaliteit, de uitzonderingen en de herstelroute beheerst. Log relevante beslissingen en toolaanroepen, leg wijzigingen aan prompts, modellen en koppelingen vast en beoordeel periodiek of de oorspronkelijke autorisatie nog passend is.
Tot slot verdient verandering in het werkproces dezelfde aandacht als de technologie. Maak duidelijk wie verantwoordelijk is voor de broninformatie, wie uitzonderingen behandelt, wie resultaten beoordeelt en wie bevoegd is de agent stil te zetten. Een pilot wordt pas een schaalbare toepassing wanneer deze verantwoordelijkheden uitvoerbaar zijn in de dagelijkse operatie, niet alleen in een projectteam.
De 62% uit het onderzoek is daarmee vooral een signaal van brede nieuwsgierigheid. De 23% die in minstens één functie opschaalt, laat zien dat vooruitgang mogelijk is, maar niet dat de implementatievraag is opgelost. Voor bestuurders ligt de kern niet in het najagen van een algemene adoptiegraad. De kern is een aantoonbaar beter proces, met begrensde bevoegdheden, meetbare resultaten en een eigenaar die kan bijsturen.
Bronnen
Edgar van Lent is de auteur van dit artikel.
