Effectmeting
Incrementeel effect meten: controlegroepen en natuurlijke experimenten
Stijgt de werkgelegenheid, daalt het ziekteverzuim of komen er meer aangiftes?
Waarom incrementeel effect meten?
Stijgt de werkgelegenheid, daalt het ziekteverzuim of komen er meer aangiftes? Zulke veranderingen worden snel aan beleid toegeschreven, maar komen ze door overheidsbeleid of door iets anders, zoals aantrekkende economische groei? Evaluatieonderzoek legt die koppeling: systematisch onderzoek naar de doelmatigheid en doeltreffendheid van het gevoerde beleid.
Daarvoor moet je onderscheiden wat de uitvoering oplevert en wat het beleid teweegbrengt. De beleidsuitvoering resulteert in beleidsprestaties (output) en in beoogde effecten en neveneffecten (outcome). Een experiment of pilot kan laten zien of, hoe en in welke mate een interventie bijdraagt aan het oplossen van een bepaald maatschappelijk probleem. Het incrementele effect is het deel van de uitkomst dat daadwerkelijk aan de interventie valt toe te schrijven: het verschil met de situatie waarin die interventie niet had plaatsgevonden.
Effectmeting is geen losse activiteit achteraf, maar een fase in de beleidscyclus. In een beleidsproces worden vijf fasen onderscheiden: beleidsvoorbereiding (probleemformulering en analyse van alternatieven), beleidsbepaling (besluitvorming en instrumentkeuze), beleidsuitvoering, beleidsevaluatie en terugkoppeling (bijsturen op basis van informatie over inhoud, proces, prestaties en effecten). Instrumenten als de maatschappelijke kosten-batenanalyse zitten in de beleidsvoorbereidende fase, maar kunnen ook achteraf worden ingezet om op uitgevoerd beleid terug te blikken. Wordt de effectvraag pas na afloop gesteld, dan ontbreken vaak juist de gegevens die ervoor nodig zijn.
De controlegroep: het effect als verschil
Het incrementele effect is het verschil in uitkomst tussen de groep die de interventie ondergaat en de groep die haar niet ondergaat. Dat tweede deel is per definitie niet zichtbaar: je kunt een burger, bedrijf of gemeente niet tegelijk wel en niet aan het beleid blootstellen. Daarom wordt een controlegroep gezocht. In de evaluatiepraktijk geldt: het verschil in uitkomst van de twee groepen is dan ook het effect van het beleid.
Zonder vergelijkingsgroep is een verandering niet te duiden. Stijgt de werkgelegenheid in een regio met een nieuw arbeidsmarktprogramma, dan kan dat net zo goed komen door de economische groei die in het hele land speelt. De controlegroep laat zien wat er zonder de interventie was gebeurd; alleen het verschil daartussen is toe te schrijven aan het beleid en niet aan autonome ontwikkeling, seizoen of landelijke trend.
De zuiverste manier om die twee groepen te maken is randomisatie: door loting zijn interventie- en controlegroep vergelijkbaar, ook op kenmerken die je niet meet. In de beleidspraktijk stuit zo'n experiment vaak op ethische bezwaren, omdat een aanpak waarvan je vermoedt dat die werkt aan een deel van de doelgroep wordt onthouden. Daar komen praktische bezwaren bij: willekeurige toewijzing is lastig in te bouwen in bestaande uitvoeringssystemen, en deelnemers of gemeenten kunnen weigeren in de controlegroep terecht te komen.
Experimenten en pilots: controle door ontwerp
In een experiment of pilot wordt uitgeprobeerd of, hoe en in welke mate een bepaalde beleidsinterventie — bijvoorbeeld nieuw te introduceren wet- of regelgeving of een wijziging van bestaande regelgeving — bijdraagt aan het oplossen van een bepaald maatschappelijk probleem. Aanleiding kan zijn dat bestaande regelgeving geen ruimte biedt voor nieuwe technologische innovaties en initiatieven, of dat die regelgeving het beoogde doel niet langer bereikt door nieuwe, ongewenste ontwikkelingen.
Een experiment of pilot vereist dat tijdelijk wordt afgeweken van het geldende wettelijk kader, waarvoor een regeling met een rechtsgrond nodig is. Vaak biedt bestaande wet- en regelgeving meer ruimte om te experimenteren dan gedacht; aparte regelgeving is pas nodig als het betrokken wettelijk kader geen afwijkingsmogelijkheid kent. Het experiment blijft in tijd en bereik zo beperkt mogelijk, en de geografische omvang wordt klein gehouden, omdat het niet gewenst is een experimenteerregeling met ongewis effect direct uniform landelijk te laten werken (Ar 2.41).
Het ontwerp bepaalt de bewijskracht. Voorafgaand aan het experiment wordt vastgesteld hoe en wanneer het wordt geëvalueerd en onder welke voorwaarden het als geslaagd geldt (Ar 2.42). Het experiment moet wel lang genoeg duren om de noodzakelijke informatie op te halen; een te korte meetperiode levert alleen een momentopname. Daarmee ligt de controlegroep in het ontwerp besloten: wie doet wel mee, wie niet, welke periode is de vergelijkingsbasis en welke uitkomstmaat telt.
Als voordeel geldt dat het invoeren van nieuwe wetgeving een langdurig traject is, zodat experimenteren voorafgaand of gelijktijdig aan het wetgevingstraject eerder informatie oplevert. Daar staat tegenover dat de uitkomsten van een tijdelijke, beperkte proef niet zonder meer opgaan voor landelijke invoering — het beperkte bereik is juist bedoeld om dat risico in te dammen. Voor innovatiebeleid geldt bovendien dat generieke instrumenten onvoldoende zijn en dat er ruimte moet komen voor maatwerk; dat vraagt om een overheid die durft te experimenteren, risico durft te nemen en wendbaar is (Rathenau Instituut).
Vergelijking tussen experimenten en natuurlijke experimenten
- Randomisatie
- Ja (in experimenten)
- Ethische bezwaren
- Hogere kans in willekeurige toewijzing
- Praktische uitvoerbaarheid
- Moeilijker in bestaande systemen
- Gebruik van bestaande variatie
- Ja (bij natuurlijke experimenten)
- Kosten voor onderzoekssetup
- Laag (geen nieuwe groep nodig)
Natuurlijke experimenten: bestaande variatie als controlegroep
Waar randomisatie of een pilot niet kan, is er in de uitvoeringspraktijk vaak al variatie die als controlegroep kan dienen. Natuurlijke experimenten gebruiken bestaande verschillen in timing (een maatregel wordt gefaseerd ingevoerd), plaats (de ene gemeente of regio voert iets in, de andere niet) of doelgroep (een leeftijds-, inkomens- of omzetgrens bepaalt wie er wel en niet onder valt). De groep die nog niet of niet aan de maatregel is blootgesteld, levert het vergelijkingspunt.
Het CPB typeerde natuurlijke experimenten in 2004 al als een relatief goedkope bron van kennis over de effecten van beleid, met daarbij een bijkomend voordeel. Voor de uitvoering betekent het in elk geval dat er geen onderzoekssetting hoeft te worden opgetuigd en dat er niemand geloot hoeft te worden.
De prijs is een aanname. De vergelijkingsgroep moet op alle relevante punten op de interventiegroep lijken, behalve op de interventie zelf. Bij gefaseerde invoering betekent dat dat beide groepen zonder de maatregel dezelfde ontwikkeling zouden hebben doorgemaakt. Bij plaatsverschillen kan de ene gemeente om andere redenen dan de andere hebben gekozen voor invoering — urgentie, bestuurlijke kleur, demografie, economische structuur — en die verschillen lopen door in de uitkomst. Bij doelgroepgrenzen (leeftijd, inkomen, omzet) kan de grens samenvallen met andere breuken in gedrag of administratie. Blijkt de controlegroep niet vergelijkbaar, dan meet je een verschil dat niet aan het beleid valt toe te schrijven.
Voor zulke situaties bestaan gestandaardiseerde analysetechnieken, zoals verschil-in-verschil (voor en na bij een wel- en een niet-groep), regressiediscontinuïteit (rond een scherpe toelatingsgrens) en instrumentele variabelen. De notitie Innovatieve beleidsevaluatie (J. van Hattem, 2022) verdiept een aantal evaluatiemethoden met toepassingen op voor IenW relevante onderwerpen.
Voordelen en nadelen van natuurlijke experimenten
- Voordelen
- Geen extra onderzoekssetup nodig; geen loting; kostenefficiënt
- Nadelen
- Aannames over vergelijkbaarheid; risico op bias door ongelijke ontwikkelingen of selectie
Van vergelijking naar bruikbaar effect
De vergelijking zelf is eenvoudig: gemiddelde uitkomst in de interventiegroep minus gemiddelde uitkomst in de controlegroep. De interpretatie is het lastige deel. Eerst moet de beginsituatie op tafel: waren de groepen voor de start al verschillend in niveau, dan moet dat verschil uit de vergelijking worden gehaald of moet er een nulmeting vooraf zijn vastgelegd.
Daarna komen trends en selectie. Zelfselectie (deelnemers melden zich aan omdat ze toch al gemotiveerd waren) en selectie op urgentie (gemeenten met de grootste problemen starten het eerst) leveren een controlegroep op die systematisch anders is. Ook een verschil dat na correctie blijft staan, kan nog door iets anders worden verklaard: een gelijktijdige andere maatregel, een landelijke campagne, of een wijziging in de registratie waardoor de cijfers zelf veranderen.
Onzekerheid hoort in de rapportage. Geef een bandbreedte in plaats van één getal, benoem welke alternatieve verklaringen zijn uitgesloten en welke niet, en maak zichtbaar hoe groot de groepen en de meetperiode zijn. Een verschil dat binnen de foutmarge valt, is geen effect.
Gedrag is vaak het kanaal waarlangs een interventie werkt. De BiNNL-publicatie Hoe is gedrag te onderzoeken? is bedoeld voor ambtenaren die gedragsinzichten toepassen in beleid, communicatie, uitvoering en handhaving; het gedrag van burgers én van uitvoerders bepaalt of een maatregel aankomt. Wie alleen naar de invoering kijkt, mist dat tussenliggende mechanisme.
Bij het wegen van de uitkomst helpt het om te weten welk type vraag wordt gesteld. Evaluatieonderzoek kan zich richten op doelbereiking (is het doel gehaald, heeft het beleid daaraan bijgedragen) of op doelmatigheid (is de uitvoering efficiënt verlopen, is de verhouding tussen kosten en kwaliteit van aansturing en uitvoering te verbeteren). Een maatschappelijke kosten-batenanalyse kan ook achteraf worden gebruikt om op uitgevoerd beleid terug te blikken, en is breed toepasbaar — van onderwijs, zorg en arbeidsmarktbeleid tot woon-, milieu-, natuur- en energiebeleid en digitale overheidsprojecten.
Belangrijkste bronnen voor evaluatiemethoden in Nederland
- CPB
- Lerend beleid: het versterken van beleid door experimenteren en evalueren
- Rathenau Instituut
- Innovatiebeleid en ruimte voor maatwerk
- BiNNL
- Hoe is gedrag te onderzoeken?
- Kimnet
- Notitie Innovatieve Beleidsevaluatie (2022)
Effectmeting inbedden in de beleidscyclus
Terugkoppeling is de fase waarin op basis van informatie over inhoud, proces, prestaties en effecten het beleid wordt bijgestuurd. Effectmeting levert alleen iets op als die terugkoppeling ook plaatsvindt: resultaten moeten op een vast moment terechtkomen waar de afweging opnieuw wordt gemaakt — begroting, wetswijziging of uitvoeringsafspraken met gemeenten.
Begin bij de causaliteitsvraag: formuleer vooraf welk increment je wilt weten en ten opzichte waarvan. Leg de controlegroep in het ontwerp vast — wie doet wel en niet mee — en bepaal de vergelijkingsbasis voordat de interventie begint. Stel bij een experiment vooraf vast hoe, wanneer en met welke maatstaf wordt geëvalueerd en wanneer het experiment geslaagd heet (Ar 2.42).
Houd het experiment in tijd en geografische omvang beperkt (Ar 2.41), maar laat het lang genoeg lopen om de benodigde informatie op te halen. Weeg de ethische kant expliciet: een experiment bij beleid stuit in de praktijk vaak op ethische bezwaren, wat pleit voor een bewuste afweging en voor alternatieven zoals natuurlijke experimenten. Zorg daarnaast dat uitvoerings- en registratiegegevens bruikbaar zijn voor de gekozen uitkomstmaat, want zonder meetbare uitkomst is geen enkele vergelijking te maken.
Communiceer de effectgrootte met een onzekerheidsmarge in plaats van een ja/nee-oordeel, en benoem de alternatieve verklaringen die niet zijn uitgesloten. De vervolgvraag voor beleidsbijstelling is dan voor wie, onder welke omstandigheden en met welke invoeringswijze het effect groter of kleiner is.
Fasen van de beleidscyclus met effectmeting
- BeleidsvoorbereidingProbleemformulering en analyse van alternatieven
- BeleidsbepalingBesluitvorming en instrumentkeuze
- BeleidsuitvoeringImplementatie van het beleid
- BeleidsevaluatieSystematische meting van effecten, inclusief controlegroep
- TerugkoppelingBijsturing op basis van resultaten (begroting, wetgeving, uitvoering)

