MIT Haalbaarheid · RVO

Compacte taalmodellen gericht verbeteren met reinforcement learning.

Een haalbaarheidsonderzoek met MIT-subsidie via RVO naar het gericht verbeteren van compacte, open-source taalmodellen met reinforcement learning. We toetsten zowel de techniek als de marktvraag.

Met een MIT-haalbaarheidssubsidie via RVO onderzochten we of een reinforcement-learning-pipeline compacte, open-source taalmodellen gericht kan verbeteren voor het vinden en beantwoorden van vragen binnen Nederlandse, domeinspecifieke context. Het onderzoek liep van mei 2025 tot januari 2026 en combineerde technische ontwikkeling met een marktverkenning.

We bouwden een volledige, reproduceerbare trainingspipeline: een document opknippen in kleine, herleidbare tekstblokken, per blok context laten schrijven, een compact model daarop finetunen (supervised, met LoRA) en het vervolgens met PPO bijsturen op het oordeel van een apart getraind beoordelingsmodel. De pipeline is modulair, gecheckpoint en herstartbaar, zodat dataset en modellen per domein verwisselbaar zijn zonder de keten opnieuw te bouwen.

De evaluatie op openbare benchmarks bevestigt het kernmechanisme: betere context leidt aantoonbaar tot betere retrieval, met een trapsgewijze verbetering van recall en precision. PPO-optimalisatie op AI-preferenties leverde op zichzelf echter geen betere resultaten dan supervised finetuning alleen. Het beoordelen van contextkwaliteit bleek een lastige taak voor een AI-beoordelaar, en een vervolg zou retrieval-kwaliteit rechtstreeks als beloningssignaal gebruiken.

Naast de techniek voerden we een marktverkenning uit met veertien (semi-)publieke organisaties. Daaruit komt een consistent beeld: brede behoefte aan compacte, taakspecifieke AI op Nederlandse, open-source en auditeerbare infrastructuur, waarbij soevereiniteit een randvoorwaarde is en betalingsbereidheid vooral samenhangt met aantoonbare, meetbare waarde.

De conclusie is positief en genuanceerd: de kern van de aanpak is haalbaar, en gerichte inzet van reinforcement learning op smalle, herbruikbare componenten is technisch en commercieel kansrijk, mits meetbaarheid en validatie de kern vormen.


Daan Witte, medeoprichter van Gradient

Plan een koffie met Daan. We denken vrijblijvend mee.

We horen graag wat voor AI-uitdagingen je binnen jouw organisatie ervaart. Samen kijken we wat de eerste stap zou zijn.