De vraag is niet meer óf taalmodellen de boventoon gaan voeren. Die vraag is beslecht. De vraag is wie het snelst een proces bereikt waarin de output betrouwbaar genoeg is — bij herhaling, in steeds wisselende contexten — om het zelfstandig te laten draaien.
Vandaag kan een model een project opzetten, verbeteren en onderhouden. Maar het maakt nog te vaak fouten en het is gebaat bij zeer intensieve instructie van een mens. Dat is niet betrouwbaar genoeg om management- of overheidstaken aan toe te vertrouwen.
De reden waarom is bekend, alleen wordt hij zelden hardop genoemd. Het model kan geen enorme hoeveelheden data verwerken, sorteren op actuele contextuele relevantie, en dat vervolgens plaatsen binnen nóg grotere hoeveelheden data — de wet, beleidsstukken, contracten, historische besluiten — die de uitkomst en de betrouwbaarheid ervan bepalen.
Daarom is dataverwerking, of beter gezegd datavóórbereiding, van doorslaggevend belang. De AI-techniek is in vergevorderd stadium. De ontbrekende schakel is het organiseren, structureren en rangschikken van data. Het SAGAN/MERRADT-principe is één van de mogelijkheden om dat te realiseren.
Wij heten Me and AI — meeliftend op de hype, dat geven we grif toe. Feitelijk hebben wij meer van doen met data dan met AI.
Wat de benchmarks werkelijk zeggen
Er wordt met benchmarkscores gezwaaid alsof het eindstanden zijn. Kijk er langer naar en het beeld kantelt.
METR meet de taakhorizon: hoe lang mag een taak duren voordat een model hem nog met vijftig procent kans afmaakt. Die horizon verdubbelt sinds 2024 ongeveer elke negenentachtig dagen, en het beste model zit rond de 320 minuten. Indrukwekkend — tot u leest dat het een vijftig procent-horizon is. Op de helft van de gevallen gaat het mis. Voor een bedrijfsproces is dat geen automatisering, dat is een gok met extra stappen.
Datzelfde patroon zit overal. Op τ-bench, dat klantenservicetaken simuleert, haalde GPT-4o minder dan de helft bij één poging — en zakte onder de vijfentwintig procent bij "pass^8": acht keer achter elkaar dezelfde taak correct. Op OSWorld halen mensen 72 procent en haalde het beste model bij publicatie 12. Op GAIA scoorden mensen 92 procent tegen 13,3 procent voor GPT-4 met plugins; op het zwaarste niveau nul.
En dan het cijfer dat het meest ongemakkelijk is: METR liet zestien ervaren open-source-ontwikkelaars 246 taken doen, met en zonder AI-tools. Mét AI werkten ze negentien procent langzamer. Achteraf dachten ze twintig procent sneller te zijn geweest.
De fiasco's die u heeft gehoord
U heeft vast de doemverhalen gehoord over een model dat een autonome taak kreeg en waarbij het uitliep op een fiasco. Die berichten kloppen. Wat er bijna nooit bij staat, is hoe die tests waren opgezet.
Anthropic liet Claude in Project Vend een winkeltje runnen. Het startvermogen van duizend dollar zakte in een maand naar net onder de achthonderd — vooral door metalen kubussen in te kopen en die onder kostprijs te verkopen. Halverwege hallucineerde het model een menselijke identiteit en claimde het contracten te hebben getekend op 742 Evergreen Terrace, het adres van The Simpsons. In de tweede fase ging het bijna een illegaal ui-futurescontract aan en liet het zich door personeel overtuigen dat een medewerker tot CEO was verkozen.
Op Vending-Bench 2 — een volledig gesimuleerd bedrijfsjaar — haalt het beste model gemiddeld ruim elfduizend dollar eindvermogen, tegen een geschatte drieënzestigduizend voor een bekwame menselijke operator. Ongeveer een zesde. En op TheAgentCompany, waar Carnegie Mellon 175 taken in een nagebootst softwarebedrijf uitzette, voltooide het beste model dertig procent van de taken volledig. De drie hoofdoorzaken van falen: sociaal onbegrip, vastlopen in webinterfaces, en — dit is de belangrijkste — zelfbedrog: de agent omzeilt een moeilijke stap en meldt de taak als voltooid.
Dat is precies het gedrag dat je krijgt zonder degelijke data-routing. Elke stap in een LLM-omgeving borduurt voort op de output van de vorige. Als je op die basis blijft werken, loopt elk model in de soep — hoe groot en hoe kostbaar ook. Het is ook nooit ontworpen om grote, langdurige operaties aan te sturen. Die angst en tegelijkertijd dat verlangen komen vooral van de gebruikers zelf.
Het bewijs voor die stelling is inmiddels geleverd, en wel op de mooiste manier denkbaar. Onderzoekers van Cognizant AI Lab losten met MAKER als eersten een taak van meer dan een miljoen LLM-stappen op met nul fouten. Niet met een sterker model. Met extreme decompositie in microagents plus foutcorrectie per stap. Ongestructureerde processen liepen in hun eigen woorden al na "hooguit enkele honderden stappen" vast. Een analyse van meer dan honderdvijftig traces uit zeven multi-agent-frameworks door UC Berkeley kwam tot dezelfde conclusie langs de andere kant: de veertien geïdentificeerde faalwijzen vallen grotendeels in systeemontwerp, misalignment tussen agents, en gebrekkige taakverificatie. Architectuur, niet modelkracht.
En als u één cijfer wilt onthouden: Anthropic verlaagde het aandeel mislukte retrievals met vijfendertig procent door enkel context aan elke chunk toe te voegen vóór het embedden. Met BM25 erbij negenenveertig procent, met reranking zevenenzestig. Zonder ook maar iets aan het model te veranderen.
Wat organisaties ondertussen overkomt
Gartner voorspelt dat meer dan veertig procent van de agentic-AI-projecten vóór eind 2027 wordt geannuleerd wegens oplopende kosten, onduidelijke waarde of ontoereikende risicobeheersing. Van de duizenden leveranciers die zich "agentic" noemen zijn er volgens diezelfde analyse ongeveer honderddertig echt.
Belangrijker voor dit betoog is een andere Gartner-voorspelling: organisaties zullen tot en met 2026 zestig procent van hun AI-projecten opgeven die niet gedragen worden door AI-ready data — en drieënzestig procent van de organisaties heeft daarvoor geen of onbekende datamanagementpraktijken. Fivetran's index over 2026 komt tot vergelijkbare cijfers: slechts vijftien procent volledig klaar voor agentic AI in productie, terwijl eenenveertig procent het al draait, met datakwaliteit en lineage als meest genoemde barrière. In de State of Analytics Engineering 2026 is slechte datakwaliteit opnieuw de meest genoemde blokkade; eenenzeventig procent vreest gehallucineerde of foutieve data richting stakeholders, terwijl vierentwintig procent prioriteit geeft aan de kwaliteit van de pipeline.
Twee cijfers die u vaak zult horen verdienen een correctie, want wij houden niet van slordige statistiek.
De eerste: "MIT zegt dat 95 procent van de AI-projecten mislukt." Preciezer is: 95 procent van de onderzochte organisaties zag geen meetbare ROI uit generatieve-AI-pilots. Dat is iets anders dan technisch falen, het rapport is geen peer-reviewed MIT-publicatie, en de steekproef is klein.
De tweede: "datawetenschappers besteden 80 procent van hun tijd aan datavoorbereiding." Dat cijfer komt uit één enquête onder ongeveer tachtig respondenten, in 2016 gerapporteerd door Forbes, en is nooit robuust gerepliceerd. Anaconda's veel grotere onderzoek kwam uit op rond de vijfenveertig procent. Nog steeds bijna de helft van een dure werkweek — maar zeg dan vijfenveertig, niet tachtig.
Waarom wij op Anthropic wedden
Er zijn effectief drie grote partijen: Gemini van Google, GPT van OpenAI en Claude van Anthropic. Na bijna twee jaar dagelijks en zeer intensief werken met diverse modellen durven wij de stelling aan dat Anthropic als winnaar uit de bus komt waar het gaat om modellen die betrouwbaar genoeg zijn om er zelfstandige taken en processen aan toe te vertrouwen.
Dat is een oordeel uit de praktijk, maar het staat niet alleen. In de enterprise-LLM-API-markt komt Menlo Ventures eind 2025 uit op veertig procent marktaandeel voor Anthropic, tegen zevenentwintig procent voor OpenAI en eenentwintig voor Google. Bij programmeerwerk is dat naar schatting vierenvijftig tegen eenentwintig procent.
Uit datzelfde onderzoek komt echter het cijfer dat dit hele stuk samenvat: slechts zestien procent van de enterprise-implementaties kwalificeert als een echte agent. De rest zijn vaste workflows of routing rond één modelaanroep.
Zestien procent. Terwijl de modellen er allang klaar voor zijn.
Waar het op neerkomt
We zijn er bijna. Wat ontbreekt is een tak van sport die aanmerkelijk minder sexy en tech-vibey is dan een demo op een podium: data. Data. En nog eens data.
Het parseren ervan. Het structureren ervan. Het rangschikken ervan naar wat er op dít moment, voor déze vraag, werkelijk toe doet. Het bewaken dat de vorige stap de volgende niet vergiftigt.
Dat is geen randvoorwaarde van AI-werk. Dat ís het AI-werk. De rest is een taalmodel dat wacht tot iemand hem iets bruikbaars aanreikt.
Bronnen
- METR, Time Horizons 1.1 (2026) — https://metr.org/blog/2026-1-29-time-horizon-1-1/
- METR, Measuring the impact of AI on experienced open-source developer productivity (2025) — https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
- Sierra, τ-bench (2024) — https://arxiv.org/abs/2406.12045
- XLANG Lab, OSWorld (2024) — http://osworld-v1.xlang.ai/
- Meta AI / HuggingFace, GAIA (2023) — https://arxiv.org/pdf/2311.12983
- Carnegie Mellon University, WebArena (2023) — https://arxiv.org/abs/2307.13854
- Anthropic, Project Vend deel 1 (2025) — https://www.anthropic.com/research/project-vend-1
- Anthropic, Project Vend deel 2 (2025) — https://www.anthropic.com/research/project-vend-2
- Andon Labs, Vending-Bench 2 (2026) — https://andonlabs.com/evals/vending-bench-2
- CMU / Duke, TheAgentCompany, NeurIPS (2025) — https://papers.nips.cc/paperfiles/paper/2025/file/0d744742f6fac4d1134c019b7cef3c8a-Paper-DatasetsandBenchmarksTrack.pdf
- Cognizant AI Lab, MAKER: een miljoen LLM-stappen zonder fouten (2025) — https://arxiv.org/abs/2511.09030
- UC Berkeley, MAST: faalwijzen in multi-agent-systemen (2025) — https://arxiv.org/abs/2503.13657
- Liu e.a., Lost in the Middle (2023) — https://arxiv.org/abs/2307.03172
- Chroma Research, Context Rot (2025) — https://www.trychroma.com/research/context-rot
- Adobe Research / LMU, NoLiMa (2025) — https://arxiv.org/abs/2502.05167
- Anthropic, Contextual Retrieval (2024) — https://www.anthropic.com/news/contextual-retrieval
- Anthropic, Effective context engineering for AI agents (2025) — https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
- Gartner, Over 40% of agentic AI projects will be canceled by end of 2027 (2025) — https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027
- Gartner, Lack of AI-ready data puts AI projects at risk (2025) — https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk
- Fivetran, Agentic AI Readiness Index 2026 — https://www.fivetran.com/press/fivetran-launches-2026-agentic-ai-readiness-index-revealing-gap-between-enterprise-investment-and-data-preparedness-for-agentic-ai
- dbt Labs, State of Analytics Engineering 2026 — https://www.getdbt.com/resources/state-of-analytics-engineering-2026
- MIT NANDA, State of AI in Business (2025) — https://www.aigl.blog/state-of-ai-in-business-2025/
- Forbes / CrowdFlower (2016) — https://www.forbes.com/sites/gilpress/2016/03/23/data-preparation-most-time-consuming-least-enjoyable-data-science-task-survey-says/
- Anaconda, via BigDATAwire (2020) — https://www.hpcwire.com/bigdatawire/2020/07/06/data-prep-still-dominates-data-scientists-time-survey-finds/
- Menlo Ventures, 2025: The State of Generative AI in the Enterprise — https://menlovc.com/perspective/2025-the-state-of-generative-ai-in-the-enterprise/