ELECTE 4.0 is live — de AI Agent is er.Bekijk wat er nieuw is
Newsletter6 min leestijd

De illusie van redeneren: het debat dat de AI-wereld op zijn grondvesten doet schudden

Apple publiceert twee vernietigende artikelen - 'GSM-Symbolic' (oktober 2024) en 'The Illusion of Thinking' (juni 2025) - die aantonen hoe LLM faalt op kleine variaties van klassieke problemen (Toren van Hanoi, rivieroversteek): 'prestaties nemen af wanneer alleen numerieke waarden worden veranderd'. Nul succes bij complexe Toren van Hanoi. Maar Alex Lawsen (Open Philanthropy) antwoordt met "The Illusion of Thinking", waarin hij een falende methodologie demonstreert: mislukkingen waren limieten aan de uitvoer van tokens, geen ineenstorting van redeneringen, automatische scripts classificeerden gedeeltelijk correcte uitvoer verkeerd, sommige puzzels waren wiskundig onoplosbaar. Door tests te herhalen met recursieve functies in plaats van zetten op te sommen, losten Claude/Gemini/GPT de Toren van Hanoi 15 records op. Gary Marcus omarmt Apple-these over 'distributieverschuiving', maar pre-WWDC timing paper roept strategische vragen op. Zakelijke implicaties: hoeveel vertrouwen in AI voor kritieke taken? Oplossing: neurosymbolische benaderingen neurale netwerken voor patroonherkenning+taal, symbolische systemen voor formele logica. Voorbeeld: AI boekhouding begrijpt "hoeveel reiskosten?" maar SQL/berekeningen/belastingcontroles = deterministische code.

L'Illusione del Ragionamento: Il Dibattito che Sta Scuotendo il Mondo dell'AI

Vat dit artikel samen met AI


Wanneer AI-redenering de realiteit ontmoet: de robot past de logische regel correct toe, maar identificeert de basketbal als een sinaasappel. Een perfecte metafoor voor hoe LLM's logische processen kunnen simuleren zonder werkelijk begrip te bezitten.

De afgelopen maanden is de kunstmatige-intelligentiegemeenschap doortrokken van een verhit debat, ontstaan door twee invloedrijke onderzoekspapers gepubliceerd door apple. Het eerste, illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">"GSM-Symbolic" (oktober 2024), en het tweede, "The Illusion of Thinking" (juni 2025), hebben de veronderstelde redeneercapaciteiten van Large Language Models in twijfel getrokken, wat tegenstrijdige reacties in de hele sector heeft veroorzaakt.

Zoals reeds geanalyseerd in onze eerdere verdieping over "De Illusie van Vooruitgang: Kunstmatige Algemene Intelligentie Simuleren Zonder Haar te Bereiken", raakt de kwestie van kunstmatige redenering de kern van wat we als intelligentie in machines beschouwen.

Wat Apple zegt

De onderzoekers van Apple hebben een systematische analyse uitgevoerd op Large Reasoning Models (LRM) - modellen die gedetailleerde redeneersporen genereren voordat ze een antwoord geven. De resultaten waren verrassend en, voor velen, verontrustend.

Uitgevoerde tests

Het onderzoek onderwierp de meest geavanceerde modellen aan klassieke algoritmische puzzels zoals:

  • Toren van Hanoi: Een wiskundige puzzel die voor het eerst in 1957 werd opgelost
  • Rivieroversteekproblemen: Logische raadsels met specifieke beperkingen
  • GSM-Symbolic Benchmark: Variaties op wiskundige problemen van basisschoolniveau


Redenering testen met klassieke raadsels: het probleem van de boer, de wolf, de geit en de kool is een van de logische puzzels die in de Apple-studies worden gebruikt om de redeneercapaciteiten van LLM's te evalueren. De moeilijkheid ligt in het vinden van de juiste volgorde van oversteken, zonder dat de wolf de geit opeet of de geit de kool opeet wanneer ze alleen worden gelaten. Een eenvoudige maar effectieve test om onderscheid te maken tussen algoritmisch begrip en het onthouden van patronen.

Controversiële resultaten

De resultaten toonden aan dat zelfs kleine wijzigingen in de formulering van de problemen tot aanzienlijke variaties in de prestaties leiden, wat wijst op een zorgwekkende broosheid in de redenering. Zoals gemeld in de berichtgeving van AppleInsider, "nemen de prestaties van alle modellen af wanneer alleen de numerieke waarden in de vragen van de GSM-Symbolic benchmark worden gewijzigd".

Het tegenoffensief: de illusie van denken

De reactie van de AI-gemeenschap liet niet lang op zich wachten. Alex Lawsen van Open Philanthropy, in samenwerking met Claude Opus van Anthropic, publiceerde een gedetailleerde weerlegging getiteld "The Illusion of the Illusion of Thinking", waarin de methodologieën en conclusies van de Apple-studie werden betwist.

De belangrijkste bezwaren

  1. Genegeerde Output-limieten: Veel mislukkingen die werden toegeschreven aan "redeneercollaps" waren in werkelijkheid te wijten aan de token-limieten van de output van de modellen
  2. Foutieve Evaluatie: De automatische scripts classificeerden ook gedeeltelijke maar algoritmisch correcte outputs als totale mislukkingen
  3. Onmogelijke Problemen: Sommige puzzels waren wiskundig onoplosbaar, maar de modellen werden bestraft omdat ze ze niet hadden opgelost

Bevestigingstesten

Toen Lawsen de tests herhaalde met alternatieve methodologieën - door de modellen te vragen recursieve functies te genereren in plaats van alle zetten op te sommen - waren de resultaten dramatisch anders. Modellen als Claude, gemini en GPT losten correct problemen van de Toren van Hanoi met 15 schijven op, ver voorbij de complexiteit waarbij Apple nul successen rapporteerde.

Gezaghebbende stemmen in het debat

Gary Marcus: de historische criticus

Gary Marcus, van oudsher criticus van de redeneercapaciteiten van LLM's, omarmde de Apple-resultaten als bevestiging van zijn twintig jaar oude stellingen. Volgens Marcus blijven LLM's worstelen met "distribution shift" - het vermogen om te generaliseren voorbij de data waarop ze zijn getraind - en blijven ze "goede oplossers van reeds opgeloste problemen".

De LocalLlama Gemeenschap

De discussie breidde zich ook uit naar gespecialiseerde communities zoals LocalLlama op Reddit, waar ontwikkelaars en onderzoekers debatteren over de praktische implicaties voor open-source modellen en lokale implementatie.

De controverse voorbij: wat betekent dit voor bedrijven?

Strategische implicaties

Dit debat is niet louter academisch. Het heeft directe gevolgen voor:

  • AI-deployment in Productie: Hoeveel kunnen we de modellen vertrouwen voor kritieke taken?
  • Investeringen in R&D: Waar moeten middelen worden geconcentreerd voor de volgende doorbraak?
  • Communicatie met Stakeholders: Hoe realistische verwachtingen over AI-capaciteiten beheren?

De neurosymbolische weg

Zoals blijkt uit verschillende technische inzichten, wordt steeds duidelijker dat er behoefte is aan hybride benaderingen die het volgende combineren:

  • Neurale netwerken voor patroonherkenning en taalbegrip
  • Symbolische systemen voor algoritmische redenering en formele logica

Triviaal voorbeeld: een AI-assistent die helpt bij boekhouding. Het taalmodel begrijpt wanneer je vraagt "hoeveel heb ik deze maand aan reiskosten uitgegeven?" en haalt de relevante parameters eruit (categorie: reiskosten, periode: deze maand). Maar de SQL-query die de database bevraagt, de berekening van de som en de controle van de fiscale beperkingen? Dat doet deterministische code, niet het neurale model.

Timing en strategische context

Het is de waarnemers niet ontgaan dat de Apple-paper kort voor WWDC werd gepubliceerd, wat vragen oproept over de strategische motieven. Zoals de analyse van 9to5Mac opmerkt: "de timing van de Apple-paper - vlak voor WWDC - deed sommigen de wenkbrauwen fronsen. Was dit een onderzoeksmijlpaal, of een strategische zet om Apple te herpositioneren in het bredere AI-landschap?"

Lessen voor de toekomst

Voor onderzoekers

  • Experimenteel Ontwerp: Het belang van het onderscheiden tussen architecturale beperkingen en implementatiebeperkingen
  • Rigoureuze Evaluatie: De noodzaak van geavanceerde benchmarks die cognitieve capaciteiten scheiden van praktische beperkingen
  • Methodologische Transparantie: De verplichting om experimentele opzet en beperkingen volledig te documenteren

Voor bedrijven

  • Realistische Verwachtingen: De huidige beperkingen erkennen zonder het toekomstige potentieel op te geven
  • Hybride Benaderingen: Investeren in oplossingen die de sterke punten van verschillende technologieën combineren
  • Continue Evaluatie: Testsystemen implementeren die reële gebruiksscenario's weerspiegelen

Conclusies: Navigeren door onzekerheid

Het debat dat door de Apple-papers is ontstaan, herinnert ons eraan dat we ons nog in de beginfase van het begrip van kunstmatige intelligentie bevinden. Zoals benadrukt in ons eerdere artikel, blijft het onderscheid tussen simulatie en authentieke redenering een van de meest complexe uitdagingen van onze tijd.

De echte les is niet of LLM's al dan niet kunnen 'redeneren' in de menselijke betekenis van het woord, maar eerder hoe we systemen kunnen bouwen die hun sterke punten uitbuiten en tegelijkertijd hun beperkingen compenseren. In een wereld waarin AI al hele sectoren transformeert, is de vraag niet langer of deze hulpmiddelen 'slim' zijn, maar hoe we ze effectief en verantwoord kunnen gebruiken.

De toekomst van ondernemings-AI ligt waarschijnlijk niet in één revolutionaire benadering, maar in de intelligente orkestratie van verschillende complementaire technologieën. En in dit scenario wordt het vermogen om de mogelijkheden van onze tools kritisch en eerlijk te evalueren zelf een concurrentievoordeel.

Laatste Ontwikkelingen (Januari 2026)

OpenAI brengt o3 en o4-mini uit: Op 16 april 2025 heeft OpenAI o3 en o4-mini publiekelijk uitgebracht, de meest geavanceerde reasoning-modellen uit de o-serie. Deze modellen kunnen nu op agentieve wijze tools gebruiken, waarbij webzoeken, bestandsanalyse, visuele redenering en beeldgeneratie worden gecombineerd. o3 heeft nieuwe records gevestigd op benchmarks zoals Codeforces, SWE-bench en MMMU, terwijl o4-mini prestaties en kosten optimaliseert voor reasoning-taken met een hoog volume. De modellen tonen het vermogen om "met beelden te denken", waarbij inhoud visueel wordt getransformeerd voor diepgaandere analyses.

DeepSeek-R1 schudt de AI-industrie op: In januari 2025 bracht DeepSeek R1 uit, een open-source reasoningmodel dat prestaties bereikte vergelijkbaar met OpenAI o1, met een trainingskosten van slechts $6 miljoen (tegenover honderden miljoenen voor westerse modellen). DeepSeek-R1 toont aan dat redeneervaardigheden kunnen worden gestimuleerd door puur reinforcement learning, zonder dat menselijke geannoteerde demonstraties nodig zijn. Het model werd de #1 gratis app op App Store en Google Play in tientallen landen. In januari 2026 publiceerde DeepSeek een uitgebreid paper van 60 pagina's dat de geheimen van de training onthult en openlijk toegeeft dat technieken zoals Monte Carlo Tree Search (MCTS) niet werkten voor algemeen redeneren.

Anthropic werkt de "Grondwet" van Claude bij: Op 22 januari 2026 publiceerde Anthropic een nieuwe grondwet van 23.000 woorden voor Claude, waarbij het overstapte van een regelgebaseerde aanpak naar een aanpak gebaseerd op het begrijpen van ethische principes. Het document is het eerste framework van een groot AI-bedrijf dat formeel de mogelijkheid van bewustzijn of morele status van AI erkent, en stelt dat Anthropic zich bekommert om het "psychologisch welzijn, zelfbeeld en welbevinden" van Claude.

Het debat verhevigt: Een studie uit juli 2025 heeft de Apple-benchmarks gerepliceerd en verfijnd, en bevestigt dat LRM's nog steeds cognitieve beperkingen vertonen wanneer de complexiteit matig toeneemt (rond de 8 schijven bij de Toren van Hanoi). De onderzoekers hebben aangetoond dat dit niet alleen afhangt van output-beperkingen, maar ook van echte cognitieve grenzen, wat erop wijst dat het debat verre van afgesloten is.

Voor verdieping over de AI-strategie van uw organisatie en de implementatie van robuuste oplossingen staat ons team van experts klaar voor persoonlijk advies.

Bronnen en referenties:

Reacties

Nog geen reacties — start het gesprek.