ELECTE 4.0 är live — AI Agent är här.Se vad som är nytt
Newsletter6 min läsning

Illusionen av resonemang: Debatten som skakar AI-världen

Apple publicerar två förödande artiklar - "GSM-Symbolic" (oktober 2024) och "The Illusion of Thinking" (juni 2025) - som visar hur LLM misslyckas med små variationer av klassiska problem (Tower of Hanoi, flodkorsning): "prestandan minskar när endast numeriska värden ändras". Noll framgång på komplexa Tower of Hanoi. Men Alex Lawsen (Open Philanthropy) svarar med "The Illusion of Thinking" som demonstrerar misslyckad metodik: misslyckanden var gränser för symboliska utdata inte resonemangskollapser, automatiska skript felklassificerade delvis korrekta utdata, vissa pussel var matematiskt olösliga. Genom att upprepa tester med rekursiva funktioner istället för att lista drag löste Claude/Gemini/GPT Tower of Hanoi 15 poster. Gary Marcus omfamnar Apples tes om "distributionsskift", men timingdokumentet före WWDC väcker strategiska frågor. Affärsimplikationer: hur mycket ska man lita på AI för kritiska uppgifter? Lösning: neurosymboliska metoder neurala nätverk för mönsterigenkänning + språk, symboliska system för formell logik. Exempel: AI-redovisning förstår "hur mycket resekostnader?" men SQL/beräkningar/skatterevisioner = deterministisk kod.

L'Illusione del Ragionamento: Il Dibattito che Sta Scuotendo il Mondo dell'AI

Sammanfatta artikeln med AI


När AI-resonemang möter verkligheten: roboten tillämpar den logiska regeln korrekt men identifierar basketbollen som en apelsin. En perfekt metafor för hur LLM:er kan simulera logiska processer utan att besitta verklig förståelse.

Under de senaste månaderna har AI-communityn genomsyrats av en het debatt utlöst av två inflytelserika forskningsartiklar publicerade av apple. Den första, illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">"GSM-Symbolic" (oktober 2024), och den andra, "The Illusion of Thinking" (juni 2025), har ifrågasatt Large Language Models påstådda resonemangsförmågor, vilket har utlöst motstridiga reaktioner i hela branschen.

Som redan analyserats i vår tidigare fördjupning om "Framstegets Illusion: Att Simulera Generell Artificiell Intelligens Utan Att Uppnå Den", berör frågan om artificiellt resonemang själva kärnan i vad vi betraktar som intelligens hos maskiner.

Vad Apple Research säger

Apples forskare genomförde en systematisk analys av Large Reasoning Models (LRM) - de modeller som genererar detaljerade resonemangsspår innan de ger ett svar. Resultaten var förvånande och, för många, oroväckande.

Genomförda tester

I studien utsattes de mest avancerade modellerna för klassiska algoritmiska pussel som t.ex:

  • Torn i Hanoi: Ett matematiskt pussel som löstes för första gången 1957
  • Flodövergångsproblem: Logiska gåtor med specifika begränsningar
  • GSM-Symbolic-benchmark: Variationer av matematiska problem på grundskolenivå


Att testa resonemang med klassiska gåtor: problemet med bonden, vargen, geten och kålen är ett av de logiska pussel som användes i Apples studier för att bedöma LLM:ers resonemangsförmåga. Svårigheten ligger i att hitta rätt sekvens av övergångar och undvika att vargen äter geten eller geten äter kålen när de lämnas ensamma. Ett enkelt men effektivt test för att skilja mellan algoritmisk förståelse och mönsterinlärning.

Kontroversiella resultat

Resultaten visade att även små förändringar i problemformuleringen leder till betydande variationer i prestanda, vilket antyder en oroande skörhet i resonemangsförmågan. Som rapporterats i AppleInsiders rapportering, "minskar prestandan hos alla modeller när enbart de numeriska värdena i GSM-Symbolic-benchmarkets frågor ändras".

Motoffensiven: Illusionen av att tänka

Reaktionen från AI-communityn dröjde inte. Alex Lawsen från Open Philanthropy publicerade, i samarbete med Claude Opus från Anthropic, ett detaljerat svar med titeln "The Illusion of the Illusion of Thinking", där han ifrågasatte metodologin och slutsatserna i Apples studie.

De viktigaste invändningarna

  1. Ignorerade Output-begränsningar: Många fel som tillskrevs "resonemangskollaps" berodde i själva verket på modellernas begränsningar i output-tokens
  2. Felaktig Utvärdering: De automatiska skripten klassificerade även partiella men algoritmiskt korrekta output som totala misslyckanden
  3. Olösbara Problem: Vissa pussel var matematiskt olösliga, men modellerna straffades för att inte ha löst dem

Bekräftelsetest

När Lawsen upprepade testerna med alternativa metoder - genom att be modellerna generera rekursiva funktioner istället för att lista alla drag - blev resultaten dramatiskt annorlunda. Modeller som Claude, gemini och GPT löste korrekt Torn i Hanoi-problem med 15 skivor, långt bortom den komplexitetsnivå där Apple rapporterade noll framgångar.

Auktoritativa röster i debatten

Gary Marcus: Den historiska kritikern

Gary Marcus, som alltid varit kritisk till LLM:ers resonemangsförmåga, tog emot Apples resultat som en bekräftelse på sina tjugoåriga teser. Enligt Marcus fortsätter LLM:er att kämpa med "distribution shift" - förmågan att generalisera bortom träningsdata - och förblir "goda problemlösare av redan lösta problem".

Den lokala lamagemenskapen

Diskussionen har även spridit sig till specialiserade communities som LocalLlama på Reddit, där utvecklare och forskare diskuterar de praktiska implikationerna för open source-modeller och lokal implementering.

Bortom kontroverser: Vad det innebär för företag

Strategiska konsekvenser

Denna debatt är inte enbart akademisk. Den har direkta konsekvenser för:

  • AI-driftsättning i Produktion: Hur mycket kan vi lita på modellerna för kritiska uppgifter?
  • Investeringar i FoU: Var ska vi koncentrera resurserna för nästa genombrott?
  • Kommunikation med Intressenter: Hur hanterar man realistiska förväntningar på AI-förmågor?

Det neurosymboliska sättet

Som framhållits i flera tekniska fördjupningar, framträder allt tydligare behovet av hybridansatser som kombinerar:

  • Neurala nätverk för mönsterigenkänning och språkförståelse
  • Symboliska system för algoritmiskt resonemang och formell logik

Trivialt exempel: en AI-assistent som hjälper till med bokföring. Språkmodellen förstår när du frågar "hur mycket har jag spenderat på resor den här månaden?" och extraherar de relevanta parametrarna (kategori: resor, period: den här månaden). Men SQL-frågan som söker i databasen, summeringen och kontrollen av skattemässiga begränsningar? Det gör deterministisk kod, inte den neurala modellen.

Tidplan och strategisk kontext

Det har inte undgått observatörer att Apples artikel publicerades strax före WWDC, vilket väckt frågor om de strategiska motiven. Som 9to5Macs analys konstaterar, "tidpunkten för Apples artikel - precis före WWDC - har väckt en del ögonbryn. Var detta en milstolpe inom forskningen, eller ett strategiskt drag för att ompositionera Apple i det bredare AI-landskapet?"

Lärdomar för framtiden

För forskare

  • Experimentell Design: Vikten av att skilja mellan arkitektoniska begränsningar och implementeringsmässiga begränsningar
  • Rigorös Utvärdering: Behovet av sofistikerade benchmarks som separerar kognitiva förmågor från praktiska begränsningar
  • Metodologisk Transparens: Skyldigheten att fullständigt dokumentera experimentella upplägg och begränsningar

För företag

  • Realistiska Förväntningar: Erkänna nuvarande begränsningar utan att ge upp framtida potential
  • Hybridansatser: Investera i lösningar som kombinerar styrkorna hos olika teknologier
  • Kontinuerlig Utvärdering: Implementera testsystem som återspeglar verkliga användningsscenarier

Slutsatser: Att navigera i osäkerhet

Debatten som utlösts av Apples artiklar påminner oss om att vi fortfarande befinner oss i de inledande faserna av förståelsen av artificiell intelligens. Som framhålls i vår tidigare artikel, förblir distinktionen mellan simulering och genuint resonemang en av vår tids mest komplexa utmaningar.

Den verkliga lärdomen är inte huruvida jurister kan "resonera" i ordets mänskliga bemärkelse, utan snarare hur vi kan bygga system som utnyttjar deras styrkor och samtidigt kompenserar för deras begränsningar. I en värld där AI redan håller på att förändra hela sektorer är frågan inte längre om dessa verktyg är "smarta", utan hur de ska användas på ett effektivt och ansvarsfullt sätt.

Framtiden för AI i företag kommer förmodligen inte att ligga i ett enda revolutionerande tillvägagångssätt, utan i en intelligent orkestrering av flera kompletterande tekniker. Och i det här scenariot blir förmågan att kritiskt och ärligt utvärdera våra verktygs kapacitet en konkurrensfördel i sig.

Senaste Utvecklingen (Januari 2026)

OpenAI lanserar o3 och o4-mini: Den 16 april 2025 lanserade OpenAI offentligt o3 och o4-mini, de mest avancerade resonemangsmodellerna i o-serien. Dessa modeller kan nu använda verktyg på ett agentivt sätt, genom att kombinera webbsökning, filanalys, visuellt resonemang och bildgenerering. o3 satte nya rekord på benchmarks som Codeforces, SWE-bench och MMMU, medan o4-mini optimerar prestanda och kostnader för resonemangsuppgifter med hög volym. Modellerna visar förmåga till "tänkande med bilder", genom att visuellt transformera innehåll för djupare analys.

DeepSeek-R1 skakar om AI-industrin: I januari 2025 släppte DeepSeek R1, en resoneringsmodell med öppen källkod som uppnådde prestanda jämförbar med OpenAI o1 till en träningskostnad på endast 6 miljoner dollar (jämfört med hundratals miljoner för västerländska modeller). DeepSeek-R1 visar att resoneringsförmåga kan stimuleras genom ren förstärkningsinlärning (reinforcement learning), utan behov av annoterade mänskliga demonstrationer. Modellen blev app nummer ett bland gratisappar på App Store och Google Play i dussintals länder. I januari 2026 publicerade DeepSeek ett utökat 60-sidigt paper som avslöjar träningshemligheterna och öppet erkänner att tekniker som Monte Carlo Tree Search (MCTS) inte fungerade för allmän resonering.

Anthropic uppdaterar Claudes "konstitution": Den 22 januari 2026 publicerade Anthropic en ny konstitution på 23 000 ord för Claude, och gick från en regelbaserad ansats till en som bygger på förståelse av etiska principer. Dokumentet blir det första ramverket från ett stort AI-företag som formellt erkänner möjligheten av medvetande eller moralisk status hos AI, och slår fast att Anthropic bryr sig om Claudes "psykologiska välbefinnande, självkänsla och välmående".

Debatten hårdnar: En studie från juli 2025 replikerade och förfinade Apples riktmärken (benchmarks), och bekräftade att LRM-modeller fortfarande visar kognitiva begränsningar när komplexiteten ökar måttligt (cirka 8 diskar i Tornen i Hanoi). Forskarna visade att detta inte bara beror på begränsningar i outputen, utan även på verkliga kognitiva gränser, vilket visar att debatten långt ifrån är avslutad.

För fördjupning kring er organisations AI-strategi och implementering av robusta lösningar står vårt expertteam till förfogande för skräddarsydd rådgivning.

Källor och referenser:

Kommentarer

Inga kommentarer än — starta konversationen.