ELECTE 4.0 вже тут — зустрічайте AI Agent.Що нового
Newsletter6 хв читання

Ілюзія розуму: дебати, які стрясають світ штучного інтелекту

Apple публікує дві розгромні статті - "GSM-Symbolic" (жовтень 2024) та "The Illusion of Thinking" (червень 2025), які демонструють, як LLM не справляється з невеликими варіаціями класичних задач (Ханойська вежа, переправа через річку): "продуктивність знижується, коли змінюються лише числові значення". Нульовий успіх на складній Ханойській вежі. Але Алекс Лоусен (Open Philanthropy) заперечує "Ілюзією мислення", демонструючи невдалу методологію: невдачі були пов'язані з обмеженнями на виведення символів, а не з колапсом міркувань, автоматичні скрипти неправильно класифікували частково правильні результати, деякі головоломки були математично нерозв'язними. Повторюючи тести з рекурсивними функціями замість того, щоб перераховувати ходи, Claude/Gemini/GPT розгадали 15 рекордів Ханойської вежі. Гері Маркус приймає тезу Apple про "зміну розподілу", але стаття про хронометраж до WWDC піднімає стратегічні питання. Наслідки для бізнесу: наскільки можна довіряти ШІ у вирішенні критично важливих завдань? Рішення: нейросимволічні підходи - нейронні мережі для розпізнавання образів + мова, символьні системи для формальної логіки. Приклад: АІ-бухгалтерія розуміє "скільки витрат на відрядження?", але SQL/розрахунки/податковий аудит = детермінований код.

L'Illusione del Ragionamento: Il Dibattito che Sta Scuotendo il Mondo dell'AI

Підсумувати статтю за допомогою ШІ


Коли AI-міркування стикається з реальністю: робот правильно застосовує логічне правило, але ідентифікує баскетбольний м'яч як апельсин. Ідеальна метафора того, як LLM можуть імітувати логічні процеси, не володіючи справжнім розумінням.

Останніми місяцями спільноту штучного інтелекту сколихнула жвава дискусія, спричинена двома впливовими дослідницькими роботами, опублікованими apple. Перша, illusione-del-ragionamento-il-dibattito-che-sta-scuotendo-il-mondo-dell-ai&_bhlid=a540c17e5de7c2723906dabd9b8f31cdf0c5bf18" target="_blank" id="">"GSM-Symbolic" (жовтень 2024), а друга, "The Illusion of Thinking" (червень 2025), поставили під сумнів передбачувані здібності до міркування у Large Language Models, викликавши суперечливі реакції в усій галузі.

Як уже було проаналізовано в нашому попередньому дослідженні "Ілюзія Прогресу: Симулювати Загальний Штучний Інтелект, Не Досягаючи Його", питання штучного міркування торкається самої суті того, що ми вважаємо інтелектом у машинах.

Що говорять дослідження Apple

Дослідники Apple провели систематичний аналіз Large Reasoning Models (LRM) - тих моделей, які генерують детальні сліди міркування перед наданням відповіді. Результати виявилися несподіваними і, для багатьох, тривожними.

Проведені випробування

У дослідженні найдосконаліші моделі піддавалися класичним алгоритмічним головоломкам, таким як:

  • Ханойська вежа: Математична головоломка, вперше розв'язана в 1957 році
  • Задачі про переправу через річку: Логічні загадки зі специфічними обмеженнями
  • Тест GSM-Symbolic: Варіації математичних задач початкового рівня


Тестування міркування за допомогою класичних загадок: задача про селянина, вовка, козу та капусту - одна з логічних головоломок, використаних у дослідженнях Apple для оцінки здібностей до міркування у LLM. Складність полягає у знаходженні правильної послідовності переправ, уникаючи того, щоб вовк з'їв козу або коза з'їла капусту, коли їх залишають самих. Простий, але ефективний тест для розрізнення алгоритмічного розуміння та запам'ятовування патернів.

Суперечливі результати

Результати показали, що навіть невеликі зміни у формулюванні задач призводять до значних відхилень у продуктивності, що вказує на тривожну крихкість міркування. Як повідомляється у матеріалі AppleInsider, "продуктивність усіх моделей знижується, коли змінюються лише числові значення в питаннях тесту GSM-Symbolic".

Контрнаступ: ілюзія мислення

Реакція AI-спільноти не забарилася. Алекс Лоусен з Open Philanthropy у співпраці з Claude Opus від Anthropic опублікував детальну відповідь під назвою "The Illusion of the Illusion of Thinking", оскаржуючи методології та висновки дослідження Apple.

Основні заперечення

  1. Проігноровані Обмеження Виводу: Багато невдач, приписаних "колапсу міркування", насправді були зумовлені обмеженнями на кількість вихідних токенів моделей
  2. Помилкова Оцінка: Автоматичні скрипти класифікували як повні провали навіть часткові, але алгоритмічно правильні результати
  3. Нерозв'язні Задачі: Деякі головоломки були математично нерозв'язними, але моделі штрафувалися за те, що не розв'язали їх

Підтверджувальні тести

Коли Лоусен повторив тести з альтернативними методологіями - просячи моделі генерувати рекурсивні функції замість переліку всіх ходів - результати виявилися разюче іншими. Такі моделі, як Claude, gemini та GPT, правильно розв'язали задачі Ханойської вежі з 15 дисками, значно перевершивши рівень складності, на якому Apple повідомляла про нульовий успіх.

Авторитетні голоси в дебатах

Гарі Маркус: історичний критик

Gary Marcus, який завжди критикував здатність LLM до міркування, сприйняв результати Apple як підтвердження своїх двадцятирічних тез. За словами Маркуса, LLM продовжують боротися з "distribution shift" - здатністю узагальнювати за межі даних навчання, залишаючись "хорошими розв'язувачами вже вирішених задач".

Спільнота LocalLlama

Дискусія поширилася також на спеціалізовані спільноти, такі як LocalLlama на Reddit, де розробники та дослідники обговорюють практичні наслідки для моделей з відкритим кодом та локального впровадження.

Поза межами суперечок: що це означає для компаній

Стратегічні наслідки

Ця дискусія не є суто академічною. Вона має прямі наслідки для:

  • Розгортання ШІ у виробництві: Наскільки ми можемо довіряти моделям для критично важливих завдань?
  • Інвестиції в НДДКР: Куди спрямувати ресурси для наступного прориву?
  • Комунікація зі стейкхолдерами: Як керувати реалістичними очікуваннями щодо можливостей ШІ?

Нейросимволічний шлях

Як показано в кількох технічних аналізах, дедалі очевиднішою стає необхідність гібридних підходів, які поєднують:

  • Нейронні мережі для розпізнавання патернів та розуміння мови
  • Символьні системи для алгоритмічного міркування та формальної логіки

Простий приклад: AI-асистент, який допомагає з бухгалтерією. Мовна модель розуміє, коли ви запитуєте "скільки я витратив на відрядження цього місяця?", і витягує відповідні параметри (категорія: відрядження, період: цей місяць). Але SQL-запит, який звертається до бази даних, обчислення суми та перевірка податкових обмежень? Це виконує детермінований код, а не нейронна модель.

Час і стратегічний контекст

Спостерігачі не залишили без уваги той факт, що дослідження Apple було опубліковано незадовго до WWDC, що викликало запитання щодо стратегічних мотивів. Як зазначає аналіз 9to5Mac, "час публікації дослідження Apple - якраз перед WWDC - викликав кілька піднятих брів. Чи була це наукова віха, чи стратегічний хід для перепозиціонування Apple в ширшому ландшафті ШІ?"

Уроки на майбутнє

Для дослідників

  • Експериментальний дизайн: Важливість розрізнення архітектурних обмежень та імплементаційних обмежень
  • Ретельна оцінка: Необхідність складних бенчмарків, які відокремлюють когнітивні здібності від практичних обмежень
  • Методологічна прозорість: Обов'язок повністю документувати експериментальні налаштування та обмеження

Для компаній

  • Реалістичні очікування: Визнавати поточні обмеження, не відмовляючись від майбутнього потенціалу
  • Гібридні підходи: Інвестувати в рішення, що поєднують сильні сторони різних технологій
  • Постійна оцінка: Впроваджувати системи тестування, що відображають реальні сценарії використання

Висновки: Навігація в умовах невизначеності

Дискусія, породжена дослідженнями Apple, нагадує нам, що ми все ще перебуваємо на початкових етапах розуміння штучного інтелекту. Як підкреслено в нашій попередній статті, розрізнення між симуляцією та справжнім міркуванням залишається одним із найскладніших викликів нашого часу.

Справжній урок полягає не в тому, чи можуть ШІ "міркувати" в людському розумінні цього терміну, а в тому, як ми можемо побудувати системи, які використовують їхні сильні сторони, компенсуючи їхні обмеження. У світі, де штучний інтелект вже трансформує цілі галузі, питання вже не в тому, чи є ці інструменти "розумними", а в тому, як їх ефективно і відповідально використовувати.

Майбутнє корпоративного ШІ, ймовірно, буде не за одним революційним підходом, а за розумною оркестровкою декількох взаємодоповнюючих технологій. І в цьому сценарії здатність критично і чесно оцінювати можливості наших інструментів сама стає конкурентною перевагою.

Останні розробки (Січень 2026)

OpenAI випускає o3 та o4-mini: 16 квітня 2025 року OpenAI офіційно випустила o3 та o4-mini, найбільш просунуті моделі міркування серії o. Ці моделі тепер можуть використовувати інструменти агентним способом, поєднуючи веб-пошук, аналіз файлів, візуальне міркування та генерацію зображень. o3 встановила нові рекорди на таких бенчмарках, як Codeforces, SWE-bench та MMMU, тоді як o4-mini оптимізує продуктивність і витрати для завдань міркування великого обсягу. Моделі демонструють здатність до "мислення за допомогою зображень", візуально трансформуючи вміст для глибшого аналізу.

DeepSeek-R1 сколихнула індустрію ШІ: У січні 2025 року DeepSeek випустила R1, модель міркування з відкритим кодом, яка досягла продуктивності, порівнянної з OpenAI o1, за вартості навчання лише $6 мільйонів (проти сотень мільйонів у західних моделей). DeepSeek-R1 демонструє, що здатності до міркування можна стимулювати за допомогою чистого навчання з підкріпленням, без потреби в анотованих людських демонстраціях. Модель стала безкоштовним додатком №1 в App Store та Google Play у десятках країн. У січні 2026 року DeepSeek опублікувала розширену статтю на 60 сторінок, яка розкриває секрети навчання і відверто визнає, що такі техніки, як Monte Carlo Tree Search (MCTS), не спрацювали для загального міркування.

Anthropic оновлює "Конституцію" Claude: 22 січня 2026 року Anthropic опублікувала нову конституцію на 23 000 слів для Claude, перейшовши від підходу, заснованого на правилах, до підходу, заснованого на розумінні етичних принципів. Документ стає першим фреймворком великої компанії з ШІ, який формально визнає можливість свідомості або морального статусу ШІ, стверджуючи, що Anthropic піклується про "психологічне благополуччя, самосвідомість і добробут" Claude.

Дебати загострюються: Дослідження липня 2025 року відтворило та вдосконалило бенчмарки Apple, підтвердивши, що LRM все ще демонструють когнітивні обмеження при помірному зростанні складності (близько 8 дисків у Ханойській вежі). Дослідники показали, що це залежить не лише від обмежень виводу, а й від реальних когнітивних меж, підкресливши, що дебати далекі від завершення.

Для поглибленого вивчення AI-стратегії вашої організації та впровадження надійних рішень наша команда експертів готова надати персоналізовані консультації.

Джерела та література:

Коментарі

Коментарів поки немає — почніть обговорення.