За межами алгоритму: як навчають і вдосконалюють моделі штучного інтелекту
"Дані - це ключ. Святий Грааль генеративного ШІ", - Хіларі Пакер, технічний директор American Express. На боротьбу з даними витрачається 80% зусиль у проектах зі створення ШІ. DeepSeek змінив правила: висновок коштує 1/30 порівняно з OpenAI. Даріо Амодей: витрати знижуються в 4 рази на рік. "Я очікую, що витрати впадуть до нуля" - CDO Intuit. Поєднання дистиляції + RAG - це те, в чому полягає магія для більшості компаній. Майбутнє? Маса специфічних, недорогих моделей, заснованих на даних компанії.

Як навчається модель штучного інтелекту
Навчання моделей штучного інтелекту є одним з найскладніших завдань у сфері сучасного технологічного розвитку. Це набагато більше, ніж просто алгоритмічне питання: ефективне навчання моделі вимагає методичного та багатопрофільного підходу, що об'єднує дані, науку про дані, знання предметної області та розробку програмного забезпечення. Як зазначає Джеймс Люк у своїй фундаментальній праці "Beyond Algorithms: Delivering AI for Business", успіх впровадження ШІ залежить набагато більше від управління даними та системного проєктування, ніж від самих алгоритмів. Ситуація стрімко змінюється: такі новинки, як модель DeepSeek-R1, переосмислюють витрати та доступність.
Фундамент: збір та управління даними
Якість, а не кількість
Всупереч поширеній думці, кількість даних не завжди є визначальним фактором успіху. Значно важливішими є якість та репрезентативність даних. У цьому контексті дуже важливо інтегрувати різні джерела:
- Власні дані: зібрані та етично анонімізовані з наявних впроваджень
- Ліцензовані дані: отримані від надійних постачальників, що відповідають суворим стандартам якості
- Набори даних з відкритим кодом: ретельно перевірені для забезпечення різноманітності та точності
- Синтетичні дані: штучно згенеровані для заповнення прогалин і вирішення проблем конфіденційності
Ця інтеграція створює комплексну навчальну базу, яка охоплює реальні сценарії, зберігаючи при цьому етичні стандарти та стандарти конфіденційності.
Проблема підготовки даних
На процес "боротьби з даними" припадає до 80 відсотків зусиль, необхідних у проектах зі штучного інтелекту. Ця фаза включає в себе:
- Очищення даних: усунення невідповідностей, дублікатів і аномальних значень
- Перетворення даних: конвертація у формати, придатні для обробки
- Інтеграція даних: об'єднання різних джерел, які часто використовують несумісні схеми та формати
- Обробка відсутніх даних: стратегії, такі як статистична імпутація або використання проксі-даних
Архітектура моделі: правильний вибір розміру
При виборі архітектури моделі необхідно керуватися специфікою проблеми, яку потрібно вирішити, а не особистими схильностями чи вподобаннями. Різні типи проблем вимагають різних підходів:
- Мовні моделі на основі трансформерів для завдань, що вимагають глибокого розуміння мови
- Згорткові нейронні мережі для розпізнавання зображень і закономірностей
- Графові нейронні мережі для аналізу складних зв'язків між сутностями
- Навчання з підкріпленням для задач оптимізації та прийняття рішень
- Гібридні архітектури, що поєднують кілька підходів для складних випадків використання
Архітектурна оптимізація вимагає систематичної оцінки різних конфігурацій з акцентом на збалансування продуктивності та обчислювальних вимог - аспект, який став ще більш актуальним з появою таких моделей, як DeepSeek-R1, що пропонують розширені можливості міркувань при значно менших витратах.
Прогресивні методики навчання
Модельна дистиляція
Дистиляція стала особливо потужним інструментом у сучасній екосистемі ШІ. Цей процес дозволяє створювати менші, більш специфічні моделі, які успадковують можливості міркувань більших і складніших моделей, таких як DeepSeek-R1.
Як показує приклад DeepSeek, компанія перенесла свої здібності до міркування на кілька менших моделей, включно з моделями з відкритим кодом сімейства Llama від Meta та сімейства Qwen від Alibaba. Ці менші моделі можна згодом доопрацювати для конкретних завдань, що прискорює тенденцію до появи швидких і спеціалізованих моделей.
Сем Віттевін, розробник машинного навчання, зазначає: "Ми починаємо входити у світ, де люди використовують кілька моделей. Вони не просто використовують одну модель постійно". Сюди входять недорогі закриті моделі, такі як Gemini Flash і GPT-4o Mini, які "дуже добре працюють у 80 відсотках випадків використання".
Багатозадачне навчання
Замість того, щоб навчати окремі моделі суміжним навичкам, багатозадачне навчання дозволяє моделям обмінюватися знаннями між різними функціями:
- Моделі одночасно оптимізуються за кількома пов'язаними цілями
- Базові функції отримують користь від ширшого впливу різних завдань
- Продуктивність покращується для всіх завдань, особливо тих, де даних мало
- Обчислювальна ефективність зростає завдяки спільному використанню компонентів
Контрольоване доопрацювання (SFT)
Для компаній, що працюють у дуже специфічних галузях, де інформація не є широко доступною в Інтернеті або в книгах, які зазвичай використовуються для навчання мовних моделей, ефективним варіантом є контрольоване точне налаштування (SFT).
DeepSeek продемонстрував, що можна досягти хороших результатів з "тисячами" наборів даних запитань і відповідей. Наприклад, інженер IBM Кріс Хей показав, як він створив невелику модель, використовуючи власні математичні набори даних, і отримав надзвичайно швидкі відповіді, які перевищили продуктивність моделі OpenAI o1 на тих же завданнях.
Навчання з підкріпленням (RL)
Компанії, які бажають навчити модель з подальшим пристосуванням до конкретних уподобань - наприклад, зробити чат-бота для підтримки клієнтів чуйним, але лаконічним, - захочуть застосувати методи навчання з підкріпленням (RL). Цей підхід особливо корисний, якщо компанія хоче, щоб її чат-бот адаптував свій тон і рекомендації на основі відгуків користувачів.
Генерація з розширеним пошуком (RAG)
Для більшості компаній найпростішим і найбезпечнішим шляхом є генерація на основі розширеного пошуку (Retrieval-Augmented Generation, RAG). Це відносно простий процес, який дозволяє організаціям прив'язувати свої моделі до власних даних, що містяться в їхніх базах даних, гарантуючи, що результати будуть точними і специфічними для конкретної галузі.
Такий підхід також допомагає боротися з деякими проблемами галюцинацій, властивими моделям на кшталт DeepSeek, які наразі галюцинують у 14% випадків порівняно з 8% у моделі o3 від OpenAI, згідно з дослідженням, проведеним компанією Vectara.
Поєднання модельної дистиляції та RAG - це те, де криється магія для більшості компаній, яка стала неймовірно простою у впровадженні, навіть для тих, хто має обмежені навички в галузі науки про дані або програмування.
Оцінка та вдосконалення: за межами метрик точності
Ефективність ШІ вимірюється не лише з точки зору вихідної точності, але й вимагає комплексної системи оцінки, яка враховує всі фактори:
- Функціональна точність: як часто модель видає правильні результати
- Стійкість: узгодженість продуктивності при змінних вхідних даних і умовах
- Справедливість: узгоджена продуктивність для різних груп користувачів і сценаріїв
- Калібрування: відповідність між показниками впевненості та фактичною точністю
- Ефективність: вимоги до обчислювальних ресурсів і пам'яті
- Пояснюваність: прозорість процесів прийняття рішень — аспект, у якому дистильовані моделі DeepSeek особливо вирізняються, демонструючи хід своїх міркувань
Вплив кривої витрат
Найбільш безпосереднім наслідком виходу DeepSeek стало агресивне зниження цін. Технологічна індустрія очікувала, що витрати з часом знизяться, але мало хто очікував, як швидко це станеться. DeepSeek продемонстрував, що потужні, відкриті моделі можуть бути одночасно дешевими та ефективними, створюючи можливості для широкого експериментування та економічно ефективного впровадження.
Амр Авадалла, генеральний директор Vectara, підкреслив цей момент, зазначивши, що справжньою переломною точкою є не тільки вартість навчання, але й вартість виведення, яка для DeepSeek становить приблизно 1/30 від вартості виведення моделей OpenAI o1 або o3 у розрахунку на токен. "Маржа, яку змогли отримати OpenAI, Anthropic і Google Gemini, тепер повинна буде скоротитися щонайменше на 90 відсотків, оскільки вони не зможуть залишатися конкурентоспроможними з такими високими цінами", - сказав Авадаллах.
Мало того, ці витрати будуть продовжувати знижуватися. Генеральний директор Anthropic Даріо Амодей нещодавно заявив, що вартість розробки моделей продовжує знижуватися приблизно в чотири рази щороку. Як наслідок, ставка, яку постачальники LLM стягують за їх використання, також продовжуватиме знижуватися.
"Я повністю очікую, що вартість дійде до нуля," сказав Ашок Срівастава, CDO компанії Intuit, компанії, яка активно впроваджувала ШІ у свої податкові та бухгалтерські програмні рішення, такі як TurboTax і Quickbooks. "...а затримка дійде до нуля. Вони просто стануть базовими можливостями, якими ми зможемо користуватися."
Висновок: Майбутнє корпоративного ШІ є відкритим, економічним і керованим даними
DeepSeek і Deep Research від OpenAI - це не просто нові інструменти в арсеналі штучного інтелекту, це ознаки глибоких змін, в результаті яких компанії будуть розгортати масу спеціально створених моделей, які є надзвичайно економічно ефективними, компетентними і заснованими на власних даних і підходах компанії.
Для компаній повідомлення чітке: інструменти для створення потужних застосунків ШІ, специфічних для певної галузі, вже доступні. Є ризик відстати, якщо не скористатися цими інструментами. Але справжній успіх залежатиме від того, як ви обробляєте дані, використовуєте такі техніки, як RAG і дистиляція, та впроваджуєте інновації поза етапом попереднього навчання.
Як сказав Пакер з AmEx: компанії, які правильно управляють своїми даними, стануть лідерами наступної хвилі інновацій у сфері штучного інтелекту.

Коментарі
Коментарів поки немає — почніть обговорення.