ELECTE 4.0 متاح الآن — وميزة AI Agent وصلت.اطّلع على الجديد
استراتيجية الذكاء الاصطناعي4 دقيقة قراءة

بيانات التدريب على الذكاء الاصطناعي: 10 مليارات من الأعمال التي تدعم الذكاء الاصطناعي

تبلغ قيمة الذكاء الاصطناعي على نطاق واسع 29 مليار دولار أمريكي وربما لم تسمع بها من قبل. إنها الصناعة غير المرئية لبيانات التدريب التي تجعل ChatGPT والانتشار المستقر ممكنًا - سوق بقيمة 9.58 مليار دولار مع نمو سنوي بنسبة 27.7%. ارتفعت التكاليف بنسبة 4,300% منذ عام 2020 (Gemini Ultra: 192 مليون دولار). ولكن بحلول عام 2028 سينفد النص البشري العام المتاح بحلول عام 2028. في هذه الأثناء، دعاوى حقوق النشر وملايين جوازات السفر الموجودة في مجموعات البيانات. بالنسبة للشركات: يمكنك البدء مجانًا مع Hugging Face و Google Colab.

I Dati di Addestramento AI: Il Business da 10 Miliardi che Alimenta l'Intelligenza Artificiale

لخّص هذا المقال بالذكاء الاصطناعي

الصناعة الخفية التي تجعل ChatGPT وStable Diffusion وكل نظام AI حديث آخر ممكناً

أفضل سر مخفي في الذكاء الاصطناعي

عندما تستخدمون ChatGPT لكتابة بريد إلكتروني أو تولّدون صورة باستخدام Midjourney، نادراً ما تفكرون فيما يكمن خلف "سحر" الذكاء الاصطناعي. ومع ذلك، خلف كل إجابة ذكية وكل صورة مولّدة تختبئ صناعة تُقدَّر بمليارات الدولارات لا يتحدث عنها الكثيرون: سوق بيانات تدريب AI.

هذا القطاع، الذي وفقاً لـMarketsandMarkets سيصل إلى 9.58 مليار دولار بحلول عام 2029 بمعدل نمو سنوي قدره 27.7%، هو المحرك الحقيقي للذكاء الاصطناعي الحديث. لكن كيف يعمل هذا العمل الخفي بالضبط؟

النظام البيئي غير المرئي الذي يحرك المليارات

الشركات التجارية العملاقة

يهيمن عدد قليل من الشركات على عالم بيانات تدريب الذكاء الاصطناعي التي لم يسمع بها معظم الناس من قبل:

Scale AI، الشركة الأكبر في القطاع بحصة سوقية تبلغ 28%، تم تقييمها مؤخراً بـ29 مليار دولار بعد استثمار Meta. عملاؤها من الشركات يدفعون ما بين 100,000 دولار وعدة ملايين من الدولارات سنوياً مقابل بيانات عالية الجودة.

Appen، ومقرها أستراليا، تدير شبكة عالمية تضم أكثر من مليون متخصص في 170 دولة يقومون يدوياً بوضع علامات على البيانات ومعالجتها للذكاء الاصطناعي. شركات مثل Airbnb وJohn Deere وProcter & Gamble تستخدم خدماتها "لتعليم" نماذجها الخاصة بالذكاء الاصطناعي.

عالم المصادر المفتوحة

بالتوازي مع ذلك، يوجد نظام بيئي مفتوح المصدر تقوده منظمات مثل LAION (Large-scale Artificial Intelligence Open Network)، وهي منظمة ألمانية غير ربحية أنشأت LAION-5B، مجموعة البيانات المكوّنة من 5.85 مليار زوج من الصور والنصوص التي جعلت Stable Diffusion ممكناً.

Common Crawl تصدر شهرياً تيرابايتات من بيانات الويب الخام المستخدمة لتدريب GPT-3 وLLaMA والعديد من النماذج اللغوية الأخرى.

التكاليف الخفية للذكاء الاصطناعي

ما لا يعرفه الجمهور هو مدى ارتفاع تكلفة تدريب نموذج AI حديث. وفقاً لـEpoch AI، ارتفعت التكاليف بمعدل 2-3 مرات سنوياً خلال السنوات الثماني الماضية.

أمثلة على التكاليف الحقيقية:

الرقم الأكثر إثارة للدهشة؟ وفقاً لـAltIndex.com، ارتفعت تكاليف تدريب الذكاء الاصطناعي بنسبة 4,300% منذ عام 2020.

التحديات الأخلاقية والقانونية التي تواجه القطاع

مشكلة حقوق الطبع والنشر

واحدة من أكثر المشكلات إثارة للجدل تتعلق باستخدام مواد محمية بحقوق الطبع والنشر. في فبراير 2025، قضت محكمة ديلاوير في قضية Thomson Reuters v. ROSS Intelligence بأن تدريب الذكاء الاصطناعي يمكن أن يشكل انتهاكاً مباشراً لحقوق الطبع والنشر، رافضةً دفاع "الاستخدام العادل".

نشر مكتب حقوق الطبع والنشر الأمريكي تقريراً من 108 صفحات خلص إلى أن بعض الاستخدامات لا يمكن الدفاع عنها كاستخدام عادل، ما يفتح الطريق أمام تكاليف ترخيص ضخمة محتملة لشركات الذكاء الاصطناعي.

الخصوصية والبيانات الشخصية

كشف تحقيق أجرته MIT Technology Review أن DataComp CommonPool، إحدى مجموعات البيانات الأكثر استخداماً، تحتوي على ملايين الصور لجوازات السفر وبطاقات الائتمان وشهادات الميلاد. ومع أكثر من مليوني تحميل خلال العامين الماضيين، يثير هذا مسائل خصوصية ضخمة.

المستقبل: الندرة والابتكار

مشكلة بيانات الذروة

يتوقع الخبراء أنه بحلول عام 2028 سيتم استخدام معظم النصوص العامة التي ينتجها البشر المتاحة على الإنترنت. هذا السيناريو المعروف بـ"ذروة البيانات" يدفع الشركات نحو حلول مبتكرة:

  • البيانات الاصطناعية: توليد اصطناعي لبيانات التدريب
  • اتفاقيات الترخيص: شراكات استراتيجية مثل تلك بين OpenAI وFinancial Times
  • البيانات متعددة الوسائط: دمج النصوص والصور والصوت والفيديو

لوائح جديدة ستصدر قريباً

California AI Transparency Act سيُلزم الشركات بالكشف عن مجموعات البيانات المستخدمة في التدريب، بينما يعمل الاتحاد الأوروبي على تطبيق متطلبات مماثلة ضمن AI Act.

الفرص المتاحة للشركات الإيطالية

بالنسبة للشركات التي ترغب في تطوير حلول الذكاء الاصطناعي، فإن فهم هذا النظام البيئي أمر بالغ الأهمية:

خيارات اقتصادية:

حلول للمؤسسات:

  • Scale AI وAppen للمشاريع الحساسة
  • خدمات متخصصة: مثل Nexdata لمعالجة اللغة الطبيعية أو FileMarket AI للبيانات الصوتية

الاستنتاجات

تبلغ قيمة سوق بيانات التدريب في مجال الذكاء الاصطناعي 9.58 مليار دولار أمريكي، وتنمو بنسبة 27.7% سنوياً. هذه الصناعة غير المرئية ليست فقط محرك الذكاء الاصطناعي الحديث، ولكنها تمثل أيضًا أحد أكبر التحديات الأخلاقية والقانونية في عصرنا.

في المقالة التالية سنستكشف كيف يمكن للشركات الدخول بشكل ملموس إلى هذا العالم، مع دليل عملي للبدء في تطوير حلول الذكاء الاصطناعي باستخدام مجموعات البيانات والأدوات المتاحة اليوم.

بالنسبة لأولئك الذين يرغبون في معرفة المزيد الآن، قمنا بتجميع دليل مفصل مع خارطة طريق للتنفيذ والتكاليف المحددة ومجموعة الأدوات الكاملة - يمكن تنزيله مجانًا مع الاشتراك في newsletter.

روابط مفيدة للبدء فورًا:

مصادر تقنية:

لا تنتظر "ثورة الذكاء الاصطناعي". اصنعها بنفسك. خلال شهر من اليوم قد يكون لديك أول نموذج يعمل فعليًا، بينما لا يزال الآخرون في مرحلة التخطيط.

التعليقات

لا توجد تعليقات بعد — ابدأ المحادثة.