ELECTE 4.0 มาแล้ว — พร้อม AI Agentดูว่ามีอะไรใหม่
กลยุทธ์ด้าน AIอ่าน 4 นาที

ข้อมูลการฝึกอบรม AI: ธุรกิจมูลค่า 10,000 ล้านดอลลาร์ที่ขับเคลื่อนปัญญาประดิษฐ์

Scale AI มีมูลค่า 29 พันล้านดอลลาร์สหรัฐ และคุณอาจไม่เคยได้ยินมาก่อน มันคืออุตสาหกรรมข้อมูลการฝึกอบรมที่มองไม่เห็นที่ขับเคลื่อน ChatGPT และ Stable Diffusion ซึ่งเป็นตลาดมูลค่า 9.58 พันล้านดอลลาร์สหรัฐที่เติบโต 27.7% ต่อปี ต้นทุนเพิ่มขึ้นถึง 4,300% ตั้งแต่ปี 2020 (Gemini Ultra: 192 ล้านดอลลาร์สหรัฐ) แต่ภายในปี 2028 จะไม่มีข้อความมนุษย์ที่เผยแพร่สู่สาธารณะอีกต่อไป ในขณะเดียวกัน พบคดีความละเมิดลิขสิทธิ์และหนังสือเดินทางหลายล้านเล่มในชุดข้อมูล สำหรับบริษัท: คุณสามารถเริ่มต้นใช้งานได้ฟรีด้วย Hugging Face และ Google Colab

I Dati di Addestramento AI: Il Business da 10 Miliardi che Alimenta l'Intelligenza Artificiale

สรุปบทความนี้ด้วย AI

อุตสาหกรรมที่มองไม่เห็นซึ่งทำให้ ChatGPT, Stable Diffusion และระบบ AI สมัยใหม่อื่นๆ เป็นไปได้

ความลับที่ AI เก็บรักษาไว้เป็นอย่างดี

เมื่อคุณใช้ ChatGPT เขียนอีเมล หรือสร้างภาพด้วย Midjourney คุณแทบไม่เคยคิดว่าอะไรอยู่เบื้องหลัง "เวทมนตร์" ของปัญญาประดิษฐ์ แต่เบื้องหลังทุกคำตอบอันชาญฉลาดและทุกภาพที่ถูกสร้างขึ้นนั้น ซ่อนอยู่ด้วยอุตสาหกรรมมูลค่าหลายพันล้านที่แทบไม่มีใครพูดถึง: ตลาดข้อมูลสำหรับฝึกฝน AI

ภาคส่วนนี้ ซึ่งตาม MarketsandMarkets จะมีมูลค่าถึง 9,58 พันล้านดอลลาร์ภายในปี 2029 ด้วยอัตราการเติบโต 27,7% ต่อปี คือกลไกที่แท้จริงเบื้องหลังปัญญาประดิษฐ์สมัยใหม่ แต่ธุรกิจที่ซ่อนอยู่นี้ทำงานอย่างไรกันแน่?

ระบบนิเวศที่มองไม่เห็นที่เคลื่อนย้ายเงินนับพันล้าน

ยักษ์ใหญ่แห่งวงการพาณิชย์

โลกของข้อมูลการฝึกอบรม AI ถูกครอบงำโดยบริษัทไม่กี่แห่งที่คนส่วนใหญ่ไม่เคยได้ยินชื่อ:

Scale AI บริษัทที่ใหญ่ที่สุดในภาคส่วนนี้ ด้วยส่วนแบ่งตลาด 28% เพิ่งได้รับการประเมินมูลค่าที่ 29 พันล้านดอลลาร์ หลังจากการลงทุนจาก Meta ลูกค้าองค์กรของพวกเขาจ่ายเงินระหว่าง 100.000 ถึงหลายล้านดอลลาร์ต่อปีสำหรับข้อมูลคุณภาพสูง

Appen ซึ่งมีฐานอยู่ในออสเตรเลีย บริหารจัดการเครือข่ายผู้เชี่ยวชาญกว่า 1 ล้านคนทั่วโลกใน 170 ประเทศ ที่ทำการติดป้ายกำกับและจัดเตรียมข้อมูลด้วยมือสำหรับ AI บริษัทอย่าง Airbnb, John Deere และ Procter & Gamble ใช้บริการของพวกเขาเพื่อ "สอน" โมเดล AI ของตนเอง

โลกโอเพ่นซอร์ส

ควบคู่ไปกับสิ่งนี้ ยังมีระบบนิเวศแบบโอเพนซอร์สที่นำโดยองค์กรอย่าง LAION (Large-scale Artificial Intelligence Open Network) องค์กรไม่แสวงหากำไรของเยอรมนีที่สร้าง LAION-5B ชุดข้อมูลที่ประกอบด้วยคู่ภาพและข้อความ 5,85 พันล้านคู่ ซึ่งทำให้ Stable Diffusion เป็นไปได้

Common Crawl เผยแพร่ข้อมูลเว็บดิบหลายเทราไบต์ทุกเดือน ซึ่งถูกนำไปใช้ฝึกฝน GPT-3, LLaMA และโมเดลภาษาอื่นๆ อีกมากมาย

ต้นทุนที่ซ่อนอยู่ของปัญญาประดิษฐ์

สิ่งที่สาธารณชนไม่รู้คือ การฝึกฝนโมเดล AI สมัยใหม่นั้นมีค่าใช้จ่ายสูงขึ้นเพียงใด ตาม Epoch AI ค่าใช้จ่ายเพิ่มขึ้น 2-3 เท่าต่อปีในช่วงแปดปีที่ผ่านมา

ตัวอย่างต้นทุนที่แท้จริง:

ข้อมูลที่น่าประหลาดใจที่สุด? ตาม AltIndex.com ค่าใช้จ่ายในการฝึกฝน AI เพิ่มขึ้น 4.300% ตั้งแต่ปี 2020

ความท้าทายด้านจริยธรรมและกฎหมายของภาคส่วน

คำถามเรื่องลิขสิทธิ์

ปัญหาหนึ่งที่เป็นข้อถกเถียงมากที่สุดเกี่ยวข้องกับการใช้เนื้อหาที่มีลิขสิทธิ์คุ้มครอง ในเดือนกุมภาพันธ์ 2025 ศาลรัฐเดลาแวร์ได้ตัดสินในคดี Thomson Reuters v. ROSS Intelligence ว่าการฝึกฝน AI สามารถเป็นการละเมิดลิขสิทธิ์โดยตรงได้ โดยปฏิเสธข้อต่อสู้เรื่อง "fair use"

สำนักงานลิขสิทธิ์สหรัฐฯ ได้เผยแพร่รายงานความยาว 108 หน้า สรุปว่าการใช้งานบางประเภทไม่สามารถอ้างเป็น fair use ได้ ซึ่งเปิดทางไปสู่ค่าใช้จ่ายด้านลิขสิทธิ์มหาศาลที่อาจเกิดขึ้นกับบริษัท AI

ความเป็นส่วนตัวและข้อมูลส่วนบุคคล

การสืบสวนของ MIT Technology Review เปิดเผยว่า DataComp CommonPool ซึ่งเป็นหนึ่งในชุดข้อมูลที่ถูกใช้งานมากที่สุด มีภาพหลายล้านภาพของหนังสือเดินทาง บัตรเครดิต และสูติบัตร ด้วยยอดดาวน์โหลดกว่า 2 ล้านครั้งในช่วงสองปีที่ผ่านมา สิ่งนี้ก่อให้เกิดปัญหาด้านความเป็นส่วนตัวอย่างมหาศาล

อนาคต: ความขาดแคลนและนวัตกรรม

ปัญหา "ข้อมูลสูงสุด"

ผู้เชี่ยวชาญคาดการณ์ว่าภายในปี 2028 ข้อความสาธารณะที่มนุษย์สร้างขึ้นส่วนใหญ่ที่มีอยู่บนอินเทอร์เน็ตจะถูกนำมาใช้จนหมด สถานการณ์ "peak data" นี้กำลังผลักดันให้บริษัทต่างๆ หันไปหาแนวทางแก้ไขที่สร้างสรรค์:

  • ข้อมูลสังเคราะห์: การสร้างข้อมูลฝึกฝนขึ้นเทียม
  • ข้อตกลงด้านใบอนุญาต: พันธมิตรเชิงกลยุทธ์ เช่นระหว่าง OpenAI และ Financial Times
  • ข้อมูลหลายรูปแบบ: การผสมผสานข้อความ ภาพ เสียง และวิดีโอ

กฎระเบียบใหม่กำลังจะมาเร็วๆ นี้

California AI Transparency Act จะกำหนดให้บริษัทต่างๆ ต้องเปิดเผยชุดข้อมูลที่ใช้ในการฝึกฝน ในขณะที่สหภาพยุโรปกำลังดำเนินการกำหนดข้อกำหนดที่คล้ายคลึงกันใน AI Act

โอกาสสำหรับบริษัทอิตาลี

สำหรับบริษัทต่างๆ ที่ต้องการพัฒนาโซลูชัน AI การทำความเข้าใจระบบนิเวศนี้ถือเป็นสิ่งสำคัญ:

ตัวเลือกประหยัดงบประมาณ:

โซลูชันระดับองค์กร:

  • Scale AI และ Appen สำหรับโปรเจกต์ที่มีความสำคัญสูง (mission-critical)
  • บริการเฉพาะทาง: เช่น Nexdata สำหรับ NLP หรือ FileMarket AI สำหรับข้อมูลเสียง

บทสรุป

ตลาดข้อมูลการฝึกอบรม AI มีมูลค่า 9.58 พันล้านดอลลาร์สหรัฐ และเติบโตในอัตรา 27.7% ต่อปี อุตสาหกรรมที่มองไม่เห็นนี้ไม่เพียงแต่เป็นเครื่องยนต์ขับเคลื่อน AI ยุคใหม่เท่านั้น แต่ยังเป็นหนึ่งในความท้าทายด้านจริยธรรมและกฎหมายที่ยิ่งใหญ่ที่สุดในยุคสมัยของเราอีกด้วย

ในบทความถัดไป เราจะมาสำรวจว่าบริษัทต่างๆ สามารถเข้าสู่โลกนี้ได้อย่างไร พร้อมคำแนะนำปฏิบัติสำหรับการเริ่มต้นพัฒนาโซลูชัน AI โดยใช้ชุดข้อมูลและเครื่องมือที่มีอยู่ในปัจจุบัน

สำหรับผู้ที่ต้องการเจาะลึกในทันที เราได้จัดทำคู่มือโดยละเอียดพร้อมแผนงานการใช้งาน ค่าใช้จ่ายเฉพาะ และชุดเครื่องมือที่สมบูรณ์ ซึ่งดาวน์โหลดได้ฟรีโดยการลงทะเบียน newsletter -

ลิงก์ที่เป็นประโยชน์เพื่อเริ่มต้นได้ทันที:

  • สภาพแวดล้อมสำหรับพัฒนา: Google Colab (ฟรี พร้อม GPU)
  • ดาต้าเซ็ต open source: Hugging Face Datasets
  • เครื่องมือติดป้ายข้อมูล: Label Studio (ฟรี)
  • Deploy รวดเร็ว: Gradio + HF Spaces
  • คอร์สภาคปฏิบัติ: Fast.ai (ฟรี ลงมือทำจริง)

แหล่งข้อมูลทางเทคนิค:

อย่ารอ "การปฏิวัติ AI" จงสร้างมันขึ้นมาเอง อีกหนึ่งเดือนนับจากวันนี้ คุณอาจมีโมเดลแรกที่ใช้งานได้จริงแล้ว ในขณะที่คนอื่นยังวางแผนอยู่

ความคิดเห็น

ยังไม่มีความคิดเห็น — เริ่มการสนทนาได้เลย