ELECTE 4.0 มาแล้ว — พร้อม AI Agentดูว่ามีอะไรใหม่
ข้อมูล & การวิเคราะห์อ่าน 6 นาที

เหนือกว่าอัลกอริทึม: โมเดล AI ได้รับการฝึกอบรมและปรับปรุงอย่างไร

"ข้อมูลคือกุญแจสำคัญ เปรียบเสมือนจอกศักดิ์สิทธิ์ของ AI เชิงสร้างสรรค์" — ฮิลารี แพคเกอร์ ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ American Express การจัดการข้อมูลคิดเป็น 80% ของความพยายามทั้งหมดในโครงการ AI DeepSeek ได้เปลี่ยนโฉมหน้าของวงการนี้: ต้นทุนการอนุมานอยู่ที่ 1 ใน 30 ของ OpenAI ดาริโอ อโมเดอิ: ต้นทุนลดลง 4 เท่าต่อปี "ผมคาดว่าต้นทุนจะลดลงเหลือศูนย์" — ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ Intuit การผสมผสานระหว่างการกลั่นกรองและ RAG คือเสน่ห์ที่บริษัทส่วนใหญ่ใช้ อนาคตล่ะ? โมเดลเฉพาะเจาะจงและคุ้มค่าจำนวนมากที่ฝังรากลึกอยู่ในข้อมูลองค์กร

Oltre l'algoritmo: Come i modelli di intelligenza artificiale vengono addestrati e perfezionati

สรุปบทความนี้ด้วย AI

วิธีการฝึกฝนโมเดลปัญญาประดิษฐ์

การฝึกฝนโมเดลปัญญาประดิษฐ์ถือเป็นหนึ่งในความท้าทายที่ซับซ้อนที่สุดในด้านการพัฒนาเทคโนโลยีร่วมสมัย การฝึกฝนโมเดลอย่างมีประสิทธิภาพนั้นไม่ได้เป็นเพียงเรื่องของอัลกอริทึมเท่านั้น แต่ต้องอาศัยแนวทางที่เป็นระบบและสหวิทยาการ ซึ่งผสานรวมข้อมูล วิทยาศาสตร์ข้อมูล ความรู้เฉพาะด้าน และวิศวกรรมซอฟต์แวร์เข้าด้วยกัน ดังที่ James Luke ได้ชี้ให้เห็นในหนังสือสำคัญของเขา "Beyond Algorithms: Delivering AI for Business" ความสำเร็จของการนำ AI ไปใช้งานนั้นขึ้นอยู่กับการจัดการข้อมูลและการออกแบบระบบมากกว่าตัวอัลกอริทึมเสียอีก ภูมิทัศน์นี้กำลังพัฒนาอย่างรวดเร็ว ด้วยนวัตกรรมอย่างโมเดล DeepSeek-R1 ที่กำลังปรับเปลี่ยนต้นทุนและการเข้าถึงใหม่ทั้งหมด

มูลนิธิ: การรวบรวมและจัดการข้อมูล

คุณภาพเหนือปริมาณ

ตรงกันข้ามกับความเชื่อที่แพร่หลาย ปริมาณข้อมูลไม่ใช่กุญแจสำคัญสู่ความสำเร็จเสมอไป คุณภาพและความเป็นตัวแทนข้อมูลมีความสำคัญมากกว่าอย่างมาก ในบริบทนี้ การผสานรวมแหล่งข้อมูลที่แตกต่างกันจึงเป็นสิ่งสำคัญ:

  • ข้อมูลที่เป็นกรรมสิทธิ์: รวบรวมและทำให้ไม่ระบุตัวตนอย่างมีจริยธรรมจากการใช้งานที่มีอยู่
  • ข้อมูลที่ได้รับอนุญาต: มาจากผู้ให้บริการที่เชื่อถือได้ซึ่งตรงตามมาตรฐานคุณภาพที่เข้มงวด
  • ชุดข้อมูลโอเพนซอร์ส: ตรวจสอบอย่างละเอียดเพื่อรับประกันความหลากหลายและความแม่นยำ
  • ข้อมูลสังเคราะห์: สร้างขึ้นเทียมเพื่ออุดช่องว่างและแก้ปัญหาด้านความเป็นส่วนตัว

การบูรณาการนี้สร้างรากฐานการฝึกอบรมที่ครอบคลุมซึ่งครอบคลุมสถานการณ์ในโลกแห่งความเป็นจริงในขณะที่ยังคงรักษามาตรฐานด้านจริยธรรมและความเป็นส่วนตัว

ความท้าทายในการเตรียมข้อมูล

กระบวนการ "จัดการข้อมูล" (หรือที่เรียกกันตามตรงว่า "การจัดการข้อมูล") คิดเป็นสัดส่วนถึง 80% ของความพยายามที่จำเป็นในโครงการปัญญาประดิษฐ์ ขั้นตอนนี้ประกอบด้วย:

  • การทำความสะอาดข้อมูล: กำจัดความไม่สอดคล้อง ข้อมูลซ้ำซ้อน และค่าผิดปกติ
  • การแปลงข้อมูล: แปลงให้อยู่ในรูปแบบที่เหมาะสมสำหรับการประมวลผล
  • การผสานรวมข้อมูล: รวมแหล่งข้อมูลที่แตกต่างกันซึ่งมักใช้สคีมาและรูปแบบที่เข้ากันไม่ได้
  • การจัดการข้อมูลที่ขาดหาย: กลยุทธ์ต่างๆ เช่น การประมาณค่าทางสถิติหรือการใช้ข้อมูลตัวแทน

ดังที่ Hilary Packer ซีทีโอของ American Express ได้ชี้ให้เห็นว่า: "จุดที่ทำให้เราตาสว่างจริงๆ คือเรื่องข้อมูล คุณสามารถเลือกโมเดลที่ดีที่สุดในโลกได้... แต่ข้อมูลคือกุญแจสำคัญ การตรวจสอบความถูกต้องและความแม่นยำคือจอกศักดิ์สิทธิ์ในยุคของ AI เชิงสร้างสรรค์ตอนนี้"

สถาปัตยกรรมแบบจำลอง: ขนาดที่เหมาะสม

การเลือกสถาปัตยกรรมแบบจำลองควรพิจารณาจากลักษณะเฉพาะของปัญหาที่ต้องการแก้ไข ไม่ใช่จากอคติหรือความชอบส่วนบุคคล ปัญหาแต่ละประเภทต้องการแนวทางที่แตกต่างกัน:

  • โมเดลภาษาที่ใช้ทรานสฟอร์เมอร์ สำหรับงานที่ต้องการความเข้าใจภาษาเชิงลึก
  • โครงข่ายประสาทแบบคอนโวลูชัน สำหรับการจดจำภาพและรูปแบบ
  • โครงข่ายประสาทแบบกราฟ สำหรับการวิเคราะห์ความสัมพันธ์ที่ซับซ้อนระหว่างเอนทิตี
  • การเรียนรู้แบบเสริมกำลัง สำหรับปัญหาด้านการเพิ่มประสิทธิภาพและการตัดสินใจ
  • สถาปัตยกรรมแบบผสมผสาน ที่รวมหลายแนวทางเข้าด้วยกันสำหรับกรณีการใช้งานที่ซับซ้อน

การเพิ่มประสิทธิภาพทางสถาปัตยกรรมต้องมีการประเมินอย่างเป็นระบบในรูปแบบการกำหนดค่าที่แตกต่างกัน โดยเฉพาะอย่างยิ่งการให้ความสำคัญต่อการแลกเปลี่ยนระหว่างประสิทธิภาพและข้อกำหนดในการคำนวณ ซึ่งเป็นประเด็นที่เกี่ยวข้องมากยิ่งขึ้นด้วยการถือกำเนิดของโมเดลเช่น DeepSeek-R1 ที่ให้ความสามารถในการใช้เหตุผลขั้นสูงด้วยต้นทุนที่ต่ำกว่าอย่างมาก

วิธีการฝึกอบรมขั้นสูง

การกลั่นแบบจำลอง

การกลั่นได้กลายมาเป็นเครื่องมือที่ทรงพลังอย่างยิ่งในระบบนิเวศ AI ในปัจจุบัน กระบวนการนี้ช่วยให้สามารถสร้างแบบจำลองที่เล็กลงและมีความเฉพาะทางมากขึ้น ซึ่งสืบทอดความสามารถในการใช้เหตุผลของแบบจำลองที่มีขนาดใหญ่และซับซ้อนกว่า เช่น DeepSeek-R1

ดังที่เห็นได้จากกรณีของ DeepSeek บริษัทได้กลั่นกรองความสามารถด้านการให้เหตุผลของตนลงในโมเดลขนาดเล็กหลายตัว รวมถึงโมเดลโอเพนซอร์สในตระกูล Llama ของ Meta และตระกูล Qwen ของ Alibaba โมเดลขนาดเล็กเหล่านี้สามารถนำไปปรับแต่งเพิ่มเติมสำหรับงานเฉพาะด้านได้ ซึ่งเร่งให้เกิดแนวโน้มสู่โมเดลที่รวดเร็วและเชี่ยวชาญเฉพาะทาง

แซม วิทเทวีน นักพัฒนาซอฟต์แวร์การเรียนรู้ของเครื่อง กล่าวว่า "เรากำลังเริ่มก้าวเข้าสู่โลกที่ผู้คนใช้โมเดลหลายตัว พวกเขาไม่ได้ใช้โมเดลเดียวตลอดเวลา" ซึ่งรวมถึงโมเดลวงจรปิดราคาประหยัดอย่าง Gemini Flash และ GPT-4o Mini ซึ่ง "ทำงานได้ดีมากสำหรับ 80% ของกรณีการใช้งาน"

การเรียนรู้แบบหลายงาน

แทนที่จะฝึกโมเดลแยกกันสำหรับความสามารถที่เกี่ยวข้อง การเรียนรู้แบบมัลติทาสก์ช่วยให้โมเดลสามารถแบ่งปันความรู้ระหว่างฟังก์ชันต่างๆ ได้:

  • โมเดลปรับให้เหมาะสมพร้อมกันสำหรับเป้าหมายที่เกี่ยวข้องกันหลายอย่าง
  • ฟังก์ชันพื้นฐานได้รับประโยชน์จากการเผชิญกับงานที่หลากหลายมากขึ้น
  • ประสิทธิภาพดีขึ้นในทุกงาน โดยเฉพาะงานที่มีข้อมูลจำกัด
  • ประสิทธิภาพเชิงคำนวณเพิ่มขึ้นจากการใช้ส่วนประกอบร่วมกัน

การปรับแต่งอย่างละเอียดภายใต้การดูแล (SFT)

สำหรับบริษัทที่ดำเนินงานในโดเมนเฉพาะเจาะจงมาก ซึ่งข้อมูลไม่สามารถเข้าถึงได้อย่างแพร่หลายบนเว็บหรือในหนังสือที่มักใช้สำหรับการฝึกอบรมโมเดลภาษา การปรับแต่งอย่างละเอียดภายใต้การดูแล (SFT) ถือเป็นตัวเลือกที่มีประสิทธิภาพ

DeepSeek ได้แสดงให้เห็นว่าการบรรลุผลลัพธ์ที่ดีด้วยชุดข้อมูลคำถามและคำตอบ "หลายพัน" ชุดนั้นเป็นไปได้ ยกตัวอย่างเช่น คริส เฮย์ วิศวกรของ IBM ได้แสดงให้เห็นว่าเขาฝึกฝนโมเดลขนาดเล็กโดยใช้ชุดข้อมูลเฉพาะทางคณิตศาสตร์ของเขาเอง ซึ่งทำให้ได้คำตอบที่รวดเร็วอย่างยิ่ง ซึ่งมีประสิทธิภาพเหนือกว่าโมเดล o1 ของ OpenAI ในงานเดียวกัน

การเรียนรู้แบบเสริมแรง (RL)

บริษัทต่างๆ ที่ต้องการฝึกฝนโมเดลให้สอดคล้องกับความต้องการเฉพาะเจาะจงมากขึ้น เช่น การทำให้แชทบอทฝ่ายสนับสนุนลูกค้าเข้าใจง่ายแต่กระชับ จะต้องนำเทคนิคการเรียนรู้แบบเสริมแรง (RL) มาใช้ วิธีนี้มีประโยชน์อย่างยิ่งหากบริษัทต้องการให้แชทบอทปรับโทนเสียงและคำแนะนำตามความคิดเห็นของผู้ใช้

การดึงข้อมูล-การสร้างเสริม (RAG)

สำหรับบริษัทส่วนใหญ่ RAG (Retrieval-Augmented Generation) ถือเป็นวิธีที่ง่ายและปลอดภัยที่สุด เป็นกระบวนการที่ค่อนข้างตรงไปตรงมา ช่วยให้องค์กรต่างๆ สามารถยึดโยงโมเดลของตนกับข้อมูลที่เป็นกรรมสิทธิ์จากฐานข้อมูลของตนเองได้ ทำให้มั่นใจได้ว่าผลลัพธ์ที่ได้มีความถูกต้องแม่นยำและเฉพาะเจาะจงตามโดเมน

แนวทางนี้ยังช่วยแก้ปัญหาการเกิดภาพหลอน (hallucination) บางส่วนที่เกี่ยวข้องกับโมเดลอย่าง DeepSeek ซึ่งปัจจุบันเกิดภาพหลอนใน 14% ของกรณี เทียบกับ 8% ของโมเดล o3 ของ OpenAI ตามการศึกษาที่ดำเนินการโดย Vectara

การผสมผสานระหว่างการกลั่นแบบจำลองและ RAG คือสิ่งที่สร้างความมหัศจรรย์ให้กับบริษัทส่วนใหญ่ โดยทำให้การนำไปใช้เป็นเรื่องง่ายอย่างเหลือเชื่อ แม้แต่กับบริษัทที่มีทักษะด้านวิทยาศาสตร์ข้อมูลหรือการเขียนโปรแกรมที่จำกัดก็ตาม

การประเมินและการปรับปรุง: เหนือกว่าความแม่นยำของเมตริก

AI ที่มีประสิทธิภาพไม่ได้วัดแค่เพียงความแม่นยำดิบเท่านั้น แต่ยังต้องมีกรอบการประเมินที่ครอบคลุมซึ่งพิจารณา:

  • ความแม่นยำเชิงฟังก์ชัน: ความถี่ที่โมเดลให้ผลลัพธ์ที่ถูกต้อง
  • ความทนทาน: ความสม่ำเสมอของประสิทธิภาพเมื่อมีอินพุตและเงื่อนไขที่แตกต่างกัน
  • ความเป็นธรรม: ประสิทธิภาพที่สม่ำเสมอในกลุ่มผู้ใช้และสถานการณ์ที่แตกต่างกัน
  • การปรับเทียบ: ความสอดคล้องระหว่างคะแนนความเชื่อมั่นและความแม่นยำที่แท้จริง
  • ประสิทธิภาพ: ข้อกำหนดด้านการคำนวณและหน่วยความจำ
  • ความสามารถในการอธิบายได้: ความโปร่งใสของกระบวนการตัดสินใจ ซึ่งเป็นด้านที่โมเดลกลั่นกรองของ DeepSeek โดดเด่น โดยแสดงกระบวนการให้เหตุผลของตนให้เห็น

ผลกระทบของเส้นโค้งต้นทุน

ผลกระทบที่เกิดขึ้นทันทีที่สุดจากการเปิดตัว DeepSeek คือการลดราคาลงอย่างมาก วงการเทคโนโลยีคาดการณ์ว่าต้นทุนจะลดลงเมื่อเวลาผ่านไป แต่มีน้อยคนนักที่จะคาดการณ์ว่าจะเกิดขึ้นอย่างรวดเร็วเช่นนี้ DeepSeek ได้พิสูจน์แล้วว่าโมเดลแบบเปิดที่ทรงพลังนั้นสามารถทั้งคุ้มค่าและมีประสิทธิภาพ สร้างโอกาสสำหรับการทดลองในวงกว้างและการนำไปใช้งานที่คุ้มค่า

อัมร์ อาวาดัลลาห์ ซีอีโอของเวคทารา เน้นย้ำประเด็นนี้ โดยระบุว่าสิ่งที่เปลี่ยนเกมอย่างแท้จริงไม่ได้อยู่ที่ต้นทุนการฝึกเท่านั้น แต่ยังรวมถึงต้นทุนการอนุมานด้วย ซึ่งสำหรับ DeepSeek แล้ว ต้นทุนการอนุมานต่อโทเค็นอยู่ที่ประมาณ 1 ใน 30 ของโมเดล o1 หรือ o3 ของ OpenAI “ส่วนต่างกำไรที่ OpenAI, Anthropic และ Google Gemini ทำได้นั้นจะต้องลดลงอย่างน้อย 90% เนื่องจากพวกเขาไม่สามารถแข่งขันกับราคาที่สูงเช่นนี้ได้” อาวาดัลลาห์กล่าว

ไม่เพียงเท่านั้น ต้นทุนเหล่านี้จะยังคงลดลงอย่างต่อเนื่อง ดาริโอ อโมเด ซีอีโอของ Anthropic ระบุเมื่อเร็วๆ นี้ว่าต้นทุนการพัฒนาโมเดลยังคงลดลงอย่างต่อเนื่องในอัตราประมาณสี่ครั้งต่อปี ดังนั้น อัตราค่าบริการที่ผู้ให้บริการ LLM เรียกเก็บสำหรับการใช้งานโมเดลเหล่านี้ก็จะลดลงอย่างต่อเนื่องเช่นกัน

"ผมคาดหวังอย่างเต็มที่ว่าต้นทุนจะลดลงเหลือศูนย์" อโชค ศรีวาสตาวา ประธานเจ้าหน้าที่ฝ่ายข้อมูล (CDO) ของ Intuit บริษัทที่ผลักดัน AI อย่างหนักในผลิตภัณฑ์ซอฟต์แวร์ด้านภาษีและบัญชี เช่น TurboTax และ Quickbooks กล่าว "...และ latency จะลดลงเหลือศูนย์ มันจะกลายเป็นเพียงความสามารถพื้นฐานที่เราสามารถนำมาใช้ได้"

บทสรุป: อนาคตของ AI สำหรับองค์กรคือความเปิดกว้าง ประหยัด และขับเคลื่อนด้วยข้อมูล

DeepSeek และ Deep Research ของ OpenAI ไม่ได้เป็นแค่เครื่องมือใหม่ในคลังอาวุธ AI เท่านั้น แต่ยังเป็นสัญญาณของการเปลี่ยนแปลงครั้งสำคัญที่บริษัทต่างๆ จะปรับใช้โมเดลที่สร้างขึ้นเพื่อจุดประสงค์เฉพาะจำนวนมาก ซึ่งคุ้มต้นทุนอย่างยิ่ง มีความสามารถ และหยั่งรากลึกอยู่ในข้อมูลและแนวทางของบริษัทเอง

สำหรับองค์กรต่างๆ ข้อความนั้นชัดเจน: เครื่องมือสำหรับสร้างแอปพลิเคชัน AI ที่ทรงพลังและเฉพาะเจาะจงสำหรับแต่ละโดเมนนั้นอยู่ในมือแล้ว มีความเสี่ยงที่จะถูกทิ้งไว้ข้างหลังหากไม่ใช้ประโยชน์จากเครื่องมือเหล่านี้ แต่ความสำเร็จที่แท้จริงจะมาจากวิธีที่คุณดูแลจัดการข้อมูล ใช้เทคนิคต่างๆ เช่น RAG และ distillation และสร้างนวัตกรรมที่ก้าวข้ามขั้นตอนการฝึกล่วงหน้า

ดังที่ Packer จาก AmEx กล่าวไว้ บริษัทต่างๆ ที่จัดการข้อมูลได้ดีจะเป็นผู้นำนวัตกรรม AI รุ่นต่อไป

ความคิดเห็น

ยังไม่มีความคิดเห็น — เริ่มการสนทนาได้เลย