ELECTE 4.0 มาแล้ว — พร้อม AI Agentดูว่ามีอะไรใหม่
Newsletterอ่าน 6 นาที

วิวัฒนาการของ LLM: ภาพรวมสั้นๆ ของตลาด

สถาบัน LLM ชั้นนำในเกณฑ์มาตรฐานสำคัญมีคะแนนน้อยกว่า 2 เปอร์เซ็นต์ สงครามเทคโนโลยีจบลงด้วยการเสมอกัน การต่อสู้ที่แท้จริงในปี 2025 ดำเนินไปในประเด็นระบบนิเวศ การกระจาย และต้นทุน DeepSeek ได้พิสูจน์แล้วว่าสามารถแข่งขันกับ GPT-4 ที่มีมูลค่า 78-191 ล้านดอลลาร์สหรัฐฯ ได้ ChatGPT ครองตลาด (76% ของการรับรู้) แม้ว่า Claude จะครองตลาดเกณฑ์มาตรฐานทางเทคนิคถึง 65% ก็ตาม สำหรับบริษัทต่างๆ กลยุทธ์ที่ประสบความสำเร็จไม่ใช่การเลือก "โมเดลที่ดีที่สุด" แต่คือการผสานโมเดลที่เสริมกันสำหรับกรณีการใช้งานที่แตกต่างกัน

Evoluzione degli LLM: una breve panoramica del mercato

สรุปบทความนี้ด้วย AI

สงครามโมเดลภาษา 2025: จากความเท่าเทียมทางเทคนิคสู่การต่อสู้ของระบบนิเวศ

การพัฒนา Large Language Models มาถึงจุดเปลี่ยนสำคัญในปี 2025 การแข่งขันไม่ได้ขึ้นอยู่กับความสามารถหลักของโมเดลอีกต่อไป ซึ่งปัจจุบันเทียบเท่ากันในเกณฑ์มาตรฐานหลัก แต่ขึ้นอยู่กับระบบนิเวศ การบูรณาการ และกลยุทธ์การใช้งาน แม้ว่า Claude Sonnet 4.5 ของ Anthropic จะยังคงมีช่องว่างความเหนือกว่าทางเทคนิคเพียงเล็กน้อยในเกณฑ์มาตรฐานเฉพาะ แต่การต่อสู้ที่แท้จริงได้เปลี่ยนไปสู่สถานการณ์ที่แตกต่างออกไป

การจับฉลากทางเทคนิค: เมื่อตัวเลขเท่ากัน

เกณฑ์มาตรฐาน MMLU (Massive Multitask Language Understanding)

  • Claude Sonnet 4.5: 88.7%
  • GPT-4o: 88.0%
  • Gemini 2.0 Flash: 86.9%
  • DeepSeek-V3: 87.1%

ความแตกต่างนั้นไม่มากนัก โดยบริษัทที่มีผลงานดีที่สุดมีน้อยกว่า 2 จุดเปอร์เซ็นต์ รายงานดัชนี AI ของสแตนฟอร์ด ประจำปี 2025 ระบุว่า "การบรรจบกันของความสามารถของโมเดลภาษาหลักเป็นหนึ่งในแนวโน้มที่สำคัญที่สุดในช่วงปี 2024-2025 ซึ่งมีผลกระทบอย่างลึกซึ้งต่อกลยุทธ์การแข่งขันของบริษัท AI"

ความสามารถด้านการให้เหตุผล (GPQA Diamond)

  • Claude Sonnet 4: 65.0%
  • GPT-4o: 53.6%
  • Gemini 2.0 Pro: 59.1%

Claude ยังคงรักษาความได้เปรียบที่สำคัญในงานการใช้เหตุผลที่ซับซ้อน แต่ GPT-4o โดดเด่นในเรื่องความเร็วในการตอบสนอง (ความหน่วงเฉลี่ย 1.2 วินาที เทียบกับ 2.1 วินาทีของ Claude) และ Gemini ในการประมวลผลมัลติโหมดดั้งเดิม

การปฏิวัติ DeepSeek: ผู้เปลี่ยนเกมของจีน

ในเดือนมกราคม พ.ศ. 2568 DeepSeek-V3 ได้เข้ามามีบทบาทสำคัญอย่างมาก ซึ่งแสดงให้เห็นว่าสามารถพัฒนาโมเดลที่แข่งขันได้ในราคา 5.6 ล้านดอลลาร์สหรัฐฯ เทียบกับ GPT-4/Gemini Ultra ที่ราคา 78–191 ล้านดอลลาร์สหรัฐฯ Marc Andreessen เรียกมันว่า "หนึ่งในความก้าวหน้าที่น่าอัศจรรย์ที่สุด และในฐานะโอเพนซอร์ส ถือเป็นของขวัญล้ำค่าที่มอบให้แก่โลก"

สเปคของ DeepSeek-V3:

  • พารามิเตอร์ทั้งหมด 671 พันล้าน (37B ทำงานผ่าน Mixture-of-Experts)
  • ต้นทุนการฝึกฝน: 5.576 ล้านดอลลาร์
  • ประสิทธิภาพ: เหนือกว่า GPT-4o ในเกณฑ์มาตรฐานคณิตศาสตร์บางส่วน
  • สถาปัตยกรรม: Multi-head Latent Attention (MLA) + DeepSeekMoE

ผลกระทบ: หุ้น Nvidia ร่วงลง 17% ในเซสชั่นเดียวหลังการประกาศ โดยตลาดกำลังประเมินอุปสรรคในการเข้าสู่การพัฒนาโมเดลใหม่

การรับรู้ของสาธารณะเทียบกับความเป็นจริงทางเทคนิค

ChatGPT ยังคงรักษาความเป็นผู้นำในด้านการรับรู้แบรนด์อย่างไม่มีใครเทียบได้: การวิจัยของ Pew Research Center (กุมภาพันธ์ 2025) แสดงให้เห็นว่าชาวอเมริกัน 76% เชื่อมโยง "AI เชิงสนทนา" กับ ChatGPT เท่านั้น ในขณะที่เพียง 12% เท่านั้นที่รู้จัก Claude และ 8% ใช้งาน Gemini อย่างจริงจัง

ความขัดแย้ง: Claude Sonnet 4 เอาชนะ GPT-4o ในเกณฑ์มาตรฐานทางเทคนิค 65% แต่มีส่วนแบ่งการตลาดผู้บริโภคเพียง 8% เมื่อเทียบกับ ChatGPT ที่มี 71% (ข้อมูล Similarweb มีนาคม 2025)

Google ตอบสนองด้วยการบูรณาการครั้งใหญ่: Gemini 2.0 ดั้งเดิมในการค้นหา Gmail เอกสาร และไดรฟ์—กลยุทธ์ระบบนิเวศเทียบกับผลิตภัณฑ์แบบสแตนด์อโลน ผู้ใช้ Google Workspace 2.1 พันล้านคนแสดงให้เห็นถึงการปรับใช้ทันทีโดยไม่ต้องรับลูกค้า

การใช้คอมพิวเตอร์และตัวแทน: ขอบเขตใหม่

Claude Computer Use (เบต้าตุลาคม 2024, การใช้งานจริง Q1 2025)

  • ความสามารถ: ควบคุมเมาส์/แป้นพิมพ์โดยตรง นำทางเบราว์เซอร์ โต้ตอบกับแอปพลิเคชัน
  • การนำไปใช้: ลูกค้าองค์กร 12% ของ Anthropic ใช้ computer use ในการทำงานจริง
  • ข้อจำกัด: ยังคงมีอัตราความล้มเหลว 14% ในงานที่ซับซ้อนหลายขั้นตอน

GPT-4o พร้อม Vision และ Actions

  • การผสานรวมกับ Zapier: ควบคุมแอปได้กว่า 6000+ แอป
  • Custom GPTs: เผยแพร่แล้ว 3 ล้านรายการ ใช้งานจริง 800,000 รายการ
  • การแบ่งรายได้ให้ผู้สร้าง GPTs: กระจายไปแล้ว 10 ล้านดอลลาร์ใน Q4 2024

Gemini Deep Research (มกราคม 2025)

  • การวิจัยอัตโนมัติจากหลายแหล่งพร้อมการวิเคราะห์เปรียบเทียบ
  • สร้างรายงานฉบับสมบูรณ์จากพรอมต์เดียว
  • เวลาเฉลี่ย: 8-12 นาทีต่อรายงานความยาว 5000+ คำ

Gartner คาดการณ์ว่าพนักงานความรู้ 33% จะใช้ตัวแทน AI อัตโนมัติภายในสิ้นปี 2025 เพิ่มขึ้นจาก 5% ในปัจจุบัน

ความแตกต่างทางปรัชญาเกี่ยวกับความปลอดภัย

OpenAI: แนวทาง "Safety Through Restriction"

  • ปฏิเสธพรอมต์ผู้บริโภค 8.7% (ข้อมูลภายในที่หลุดจาก OpenAI)
  • นโยบายเนื้อหาที่เข้มงวดทำให้ผู้พัฒนา 23% หันไปใช้ทางเลือกอื่น
  • Preparedness Framework แบบเปิดเผยพร้อม red-teaming อย่างต่อเนื่อง

Anthropic: "Constitutional AI"

  • โมเดลที่ฝึกฝนบนหลักการทางจริยธรรมที่ชัดเจน
  • การปฏิเสธแบบเลือกสรร: 3.1% ของพรอมต์ (ผ่อนปรนกว่า OpenAI)
  • ความโปร่งใสในการตัดสินใจ: อธิบายเหตุผลที่ปฏิเสธคำขอ

Google: "Maximum Safety, Minimum Controversy"

  • ตัวกรองที่เข้มงวดที่สุดในตลาด: บล็อกพรอมต์ 11.2%
  • ความล้มเหลวของ Gemini Image ในกุมภาพันธ์ 2024 (การแก้ไข bias ที่มากเกินไป) นำไปสู่ความระมัดระวังอย่างสูง
  • การมุ่งเน้นองค์กรลดความยอมรับความเสี่ยง

Meta Llama 3.1: ไม่มีตัวกรองในตัว ความรับผิดชอบของผู้ใช้—ปรัชญาที่ตรงกันข้าม

ความเชี่ยวชาญเฉพาะด้านแนวตั้ง: ตัวแยกแยะที่แท้จริง

ด้านสุขภาพ:

  • Med-PaLM 2 (Google): 85.4% ใน MedQA (เทียบกับ 77% ของแพทย์มนุษย์ที่เก่งที่สุด)
  • Claude ใน Epic Systems: นำไปใช้โดยโรงพยาบาล 305 แห่งในสหรัฐฯ เพื่อสนับสนุนการตัดสินใจทางคลินิก

ด้านกฎหมาย:

  • Harvey AI (ปรับแต่งจาก GPT-4): มีลูกค้าจากสำนักงานกฎหมายชั้นนำ 100 อันดับแรกจำนวน 102 แห่ง รายได้ประจำปี 100 ล้านดอลลาร์
  • CoCounsel (Thomson Reuters + Claude): ความแม่นยำในการวิจัยกฎหมาย 98%

ด้านการเงิน:

  • Bloomberg GPT: ฝึกฝนบนโทเค็นทางการเงินที่เป็นกรรมสิทธิ์ 363 พันล้านโทเค็น
  • Goldman Sachs Marcus AI (พื้นฐาน GPT-4): อนุมัติสินเชื่อได้เร็วขึ้น 40%

การแบ่งแนวตั้งทำให้เกิดความเต็มใจที่จะจ่าย 3.5 เท่าเมื่อเทียบกับโมเดลทั่วไป (การสำรวจของ McKinsey ผู้ซื้อองค์กร 500 ราย)

Llama 3.1: กลยุทธ์โอเพ่นซอร์สของ Meta

พารามิเตอร์ 405B ที่สามารถแข่งขันกับ GPT-4o ในเกณฑ์มาตรฐานต่างๆ ได้ มีน้ำหนักแบบเปิดอย่างสมบูรณ์ กลยุทธ์เมตา: ทำให้ชั้นโครงสร้างพื้นฐานกลายเป็นสินค้าโภคภัณฑ์เพื่อแข่งขันในชั้นผลิตภัณฑ์ (แว่นตา Ray-Ban Meta, WhatsApp AI)

การนำ Llama 3.1 มาใช้:

  • ยอดดาวน์โหลดกว่า 350K ในเดือนแรก
  • สตาร์ทอัพกว่า 50 รายสร้าง vertical AI บน Llama
  • ต้นทุน hosting แบบ self-managed: $12K/เดือน เทียบกับ $50K+ ค่า API ของโมเดลปิดสำหรับการใช้งานที่เทียบเท่ากัน

สวนทางกับสัญชาตญาณ: Meta สูญเสียเงินหลายพันล้านดอลลาร์กับ Reality Labs แต่กลับลงทุนมหาศาลใน AI แบบเปิดเพื่อปกป้องธุรกิจโฆษณาหลัก

บริบท Windows: การแข่งขันเพื่อโทเค็นนับล้าน

  • Claude Sonnet 4.5: 200K โทเคน
  • Gemini 2.0 Pro: 2M โทเคน (ยาวที่สุดที่มีจำหน่ายในเชิงพาณิชย์)
  • GPT-4 Turbo: 128K โทเคน

Context ขนาด 2M ของ Gemini ช่วยให้วิเคราะห์โค้ดเบสทั้งหมด วิดีโอ 10 ชั่วโมงขึ้นไป เอกสารหลายพันหน้า—เป็น use case ระดับองค์กรที่เปลี่ยนโฉมการทำงาน Google Cloud รายงานว่า 43% ของ enterprise POC ใช้ context มากกว่า 500K โทเคน

ความสามารถในการปรับตัวและการปรับแต่ง

Claude Projects & Styles:

  • คำสั่งกำหนดเองที่คงอยู่ข้ามบทสนทนา
  • Style presets: Formal, Concise, Explanatory
  • อัปโหลด knowledge base ได้ (สูงสุด 5GB เอกสาร)

GPT Store & Custom GPTs:

  • มี GPT เผยแพร่แล้ว 3 ล้านรายการ ใช้งานจริงต่อเดือน 800K
  • ผู้สร้างอันดับต้นทำรายได้ $63K/เดือน (จากการแบ่งรายได้)
  • 71% ขององค์กรใช้ custom GPT อย่างน้อย 1 ตัวภายในองค์กร

Gemini Extensions:

  • เชื่อมต่อกับ Gmail, Calendar, Drive, Maps ได้โดยตรง
  • Workspace context: อ่านอีเมลและปฏิทินเพื่อให้คำแนะนำเชิงรุก
  • ดำเนินการ workspace actions ไปแล้ว 1.2 พันล้านครั้งใน Q4 2024

คีย์: จาก "คำเตือนเดียว" ไปจนถึง "ผู้ช่วยถาวรพร้อมหน่วยความจำและบริบทข้ามเซสชัน"

การพัฒนาและแนวโน้มในอนาคตในไตรมาสที่ 1 ปี 2568

เทรนด์ที่ 1: การครองตลาดของ Mixture-of-Expertsโมเดลระดับท็อปทั้งหมดในปี 2025 ใช้ MoE (เปิดใช้งานเฉพาะบางส่วนของพารามิเตอร์ต่อคำขอ):

  • ลดต้นทุน inference ลง 40-60%
  • ความหน่วงดีขึ้นโดยยังคงคุณภาพไว้
  • DeepSeek, GPT-4, Gemini Ultra ล้วนใช้พื้นฐาน MoE

เทรนด์ที่ 2: มัลติโมดัลแบบดั้งเดิมGemini 2.0 เป็นมัลติโมดัลโดยธรรมชาติ (ไม่ใช่โมดูลแยกที่นำมาต่อกัน):

  • เข้าใจข้อความ+ภาพ+เสียง+วิดีโอพร้อมกัน
  • Cross-modal reasoning: "เปรียบเทียบสไตล์สถาปัตยกรรมในภาพอาคารกับคำอธิบายข้อความของยุคสมัยนั้น"

เทรนด์ที่ 3: Test-Time Compute (Reasoning Models)OpenAI o1, DeepSeek-R1: ใช้เวลาประมวลผลมากขึ้นสำหรับการให้เหตุผลที่ซับซ้อน:

  • o1: 30-60 วินาทีต่อโจทย์คณิตศาสตร์ซับซ้อน เทียบกับ 2 วินาทีของ GPT-4o
  • ความแม่นยำ AIME 2024: 83.3% เทียบกับ 13.4% ของ GPT-4o
  • มีการแลกเปลี่ยนระหว่างความหน่วงและความแม่นยำอย่างชัดเจน

เทรนด์ที่ 4: Agentic WorkflowsModel Context Protocol (MCP) ของ Anthropic เดือนพฤศจิกายน 2024:

  • มาตรฐานเปิดสำหรับให้ AI agent โต้ตอบกับ tools/ฐานข้อมูล
  • พาร์ทเนอร์กว่า 50 รายนำไปใช้ภายใน 3 เดือนแรก
  • ช่วยให้ agent สร้าง "memory" ที่คงอยู่ข้ามการโต้ตอบได้

สงครามต้นทุนและราคา

ราคา API ต่อ 1M โทเคน (input):

  • GPT-4o: $2.50
  • Claude Sonnet 4: $3.00
  • Gemini 2.0 Flash: $0.075 (ถูกกว่า 33 เท่า)
  • DeepSeek-V3: $0.27 (open source, มีค่า hosting เพิ่มเติม)

กรณีศึกษา Gemini Flash: สรุป AI สำหรับสตาร์ทอัพช่วยลดต้นทุนได้ 94% เมื่อเปลี่ยนจาก GPT-4o คุณภาพเท่าเดิม เวลาแฝงใกล้เคียงกัน

การแปลงเป็นสินค้าโภคภัณฑ์เร่งตัวขึ้น: ต้นทุนการอนุมานลดลง 70% เมื่อเทียบกับปีก่อนหน้า 2023-2024 (ข้อมูล Epoch AI)

ผลกระทบเชิงกลยุทธ์ต่อบริษัท

กรอบการตัดสินใจ: จะเลือกโมเดลไหนดี?

สถานการณ์ที่ 1: องค์กรที่ความปลอดภัยสำคัญที่สุด→ Claude Sonnet 4

  • ด้านสุขภาพ กฎหมาย การเงิน ที่ความผิดพลาดสร้างความเสียหายนับล้าน
  • Constitutional AI ช่วยลดความเสี่ยงด้านความรับผิด
  • ราคาพรีเมียมคุ้มค่าเมื่อเทียบกับการลดความเสี่ยง

สถานการณ์ที่ 2: ปริมาณสูง ไวต่อต้นทุน→ Gemini Flash หรือ DeepSeek

  • แชทบอทบริการลูกค้า การกลั่นกรองเนื้อหา การจัดหมวดหมู่
  • ประสิทธิภาพระดับ "ใช้ได้" ปริมาณสูงขึ้น 10-100 เท่า
  • ต้นทุนเป็นปัจจัยตัดสินหลัก

สถานการณ์ที่ 3: การผูกติดกับระบบนิเวศ (Ecosystem Lock-In)→ Gemini สำหรับ Google Workspace, GPT สำหรับ Microsoft

  • ลงทุนในระบบนิเวศไปแล้ว
  • การผสานรวมแบบเนทีฟ > ประสิทธิภาพที่เหนือกว่าเพียงเล็กน้อย
  • ต้นทุนการฝึกอบรมพนักงานบนแพลตฟอร์มที่มีอยู่

สถานการณ์ที่ 4: การปรับแต่ง/การควบคุม→ Llama 3.1 หรือ DeepSeek แบบโอเพนซอร์ส

  • ข้อกำหนดด้านการปฏิบัติตามกฎระเบียบเฉพาะ (data residency, การตรวจสอบ)
  • การ fine-tuning เชิงลึกบนข้อมูลกรรมสิทธิ์
  • การโฮสต์เองที่คุ้มค่าเมื่อมีปริมาณสูง

บทสรุป: จากสงครามเทคโนโลยีสู่สงครามแพลตฟอร์ม

การแข่งขัน LLM ปี 2025 ไม่ได้เป็นเพียง "โมเดลใดคิดได้ดีกว่า" แต่เป็น "ระบบนิเวศใดที่สร้างมูลค่าได้มากกว่า" OpenAI ครองตลาดแบรนด์ผู้บริโภค Google ใช้ประโยชน์จากการกระจายตัวของผู้ใช้หลายพันล้านคน Anthropic ชนะใจองค์กรที่ใส่ใจความปลอดภัย Meta เปลี่ยนโครงสร้างพื้นฐานให้เป็นสินค้าโภคภัณฑ์

คำทำนาย 2026-2027:

  • ประสิทธิภาพหลักบรรจบกันมากขึ้น (~90% MMLU สำหรับ top-5 ทั้งหมด)
  • ความแตกต่างเน้นที่: ความเร็ว ต้นทุน การผสานรวม ความเชี่ยวชาญเฉพาะด้าน
  • เอเจนต์อัตโนมัติแบบหลายขั้นตอนกลายเป็นกระแสหลัก (33% ของ knowledge workers)
  • โอเพนซอร์สปิดช่องว่างด้านคุณภาพ พร้อมรักษาข้อได้เปรียบด้านต้นทุน/การปรับแต่ง

ผู้ชนะคนสุดท้าย? อาจจะไม่ใช่ผู้เล่นรายเดียว แต่เป็นระบบนิเวศที่เสริมซึ่งกันและกันเพื่อรองรับคลัสเตอร์กรณีการใช้งานที่แตกต่างกัน เช่นเดียวกับระบบปฏิบัติการสมาร์ทโฟน (iOS และ Android อยู่ร่วมกัน) มันไม่ใช่ "ผู้ชนะได้ทั้งหมด" แต่เป็น "ผู้ชนะได้ส่วนแบ่งตลาด"

สำหรับองค์กร: กลยุทธ์หลายโมเดลกลายเป็นมาตรฐาน—GPT สำหรับงานทั่วไป, Claude สำหรับการใช้เหตุผลที่มีผลกระทบสูง, Gemini Flash สำหรับปริมาณ, Llama ที่ปรับแต่งเองสำหรับกรรมสิทธิ์

ปี 2025 ไม่ใช่ปีแห่ง "โมเดลที่ดีที่สุด" แต่เป็นปีแห่งการประสานกันอย่างชาญฉลาดระหว่างโมเดลที่เสริมกัน

แหล่งอ้างอิง:

  • Stanford AI Index Report 2025
  • Anthropic Model Card Claude Sonnet 4.5
  • OpenAI GPT-4o Technical Report
  • Google DeepMind Gemini 2.0 System Card
  • DeepSeek-V3 Technical Paper (arXiv)
  • Epoch AI - Trends in Machine Learning
  • Gartner AI & Analytics Summit 2025
  • McKinsey State of AI Report 2025
  • Pew Research Center AI Adoption Survey
  • Similarweb Platform Intelligence

ความคิดเห็น

ยังไม่มีความคิดเห็น — เริ่มการสนทนาได้เลย