ELECTE 4.0 đã ra mắt — AI Agent đã có mặt.Xem tính năng mới
Newsletter6 phút đọc

Sự phát triển của LLM: Tổng quan ngắn gọn về thị trường

Chênh lệch giữa các LLM hàng đầu về các tiêu chuẩn chính chưa đến 2 phần trăm—cuộc chiến công nghệ đã kết thúc với tỷ số hòa. Cuộc chiến thực sự vào năm 2025 sẽ diễn ra về hệ sinh thái, phân phối và chi phí: DeepSeek đã chứng minh rằng họ có thể cạnh tranh với 5,6 triệu đô la so với 78-191 triệu đô la của GPT-4. ChatGPT thống trị thương hiệu (độ nhận diện 76%) mặc dù Claude giành chiến thắng 65% trong các tiêu chuẩn kỹ thuật. Đối với các công ty, chiến lược chiến thắng không phải là chọn "mô hình tốt nhất" mà là phối hợp các mô hình bổ sung cho các trường hợp sử dụng khác nhau.

Evoluzione degli LLM: una breve panoramica del mercato

Tóm tắt bài viết này bằng AI

Cuộc Chiến Mô Hình Ngôn Ngữ 2025: Từ Ngang Bằng Kỹ Thuật Đến Trận Chiến Hệ Sinh Thái

Sự phát triển của các Mô hình Ngôn ngữ Lớn đã đạt đến một bước ngoặt quan trọng vào năm 2025: cuộc cạnh tranh không còn dựa trên năng lực cốt lõi của các mô hình - giờ đây về cơ bản là tương đương nhau về các tiêu chuẩn chính - mà dựa trên hệ sinh thái, tích hợp và chiến lược triển khai của chúng. Mặc dù Claude Sonnet 4.5 của Anthropic vẫn duy trì lợi thế kỹ thuật hẹp trong các tiêu chuẩn cụ thể, nhưng cuộc chiến thực sự đã chuyển sang một địa hình khác.

Rút thăm kỹ thuật: Khi các con số bằng nhau

Benchmark MMLU (Massive Multitask Language Understanding)

  • Claude Sonnet 4.5: 88.7%
  • GPT-4o: 88.0%
  • Gemini 2.0 Flash: 86.9%
  • DeepSeek-V3: 87.1%

Sự khác biệt là không đáng kể—chỉ cách biệt chưa đến 2 điểm phần trăm giữa các công ty có hiệu suất cao nhất. Theo Báo cáo Chỉ số AI 2025 của Stanford, "sự hội tụ của các năng lực mô hình ngôn ngữ cốt lõi đại diện cho một trong những xu hướng quan trọng nhất của giai đoạn 2024-2025, với những tác động sâu sắc đến chiến lược cạnh tranh của các công ty AI."

Khả Năng Suy Luận (GPQA Diamond)

  • Claude Sonnet 4: 65.0%
  • GPT-4o: 53.6%
  • Gemini 2.0 Pro: 59.1%

Claude vẫn giữ được lợi thế đáng kể trong các nhiệm vụ suy luận phức tạp, nhưng GPT-4o vượt trội về tốc độ phản hồi (độ trễ trung bình 1,2 giây so với Claude là 2,1 giây) và Gemini về khả năng xử lý đa phương thức gốc.

Cuộc cách mạng DeepSeek: Bước ngoặt thay đổi cuộc chơi của Trung Quốc

Tháng 1 năm 2025 chứng kiến ​​sự ra đời đột phá của DeepSeek-V3, chứng minh rằng các mô hình cạnh tranh có thể được phát triển với chi phí 5,6 triệu đô la so với 78–191 triệu đô la của GPT-4/Gemini Ultra. Marc Andreessen gọi đây là "một trong những đột phá đáng kinh ngạc nhất—và với tư cách là mã nguồn mở, đây là một món quà sâu sắc cho thế giới."

Thông Số Kỹ Thuật DeepSeek-V3:

  • 671 tỷ tham số tổng cộng (37B kích hoạt qua Mixture-of-Experts)
  • Chi phí huấn luyện: $5.576M
  • Hiệu suất: vượt GPT-4o ở một số benchmark toán học
  • Kiến trúc: Multi-head Latent Attention (MLA) + DeepSeekMoE

Tác động: Cổ phiếu Nvidia giảm 17% chỉ trong một phiên giao dịch sau thông báo, khi thị trường đang đánh giá lại các rào cản gia nhập để phát triển mô hình.

Nhận thức của công chúng so với thực tế kỹ thuật

ChatGPT vẫn duy trì vị thế thống trị không thể chối cãi về nhận diện thương hiệu: Nghiên cứu của Trung tâm nghiên cứu Pew (tháng 2 năm 2025) cho thấy 76% người Mỹ chỉ liên tưởng "AI đàm thoại" với ChatGPT, trong khi chỉ có 12% biết đến Claude và 8% tích cực sử dụng Gemini.

Nghịch lý: Claude Sonnet 4 đánh bại GPT-4o ở tiêu chuẩn kỹ thuật 65% nhưng chỉ chiếm 8% thị phần người tiêu dùng so với 71% của ChatGPT (dữ liệu của Similarweb, tháng 3 năm 2025).

Google phản hồi bằng sự tích hợp quy mô lớn: Gemini 2.0 gốc trong Tìm kiếm, Gmail, Docs và Drive—chiến lược hệ sinh thái so với sản phẩm độc lập. 2,1 tỷ người dùng Google Workspace đại diện cho việc triển khai ngay lập tức mà không cần thu hút khách hàng.

Sử dụng máy tính và tác nhân: Biên giới tiếp theo

Claude Computer Use (beta tháng 10/2024, production Q1 2025)

  • Khả năng: điều khiển trực tiếp chuột/bàn phím, điều hướng trình duyệt, tương tác ứng dụng
  • Mức độ áp dụng: 12% khách hàng doanh nghiệp của Anthropic dùng computer use trong môi trường production
  • Hạn chế: vẫn còn tỷ lệ thất bại 14% với các task phức tạp nhiều bước

GPT-4o với Vision và Actions

  • Tích hợp Zapier: hơn 6000 ứng dụng có thể điều khiển
  • Custom GPTs: 3 triệu bản đã publish, 800K đang được sử dụng tích cực
  • Chia sẻ doanh thu cho creator GPTs: $10M đã phân phối trong Q4 2024

Gemini Deep Research (tháng 1/2025)

  • Nghiên cứu tự động đa nguồn với phân tích so sánh
  • Tạo báo cáo hoàn chỉnh chỉ từ một prompt duy nhất
  • Thời gian trung bình: 8-12 phút cho báo cáo hơn 5000 từ

Gartner dự đoán 33% nhân viên trí thức sẽ sử dụng tác nhân AI tự động vào cuối năm 2025, so với 5% hiện nay.

Sự khác biệt về triết lý về an ninh

OpenAI: Cách Tiếp Cận "Safety Through Restriction"

  • Từ chối 8.7% prompt consumer (dữ liệu nội bộ OpenAI bị rò rỉ)
  • Chính sách nội dung khắt khe gây ra 23% developer chuyển sang các giải pháp thay thế
  • Preparedness Framework công khai với red-teaming liên tục

Anthropic: "Constitutional AI"

  • Mô hình được huấn luyện dựa trên các nguyên tắc đạo đức rõ ràng
  • Từ chối có chọn lọc: 3.1% prompt (dễ dãi hơn OpenAI)
  • Minh bạch trong quyết định: giải thích lý do từ chối các yêu cầu

Google: "Maximum Safety, Minimum Controversy"

  • Bộ lọc nghiêm ngặt nhất thị trường: 11.2% prompt bị chặn
  • Thất bại của Gemini Image tháng 2/2024 (overcorrection về bias) khiến hãng thận trọng cực độ
  • Trọng tâm doanh nghiệp làm giảm mức độ chấp nhận rủi ro

Meta Llama 3.1: không có bộ lọc tích hợp, trách nhiệm của người thực hiện—triết lý đối lập.

Chuyên môn hóa theo chiều dọc: Sự khác biệt thực sự

Y tế:

  • Med-PaLM 2 (Google): 85.4% trên MedQA (so với 77% của các bác sĩ giỏi nhất)
  • Claude trong Epic Systems: được 305 bệnh viện tại Mỹ áp dụng để hỗ trợ quyết định lâm sàng

Pháp lý:

  • Harvey AI (tùy chỉnh từ GPT-4): 102 công ty luật thuộc top-100 là khách hàng, ARR $100M
  • CoCounsel (Thomson Reuters + Claude): độ chính xác 98% trong nghiên cứu pháp lý

Tài chính:

  • Bloomberg GPT: được huấn luyện trên 363B token tài chính độc quyền
  • Goldman Sachs Marcus AI (nền tảng GPT-4): phê duyệt khoản vay nhanh hơn 40%

Mô hình dọc hóa tạo ra mức sẵn lòng chi trả cao gấp 3,5 lần so với các mô hình chung (khảo sát của McKinsey, 500 người mua doanh nghiệp).

Llama 3.1: Chiến lược nguồn mở của Meta

Các thông số 405B, cạnh tranh với GPT-4o trên nhiều điểm chuẩn, được thiết kế hoàn toàn mở. Chiến lược siêu dữ liệu: thương mại hóa lớp cơ sở hạ tầng để cạnh tranh trên lớp sản phẩm (kính Ray-Ban Meta, WhatsApp AI).

Mức độ áp dụng Llama 3.1:

  • Hơn 350K lượt tải trong tháng đầu tiên
  • Hơn 50 startup xây dựng vertical AI trên nền Llama
  • Chi phí hosting tự quản lý: 12K$/tháng so với hơn 50K$ chi phí API của các mô hình closed-source cho mức sử dụng tương đương

Ngược lại trực giác: Meta mất hàng tỷ đô la vào Reality Labs nhưng lại đầu tư mạnh vào AI mở để bảo vệ hoạt động quảng cáo cốt lõi.

Cửa sổ ngữ cảnh: Cuộc đua giành hàng triệu mã thông báo

  • Claude Sonnet 4.5: 200K token
  • Gemini 2.0 Pro: 2M token (dài nhất hiện có trên thị trường)
  • GPT-4 Turbo: 128K token

Context 2M của Gemini cho phép phân tích toàn bộ codebase, hơn 10 giờ video, hàng nghìn trang tài liệu—một use case đột phá cho doanh nghiệp. Google Cloud báo cáo rằng 43% các POC doanh nghiệp sử dụng context trên 500K token.

Khả năng thích ứng và tùy chỉnh

Claude Projects & Styles:

  • Hướng dẫn tùy chỉnh được lưu giữ xuyên suốt các cuộc trò chuyện
  • Style preset: Formal, Concise, Explanatory
  • Tải lên knowledge base (tối đa 5GB tài liệu)

GPT Store & Custom GPT:

  • 3 triệu GPT đã được công bố, 800K lượt sử dụng active hàng tháng
  • Creator hàng đầu kiếm được 63K$/tháng (chia sẻ doanh thu)
  • 71% doanh nghiệp sử dụng ít nhất 1 custom GPT nội bộ

Gemini Extensions:

  • Tích hợp gốc với Gmail, Calendar, Drive, Maps
  • Workspace context: đọc email+calendar để đưa ra gợi ý chủ động
  • 1,2 tỷ workspace action được thực hiện trong Q4 2024

Chú thích: Từ "lời nhắc đơn lẻ" đến "trợ lý liên tục với bộ nhớ và ngữ cảnh liên phiên".

Sự phát triển và quỹ đạo tương lai của Quý 1 năm 2025

Xu hướng 1: Sự thống trị của Mixture-of-ExpertsTất cả các mô hình hàng đầu năm 2025 đều sử dụng MoE (kích hoạt một tập con tham số cho mỗi truy vấn):

  • Giảm 40-60% chi phí inference
  • Độ trễ tốt hơn trong khi vẫn duy trì chất lượng
  • DeepSeek, GPT-4, Gemini Ultra đều dựa trên MoE

Xu hướng 2: Đa phương thức gốcGemini 2.0 đa phương thức gốc (không phải các module riêng biệt ghép lại):

  • Hiểu đồng thời văn bản+hình ảnh+âm thanh+video
  • Reasoning đa phương thức: "so sánh phong cách kiến trúc trong ảnh tòa nhà với mô tả văn bản về giai đoạn lịch sử"

Xu hướng 3: Test-Time Compute (Mô hình Reasoning)OpenAI o1, DeepSeek-R1: sử dụng nhiều thời gian xử lý hơn cho việc suy luận phức tạp:

  • o1: 30-60 giây cho một bài toán phức tạp so với 2 giây của GPT-4o
  • Độ chính xác AIME 2024: 83,3% so với 13,4% của GPT-4o
  • Trade-off rõ ràng giữa độ trễ/độ chính xác

Xu hướng 4: Agentic WorkflowModel Context Protocol (MCP) của Anthropic, tháng 11/2024:

  • Chuẩn mở để các agent AI tương tác với tools/database
  • Hơn 50 đối tác áp dụng trong 3 tháng đầu
  • Cho phép các agent xây dựng "memory" được lưu giữ xuyên suốt các tương tác

Cuộc chiến về chi phí và giá cả

Giá API cho 1M token (input):

  • GPT-4o: 2,50$
  • Claude Sonnet 4: 3,00$
  • Gemini 2.0 Flash: 0,075$ (rẻ hơn 33 lần)
  • DeepSeek-V3: 0,27$ (open source, chi phí hosting)

Nghiên cứu điển hình về Gemini Flash: tóm tắt về AI khởi nghiệp giúp giảm 94% chi phí khi chuyển đổi từ GPT-4o—chất lượng tương đương, độ trễ tương đương.

Quá trình thương mại hóa diễn ra nhanh hơn: chi phí suy luận giảm -70% so với cùng kỳ năm 2023-2024 (dữ liệu Epoch AI).

Ý nghĩa chiến lược đối với các công ty

Khung quyết định: Nên chọn mô hình nào?

Kịch bản 1: Doanh nghiệp cần an toàn tối đa→ Claude Sonnet 4

  • Y tế, pháp lý, tài chính—nơi sai sót có thể tốn hàng triệu đô la
  • Constitutional AI giúp giảm rủi ro trách nhiệm pháp lý
  • Mức giá premium được biện minh bởi việc giảm thiểu rủi ro

Kịch bản 2: Khối lượng lớn, nhạy cảm về chi phí→ Gemini Flash hoặc DeepSeek

  • Chatbot dịch vụ khách hàng, kiểm duyệt nội dung, phân loại
  • Hiệu suất "đủ tốt", khối lượng gấp 10-100 lần
  • Chi phí là yếu tố khác biệt chính

Kịch bản 3: Khóa hệ sinh thái (Ecosystem Lock-In)→ Gemini cho Google Workspace, GPT cho Microsoft

  • Đã đầu tư vào hệ sinh thái
  • Tích hợp gốc > hiệu suất vượt trội biên
  • Chi phí đào tạo phụ thuộc vào nền tảng hiện có

Kịch bản 4: Tùy chỉnh/Kiểm soát→ Llama 3.1 hoặc DeepSeek mã nguồn mở

  • Yêu cầu tuân thủ cụ thể (lưu trữ dữ liệu tại chỗ, kiểm toán)
  • Tinh chỉnh chuyên sâu trên dữ liệu độc quyền
  • Tự lưu trữ tiết kiệm chi phí theo quy mô

Kết luận: Từ cuộc chiến công nghệ đến cuộc chiến nền tảng

Cuộc thi LLM năm 2025 không còn là "mô hình nào suy nghĩ tốt hơn" nữa mà là "hệ sinh thái nào thu được nhiều giá trị hơn". OpenAI thống trị các thương hiệu tiêu dùng, Google tận dụng việc phân phối hàng tỷ người dùng, Anthropic giành được các doanh nghiệp chú trọng đến an toàn, Meta thương mại hóa cơ sở hạ tầng.

Dự đoán 2026-2027:

  • Hiệu suất cốt lõi tiếp tục hội tụ (~90% MMLU cho tất cả top-5)
  • Khác biệt hóa dựa trên: tốc độ, chi phí, tích hợp, chuyên môn hóa theo ngành
  • Tác nhân tự động đa bước trở thành xu hướng chủ đạo (33% người lao động tri thức)
  • Mã nguồn mở thu hẹp khoảng cách chất lượng, duy trì lợi thế về chi phí/tùy chỉnh

Người chiến thắng cuối cùng? Có lẽ không phải một người chơi đơn lẻ, mà là các hệ sinh thái bổ trợ phục vụ các nhóm trường hợp sử dụng khác nhau. Giống như hệ điều hành điện thoại thông minh (iOS và Android cùng tồn tại), đây không phải là "kẻ thắng được tất cả", mà là "kẻ thắng được phân khúc".

Đối với doanh nghiệp: Chiến lược đa mô hình trở thành tiêu chuẩn—GPT cho các nhiệm vụ chung, Claude cho lý luận có rủi ro cao, Gemini Flash cho khối lượng, Llama tùy chỉnh cho độc quyền.

Năm 2025 không phải là năm của "mô hình tốt nhất" mà là năm của sự phối hợp thông minh giữa các mô hình bổ sung.

Nguồn:

  • Stanford AI Index Report 2025
  • Anthropic Model Card Claude Sonnet 4.5
  • OpenAI GPT-4o Technical Report
  • Google DeepMind Gemini 2.0 System Card
  • DeepSeek-V3 Technical Paper (arXiv)
  • Epoch AI - Trends in Machine Learning
  • Gartner AI & Analytics Summit 2025
  • McKinsey State of AI Report 2025
  • Pew Research Center AI Adoption Survey
  • Similarweb Platform Intelligence

Bình luận

Chưa có bình luận nào — hãy bắt đầu cuộc trò chuyện.