ELECTE 4.0 正式上線——AI Agent 登場。看看推出了什麼
Newsletter閱讀時間 6 分鐘

法學碩士的演進:市場簡介

在主要基準上,頂尖 LLM 的差距不到 2 個百分點,技術戰以平手收場。真正的 2025 大戰在生態系統、分銷和成本上上演:DeepSeek 以 560 萬美元 vs GPT-4 的 7,800-1,900 萬美元證明了自己的競爭力。儘管 Claude 贏得 65% 的技術基準,ChatGPT 仍在品牌上佔有主導地位 (76% 的知名度)。對公司而言,致勝策略不是選擇「最好的模式」,而是針對不同的使用個案,協調互補的模式。

Evoluzione degli LLM: una breve panoramica del mercato

用 AI 摘要這篇文章

2025年語言模型之戰:從技術均勢到生態系統之爭

大型語言模型的發展在 2025 年到了一個關鍵的轉折點:競爭不再是在模型的基本能力上 - 現在在主要的基準上基本上是相同的 - 而是在生態系統、整合和部署策略上。雖然 Anthropic 的 Claude Sonnet 4.5 在特定基準上維持微弱的技術優勢,但真正的戰爭已轉移到不同的領域。

技術性抽籤:當數目相等時

MMLU基準測試(Massive Multitask Language Understanding)

  • Claude Sonnet 4.5: 88.7%
  • GPT-4o: 88.0%
  • Gemini 2.0 Flash: 86.9%
  • DeepSeek-V3: 87.1%

兩者的差異微乎其微,表現最佳的公司之間相差不到 2 個百分點。根據斯坦福的《2025 年人工智能指數報告》,「語言模型核心能力的融合代表了 2024-2025 年最重要的趨勢之一,對人工智能公司的競爭策略具有深遠的影響」。

推理能力(GPQA Diamond)

  • Claude Sonnet 4: 65.0%
  • GPT-4o: 53.6%
  • Gemini 2.0 Pro: 59.1%

Claude 在複雜的推理任務上仍維持顯著的優勢,但 GPT-4o 在反應速度(平均延遲時間 1.2s 對比 Claude 的 2.1s)和 Gemini 的原生多模式處理上更勝一籌。

DeepSeek 革命:中國的遊戲改變者

2025 年 1 月,DeepSeek-V3 嶄露頭角,以 560 萬美元對比 GPT-4/Gemini Ultra 的 7,800-1.91 億美元,展示了如何開發出具有競爭力的模型。Marc Andreessen 稱之為「最令人驚嘆的突破之一,而作為開放原始碼,更是給世界的一份深厚禮物」。

DeepSeek-V3規格:

  • 總參數量6,710億(透過Mixture-of-Experts啟用370億)
  • 訓練成本:$5.576M
  • 效能:在部分數學基準測試中超越GPT-4o
  • 架構:Multi-head Latent Attention (MLA) + DeepSeekMoE

影響:Nvidia 股價在公佈後單一交易時段下跌 17%,市場重估模型開發的進入門檻。

公眾觀感與技術現實

ChatGPT 在品牌知名度上維持無可挑戰的優勢:皮尤研究中心 (Pew Research Center) 的研究 (2025 年 2 月) 顯示,76% 的美國人只會將「會話式 AI」與 ChatGPT 聯繫起來,而只有 12% 的人知道 Claude,8% 的人會主動使用 Gemini。

悖論:Claude Sonnet 4 在 65% 的技術基準上勝過 GPT-4o,但消費者市場佔有率僅為 8%,ChatGPT 則為 71%(Similarweb 資料,2025 年 3 月)。

Google 以大量整合來回應:Gemini 2.0 原生於 Search、Gmail、Docs、Drive-策略生態系統與獨立產品。21 億 Google Workspace 使用者代表即時分銷,無需取得客戶。

電腦使用與代理:下一個領域

Claude Computer Use(2024年10月測試版,2025年第一季正式上線)

  • 功能:直接控制滑鼠/鍵盤、瀏覽器導覽、應用程式互動
  • 採用率:12%的Anthropic企業客戶在正式環境中使用Computer Use功能
  • 限制:在複雜多步驟任務上仍有14%的失敗率

具備Vision與Actions功能的GPT-4o

  • Zapier整合:可控制6000+款應用程式
  • 自訂GPTs:已發布300萬個,80萬個正在積極使用中
  • GPTs創作者收益分潤:2024年第四季已分配1000萬美元

Gemini Deep Research(2025年1月)

  • 多來源自主研究,並提供比較分析
  • 只需單一提示即可產出完整報告
  • 平均耗時:產出5000字以上報告需8至12分鐘

Gartner 預測到 2025 年底,將有 33% 的知識工作者使用自主式 AI 代理,而現在只有 5%。

關於安全的哲學分歧

OpenAI:「以限制實現安全」的策略

  • 拒絕回應8.7%的消費者提示(OpenAI內部外洩資料)
  • 嚴格的內容政策導致23%開發者流失至其他替代方案
  • 公開的Preparedness Framework,並持續進行red-teaming測試

Anthropic:「Constitutional AI」

  • 模型依明確的倫理原則訓練而成
  • 選擇性拒絕:3.1%的提示(比OpenAI更為寬容)
  • 決策透明:會說明拒絕請求的原因

Google:「安全最大化,爭議最小化」

  • 市場上最嚴格的過濾機制:封鎖11.2%的提示
  • 2024年2月Gemini Image的失敗事件(偏見過度修正)促使公司採取極度謹慎的態度
  • 以企業市場為重心,降低了風險容忍度

Meta Llama 3.1:零內建篩選器、執行者對立理念的責任。

垂直專業化:真正的差異化優勢

醫療保健:

  • Med-PaLM 2(Google):在MedQA測試中達85.4%(相較於人類頂尖醫師的77%)
  • Epic Systems中的Claude:已被美國305家醫院採用,用於臨床決策支援

法律:

  • Harvey AI(客製化GPT-4):102家頂尖百大律師事務所為其客戶,年經常性收入(ARR)達1億美元
  • CoCounsel(Thomson Reuters + Claude):法律研究準確率達98%

金融:

  • Bloomberg GPT:以3,630億個專有金融token訓練而成
  • Goldman Sachs Marcus AI(基於GPT-4):貸款核准速度提升40%

垂直化的付款意願是一般模式的 3.5 倍(麥肯錫調查,500 位企業買家)。

Llama 3.1:Meta 的開放原始碼策略

405B 參數,在許多基準上與 GPT-4o 具競爭力,完全開放重量。Meta 策略:基礎架構層商品化,以產品層競爭(Ray-Ban Meta 眼鏡、WhatsApp AI)。

Llama 3.1 採用情況:

  • 首月下載量超過 35 萬次
  • 50+ 新創公司基於 Llama 建構垂直領域 AI
  • 自主託管成本:每月 1.2 萬美元,相較於封閉模型同等用量的 API 成本超過 5 萬美元

反其道而行:Meta 在 Reality Labs 上損失數十億美元,但為了保護廣告核心業務,卻在開放式 AI 上大量投資。

Context Windows:數百萬代幣的競賽

  • Claude Sonnet 4.5:20 萬 token
  • Gemini 2.0 Pro:200 萬 token(商業可用中最長)
  • GPT-4 Turbo:12.8 萬 token

Gemini 200 萬 context 可用於分析整個程式碼庫、10 小時以上的影片、數千頁文件——這是變革性的企業應用場景。Google Cloud 報告顯示,43% 的企業 POC 使用超過 50 萬 token 的 context。

適應性與客製化

Claude Projects 與 Styles:

  • 跨對話持續存在的自訂指令
  • 風格預設:正式、簡潔、說明性
  • 知識庫上傳(最多 5GB 文件)

GPT Store 與自訂 GPT:

  • 已發布 300 萬個 GPT,月活躍使用量達 80 萬
  • 頂尖創作者每月賺取 6.3 萬美元(收益分成)
  • 71% 的企業內部使用至少 1 個自訂 GPT

Gemini 擴充功能:

  • 原生整合 Gmail、Calendar、Drive、Maps
  • Workspace context:讀取電子郵件與行事曆以提供主動建議
  • 2024 年第四季執行 12 億次 workspace 操作

關鍵:「單一提示」改為「具備跨會話記憶與情境的持久性助理」。

2025 年第一季發展與未來軌跡

趨勢一:混合專家模型(Mixture-of-Experts)主導2025 年所有頂級模型皆採用 MoE(依查詢啟動部分參數):

  • 推論成本降低 40-60%
  • 在維持品質的同時延遲更佳
  • DeepSeek、GPT-4、Gemini Ultra 皆採用 MoE 架構

趨勢二:原生多模態Gemini 2.0 為原生多模態(而非拼接的獨立模組):

  • 同時理解文字、圖像、音訊與影片
  • 跨模態推理:「將建築照片的建築風格與歷史時期的文字描述進行比較」

趨勢三:測試時運算(推理模型)OpenAI o1、DeepSeek-R1:使用更多處理時間進行複雜推理:

  • o1:複雜數學問題耗時 30-60 秒,相較 GPT-4o 的 2 秒
  • AIME 2024 準確率:83.3% 對比 GPT-4o 的 13.4%
  • 延遲與準確度之間的明確取捨

趨勢四:代理工作流程Anthropic 的 Model Context Protocol(MCP),2024 年 11 月推出:

  • 供 AI 代理與工具/資料庫互動的開放標準
  • 前 3 個月內獲得 50+ 合作夥伴採用
  • 讓代理能建立跨互動的持續性「記憶」

成本與定價大戰

每百萬 token API 定價(輸入):

  • GPT-4o:2.50 美元
  • Claude Sonnet 4:3.00 美元
  • Gemini 2.0 Flash:0.075 美元(便宜 33 倍)
  • DeepSeek-V3:0.27 美元(開源,另計託管成本)

Gemini Flash 個案研究:從 GPT-4o 轉換過來的新創公司 AI 總結降低了 94% 的成本-相同的品質、相若的延遲。

商品化加速:2023-2024 年推理成本年增 70%(Epoch AI 資料)。

對公司的策略性影響

決策框架:該選擇哪個模型?

情境一:企業安全關鍵應用→ Claude Sonnet 4

  • 醫療、法律、金融等錯誤代價高達數百萬的領域
  • Constitutional AI 降低法律責任風險
  • 溢價定價因風險緩解而合理

情境二:高流量、成本敏感型應用→ Gemini Flash 或 DeepSeek

  • 客服聊天機器人、內容審核、分類任務
  • 效能「足夠好」,用量達 10 到 100 倍
  • 成本為主要差異化因素

情境 3:生態系鎖定→ Google Workspace 用 Gemini,Microsoft 用 GPT

  • 已投資於生態系
  • 原生整合 > 些微更優的效能
  • 員工在現有平台上的訓練成本

情境 4:客製化/控制權→ Llama 3.1 或 DeepSeek 開源

  • 特定合規要求(資料落地、稽核)
  • 針對專有資料進行大量微調
  • 在大量使用下,自架成本更划算

結論:從技術戰到平台戰

2025 年的 LLM 競爭不再是「哪個模式的理由最充分」,而是「哪個生態系統能獲得最大價值」。OpenAI 主導消費者品牌,Google 利用十億用戶分銷,Anthropic 贏得具有安全意識的企業,Meta 將基礎設施商品化。

2026-2027 年預測:

  • 核心效能進一步趨於一致(前五名皆約 90% MMLU)
  • 差異化聚焦於:速度、成本、整合能力、垂直領域專精
  • 多步驟自主代理成為主流(33% 的知識工作者)
  • 開源模型縮小品質差距,保有成本/客製化優勢

最後贏家?可能不是單一玩家,而是服務於不同使用群組的互補生態系統。就像智慧型手機作業系統 (iOS + Android 並存),不是「贏家通吃」,而是「贏家分割」。

對於企業:多模型策略成為標準-GPT 適用於一般任務,Claude 適用於高風險推理,Gemini Flash 適用於大量任務,Llama 適用於專屬的客製調整。

2025 年不是「最佳模式」之年,而是互補模式之間智慧型協調之年。

資料來源:

  • Stanford AI Index Report 2025
  • Anthropic Model Card Claude Sonnet 4.5
  • OpenAI GPT-4o Technical Report
  • Google DeepMind Gemini 2.0 System Card
  • DeepSeek-V3 Technical Paper (arXiv)
  • Epoch AI - Trends in Machine Learning
  • Gartner AI & Analytics Summit 2025
  • McKinsey State of AI Report 2025
  • Pew Research Center AI Adoption Survey
  • Similarweb Platform Intelligence

留言

尚無留言——開始討論吧。