法學碩士的演進:市場簡介
在主要基準上,頂尖 LLM 的差距不到 2 個百分點,技術戰以平手收場。真正的 2025 大戰在生態系統、分銷和成本上上演:DeepSeek 以 560 萬美元 vs GPT-4 的 7,800-1,900 萬美元證明了自己的競爭力。儘管 Claude 贏得 65% 的技術基準,ChatGPT 仍在品牌上佔有主導地位 (76% 的知名度)。對公司而言,致勝策略不是選擇「最好的模式」,而是針對不同的使用個案,協調互補的模式。

2025年語言模型之戰:從技術均勢到生態系統之爭
大型語言模型的發展在 2025 年到了一個關鍵的轉折點:競爭不再是在模型的基本能力上 - 現在在主要的基準上基本上是相同的 - 而是在生態系統、整合和部署策略上。雖然 Anthropic 的 Claude Sonnet 4.5 在特定基準上維持微弱的技術優勢,但真正的戰爭已轉移到不同的領域。
技術性抽籤:當數目相等時
MMLU基準測試(Massive Multitask Language Understanding)
- Claude Sonnet 4.5: 88.7%
- GPT-4o: 88.0%
- Gemini 2.0 Flash: 86.9%
- DeepSeek-V3: 87.1%
兩者的差異微乎其微,表現最佳的公司之間相差不到 2 個百分點。根據斯坦福的《2025 年人工智能指數報告》,「語言模型核心能力的融合代表了 2024-2025 年最重要的趨勢之一,對人工智能公司的競爭策略具有深遠的影響」。
推理能力(GPQA Diamond)
- Claude Sonnet 4: 65.0%
- GPT-4o: 53.6%
- Gemini 2.0 Pro: 59.1%
Claude 在複雜的推理任務上仍維持顯著的優勢,但 GPT-4o 在反應速度(平均延遲時間 1.2s 對比 Claude 的 2.1s)和 Gemini 的原生多模式處理上更勝一籌。
DeepSeek 革命:中國的遊戲改變者
2025 年 1 月,DeepSeek-V3 嶄露頭角,以 560 萬美元對比 GPT-4/Gemini Ultra 的 7,800-1.91 億美元,展示了如何開發出具有競爭力的模型。Marc Andreessen 稱之為「最令人驚嘆的突破之一,而作為開放原始碼,更是給世界的一份深厚禮物」。
DeepSeek-V3規格:
- 總參數量6,710億(透過Mixture-of-Experts啟用370億)
- 訓練成本:$5.576M
- 效能:在部分數學基準測試中超越GPT-4o
- 架構:Multi-head Latent Attention (MLA) + DeepSeekMoE
影響:Nvidia 股價在公佈後單一交易時段下跌 17%,市場重估模型開發的進入門檻。
公眾觀感與技術現實
ChatGPT 在品牌知名度上維持無可挑戰的優勢:皮尤研究中心 (Pew Research Center) 的研究 (2025 年 2 月) 顯示,76% 的美國人只會將「會話式 AI」與 ChatGPT 聯繫起來,而只有 12% 的人知道 Claude,8% 的人會主動使用 Gemini。
悖論:Claude Sonnet 4 在 65% 的技術基準上勝過 GPT-4o,但消費者市場佔有率僅為 8%,ChatGPT 則為 71%(Similarweb 資料,2025 年 3 月)。
Google 以大量整合來回應:Gemini 2.0 原生於 Search、Gmail、Docs、Drive-策略生態系統與獨立產品。21 億 Google Workspace 使用者代表即時分銷,無需取得客戶。
電腦使用與代理:下一個領域
Claude Computer Use(2024年10月測試版,2025年第一季正式上線)
- 功能:直接控制滑鼠/鍵盤、瀏覽器導覽、應用程式互動
- 採用率:12%的Anthropic企業客戶在正式環境中使用Computer Use功能
- 限制:在複雜多步驟任務上仍有14%的失敗率
具備Vision與Actions功能的GPT-4o
- Zapier整合:可控制6000+款應用程式
- 自訂GPTs:已發布300萬個,80萬個正在積極使用中
- GPTs創作者收益分潤:2024年第四季已分配1000萬美元
Gemini Deep Research(2025年1月)
- 多來源自主研究,並提供比較分析
- 只需單一提示即可產出完整報告
- 平均耗時:產出5000字以上報告需8至12分鐘
Gartner 預測到 2025 年底,將有 33% 的知識工作者使用自主式 AI 代理,而現在只有 5%。
關於安全的哲學分歧
OpenAI:「以限制實現安全」的策略
- 拒絕回應8.7%的消費者提示(OpenAI內部外洩資料)
- 嚴格的內容政策導致23%開發者流失至其他替代方案
- 公開的Preparedness Framework,並持續進行red-teaming測試
Anthropic:「Constitutional AI」
- 模型依明確的倫理原則訓練而成
- 選擇性拒絕:3.1%的提示(比OpenAI更為寬容)
- 決策透明:會說明拒絕請求的原因
Google:「安全最大化,爭議最小化」
- 市場上最嚴格的過濾機制:封鎖11.2%的提示
- 2024年2月Gemini Image的失敗事件(偏見過度修正)促使公司採取極度謹慎的態度
- 以企業市場為重心,降低了風險容忍度
Meta Llama 3.1:零內建篩選器、執行者對立理念的責任。
垂直專業化:真正的差異化優勢
醫療保健:
- Med-PaLM 2(Google):在MedQA測試中達85.4%(相較於人類頂尖醫師的77%)
- Epic Systems中的Claude:已被美國305家醫院採用,用於臨床決策支援
法律:
- Harvey AI(客製化GPT-4):102家頂尖百大律師事務所為其客戶,年經常性收入(ARR)達1億美元
- CoCounsel(Thomson Reuters + Claude):法律研究準確率達98%
金融:
- Bloomberg GPT:以3,630億個專有金融token訓練而成
- Goldman Sachs Marcus AI(基於GPT-4):貸款核准速度提升40%
垂直化的付款意願是一般模式的 3.5 倍(麥肯錫調查,500 位企業買家)。
Llama 3.1:Meta 的開放原始碼策略
405B 參數,在許多基準上與 GPT-4o 具競爭力,完全開放重量。Meta 策略:基礎架構層商品化,以產品層競爭(Ray-Ban Meta 眼鏡、WhatsApp AI)。
Llama 3.1 採用情況:
- 首月下載量超過 35 萬次
- 50+ 新創公司基於 Llama 建構垂直領域 AI
- 自主託管成本:每月 1.2 萬美元,相較於封閉模型同等用量的 API 成本超過 5 萬美元
反其道而行:Meta 在 Reality Labs 上損失數十億美元,但為了保護廣告核心業務,卻在開放式 AI 上大量投資。
Context Windows:數百萬代幣的競賽
- Claude Sonnet 4.5:20 萬 token
- Gemini 2.0 Pro:200 萬 token(商業可用中最長)
- GPT-4 Turbo:12.8 萬 token
Gemini 200 萬 context 可用於分析整個程式碼庫、10 小時以上的影片、數千頁文件——這是變革性的企業應用場景。Google Cloud 報告顯示,43% 的企業 POC 使用超過 50 萬 token 的 context。
適應性與客製化
Claude Projects 與 Styles:
- 跨對話持續存在的自訂指令
- 風格預設:正式、簡潔、說明性
- 知識庫上傳(最多 5GB 文件)
GPT Store 與自訂 GPT:
- 已發布 300 萬個 GPT,月活躍使用量達 80 萬
- 頂尖創作者每月賺取 6.3 萬美元(收益分成)
- 71% 的企業內部使用至少 1 個自訂 GPT
Gemini 擴充功能:
- 原生整合 Gmail、Calendar、Drive、Maps
- Workspace context:讀取電子郵件與行事曆以提供主動建議
- 2024 年第四季執行 12 億次 workspace 操作
關鍵:「單一提示」改為「具備跨會話記憶與情境的持久性助理」。
2025 年第一季發展與未來軌跡
趨勢一:混合專家模型(Mixture-of-Experts)主導2025 年所有頂級模型皆採用 MoE(依查詢啟動部分參數):
- 推論成本降低 40-60%
- 在維持品質的同時延遲更佳
- DeepSeek、GPT-4、Gemini Ultra 皆採用 MoE 架構
趨勢二:原生多模態Gemini 2.0 為原生多模態(而非拼接的獨立模組):
- 同時理解文字、圖像、音訊與影片
- 跨模態推理:「將建築照片的建築風格與歷史時期的文字描述進行比較」
趨勢三:測試時運算(推理模型)OpenAI o1、DeepSeek-R1:使用更多處理時間進行複雜推理:
- o1:複雜數學問題耗時 30-60 秒,相較 GPT-4o 的 2 秒
- AIME 2024 準確率:83.3% 對比 GPT-4o 的 13.4%
- 延遲與準確度之間的明確取捨
趨勢四:代理工作流程Anthropic 的 Model Context Protocol(MCP),2024 年 11 月推出:
- 供 AI 代理與工具/資料庫互動的開放標準
- 前 3 個月內獲得 50+ 合作夥伴採用
- 讓代理能建立跨互動的持續性「記憶」
成本與定價大戰
每百萬 token API 定價(輸入):
- GPT-4o:2.50 美元
- Claude Sonnet 4:3.00 美元
- Gemini 2.0 Flash:0.075 美元(便宜 33 倍)
- DeepSeek-V3:0.27 美元(開源,另計託管成本)
Gemini Flash 個案研究:從 GPT-4o 轉換過來的新創公司 AI 總結降低了 94% 的成本-相同的品質、相若的延遲。
商品化加速:2023-2024 年推理成本年增 70%(Epoch AI 資料)。
對公司的策略性影響
決策框架:該選擇哪個模型?
情境一:企業安全關鍵應用→ Claude Sonnet 4
- 醫療、法律、金融等錯誤代價高達數百萬的領域
- Constitutional AI 降低法律責任風險
- 溢價定價因風險緩解而合理
情境二:高流量、成本敏感型應用→ Gemini Flash 或 DeepSeek
- 客服聊天機器人、內容審核、分類任務
- 效能「足夠好」,用量達 10 到 100 倍
- 成本為主要差異化因素
情境 3:生態系鎖定→ Google Workspace 用 Gemini,Microsoft 用 GPT
- 已投資於生態系
- 原生整合 > 些微更優的效能
- 員工在現有平台上的訓練成本
情境 4:客製化/控制權→ Llama 3.1 或 DeepSeek 開源
- 特定合規要求(資料落地、稽核)
- 針對專有資料進行大量微調
- 在大量使用下,自架成本更划算
結論:從技術戰到平台戰
2025 年的 LLM 競爭不再是「哪個模式的理由最充分」,而是「哪個生態系統能獲得最大價值」。OpenAI 主導消費者品牌,Google 利用十億用戶分銷,Anthropic 贏得具有安全意識的企業,Meta 將基礎設施商品化。
2026-2027 年預測:
- 核心效能進一步趨於一致(前五名皆約 90% MMLU)
- 差異化聚焦於:速度、成本、整合能力、垂直領域專精
- 多步驟自主代理成為主流(33% 的知識工作者)
- 開源模型縮小品質差距,保有成本/客製化優勢
最後贏家?可能不是單一玩家,而是服務於不同使用群組的互補生態系統。就像智慧型手機作業系統 (iOS + Android 並存),不是「贏家通吃」,而是「贏家分割」。
對於企業:多模型策略成為標準-GPT 適用於一般任務,Claude 適用於高風險推理,Gemini Flash 適用於大量任務,Llama 適用於專屬的客製調整。
2025 年不是「最佳模式」之年,而是互補模式之間智慧型協調之年。
資料來源:
- Stanford AI Index Report 2025
- Anthropic Model Card Claude Sonnet 4.5
- OpenAI GPT-4o Technical Report
- Google DeepMind Gemini 2.0 System Card
- DeepSeek-V3 Technical Paper (arXiv)
- Epoch AI - Trends in Machine Learning
- Gartner AI & Analytics Summit 2025
- McKinsey State of AI Report 2025
- Pew Research Center AI Adoption Survey
- Similarweb Platform Intelligence

留言
尚無留言——開始討論吧。