ELECTE 4.0 正式上线——AI Agent 来了。看看有哪些新功能
Newsletter阅读需 6 分钟

法律硕士的演变:市场概述

在主要基准上,顶级 LLM 之间的差距不到 2 个百分点--技术大战以平局告终。真正的 2025 大战在生态系统、分销和成本方面展开:DeepSeek 以 560 万美元对 GPT-4 的 7 800-1.91 亿美元证明了自己的实力。尽管克劳德赢得了 65% 的技术基准测试,但 ChatGPT 在品牌方面仍占主导地位(知名度为 76%)。对公司而言,制胜的策略不是选择 "最好的模式",而是针对不同的用例协调互补的模式。

Evoluzione degli LLM: una breve panoramica del mercato

用 AI 总结本文

2025年语言模型之战:从技术均势到生态系统对决

2025 年,大型语言模型的发展到了一个关键的转折点:竞争的焦点不再是模型的基本功能(目前在主要基准上基本相当),而是生态系统、集成和部署战略。虽然 Anthropic 的 Claude Sonnet 4.5 在特定基准上保持着微弱的技术优势,但真正的战斗已经转移到了不同的领域。

技术抽签:当数字相等时

MMLU基准测试(大规模多任务语言理解)

  • Claude Sonnet 4.5:88.7%
  • GPT-4o:88.0%
  • Gemini 2.0 Flash:86.9%
  • DeepSeek-V3:87.1%

这些差异微乎其微--表现最好的公司之间相差不到 2 个百分点。斯坦福大学《2025 年人工智能指数报告》指出,"语言模型核心能力的融合是 2024-2025 年最重要的趋势之一,对人工智能公司的竞争战略具有深远影响"。

推理能力(GPQA Diamond)

  • Claude Sonnet 4:65.0%
  • GPT-4o:53.6%
  • Gemini 2.0 Pro:59.1%

克劳德在复杂的推理任务中仍有明显优势,但 GPT-4o 在反应速度(平均延迟时间为 1.2 秒,克劳德为 2.1 秒)和双子座的本地多模态处理方面更胜一筹。

DeepSeek 革命中国游戏规则的改变

2025 年 1 月,DeepSeek-V3 颠覆性地问世,它展示了如何以 560 万美元开发出具有竞争力的模型,而 GPT-4/Gemini Ultra 的开发成本为 7,800-1.91 亿美元。马克-安德森(Marc Andreessen)称其为 "最令人惊叹的突破之一--作为开放源代码,它是献给世界的一份厚礼"。

DeepSeek-V3规格:

  • 总参数量6710亿(通过混合专家系统Mixture-of-Experts激活370亿)
  • 训练成本:557.6万美元
  • 性能:在部分数学基准测试中超越GPT-4o
  • 架构:多头潜在注意力机制(MLA)+ DeepSeekMoE

影响:Nvidia 股价在公告发布后单日下跌 17%,市场重估了模型开发的进入壁垒。

公众认知与技术现实

ChatGPT 保持着无可争议的品牌知名度:皮尤研究中心的研究(2025 年 2 月)显示,76% 的美国人将 "对话式人工智能 "与 ChatGPT 联系在一起,而只有 12% 的人知道克劳德,8% 的人积极使用双子座。

悖论:克劳德 Sonnet 4 在 65% 的技术基准上优于 GPT-4o,但消费者市场份额仅为 8%,而 ChatGPT 为 71%(Similarweb 数据,2025 年 3 月)。

谷歌以大规模整合作为回应:Gemini 2.0 原生于搜索、Gmail、Docs、Drive--战略生态系统而非独立产品。21 亿 Google Workspace 用户代表了无需获取客户的即时分销。

计算机使用与代理:下一个前沿领域

Claude Computer Use(2024年10月测试版,2025年第一季度正式版)

  • 能力:直接控制鼠标/键盘、浏览器导航、应用程序交互
  • 采用率:12%的Anthropic企业客户在生产环境中使用computer use功能
  • 局限性:在复杂多步骤任务上仍有14%的失败率

具备视觉与操作能力的GPT-4o

  • Zapier集成:可控制6000多款应用
  • 自定义GPTs:已发布300万个,80万个被积极使用
  • GPTs创作者分成收入:2024年第四季度分发1000万美元

Gemini Deep Research(2025年1月)

  • 多源自主研究与对比分析
  • 仅需单个提示即可生成完整报告
  • 平均耗时:生成5000字以上报告需8-12分钟

Gartner 预测,到 2025 年底,33% 的知识工作者将使用自主人工智能代理,而现在只有 5%。

关于安全的哲学分歧

OpenAI:“通过限制实现安全”方针

  • 拒绝8.7%的消费者提示(据OpenAI内部数据泄露)
  • 严格的内容政策导致23%的开发者流失至其他替代方案
  • 公开的Preparedness Framework配合持续的红队测试

Anthropic:“宪法式AI”

  • 基于明确伦理原则训练的模型
  • 选择性拒绝率:3.1%的提示(比OpenAI更宽松)
  • 决策透明度:会解释拒绝请求的原因

Google:“最大安全性,最小争议性”

  • 市场上最严格的过滤器:11.2%的提示被屏蔽
  • 2024年2月Gemini图像生成失误事件(偏见矫枉过正)促使其采取极度谨慎的态度
  • 企业导向降低了风险容忍度

Meta Llama 3.1:零内置过滤器,以实施者对立哲学为己任。

垂直专业化:真正的差异化优势

医疗健康:

  • Med-PaLM 2(Google):MedQA得分85.4%(相比之下,最优秀的人类医生为77%)
  • Epic Systems中的Claude:已被美国305家医院采用,用于临床决策支持

法律:

  • Harvey AI(定制版GPT-4):全球百强律所中102家为其客户,年经常性收入达1亿美元
  • CoCounsel(汤森路透+Claude):法律研究准确率达98%

金融:

  • Bloomberg GPT:基于3630亿专有金融词元训练
  • 高盛Marcus AI(基于GPT-4):贷款审批速度提升40%

与普通模式相比,垂直化可产生 3.5 倍的支付意愿(麦肯锡调查,500 名企业买家)。

Llama 3.1:Meta 的开源战略

405B 参数,在许多基准测试中与 GPT-4o 具有竞争能力,完全开放权重。Meta 战略:基础设施层商品化,在产品层展开竞争(雷朋 Meta 眼镜、WhatsApp 人工智能)。

Llama 3.1 采用情况:

  • 首月下载量超过35万次
  • 50多家初创公司基于Llama构建垂直AI
  • 自托管成本:每月1.2万美元,而同等使用量下闭源模型的API成本超过5万美元/月

反其道而行之:Meta 在 Reality Labs 上亏损数十亿美元,却在开放式人工智能上投入巨资,以保护广告核心业务。

上下文窗口:争夺数百万代币的竞赛

  • Claude Sonnet 4.5:20万token
  • Gemini 2.0 Pro:200万token(商用最长)
  • GPT-4 Turbo:12.8万token

Gemini 200万token上下文可分析整个代码库、10+小时视频、数千页文档——这是变革性的企业级用例。Google Cloud报告称43%的企业POC项目使用超过50万token的上下文。

适应性和定制化

Claude Projects 与 Styles:

  • 跨对话持久化的自定义指令
  • 风格预设:正式、简洁、解释性
  • 知识库上传(最高5GB文档)

GPT商店与自定义GPT:

  • 已发布300万个GPT,月活跃使用量80万
  • 顶尖创作者月收入达6.3万美元(收益分成)
  • 71%的企业内部至少使用1个自定义GPT

Gemini扩展程序:

  • 原生集成Gmail、日历、Drive、地图
  • 工作区上下文:读取邮件+日历以主动提供建议
  • 2024年第四季度执行了12亿次工作区操作

关键:从 "单一提示 "到 "具有跨会话记忆和语境的持续助手"。

2025 年第一季度的发展和未来轨迹

趋势1:混合专家模型(MoE)主导地位2025年所有顶级模型都采用MoE(针对每个查询激活参数子集):

  • 推理成本降低40-60%
  • 在保持质量的同时改善延迟
  • DeepSeek、GPT-4、Gemini Ultra均基于MoE

趋势2:原生多模态Gemini 2.0原生支持多模态(而非拼接的独立模块):

  • 同时理解文本+图像+音频+视频
  • 跨模态推理:"将建筑照片的风格与历史时期的文字描述进行对比"

趋势3:测试时计算(推理模型)OpenAI o1、DeepSeek-R1:为复杂推理投入更多处理时间:

  • o1:处理复杂数学问题耗时30-60秒,而GPT-4o仅需2秒
  • AIME 2024准确率:83.3% 对比 GPT-4o的13.4%
  • 延迟与准确性之间存在明确权衡

趋势4:智能体工作流Anthropic于2024年11月推出的模型上下文协议(MCP):

  • 供AI智能体与工具/数据库交互的开放标准
  • 前3个月吸引50多家合作伙伴采用
  • 使智能体能够构建跨交互的持久"记忆"

成本和定价战

每百万token的API定价(输入):

  • GPT-4o:2.50美元
  • Claude Sonnet 4:3.00美元
  • Gemini 2.0 Flash:0.075美元(便宜33倍)
  • DeepSeek-V3:0.27美元(开源,需自行承担托管成本)

Gemini Flash 案例研究:从 GPT-4o 转换而来的初创公司人工智能摘要降低了 94% 的成本--质量相同,延迟相当。

商品化加速:2023-2024 年推理成本同比下降 70%(Epoch AI 数据)。

对公司的战略影响

决策框架:应该选择哪个模型?

场景1:企业级安全关键应用→ Claude Sonnet 4

  • 医疗、法律、金融等出错代价高达数百万的领域
  • 宪法式AI降低法律责任风险
  • 高价定位因风险规避而合理

场景2:高流量、成本敏感型应用→ Gemini Flash 或 DeepSeek

  • 客服聊天机器人、内容审核、分类任务
  • 性能"够用即可",处理量为10-100倍
  • 成本是主要决定因素

场景 3:生态系统锁定→ Google Workspace 用 Gemini,Microsoft 用 GPT

  • 已经投资于该生态系统
  • 原生集成 > 边际性能优势
  • 员工对现有平台的培训成本

场景 4:定制化/掌控力→ Llama 3.1 或 DeepSeek 等开源模型

  • 特定合规要求(数据驻留、审计)
  • 对专有数据进行深度微调
  • 大规模自托管更具成本优势

结论:从技术战争到平台战争

2025 年的乐虎国际客户端下载竞争不再是 "哪种模式理由最充分",而是 "哪种生态系统能获取最大价值"。OpenAI 主导消费品牌,谷歌利用十亿用户分布,Anthropic 赢得安全意识企业,Meta 将基础设施商品化。

2026-2027年预测:

  • 核心性能进一步趋同(前5名均达约90% MMLU)
  • 差异化聚焦于:速度、成本、集成能力、垂直领域专精
  • 多步骤自主代理成为主流(33%的知识型员工使用)
  • 开源模型缩小质量差距,保持成本/定制化优势

最终赢家?可能不是单一的参与者,而是服务于不同使用群组的互补生态系统。正如智能手机操作系统(iOS 和 Android 共存)一样,不是 "赢家通吃",而是 "赢家细分"。

对于企业:多模型策略成为标准--GPT 适用于一般任务,Claude 适用于高风险推理,Gemini Flash 适用于大量任务,Llama 为专有任务进行定制调整。

2025 年不是 "最佳模式 "之年,而是互补模式之间智能协调之年。

资料来源:

  • Stanford AI Index Report 2025
  • Anthropic Model Card Claude Sonnet 4.5
  • OpenAI GPT-4o Technical Report
  • Google DeepMind Gemini 2.0 System Card
  • DeepSeek-V3 Technical Paper (arXiv)
  • Epoch AI - Trends in Machine Learning
  • Gartner AI & Analytics Summit 2025
  • McKinsey State of AI Report 2025
  • Pew Research Center AI Adoption Survey
  • Similarweb Platform Intelligence

评论

暂无评论——来发表第一条吧。