Skip to content
当前页大纲

近三年大模型前沿演进(2023-2026)

这三年大模型行业的变化,比过去十年加起来都多。这篇文章按时间线梳理 2023 到 2026 年的关键节点,帮你把「怎么就走到今天这一步」的脉络串起来。

写法上只收录可核实的事实(文末附来源),传闻类信息会明确标注。

一、2023:格局奠定之年

2023 年的主角毫无疑问是 GPT-4(2023 年 3 月)。多模态输入、专业考试碾压级表现,把「大模型」从极客话题变成了全社会话题。国内随之进入「百模大战」,各家公司密集发布自己的大模型产品。

同样重要的是 开源阵营的起点:Meta 的 Llama 系列证明了「开源权重模型」这条路走得通——它直接催生了后续全球的开源生态,包括后来的国产模型主力军。

回头看,2023 年定下的三条主线贯穿至今:

  1. 能力军备赛:参数、数据、算力堆出的通用能力跃迁
  2. 开源与闭源分野:两条路线的竞速从这一年开始
  3. 应用层萌芽:所有人都在想「大模型能用来干什么」

二、2024:多模态与推理模型两大拐点

拐点一:实时多模态(2024 年 5 月)

GPT-4o 把「语音对话延迟」从传统的数秒级压到接近人类对话的自然节奏,听、说、看统一进一个模型。这确立了「原生多模态」的技术方向——不再是外挂多个模型拼接,而是底层统一。

拐点二:推理模型登场(2024 年 9 月)

OpenAI 发布 o1 系列,引入「推理时计算扩展」(test-time compute scaling)的范式:模型回答前先花时间「思考」,用推理链换答案质量。这个范式后来成为 2025-2026 年最重要的技术主线——模型的智力上限不再只由训练时的参数规模决定,推理时愿意花多少计算也是变量

国产力量崛起(2024 年 12 月)

DeepSeek-V3 发布,以极低的训练成本(官方论文口径 557 万美元级)追平第一梯队,震动行业。同年 Claude 3.5 Sonnet 在编程场景的表现让「AI 辅助编程」真正进入日常开发流程。

三、2025:推理模型浪潮与开源逆袭

DeepSeek-R1 现象级出圈(2025 年 1 月)

R1 把「推理能力」用纯强化学习方法训了出来并开源权重,全球刷屏。它的意义不只是省钱:证明了推理模型路线可以被开源社区复现,此后「深度思考」成为各家标配。

开源生态的集体跃迁

  • Qwen 系列持续迭代,成为全球下载量最大的开源模型家族之一
  • Llama 4(2025 年 4 月)发布 Scout/Maverick 等型号,上下文长度最高达到 10M 级别
  • Gemma 3 提供小至 270M 的规格,端侧部署成为现实

旗舰模型密集换代(2025 下半年)

  • GPT-5(2025 年 8 月 7 日)发布,官方定位面向开发者,重点强化编码与智能体(Agent)任务,并显著降低幻觉率
  • Gemini 3(2025 年 11 月)上线,深度推理模式持续迭代
  • Claude Opus 4.5(2025 年 11 月 24 日)在长程智能体任务上的可靠性大幅提升
  • MCP 协议(2025 年 12 月)成为 Agentic AI Foundation 创始项目——大模型连接外部工具的事实标准开始成型

一个标志性变化:具身智能从演示走向量产

2025 年下半年,宇树等厂商的自研 VLA(视觉-语言-动作)模型陆续落地,Tesla Optimus 在 2026 年确认进入量产阶段。机器人和大模型的结合不再是 PPT 概念。

四、2026:智能体元年

模型侧:三极竞争白热化

  • GPT-5.6(2026 年 7 月 9 日):一次性推出 Sol(旗舰)/ Terra(低成本)/ Luna(快速)三档模型,并推出多智能体(multi-agent)beta 能力——「一个模型打天下」让位于「按场景选模型」
  • Claude 5 系列(2026 年 6-7 月):Fable 5、Mythos 5 面向长期复杂异步任务,Sonnet 5、Opus 5(7 月 24 日)跟进,Opus 5 以 Fable 一半的价格逼近其前沿智能水平
  • Qwen3.8-Max(2026 年 8 月 3 日):2.4 万亿参数、100 万 token 上下文,并宣布将开源 Max 级别权重——开源模型直接冲旗舰

生态侧:MCP 成为基础设施

到 2026 年,MCP 月 SDK 下载量超过 9700 万,官方注册的 MCP Server 数以万计,ChatGPT、Claude、Gemini、VS Code、Cursor 全部支持。「模型 + 工具」的连接层标准化完成,这是 Agent 应用爆发的管道前提。

格局侧:开源调用量反超闭源

2026 年 8 月,Vercel AI Gateway 上的开放权重模型 token 调用量占比达到 54%,历史上首次超过闭源模型。开源阵营在数学、代码等基准上也已与闭源前沿正面竞争。「开源追赶闭源」的时代结束了,现在是并跑。

五、三年演进的四条主线(总结)

主线2023202420252026
推理范式直接回答o1 引入思考链推理模型普及推理时计算成标配
多模态图片理解实时语音+视觉视频理解生成视频/世界模型
Agent概念讨论Function CallingMCP 标准化多智能体协作落地
开源格局追赶差距缩小R1 证明可行调用量反超(54%)

想继续深入的话:

参考来源

  • OpenAI:GPT-5 发布(openai.com/index/introducing-gpt-5-for-developers/)、GPT-5.6 发布(openai.com/index/gpt-5-6/)
  • Anthropic:Claude Opus 4.5(anthropic.com/claude/opus)、Claude Fable 5 / Mythos 5(anthropic.com/news/claude-fable-5-mythos-5)、Claude Opus 5(anthropic.com/news/claude-opus-5)
  • Google:Gemini API 更新日志(ai.google.dev/gemini-api/docs/changelog)、Gemma 发布记录(ai.google.dev/gemma/docs/releases)
  • 阿里巴巴 / Qwen:Qwen3.5 发布(qwen.ai/blog?id=qwen3.5)、Qwen3.8-Max(qwen.ai/blog?id=qwen3.8)
  • Meta Llama Models(github.com/meta-llama/llama-models)
  • MCP 官方博客(blog.modelcontextprotocol.io)
  • 新华网 2026 年 8 月全球 AI 发展盘点(xinhuanet.com)

注:个别第三方来源的发布时间(如部分 Grok 版本)在公开报道中口径不一,本文未采用。

MIT License.