2025 LLM年度回顾
2026/7/19 11:18:16 · 来源
2025年大语言模型(LLM)关键范式转变的回顾,涵盖基于可验证奖励的强化学习(RLVR)、AI能力的锯齿状特征、本地智能体系统以及自然语言编程的兴起。
unnamed
2025 年是大语言模型(LLM)取得强劲且具有里程碑意义的进展的一年。 这一年并非旧趋势的线性延续,而是由彻底改变 AI 格局的关键范式转变所定义。从新的训练架构到新颖的软件界面,这些发展重新塑造了我们构想和利用 AI 进行构建的方式。
1. 基于可验证奖励的强化学习(RLVR)
在 2025 年初,各大实验室的标准 LLM 生产管线由三个成熟的、顺序进行的步骤组成:
- 预训练(Pretraining,例如 GPT-2/3,约 2020 年)
- 监督微调(SFT,例如 InstructGPT,约 2022 年)
- 基于人类反馈的强化学习(RLHF,约 2022 年)
在 2025 年,**基于可验证奖励的强化学习(RLVR)**成为了该管线事实上(de facto)的第四个阶段。通过在自动可验证、不可投机的环境(如数学证明或代码执行)中训练模型,LLM 会自发产生类似于人类“推理”的策略。
[Pretraining] ──> [Supervised Finetuning (SFT)] ──> [RLHF] ──> [RLVR (New in 2025)]
在 RLVR 期间,模型学会将问题分解为中间计算步骤,并在遇到错误时迭代修正其方向(详见 DeepSeek R1 论文)。这些推理轨迹(reasoning traces)极难仅通过 SFT 来教授,因为对于神经网络而言,什么才是“最佳”的中间思维过程并不明晰——LLM 必须通过针对客观奖励的直接优化,来探索出最有效的路径。
与 SFT 和 RLHF 这种计算成本低廉的微调步骤不同,RLVR 支持长得多的优化运行。在 2025 年,这一范式在“单位美元能力提升”方面被证明具有极高的效率,最终消耗了原本预留给传统预训练的计算预算。因此,在 2025 年,我们看到类似参数规模的模型仅通过更长时间的强化学习运行,就实现了巨大的能力跃升。
此外,RLVR 引入了一条新的缩放定律(scaling law):测试时计算(test-time compute)。通过允许模型生成更长的推理轨迹并增加其“思考时间”,开发人员获得了一个在运行时直接扩展模型能力的杠杆。虽然 OpenAI 的 o1(2024 年底)充当了最初的概念验证,但 2025 年初发布的 o3 标志着行业内一个明确的拐点,使这一能力变得无可争议。
2. 幽灵 vs. 动物与“参差不齐的智能”
在 2025 年,行业开始内化 LLM 能力的真实“形态”。我们并不是在培养“进化的动物”,而是在**“召唤幽灵”**。
因为整个 LLM 架构体系——从神经架构、训练数据到优化压力——从根本上都与生物进化完全不同,我们不应该指望这些模型的行为会像人类心智一样。
- 人类大脑是为荒野中部落的物理和社交生存而优化的。
- LLM 神经网络是为复制人类的文本档案、在合成数学谜题中实现奖励最大化,以及在 LMSYS Chatbot Arena 上赢得点赞而优化的。
结果就是,LLM 的能力呈现出高度的锯齿状(jagged)。一个模型可以同时在复杂领域表现得像个天才博学家,而在简单任务中表现得像个有认知障碍的小学生,并且对基本的越狱(jailbreak)和数据泄露手段毫无防备。
G6zymj4a0AMNJkJ
人类智能(蓝色)与 AI 智能(红色)展现出截然不同的参差状态。
这一认知导致了 2025 年人们对传统评估基准(benchmarks)的普遍怀疑。因为从定义上看,基准是可验证的环境,它们极易受到 RLVR 优化和合成数据生成的影响。在被称为“刷榜极限化(benchmaxxing)”的过程中,各大实验室积极构建与这些基准相邻的环境,定向培养“锯齿”以覆盖测试集。
在测试集上训练正式成为了一门新的艺术,这引发了一个问题:横扫所有基准却仍未实现通用人工智能(AGI),会是怎样一种景象?
欲深入探讨这些概念转变,请阅读以下文章:
3. Cursor 与编排层
Cursor 编辑器在 2025 年的迅速崛起,展示了构建在基础模型之上的厚重的、特定领域的应用层所具有的巨大价值,引发了“Cursor for X”(各行各业的 Cursor)创业公司的淘金热。
正如 Andrej Karpathy 在 Y Combinator 演讲中所概述的(可通过此文字稿和下方视频观看),成功的 LLM 应用不仅仅是透传 API 密钥。相反,它们在底层处理复杂的编排:
具体而言,这些高级应用会:
- 进行复杂的**上下文工程(context engineering)**以呈现相关数据。
- 编排多次 LLM 调用,将其结构化为复杂的有向无环图(DAG),以平衡性能和成本。
- 提供定制化的、高度互动的图形用户界面(GUI)。
- 提供一个**“自主性滑块”(autonomy slider)**,允许用户在副驾驶(copilot)和智能体(agentic)模式之间进行选择。
尽管有人争论基础模型实验室最终是否会通过开发同类功能来“收编”(sherlock)这些工具,但专用应用仍然存在着巨大的机遇。基础实验室可能会继续培养出能力强大的“大学生”模型,而专门的 LLM 应用则会通过提供私有数据、执行器和本地化反馈循环,来组织、微调并编排这些模型团队,使之成为精英级别的、特定领域的专家。
4. Claude Code:本地主机上的 AI
Claude Code (CC) 脱颖而出,成为第一个真正令人信服的开发者智能体(developer agent)演示。它无缝地将工具使用、环境执行和多步推理串联起来,以解决复杂的软件工程任务。
关键在于,Claude Code 直接在你的本地机器(localhost)上运行,访问你真实的运行环境、本地数据、工具和配置。
[Cloud-hosted Sandboxes] (OpenAI's early focus) vs. [Localhost Environment] (Claude Code)
└── Isolated containers └── Instant low-latency execution
└── Limited context & secrets └── Full access to local data, tools, & config
虽然在云端运行大规模智能体集群(agent swarms)仍是一个长期目标,但在我们目前能力参差不齐的“缓慢起飞”时代,在本地运行智能体显然要合理得多。通过在开发人员预先配置好的计算机上执行,Claude Code 绕过了云端容器的延迟、上下文隔离以及环境搭建的障碍。Claude Code 包装为一个极简的命令行界面(CLI),感觉不那么像传统的搜索引擎或远程聊天机器人,而更像一个直接生活在你的开发工作空间里的、乐于助人的本地实体。
5. 氛围编码(Vibe Coding)
在 2025 年,LLM 跨越了一个重大的能力门槛,允许人们使用纯英语构建复杂的、生产级别的应用程序,而无需查看底层源码——这种现象现在被广泛称为**“氛围编码”(vibe coding)**。
该词源于一条灵光一现的推文,并迅速成为这一年的标志性概念。这一转变展示了 LLM 如何颠覆传统技术传播的剧本,正如赋能于人:LLM 如何颠覆技术传播的剧本中所讨论的那样。与以往主要赋能于大型机构的技术不同,LLM 为个人和非专业创作者提供了最大的相对杠杆。
然而,氛围编码不仅适用于新手,它还允许经验丰富的专业人士编写在以前因过于耗时而显得得不偿失的软件。
氛围编码项目示例
- 自定义 Rust 分词器(Tokenizer): 为 nanochat 构建,旨在提供一个高效的自定义 BPE 分词器,而无需在系统层面上手动学习 Rust。
- menugen:一个互动的餐馆菜单生成器。
- llm-council:一个多智能体共识引擎。
- reader3:一个干净的网页内容提取器。
- hn-time-capsule:Hacker News 的时间线界面。
氛围编码将代码视为廉价、可塑且可丢弃的东西。当创建一个一次性脚本或调试一个临时问题的成本几乎为零时,我们与软件开发的关系便发生了永久性的转变。
6. Gemini Nano (Banana) 与原生 LLM GUI
谷歌的 Gemini Nano(特别是“banana”迭代版本) 凸显了人类与模型交互方式的巨大演变。
如果说 LLM 是下一个基础计算范式(类似于 20 世纪 70 和 80 年代的个人电脑),那么当前的聊天界面就相当于早期的命令行控制台。虽然文本是计算系统的母语,但对人类消费而言效率极低。当信息以视觉和空间的形式呈现时,人类处理信息的速度要快得多。
[Console / Command Line] ──> [Graphical User Interface (GUI)]
(Text Chat) (Visual, Spatial, Interactive)
正如传统操作系统从 DOS 演变为 Windows 和 Macintosh 一样,LLM 的交互也必须向丰富、空间化和可视化的界面转变。早期的前兆包括 Markdown 表格、表情符号(emojis)和基础的 UI 模块。
像 Gemini Nano 这样的模型指向了一个未来,在这个未来中,文本生成、图像生成和深度的世界知识原生集成在模型权重之内。这些认知引擎不再输出一堵堵“文本墙”,而是可以直接使用定制界面、信息图表、动态幻灯片、实时白板以及交互式 Web 应用进行沟通,并立即可根据用户的认知需求进行定制。
核心要点
- RLVR 成为新的训练标准: 从人类反馈转向自动化的、可验证的奖励系统,释放了深层推理轨迹和测试时缩放。
- 智能是非线性的且“参差不齐”: LLM 的扩展方式与生物动物不同。它们在某些领域是尖锐、出色的博学家,而在另一些领域则是脆弱、极易被越狱的系统,这使得传统的静态基准测试日益过时。
- 智能体(Agent)的用户体验正走向本地: 像 Claude Code 这样的产品表明,与隔离的云容器相比,直接在用户的本地机器(
localhost)上运行智能体工作流,能够提供更直观、低延迟且富含上下文的环境。 - 软件已变得转瞬即逝: “氛围编码”已使软件创建商品化。即时编写、部署和丢弃自定义应用程序,如今对于非程序员和专业开发人员而言,都是一种可行的工作流。
- 我们正迈向 LLM GUI: 纯文本聊天是 AI 时代的命令行。AI 交互的未来在于原生、多模态的模型输出,如 Gemini Nano,它能够以视觉和空间的方式与我们对话。
正如在 Dwarkesh Podcast 中所讨论的那样,我们既处于一条极速进步的道路上,同时又还有海量的基础工程有待完成。业界目前实现的模型潜力还不足 10%——设计空间大有可为。
学习地图
阶段式 LLM 范式学习地图
阶段 1:现代 LLM 训练阶段
- SFT & RLHF 对比 RLVR:理解为什么传统的监督微调(SFT)和人类反馈(RLHF)正在被可验证奖励强化学习(RLVR)所增强,以产生真实的推理轨迹。
- 测试时计算:了解如何通过扩展思考时间(生成更长的推理路径)来动态提升模型能力,而无需从头开始重新训练。
阶段 2:锯齿状智能与评估
- 幽灵与动物:内化这一概念框架,即 LLM 是针对合成环境优化过的外星智能,而非类似于人类的通用推理。
- 基准测试悖论:探究为什么静态基准测试很容易通过有针对性的强化优化被钻空子,从而制造出看似能力强大但实际脆弱的模型。
阶段 3:现代开发者工作流
- 上下文工程与 DAG:探索现代应用(如 Cursor)如何在底层使用 LLM 调用的有向无环图(DAG)来编排复杂的工作流。
- Vibe Coding(氛围编码):学习如何将代码视为一次性的、瞬态的基础设施,完全通过自然语言的迭代来构建。
动手实践——分步指南
逐步 Vibe Coding 与 Agent 设置
- 准备本地环境 确保已安装 Node.js 和 Git。创建一个干净的工作区目录:
mkdir vibe-project && cd vibe-project
- 初始化本地 Agent 工具 为了体验 Agent 化的软件开发,请设置一个 CLI 终端助手(例如 Anthropic 的 Claude Code 或类似的 Agent 化 CLI 封装工具):
npx @anthropic-ai/claude-code
按照屏幕上的提示进行操作,以安全地使用您的 API 密钥进行身份验证。
- 启动 Agent 任务 命令本地 Agent 在您的目录中完全从头开始构建一个自定义应用程序,无需手动编写任何样板代码。运行:
/dev "Create a simple single-page web app that fetches the latest Hacker News stories and groups them by sentiment analysis using a lightweight Javascript library. Serve it locally."
-
观察工具循环 观察 Agent 如何利用其内置的反馈循环来读取目录上下文、生成 HTML/JS、测试代码、定位缺失的包并自动解决错误。
-
启动并验证 一旦 Agent 确认构建成功,请检查生成的文件以了解系统是如何组织代码结构的,然后运行 Agent 提供的本地服务器命令来测试您新编写的 vibe-coded 应用程序。
三大推荐资源
- 1Andrej Karpathy's Blog: Animals vs. Ghosts
An insightful exploration of AI's jagged intelligence profiles and why they differ fundamentally from human cognitive evolution.
https://karpathy.bearblog.dev/animals-vs-ghosts/
- 2DeepSeek-R1 GitHub Repository
Official open-source repository for DeepSeek-R1, demonstrating practical implementation of reinforcement learning and reasoning capabilities.
https://github.com/deepseek-ai/DeepSeek-R1
- 3Anthropic Claude Code Documentation
The official platform documentation showcasing how to run agentic terminal assistants that operate locally with secure context.
https://docs.anthropic.com
链接由 AI 推荐——使用前建议快速核实。