过去两年,衡量一家公司AI实力的流行问题通常是你的模型有多少参数;到了2025年,这个问题正在被你的模型愿意花多少时间思考所取代。

一条新曲线:把算力花在推理阶段

所谓推理时计算(test-time compute),指的是模型在给出答案前先展开一段较长的内部推理——拆解问题、尝试多种解法、自我检查、必要时回溯重来。2024年9月OpenAI发布o1系列,首次把先想再答做成可用的产品形态;2025年初DeepSeek-R1以开源方式证明了这条路径可以被复现;Anthropic为Claude加入扩展思考模式,谷歌Gemini 2.5也把思考预算交给用户调节。这些模型的共同点不是参数更多,而是在回答难题时愿意消耗更多token。

范式为什么会转移

背后有两个现实压力。一是预训练的边际收益在放缓:公开互联网上的高质量文本接近见底,有研究机构估计,可用语料可能在未来数年内被训练耗尽,继续单纯堆参数的性价比在下降。二是评测方式变了:数学竞赛题、复杂编程、科研问答这类有明确对错、却需要多步推理的任务,恰好是延长思考时间能明显提分的领域。业内常被引用的一组实验显示,在难题上合理分配推理算力,效果可以超过把模型规模放大若干倍。

代价与新的分层

思考不是免费的。推理阶段消耗的token直接对应成本与延迟,一个问题若要想十分钟,用户未必愿意等。于是产品设计出现分层:简单问答走快速模型,复杂任务才调用深度思考。API定价也随之分化,按思考量计费、区分快慢档位逐渐成为常见做法。对开发者而言,这带来一道新的优化题——不是把每个请求都交给最强的模型,而是判断哪些请求值得多想一会儿。

产业层面的连锁反应

结语

从拼参数到拼思考,本质是把变聪明的责任从训练阶段部分转移到使用阶段:同一个模型,可以按任务难度动态分配算力。这并不意味着规模不再重要,底座仍决定上限,但竞争的焦点正从谁的模型更大,转向谁更会用算力思考,并把这份能力以可接受的价格交付。对普通用户来说,接下来的体感或许很直接:AI回答变慢了,但答对的时候变多了。