← 返回洞察与动态

洞察 / 基础模型与学习范式

2026年在等到AGI之前,我们先做什么。

从模型能力、智能体和真实场景出发,讨论技术尚未收敛时的创业重点。

2026年开年即起风,AI行业IPO热潮席卷资本市场,壁仞科技、智谱AI、MiniMax密集推进上市进程,也因此有媒体判断2026年是"IPO大年"。这也从侧面印证了 AI 行业国产大模型正式从"技术探索期"迈入"产业深耕期"。

然而,产业化进程的加快,并不意味着技术路径已然收敛。在AGI尚未出现明确拐点的当下,技术演进的主线是什么?创业者该如何把握阶段性机会?这是AI领域从业者与投资者共同关注的核心命题。

在当前技术能力仍处于线性增长的阶段,一方面,持续探索模型的智能上限仍是最重要的任务;另一方面,如何将模型已经具备的能力在真实、复杂场景中有效激活与释放,也成为无法回避的现实挑战。这两点,构成了当前行业关注的核心问题。

在这样的背景下,理解"拐点未至时该做什么",成为判断下一阶段技术与产业趋势的关键前提。

01 拐点未至:探索智能上界仍是重点,Scaling仍是最高效的方法

预训练使得大模型已经掌握世界常识知识,并且具备简单推理能力。更多数据、更大参数和更饱和的计算仍然是scaling基座模型最高效的办法。过去两年,行业在多模态、端到端语音等方向进行了大量尝试,但实践证明,真正决定模型智能上限的,依然是文本。当前模型的知识量和基本的推理能力都依靠"大量读书",也就是承载人类常识知识的文本数据。从第一性原理的角度,要探索智能上限,第一个核心要素就是更大规模的数据,尤其是常识知识数据(真实数据、合成数据及蒸馏数据)。同时,尽管在模型层和infra(基础设施)层,大家都在探索更高效的方式,但在可预见的时间内,scale仍然是提升模型能力最有效的路径——除了更大规模的数据,更大的模型参数规模,以及更多的算力投入仍然必要。

02 现有模型能力释放的关键:激活对齐与增强推理能力

激活对齐和增强推理能力,尤其是激活更全面的长尾能力是保证模型效果的另一关键。即使模型具备了常识知识,如果无法被有效激活,其能力也难以释放。过去,对齐主要依赖SFT、CoT等方式,而当前强化学习正逐步成为主流路径:通过构造场景和数据,让模型在强化学习中自我优化,以激活智能上界。但现实挑战在于,通用benchmark的出现一方面可以评测模型的通用效果,但也可能使得很多模型过拟合。同时,评测benchmark数量有限,而真实世界的应用场景几乎无限。随着大量Agent的出现,对齐的复杂度显著提升——如果说过去模型对齐更像是在考语文、数学等知识点,那么Agent更接近真实工作环境,工种多样、情境复杂,甚至需要一定的"情商"。例如订机票、订酒店,本质上是通过引入Agent数据,与人类行为对齐,从而激活模型能力。因此,下一个阶段要取得的突破是让模型更快、更好地对齐长尾的真实场景。Mid-training和Post-training将使得更多场景的快速对齐和强推理能力成为可能。

03 Agent演进:跨环境泛化与迁移仍是难题,简单解法是构造环境数据+强化学习

Agent是模型能力扩展的一个里程碑,也是体现AI模型进入人类真实(虚拟/物理)世界的关键。没有Agent能力,大模型将停留在(理论学习)阶段,难以将知识积累转化为真实生产力。接下来的一年里,将会继续涌现大量Agent——这个判断已经不再新鲜。但要推进Agent大规模应用落地,核心首先在于理解AI的本质不是创造全新的能力,而是系统性替代人类的部分工作或能力。这也是决定Agent必然爆发的关键因素。其次,尽管早期的Agent主要通过模型应用实现,但当前模型已经可以将Agent数据直接集成到训练过程,从而增强模型的通用性。然而,难题在于不同Agent环境之间的泛化与迁移。因此,应用层最简单的路径正如前文所言——不断引入更多不同Agent环境的数据,并针对不同环境进行强化学习。

04 模型能力突破的重点:记忆、在线学习与自我评估

应用层:围绕不同工种构建应用,并保持足够"薄"以适应模型能力演进。

关于应用层,有两个主要判断:一是在大模型发展越来越端到端的情况下,模型研发和模型应用不可避免地需要被结合起来。应用层必须做得足够"薄",能够快速适配基座模型的能力变化,迅速上线、迭代和验证价值;二是,构建模型应用应该以帮助人、创造新的价值为出发点。如果做一个AI软件没人用,也就无法创造价值,那么它注定缺乏生命力。

具体而言,AI软件究竟应该做什么?回到第一性原理,AI不需要创建新的应用,其本质是模拟人或代替人或帮助人实现人类某些必须要做到的事(某些工种)。从这个角度,未来的应用主要分为两类:将过去的软件AI化,原来需要人参与的部分改为AI;创造对齐人类某个公众的AI软件,替代人类工作。

05 具身智能:在更多真实场景解锁模型能力,需解决数据规模和硬件技术问题

虚拟世界之外,与Agent爆发相对应的,是具身智能的发展。当前机器人大脑已经具备较强智能,下一步的关键在于将大模型能力与机器人行为做好对齐并加以激活。随着硬件技术逐步成熟,具身智能有望在更多真实场景中释放模型能力。但同时,和Agent面临的难以泛化的问题一样,通过少样本激活通用具身能力基本不可能实现。这就需要突破大规模数据获取的问题。

06 多模态:长期重要方向,高效路径是文本、多模态理解、多模态生成并行探索

尽管多模态尚未在探索AGI的智能上限方面有实质帮助,但其无疑是一个重要方向。当前有效的路径仍然是文本、多模态理解、多模态生成并行发展,并适度探索三者的结合,寻找新的能力涌现。当然,三者结合的探索不仅需要技术探索上的勇气,也需要长期、持续的资本投入。

07 领域模型:理性看待阶段性机会

在AGI终局下,领域模型很可能会被基座模型覆盖,领域的数据、流程、Agent数据都会逐渐进入主模型。但在AGI尚未实现的阶段,只要有持续投入的决心,在拥有领域数据并与基座模型保持紧密耦合的情况下,仍有机会在特定竞争窗口中建立领先优势。