AI进化的主轴正从“预训练定终身”转向“部署后持续变强”,这一范式转折的核心判断是:模型竞争力不再取决于训练时的参数规模,而取决于其在真实场景中的在线学习能力。技术实现上,上下文学习与记忆巩固构成两条并行通路——前者让模型在推理时动态吸收新信息,后者通过外部记忆机制将交互经验沉淀为长期能力。腾讯混元HY3采用MoE架构,正是通过上下文学习在成本可控前提下覆盖更大能力范围;而HY-WU(无相)训练参数生成器,按条件生成个性化权重,探索“模型根据场景实时换脑”的激进路径。然而,前沿模型从上下文中实时学习的能力仍远未成熟,CL-bench测试显示最强模型任务解决率仅17%,这意味着在线进化尚处早期,技术栈的每一层——上下文压缩、记忆检索、权重生成——都蕴含结构性机会。竞争焦点正从“谁训练得更好”转向“谁部署后学得更快”。
RLVR(程序化验证奖励)正沿“规则明确→结果可验”的谱系向外扩散:从代码与数学的封闭领域,向药物分子设计、材料合成等科学前沿推进。扩散的驱动力在于验证器的可自动化程度——代码有编译器和测试用例,数学有形式化证明,而科学场景中,AI药物项目已达170个进入临床开发,英矽智能已有13款候选药物获批IND,其验证信号来自湿实验反馈而非程序化规则。但边界同样清晰:开放式情境下,需求模糊、验证延迟、反馈稀疏,模型能力大幅下降。晶泰科技每月产生超5万条反应产率数据和30万条过程数据,恰恰说明科学RLVR依赖高密度、高质量的实验数据闭环——而这正是多数科研机构不具备的基础设施。RLVR在科学前沿的扩散,本质上是一场“验证器工业化”的竞赛。
在线进化的天花板,正从模型算法转向基础设施质量——数据通路的完整性、实验反馈的自动化程度、验证闭环的闭环速度,决定了模型能学多快、学多深。Anthropic年化收入已达140亿美元,增长团队仅约40人,其Claude Code收入从零做到25亿美元仅用9个月,背后是代码场景中反馈信号的高度结构化与基础设施的极致打磨。反观科学领域,大量关键数据被困在手动网页流程和分散数据库中,模型触达不到,直接阻碍RLVR扩散。晶泰科技可编排数百个工作站和自动化实验站,支持7×24小时研发,以月产5万条反应产率数据的基础设施密度,率先实现年度盈利——这印证了一个核心判断:基础设施质量对AI应用效果的影响可能大于模型能力本身。掌握领域数据通路的机构,将获得在线进化时代的话语权。


前沿大模型的实时学习能力与其在静态基准上的表现存在显著断层。CL-bench测试的结果提供了关键证据:即便是当前最强的模型,在需要从上下文中即时提取规律并解决新问题的任务中,任务解决率也仅为17%。这一数字与模型在SWE-bench Verified等封闭式编码测试中动辄80.9%(Opus 4.5)至87.6%(Opus 4.7)的得分形成鲜明反差,揭示了“知识储备”与“情境吸收”之间的本质鸿沟。模型能调用海量预训练参数,却难以在单次交互中完成对人类而言并不复杂的“现学现卖”。这种缺陷的根源在于,当前架构的上下文窗口本质上是临时缓冲区,而非可巩固的长期记忆。当面对开放式、需求模糊的真实场景时,模型无法将对话历史中的经验沉淀为可复用的能力,导致其表现从封闭领域的“超人”骤降为开放世界的“初学者”。这不仅是技术短板,更是阻碍AI从工具迈向伙伴的核心障碍。
当模型无法在场景中持续进化,其角色就被牢牢锁定在“被动执行工具”的象限内。而用户价值的跃迁,恰恰依赖于AI能否跨越这道鸿沟。数据表明,AI编程领域已率先显现这一趋势的雏形:Claude Code的收入在9个月内从零做到25亿美元,其团队95%的代码由自身编写,甚至新产品Claude Cowork仅用1.5周即全部由AI完成开发。这不仅是效率提升,更是角色质变——AI从“写代码的工具”进化为“理解项目语境、自主完成任务”的协作伙伴。然而,这种进化仍局限于规则相对明确的编码领域。在更广阔的场景中,若AI无法记住用户的偏好、理解业务的隐性逻辑并随时间推移优化策略,它就永远只是需要人类不断“喂”指令的机器。真正的“伙伴”意味着AI能主动适应场景变化,而这一能力的缺失,正是当前多数AI应用停留在“增强”而非“自动化”层面的根本原因——数据显示,初始报告中57%的AI使用仍属于人类学习、验证、修改的增强模式,而非模型自主完成的自动化模式。
当基础模型的智力水平趋于同质化,竞争的分水岭便从“谁更聪明”转向“谁更懂我”。模型即服务(MaaS)的商业模式正在经历从“按量计费”到“按价值计费”的转变,而进化能力正是价值兑现的关键。市场数据已显露端倪:尽管行业掀起降价潮,智谱却逆势提价且调用量不降反升,Claude定价偏高但客户仍愿为质量与可靠性付费。这证明客户愿意为“更懂业务”的模型支付溢价。然而,进化能力的缺失正在成为商业化的天花板。GitClear对2.11亿行代码的分析显示,AI大规模介入后技术债务增加30-40%,代码重复率翻倍;Veracode的测试则发现45%的AI代码任务会引入已知安全漏洞。这些问题的根源,都在于模型无法从过往错误中学习、无法适应特定代码库的独特规范。未来,能够通过上下文学习、记忆巩固等机制在部署后持续变强的模型,将能有效降低维护成本、提升可靠性,从而在“模型即服务”的竞争中建立难以复制的护城河。进化能力,正从技术指标演变为决定商业成败的战略资产。


AI对自身研究进程的反哺已从概念验证进入规模化落地阶段,科学发现领域正成为这一趋势最直观的观测窗口。药物研发方面,全球已有约170个由AI参与发现、设计或优化的药物项目进入临床开发阶段,英矽智能一家便有13款候选药物获批IND,其中4款由公司自主推进临床开发,6款通过联合开发或授权方式推进,显示出AI在药物发现全链条中的渗透深度。与此同时,AI驱动的自主实验室正在重塑科研基础设施的产能边界——晶泰科技已实现每月产生超5万条反应产率数据和30万条过程数据,并可编排数百个工作站支持7×24小时连续研发;美国伯克利A-Lab则达到每天超2种新材料的发现速度。这些实证共同指向一个趋势:AI不仅在加速特定科研环节,更在重构“假设生成—实验验证—数据积累”的完整闭环,使科研产出从人力驱动转向算力与数据驱动。
递归自我改进——即AI系统通过改进自身研发流程来加速下一代AI的诞生——正处在“工具级自我增强”与“能力级自我迭代”之间的过渡地带。编程领域提供了最清晰的进展证据:Anthropic的Claude Code团队95%的代码已由AI编写,新产品Claude Cowork全部由AI编写、仅用1.5周完成;SWE-bench Verified成绩在22个月内从49%跳升至87.6%,提升38个百分点。然而,自我改进的纵深推进正遭遇结构性瓶颈。CL-bench测试显示,即便是最强模型,在需要从上下文中即时学习的任务中解决率仅17%,与封闭式编码测试中87.6%的成绩形成巨大断层,说明模型尚无法在开放式情境中实现真正的自主迭代。更深层的制约在于,AI生成代码虽大幅提升效率,但GitClear对2.11亿行代码的分析显示,AI大规模介入后技术债务增加30-40%,代码重复率翻倍,Veracode测试发现45%的AI代码任务会引入已知安全漏洞。这意味着递归自我改进在“量”的层面已显著加速,但在“质”的闭环上仍未形成自洽的自我纠错机制。
跨越递归自我改进瓶颈的关键,在于AI能否从“人类设定目标、AI执行任务”的辅助模式,跃迁至“AI自主定义问题、设计实验、迭代方案”的研究者角色。当前产业正处在这一跨越的前夜。OpenAI已提出明确时间线:2026年9月前达到实习生级研究员,2028年3月前造出能独立完成科研项目的AI。资本市场的反应印证了这一预期的可信度——Isomorphic Labs以21亿美元B轮融资将累计外部资金推至约27亿美元,Anthropic以约4亿美元收购AI生物公司Coefficient Bio,Lila Sciences累计融资达5.5亿美元并签署23.55万平方英尺实验室租赁合同,这些投入共同指向一个方向:构建具备持续自主性的AI科研体。然而,自主性的核心瓶颈在于“持续”二字——AI在规则明确、反馈即时的封闭环境中已展现超越人类的能力,但在需求模糊、反馈延迟的开放式科研情境中,其能力衰减显著。RLVR(程序化验证奖励)正从代码、数学等封闭领域向科学前沿扩散,但科学AI领域大量关键数据仍被困在手动网页流程和分散数据库中,模型触达不到,制约了自主性的纵深拓展。从辅助工具到自主研究者的跨越,本质上是AI从“执行者”向“决策者”的权限让渡,这一进程不仅取决于模型能力的提升,更取决于数据通路的打通、验证机制的完善以及人类对AI科研自主权的信任构建。


多模态AI正在跨越从“生成工具”到“创作主体”的分水岭,其核心标志是系统开始理解创作意图而非仅执行像素级指令。2025年AI视频可用率仅约20%,意味着绝大多数输出仍需人工筛选与修正,模型本质上是高级渲染器;而字节Seedance 2.0将15秒视频可用率拉升至90%,这一跃升不仅是画质改善,更代表模型开始具备场景连贯性与叙事逻辑的初级理解力。进化路径的下一步指向世界模型的构建——在内部模拟未来状态序列以评估风险并选择最优动作,这正是Meta V-JEPA 2-AC所探索的方向,其运行速度比生成式路线快约15倍,且不重建像素而在抽象表示空间做预测,为多模态系统从“看见”走向“预判”提供了非生成式的新范式。当模型能自主规划画面、编排叙事时,多模态安全滞后的代价将急剧上升,视觉记忆对隐私的侵入也将从文本层面的担忧升级为对家庭、面孔等亲密信息的系统性采集。
未来12个月,AI编程的地位将从“加速工具”固化为“默认基础设施”,这一判断的底气来自商业兑现速度与渗透深度的双重验证。Anthropic的Claude Code收入从零做到25亿美元仅用9个月,其团队95%的代码由Claude Code编写,新产品Claude Cowork全部由AI编写、仅用1.5周完成——当AI成为组织自身的生产方式而非辅助手段,基础设施化便已发生。编码是企业AI应用中领先近一个数量级的主导用例,非开发者用户增速是开发者的3倍以上,Bolt的用户中60-70%是设计师、学生、健身教练等非程序员,Epic Games内部超过一半的Claude Code使用来自非开发者,使用人群的泛化正在将编程从专业壁垒改写为通用素养。然而,基础设施化的另一面是质量债的累积:GitClear对2.11亿行代码的分析显示,AI大规模介入后技术债务增加30-40%,代码重复率翻倍,Veracode的测试发现45%的AI代码任务会引入已知安全漏洞——当AI成为默认基础设施,这些系统性风险将从个别项目的技术问题升级为整个软件供应链的稳定性挑战。
基础设施质量对AI应用效果的影响可能大于模型能力本身,而数据通路正是基础设施竞争的核心战场。当前模型调用量的价格分布揭示了这一逻辑:每百万Token价格4美元以下的模型承接了约76%的真实调用量,1美元以内最为密集——当模型能力趋于同质化,谁能以更低成本触达高质量数据,谁就掌握了应用效果的放大器。智谱在行业降价期逆势提价、调用量不降反升,Claude定价偏高但客户仍愿为质量与可靠性付费,说明数据通路的稀缺性正在超越模型参数的稀缺性,成为新的定价权来源。在科学AI领域,这一竞争尤为激烈:全球已有约170个AI参与发现、设计或优化的药物项目进入临床开发,晶泰科技每月产生超5万条反应产率数据和30万条过程数据,可编排数百个工作站支持7×24小时研发——这些数据的采集、标注与流通通道,决定了AI在科研场景中能否从单点工具进化为系统平台。掌握领域数据通路的机构,将在科学AI时代获得超越纯模型厂商的议价能力与话语权。


