热点丨RSI从硅谷热到国内,AI开始参与训练下一版自己

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

前言:

工具开始参与修改自己的图纸,技术史便翻到了微妙的一页。硅谷实验室将AI接入研发流程,国内厂商也让模型参与数据生产、实验执行与训练维护。

RSI热潮因此有了现实的落点:模型的竞争,开始延伸到制造模型的过程。

作者 | 方文三

图片来源 | 网络

6.5亿美元买的,是会自我加速的研发曲线

RSI的全称是Recursive Self-Improvement,递归自我改进。

1965年,英国数学家I. J. Good就讨论过机器设计更聪明机器之后可能出现的智能加速。大模型把事情往现实推了一截,因为机器第一次具备了大规模读代码、写代码、调用工具、运行实验和检查结果的能力。 

2026年,资本开始给这件事贴上惊人的价格标签。 

5月,Richard Socher参与创办的Recursive Superintelligence走出隐身状态,融资超过6.5亿美元,估值达到46.5亿美元。7月,公司又与AWS签下4.1亿美元的多年算力协议。

另一家名字只差一个字母的Ricursive Intelligence选择从芯片切入。公司2025年12月获得3500万美元种子融资,2026年1月再完成3亿美元A轮融资,投后估值达到40亿美元。 

它试图构造的循环十分具象,AI设计更好的芯片,更好的芯片训练更强的AI,更强的AI继续改善下一代芯片。 

这些钱表面上投向模型、算力和人才,底层定价的却是一种新的研发经济学。 

模型一旦能够承担越来越多研究工作,每一代模型的能力提升便可能降低下一代模型的研发成本,又缩短下一轮迭代时间。 

研发速度本身,也可能开始复利,这也是RSI突然从论文边角走进融资新闻的原因。

硅谷的进展落在训练链条里,1%也有分量

谈到AI自我改进,很容易在脑海里出现一个过于科幻的画面。模型修改自己的权重,重启,智力暴涨,然后继续修改自己。 

现实安静得多,今天已经发生的事情,更接近一条研发流水线逐段自动化。 

OpenAI在2026年2月发布GPT-5.3-Codex时披露,团队使用其早期版本调试训练、管理部署,并分析测试和评估结果。这里的闭环很具体:尚在开发中的模型,开始帮助工程师完成后续开发。 

截至2026年5月,Anthropic合并进代码库的代码中,超过80%由Claude编写。2026年第二季度,其典型工程师每天合并的代码量约为2024年的8倍。它衡量的是代码产出来源,不能直接换算为研究工作被替代的比例。 

更接近AI研究本身的一项内部实验,则透露出另一层变化。Anthropic会给模型一段训练小型AI的代码,要求模型在保持结果正确的情况下尽量提高训练速度。 

2025年5月,Claude Opus 4平均能够实现约3倍加速。到2026年4月,内部测试中的Claude Mythos Preview已经做到约52倍。 

实验目标和评价标准仍由人设定,但提出修改方案、运行代码、观察结果、继续试验的循环,已经大量交给模型。 

Google DeepMind的AlphaEvolve让Gemini生成程序,用自动评价器打分,再通过进化式搜索保留较好的方案继续变异。 

它优化了Gemini训练中的一个矩阵乘法内核,使该内核提速23%,对应Gemini整体训练时间减少1%;另一个用于数据中心调度的成果,平均持续回收谷歌全球0.7%的计算资源。

Karpathy在2026年3月推出的autoresearch,则把自动实验压缩成一个便于观察的最小系统:智能体修改训练代码,每次训练预算固定为5分钟;随后依据验证指标保留或放弃改动。能运行、能比较、能回退的环境,已经可以承接一部分研究劳动。 

把这些工作摆在一起,一条线已经能够看见。AI先学会回答问题,接着学会使用工具,然后学会跑实验、产生数据、检查结果,再进一步参与决定下一轮应该做什么实验。 

研发者和研发工具之间那堵墙,正在变薄。

国内沿着工具、实验与数据三条路径推进

国内的探索同样需要按改进对象来读。 

MiniMax在3月18日发布M2.7时介绍,内部研究智能体在所述强化学习研发工作流中可承担30%—50%的工作。另一项内部实验让模型连续进行超过100轮编程框架优化,在内部评测集上取得30%的效果提升。 

这两个比例描述不同事情。前者针对特定流程的参与范围,后者针对特定框架的评测收益。 

云知声U2-Flash的切入点更靠近后训练数据,模型通过任务生成、轨迹分析、纠错重采,以及强弱模型执行过程对比,围绕薄弱环节构建训练材料,已形成近10万规模的软件工程任务集。

9月10日,一篇名为《The Last AI Built by Humans》的论文上线。论文试图给混乱的「自我改进」划出层级,从执行改进方案,到自主选择改进策略,再到自主获取经验、适应环境,最终进入递归式元改进,也就是连「如何改进自己」这套机制本身都成为可修改对象。 

这套分层很重要,今天大量被称作Self-Improving的系统,依然有人类设置任务、评价标准和晋级规则。模型可以跑得很勤快,却仍是在别人修好的跑道上比赛。 

智谱披露,由GLM-5.3驱动的Infra Agent参与GLM-5.3-Flash推理基础设施的设计、调试与优化。在超过10万张国产芯片组成的集群上,团队不到两周将端到端吞吐提高到初始水平约3倍。 

更重要的一步出现在反馈环节,真实基础设施任务能够形成可验证的工作轨迹,这些轨迹又可以转化为后续模型训练所需的经验。 

下一阶段,越来越多高价值经验可能来自上一代模型亲自工作后留下的痕迹。代码修改记录、失败实验、性能瓶颈、工具调用路径、基础设施异常、被否决的方案,都可能成为下一代模型的教材。

下一轮护城河,可能在验证器和训练场里

RSI还有一个容易被忽略的现实约束,让AI提出方案已经不算特别困难,让AI判断自己的方案到底有没有变好,困难得多。 

2026年9月由上海交通大学等多家中国团队及合作者联合发表的重磅综述论文《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》(人类建造的最后一代 AI:迈向真正的递归自我改进)。 

该论文提出的Headroom-Closed Index (HCI,空间收敛指数)显示:2026年高级数学达到86.4,研究生级科学达到85.8,而软件工程只有52.6,工具Agent只有39.9。

作者据此指出,静态且易验证的任务进展明显更快,长流程、状态复杂、需要持续使用工具的任务仍留下很大空间。

这组数字背后藏着RSI时代可能非常值钱的一种基础设施:验证器。 

AI可以一天生成100万个科研假设,无法可靠判断哪一个成立时,100万个假设只是100万份电子噪声。 

可验证的真实环境、稳定的奖励函数、自动化实验设施、独立评价模型、可重复的软件工程任务以及来自生产系统的高质量轨迹,会越来越接近核心资产。 

这对国内AI产业尤其有意思,国内拥有大量复杂工程环境,也拥有国产芯片适配、云计算调度、制造软件、工业控制、机器人、物流和科研计算等真实任务。这些场景没有互联网文本那样整洁,却能产生非常稀缺的反馈。 

当模型能够在这些环境里持续工作,企业得到的便不只是一次自动化收益。工作本身还会生产下一轮训练材料,生产环境可能逐渐兼任训练场。 

本轮RSI热潮是一场研发生产方式的竞争。 

模型现有能力决定它今天能完成什么;研发系统的效率,则影响下一版能力要花多久、付出多少成本才能获得。两者一旦形成正向反馈,优势就可能沿着研发流程继续累积。 

人的工作也会随之变化。执行环节交给AI之后,研究方向、实验解释、异常识别和停止无效探索的判断,会占据更大分量。

结尾:

AI已经开始参与下一版自己的制造,递归的远景仍需一轮轮实验铺实。

图纸可以交给机器参与修改,衡量进步的尺子,则需要在每次迭代中保持可靠。 

部分资料参考:云知声:《U2-Flash:让AI参与训练下一代AI》,OpenAI:《Introducing GPT-5.3-Codex》,Google DeepMind:《AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms》,Karpathy:《autoresearch》,arXiv:《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI芯天下专栏: https://www.tuoluo.cn/columns/author1911711/

本文网址: https://www.tuoluo.cn/article/detail-10131293.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章