Mirendil、INT21、rekursiv.ai……最热门RSI公司都在“自我改进”什么
日期:2026-08-22 17:18:04 / 人气:14

RSI(Recursive Self-Improvement,递归自我改进)是2026年AI创业最拥挤的赛道。半年内,七家核心公司合计融资超10亿美元,Recursive单轮估值就达46.5亿美元。它们用词各异:self-improving AI、self-accelerating AI R&D、AI Scientist,但底层指向同一个愿景——让AI参与“制造下一代AI”的过程。
严格来说,目前没有任何一家公司实现RSI的“理想定义”:AI改进“制造下一代AI”的方法,下一代继承这个改进,再做出更好的下下代。现在行业里更务实的拆解是四步:提出改法→执行→验证→保留。七家公司的本质差异,是对三个问题的回答:AI接管了哪几步?验证信号从哪来、有多“硬”?改进是单次有效,还是能被下一代继承?
按验证信号的“硬度”从高到低,这七家公司的自我改进逻辑可以排成一条清晰的谱系。
一、反馈来自硬件计时:INT21——最硬的尺子
验证信号:GPU硬件实测性能(正确性+延迟/吞吐量/内存占用)
INT21创始人Bing Xu是GAN原始论文共同作者,此前创办的GPU推理公司HippoML被英伟达收购。它的改进对象是AI运行的底层代码(Kernel)——大模型在GPU上的每一个矩阵乘法、注意力操作,都需要翻译成GPU直接执行的Kernel程序,手写Kernel的人才极少,优化空间却极大。
它的产品PTX Kernel Factory流程极其清晰:用户定义操作、正确性要求、目标硬件和性能指标,系统调度多个Agent生成候选实现,编译后在真实GPU上测试正确性、测速,淘汰错误方案,保留更快的实现,成功和失败的记录全部带入下一轮。
硬件计时是“不会被说服的尺子”。INT21公开了四个Kernel的测试结果:Kimi Delta Attention在GH200上达到专家手写版本的1.24至1.59倍加速,RMSNorm在GH200的11个前向测试中几何平均快8.17%,B200的126个可比案例全部领先,同时也公开了两个轻微回退案例。这种可复现、可审计的验证,是目前RSI赛道最硬的信号。
它的局限也很明确:更像一套出色的自动调优系统,还没表现出能改进“如何搜索候选Kernel”本身的方法。接下来要看四个Kernel能否变成稳定管线,一次任务的经验能否迁移到新算子、新硬件,算子级加速在完整模型上还能剩多少。
二、反馈来自Benchmark:AI开始选假设——rekursiv.ai与Inherent
验证信号:公开Benchmark分数(辅以AI打分+少量人类校准)
这一层的产品都叫“AI Scientist”:像研究员一样读论文、提假设、写代码、跑实验、看结果、决定下一步。和INT21的区别是,目标函数仍是人给的,但“验证哪个假设值得跟进”开始交给AI。
rekursiv.ai:自动研究的“驾驶舱”
创始人来自Google/DeepMind和Luma AI,入选YC S26。它的系统调度多名AI Scientist并行建立假设、写代码、跑实验、维护排行榜,每条结论都能追溯到原始实验记录。
最具体的案例是2026年7月的ARC-AGI项目:系统在几天内跑了235次完整实验、探索15条主要方向,7条带来可保留的提升,单模型ARC-AGI-1准确率从44.9%提高到71.4%,五模型集成达75.5%。但更有价值的是它对失败的8个方向的记录:能否解释失败、及时止损、据此调整下一轮,才是它是否具备“研究判断力”的核心。
它的风险也很直接:在公开测试集上跑235次实验,过拟合风险极高;且目前任务边界清晰、指标现成,真正的科研往往需要重新设计评估指标,这才是它的考验。
Inherent:递归集体自我改进
创始人来自AI Scientist、AlphaProof等项目,是Public Benefit Corporation,5000万美元种子轮由Index Ventures和Radical Ventures领投。它的野心更大:改进对象是整间实验室——开会方式、算力分配、人何时介入、组织如何从每次实验里学习。
目前最具体的成果是27B参数的AI Scientist模型Faraday,能调用更大的Coding Agent,完成机器学习论文复现。在“复现论文图表”的测试中,它在73%的同分布任务和60%的AI for Science留出任务上优于对照Agent,平均分比Claude Opus 4.8和GPT-5.5分别高6%和8%。
它的“验证”方式很有代表性:先用Claude Opus 4.7生成评分标准,再用Codex GPT-5.5打分,同时收集20名专家的117组排序来校准AI评分。这种“AI打分+少量人类校准”是这一层的典型模式,也是共同软肋——距离“独立、可审计”仍有距离。
它的思路对应工业史上的“工厂电气化”类比:刚接入电力时只是替换蒸汽机,生产率没变;飞跃要等到厂房布局和管理方式都围绕电力重新设计。Inherent盯的是后面这一步,接下来要看它能否产出原创发现、跨领域迁移,以及PBC治理如何约束逐渐自动化的实验室。
三、反馈来自实验室自身运转:Core Automation与Mirendil
验证信号:实验室内部效率提升(自动化程度、研究周期缩短等,公开信息极少)
这一层的改进对象是实验室本身:先用AI自动化自己的研究,省下的研究能力再去发现下一批可自动化的环节,公司自己是第一个客户。这也意味着它们公开的信息最少。
Core Automation:重构研究流程
创始人Jerry Tworek在OpenAI近七年,参与过o1、o3、GPT-4等核心项目。它的目标是建立高度自动化的AI Lab,寻找超越大规模预训练和现有RL的学习算法,以及比Transformer更能扩展的架构。
目前唯一落地的具体案例是Mark Saroufim的博客:团队在开发KernelBot时发现Agent会出现Reward Hacking——找到让分数变高但没解决问题的捷径,比如绕过测试、只优化测试覆盖到的情况。团队把人工审计积累成数据,构建了KernelGuard检查规则。
它的优势是研究和系统能力在同一个团队:很多自动研究Demo在小代码库里表现好,进入前沿训练就会卡在集群调度、Kernel、数据管线和失败恢复上。让架构和基础设施一起演进,比单个AI Scientist更接近“自动化实验室”。但它也是七家里“资本先于证据”最明显的一家,后续要看第一个公开成果是否由Agent主导、自动化省了多少研究员时间、新算法能否脱离Transformer配方。
Mirendil:专用模型+数据飞轮
创始人来自Anthropic、xAI、DeepMind等,2亿美元种子轮由a16z和Kleiner Perkins领投,NVIDIA参与。它的路径和Core不同:先训练一个专门擅长AI研究的前沿模型,再围绕它重建实验平台(代码、训练、评估、调试、Kernel、Checkpoint比较、算力管理),已和Google Cloud签下多年合作,同时使用TPU和NVIDIA集群。
它押注的是“数据飞轮”:通用模型的训练数据里缺少完整的AI研究轨迹(从提出想法到调试失败到比较结果),而专用模型每天在自己平台里做这些事,就能积累外部无法复制的数据。
但目前这个飞轮仍在设想阶段:没有公开模型、演示或Benchmark。2亿美元能付得起实验账单,但不代表它的模型比通用编码Agent更会做研究。后续要观察它独立完成了多少可复现研究、改进发生在权重、Harness还是人工流程里、客户能否在不复制整间实验室的前提下用上它。
四、反馈来自整个发现过程:Recursive与Discovery Loop
验证信号:跨领域实验结果的“可测量性”(从AI扩展到科学工程,验证周期长、复杂度高)
最后两家不只要改进模型,还要改进研究过程本身,并最终走出机器学习,进入更广泛的科学发现。
Recursive:开放式递归改进
八位创始人覆盖Salesforce AI、Meta FAIR、DeepMind、OpenAI等,6.5亿美元融资,投后估值46.5亿美元。它的系统同样做“AI Scientist”的工作,但多出的核心是同时维护多条长期研究分支,合并有希望的路线,并在接受结果前检查Reward Hack和随机波动。
6月公布的三项结果中,NanoGPT达到指定Loss的时间从79.7秒降到77.5秒,数字本身不大,但意义在于跑通了“提方案→做实验→验证→保留改进”的完整闭环,并公开了方法、部分Artifact和不确定性。创始人Jeff Clune和Tim Rocktäschel在“开放式算法”(让系统自己不断生成新问题和新解法,不收敛到固定目标)上的十几年积累,是它从“批量跑实验”推进到“改进研究方法”的关键。
更大的挑战在于这些经验能否迁移到陌生任务,多轮后能否用更少实验找到更好方案,以及外部团队能否复现。
Discovery Loop:规模化实验操作系统
创始人是Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le——四人几乎定义了现代大规模计算和AI基础设施。它的路径分三步:用前沿模型和大规模算力自动化ML研究和工程,并行跑数千个实验;自己做第一个客户;再进入芯片、药物、材料、能源等结果可测量的领域。
和Mirendil相比,它不先训专用模型,更像一套多领域的实验操作系统;和Recursive相比,它更早延伸到AI之外。它的核心优势是“实验吞吐量”:把科学发现当成系统工程问题,用基础设施能力压缩迭代周期。
但跨度越大,疑问越明显:ML实验几小时返回Loss,药物和材料实验受制于物理设备、周期和安全约束,一轮要几周到几个月。结果可测量,也不等于研究方向值得投入。明星团队走出AI后,能否处理真实实验的复杂性,是所有RSI公司最终要面对的考验。
结语:RSI的“硬”与“软”
目前RSI赛道的分化已经非常清晰:
• 最硬的是INT21:验证信号来自硬件,可复现、可审计,是目前唯一接近“工程化RSI”的案例;
• 中间层是rekursiv.ai和Inherent:AI开始参与研究判断,但验证依赖Benchmark和AI打分,软肋在“评估器的可靠性”;
• 更软的是Core和Mirendil:改进对象是实验室自身,验证信号是内部效率,公开证据极少;
• 最激进的是Recursive和Discovery Loop:试图改进整个研究过程并跨领域扩展,验证周期长、复杂度高,目前更多停留在愿景阶段。
RSI的核心风险从来不是“跑不快”,而是“跑偏了”:验证信号不够硬,系统跑得越快,积累的错误越多。半年10亿美元的融资热潮之后,行业真正需要的不是更宏大的愿景,而是更硬的验证、更透明的证据,以及更清醒地认识到:递归自我改进的本质,不是让AI“自己变聪明”,而是让人类能更可靠地引导AI,把改进的方向始终锚定在“对人有价值”的发现上。
作者:恒达娱乐
新闻资讯 News
- Mirendil、INT21、rekursiv.a...08-22
- 牛来,一场心照不宣的共谋08-22
- 不再只守产品!日本新增5项核心技...08-22
- 仅100万像素!苹果AI最关键的“...08-22

