[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析

[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析

Geoffrey Hinton 参与的最新 RSI 相关论文,这篇论文真正有价值的地方,不是“AI 马上爆炸”这种标题党,而是它把一个以前比较玄乎科幻的问题,拆成了一个可以观察、测量、验证的工程问题:

当一种生产工具不仅能够生产财富,而且开始能够生产“更强的生产工具”时,问题就从效率问题升级成了增长函数本身的问题,也标志着是 AI 喧嚣之后进入可持续的产业逻辑。

AI 到底什么时候开始真正参与“制造下一代 AI”,并且这种参与能不能让下一代 AI 更快地制造再下一代 AI?

RSI 真正特殊的地方,不是“点石成金”,而是“点石成金的手指头开始自己制造手指头”要面临的问题。


AI 开始自己造 AI 之后,辛顿最新论文到底在担心什么?

最近,Geoffrey Hinton、Yoshua Bengio、Andrew Barto,以及 OpenAI、Anthropic、Microsoft 等机构的一批 AI 研究者共同发表了一篇非常值得注意的论文:《What if automating AI R&D triggers an intelligence explosion?》

直译过来就是:

如果 AI 自动化了 AI 研发,会不会引发一场“智能爆炸”?

这篇论文真正值得关注的地方,并不是“AI 会不会毁灭人类”这种已经被讨论很多年的问题。它提出了一个更加具体、也更加工程化的问题:

如果 AI 越来越擅长研究 AI,那么 AI 的进步速度本身,会不会开始加速?

这其实就是所谓的:Recursive Self-Improvement,RSI——递归自个人改进。

但个人认为,理解 RSI 最重要的第一步,就是不要把它想成:

“AI 修改自己的代码,然后自己变聪明。”

这其实太简单了。真正值得关注的是另外一个循环:

更强的 AI → 更强的 AI 研发能力 → 更快产生更强的 AI → 更强的 AI → ……

如果这个循环足够强,问题就不再只是“AI 每年进步多少”,而可能变成:

AI 的进步速度本身,也开始越来越快。

这才是 Hinton 等人真正担心的事情。


一、先不要被“智能爆炸”四个字吓到

“智能爆炸”听起来非常像科幻小说,但论文讨论的东西,其实可以非常朴素。

假设今天有一个 AI 实验室,里面有 100 个研究人员。他们每天干什么?

  • 写代码
  • 设计模型
  • 清洗数据
  • 设计实验
  • 跑训练
  • 分析结果
  • 修改参数
  • 研究新的算法
  • 阅读论文
  • 寻找失败原因

然后继续实验。这其实就是 AI 研发。

现在假设 AI 可以替代其中 10% 的工作,那么人类研究人员就可以把时间花在更重要的事情上。例如:原来一个研究员一天只能跑 10 个实验;现在 AI 帮他写代码、配置环境、跑实验、分析结果,这个研究员一天可能就能跑 100 个实验。

于是:研发效率提高。

这本身并不神奇。过去几十年的软件工程,本质上一直在做这件事情。


二、真正特殊的地方来了

问题在于:普通软件的研发效率提高,和 AI 研发效率提高,并不是完全一样的事情。

如果 AI 帮你做电商网站,效率提高 10 倍,很好。但这个网站本身并不会让你的 AI 变得更聪明。

可是,如果 AI 帮你研发 AI,情况就不一样了。假设:第一代 AI 能够帮助研究人员提高 20% 的 AI 研发效率,于是第二代 AI 被更快地研发出来。第二代 AI 又比第一代 AI 更擅长:

  • 写训练代码
  • 设计实验
  • 分析实验
  • 找模型问题
  • 生成训练数据
  • 优化训练方法
  • 优化推理
  • 设计新的 AI 算法

于是第二代 AI 又可以帮助人类更快制造第三代 AI,第三代 AI 又进一步提高 AI 研发效率。于是出现:

graph LR
    A["AI 变强"] --> B["AI 研发效率提高"]
    B --> C["下一代 AI 更快出现"]
    C --> D["AI 研发效率进一步提高"]
    D --> E["下一代 AI 更快出现"]
    E -.->|"……"| A

这才是真正的 RSI。


三、所以 RSI 的关键不是“自己修改自己”

这是理解这篇论文最重要的一点。很多人看到 Recursive Self-Improvement,会马上想到:

AI 修改自己的源代码。

其实没必要。只要一个系统的输出,能够提高下一轮制造更强系统的能力,就已经形成了某种意义上的递归改进。

例如:AI 帮助设计新的训练算法;新的训练算法制造出更强的 AI;更强的 AI 又帮助设计下一代训练算法。这已经形成了:

AI → AI R&D → 更强 AI → AI R&D

所以真正重要的不是:

“AI 有没有修改自己的代码?”

而是:

AI 是否开始成为 AI 研发过程中的生产力。

这两个概念差别非常大。


四、其实个人们已经走到了这个循环的入口

这也是个人认为这篇论文最值得认真看的地方。论文并没有简单地说:

“RSI 已经发生了。”

恰恰相反,作者非常清楚地指出:现在还没有证明真正的智能爆炸已经发生。 但是,AI 自动化 AI 研发的趋势已经非常明显。

论文引用的一个重要观察是:AI 已经大量参与 AI 公司自己的软件开发和研发流程。例如论文讨论到,Anthropic 报告称,2026 年 3 月时,AI 在高层监督下自主完成的内部 AI R&D 工作占比大约只有 **1%**,到 2026 年 8 月已经上升到 **26%**。(GovAI)

时间AI 在高层监督下自主完成的内部 AI R&D 工作占比
2026 年 3 月约 1%
2026 年 8 月约 26%

注意这里最重要的不是“26%”这个数字本身,而是:这个比例正在快速变化。

换句话说:AI 不再只是一个被研究的对象,AI 正在逐渐成为:

研究 AI 的工具。

这才是事情发生变化的地方。


五、一个非常简单的例子

假设个人们现在要训练一个模型。

传统方式:

graph LR
    A["人类研究员"] --> B["提出想法"]
    B --> C["写代码"]
    C --> D["跑实验"]
    D --> E["分析结果"]
    E --> F["修改方案"]
    F --> G["再跑实验"]

这是一个典型的人类研发循环。

现在加入 AI:

graph LR
    A["人类"] --> B["提出目标"]
    B --> C["AI 设计实验"]
    C --> D["AI 写代码"]
    D --> E["AI 跑实验"]
    E --> F["AI 分析结果"]
    F --> G["AI 提出下一组实验"]
    G --> H["人类审核"]

如果 AI 能够越来越多地承担中间环节:

graph LR
    A["人类"] --> B["目标"]
    B --> C["AI"]
    C --> D["实验"]
    D --> E["结果"]
    E --> F["AI"]
    F --> G["新实验"]
    G --> H["结果"]
    H --> I["AI"]
    I --> J["新模型"]

那么人类逐渐从 “亲自做研发” 变成 “管理研发系统”。


六、而真正危险的地方,是“速度”

假设每一代 AI 都只是变强一点。例如:

代际研发能力
第一代研发能力 = 1
第二代1.2
第三代1.5
第四代2

这没有什么特别恐怖的。因为虽然越来越强,但仍然是正常的技术进步。

真正值得关注的是:

代际研发能力
第一代研发能力 = 1
第二代2
第三代5
第四代15
第五代50
第六代200

这时候发生的事情就完全不同了。因为:研发能力本身开始增长。 而研发能力增长,又进一步提高研发速度。于是形成了反馈。

这就是经济学和控制论里面非常经典的东西:

正反馈。


七、可以把它想象成一个“会自己升级的工厂”

这是个人觉得最容易理解 RSI 的比喻。假设你有一座工厂:第一天,工厂生产 100 台机器;第二天,工厂生产 110 台;第三天,120 台。

这只是普通增长。

但是,如果这些机器能够帮助工厂:

制造更先进的生产设备。

事情就开始不一样:

设备代际每天产量
第一代设备100 台
第二代设备200 台
第三代500 台
第四代2000 台

这时候真正增长的已经不是产品数量,而是:

生产能力本身。

AI 的情况非常类似:

  • 普通 AI → 帮你完成工作。
  • 更强的 AI → 帮你制造更好的 AI。
  • 再更强的 AI → 帮你制造更好的“制造 AI 的方法”。

这就是递归。


八、但是,这里有一个非常重要的“坑”

如果看到这里就认为:

“那 AI 肯定会无限爆炸。”

那就错了。这恰恰是这篇论文需要谨慎理解的地方。因为:

研发能力提高 ≠ AI 能力无限增长。

现实世界有大量瓶颈。


九、第一个瓶颈:真正困难的问题

AI 可以帮你写代码,但不是所有 AI 研发问题都只是写代码。真正困难的问题可能是:

  • 到底应该研究什么?
  • 哪个方向值得投入?
  • 哪个实验有意义?
  • 为什么这个实验失败?
  • 一个新的理论到底是不是正确?

这些问题远比“帮个人写一个 Python 函数。”困难得多。因此:

自动化简单工作,并不等于自动化整个科学研究。


十、第二个瓶颈:实验需要时间

AI 可以非常快地写出一个训练程序,但模型训练可能需要几个小时、几天,甚至更长。GPU 也需要时间,数据也需要时间,实验设备也需要时间。

所以即使 AI 的“脑子”变快了:

现实世界的计算资源仍然是硬约束。

这也是为什么 RSI 不应该简单理解成:AI 变聪明 → 马上无限变聪明。现实世界没有这么理想。


十一、第三个瓶颈:算力

这是非常现实的问题。假设一个 AI 找到了一个非常好的训练算法,但训练下一代模型需要 10 万张 GPU,你没有,怎么办?AI 再聪明也没办法凭空制造出 GPU。

所以:智能不是唯一生产要素。 至少还包括:

  • 算力
  • 电力
  • 数据
  • 芯片
  • 网络
  • 实验设备
  • 时间
  • 资金
  • 工程基础设施

这些东西都会成为 RSI 的摩擦力。


十二、第四个瓶颈:判断“什么是好”

这个可能是最关键的问题。假设 AI 自己提出了 10000 个新算法,问题来了:

哪个是真的好?

  • 如果你有一个数学问题:答案可以自动验证。
  • 如果你有一个程序:可以运行测试。
  • 如果你有一个模型:可以跑 benchmark。

这类问题相对容易。但如果 AI 提出:一个新的 AI 理论。谁来判断?如果 AI 自己判断:“这个理论很好。”那么就产生了一个非常危险的问题:

谁来评价评价者?


十三、这其实是 RSI 最大的技术难题之一

你可以把 AI 自个人改进系统画成这样:

graph LR
    A["AI"] --> B["提出改进"]
    B --> C["实验"]
    C --> D["评价"]
    D --> E["选择"]
    E --> F["更强 AI"]

看起来非常漂亮。但真正关键的是:评价。

如果评价系统错了:AI 就可能优化错误目标。甚至:AI 可以学会“骗过评价系统”。于是:

graph LR
    A["真正能力提升"] --> B["OK"]
    C["只是在 benchmark 上作弊"] --> D["也 OK"]

两者可能被混在一起。

所以 RSI 的核心问题之一,其实不是:AI 能不能自己改进?而是:

AI 能不能可靠地判断自己到底有没有变好?


十四、这就是为什么“递归”两个字非常重要

一次自个人优化:

graph LR
    A["AI"] --> B["改进"]
    B --> C["AI"]

其实没什么惊天动地。真正重要的是:

graph LR
    A["AI₁"] --> B["改进"]
    B --> C["AI₂"]
    C --> D["AI₂ 改进"]
    D --> E["AI₃"]
    E --> F["AI₃ 改进"]
    F --> G["AI₄"]

每一轮都把上一轮的成果作为下一轮的基础。于是:上一轮提高了下一轮的研发效率。 这才可能形成加速。


十五、论文真正关心的,其实是一个“乘数”

可以把事情极度简化成一个公式:

下一代 AI 的进步速度 = 研发投入 × 研发效率 × AI 自动化程度

而现在发生的变化是——

以前:

研发投入 ↑

现在:

  • 研发投入 ↑
  • 研发效率 ↑
  • AI 自动化程度 ↑

如果 AI 自动化程度继续提高,那么有效研发力量可能增长得非常快。这就是为什么论文讨论 AI R&D automation,而不是简单讨论 AI capability。这两个东西并不是一回事。


十六、论文里一个很值得注意的推演

论文使用了一个非常关键的量:r:research returns,也就是研发投入带来的进步回报。

简单理解:如果研发力量增加 10%,最终得到的有效 AI 进步是否也能增加足够多?

条件推演结果
r < 1研发投入虽然增加,但收益会越来越递减。这种情况下,“AI 帮 AI 做研发”也未必能够产生持续加速。
r > 1研发力量增长可能超过研发收益递减的速度。于是:更多 AI 研发能力 → 更多 AI 进步 → 更强 AI → 更多 AI 研发能力,反馈就可能越来越强。

论文基于历史 AI 进展数据讨论的中心估计大致落在 1.2–1.9 的范围,并在一组强假设下进行模型推演:如果未来完全自动化 AI R&D,同时这种回报关系持续成立且其他瓶颈不成为主导因素,那么进步速度可能出现非常明显的加速。论文给出的一个直观尺度是,在该模型条件下,大约一年半后,原本需要一年才能实现的进步可能压缩到大约五周。(alphaXiv)

但这里一定要加粗:这不是预测。 更不是:

“Hinton 预测一年半以后 AI 会爆炸。”

它是一个:条件模型。 也就是:

如果 A + B + C + D 全部成立,那么可能出现 E。

这和预测是两回事。


十七、个人认为这篇论文最值得警惕的,不是“AI 会不会爆炸”

而是另外一个问题:

个人们可能正在把“AI 研发”本身变成一种可以规模化复制的生产力。

以前一个顶级 AI 研究员就是一个人,一个人一天只有 24 小时。但是 AI Agent 不一样。假设一个 AI 研究 Agent 可以完成一个研究员 20% 的工作,你可以部署:100 个、1000 个、10000 个,甚至更多。

于是 AI 研发第一次出现了一种非常特殊的可能性:

研发人员数量不再完全由人类数量决定。


十八、这其实比“AI 会自己写代码”重要得多

AI 写代码已经不是新闻。真正重要的是:

AI 能不能复制研发劳动?

这是两个完全不同的层级:

  • 普通 Coding Agent → 帮程序员写代码。
  • Research Agent → 帮研究员做研究。
  • 更进一步 → AI Research Agent 帮助制造更强的 AI Research Agent。

这才进入 RSI。

所以未来真正值得观察的指标,可能不是“某个模型 benchmark 提高了多少分?”,而是:

AI 完成 AI 研发任务的比例提高了多少?

以及:

AI 是否正在缩短下一代 AI 的研发周期?


十九、这里有一个非常关键的判断标准

个人认为未来判断 RSI 是否真正发生,可以简单看三个核心问题。

第一个问题:AI 能不能独立完成越来越长的 AI 研发任务?

不是“写一个函数”,而是“从提出假设,到设计实验,到实现,到运行,到分析,到提出下一步”。

第二个问题:AI 找到的改进能不能泛化?

不是“benchmark +10%”,而是“在没有针对性训练的情况下,新的研究能力仍然提高”。

第三个问题(最关键):AI 是否开始缩短下一代 AI 的研发周期?

例如:

  • 过去:一年一个重大模型。
  • 后来:半年一个。
  • 然后:三个月、一个月、两周。

如果这种压缩是因为 AI 自己提高了 AI 研发效率,那么 RSI 的味道就越来越浓了。


二十、所以个人对这篇论文的看法是

个人不会把它理解成:

Hinton 说 AI 要爆炸了。

这种理解太粗糙。个人更愿意把它理解成:

AI 正在从“工具”变成“生产 AI 的生产工具”。

这是一个非常重要的变化。

过去:

graph LR
    A["人类"] --> B["制造 AI"]

现在:

graph LR
    A["人类"] --> B["AI"]
    B --> C["辅助制造 AI"]

未来如果进一步发展:

graph LR
    A["人类"] --> B["AI 研发系统"]
    B --> C["AI"]
    C --> D["更强 AI 研发系统"]
    D --> E["更强 AI"]

那么 AI 技术进步的速度,就可能不再主要由人类研究人员的数量决定,而开始由 机器能够多快地提高机器研发效率 决定。


二十一、不过,个人并不认为“智能爆炸”是必然事件

这是个人和很多过于激进的 RSI 叙事最大的区别。因为整个系统里面存在大量瓶颈:

graph LR
    A["算法"] --> B["算力"]
    B --> C["数据"]
    C --> D["实验"]
    D --> E["验证"]
    E --> F["训练"]
    F --> G["部署"]

任何一个环节都可能卡住。尤其是:验证。

AI 可以生成 100 万个想法,但真正有价值的想法可能只有几个。如果没有可靠的验证机制:AI 产生更多想法,未必等于 AI 进步更快。

所以:

生成能力不是研发能力。

更进一步:

研发能力也不是科学发现能力。

这是理解 RSI 时非常重要的边界。


二十二、真正可能发生的事情,可能比“爆炸”更有意思

个人甚至认为:RSI 未必表现成突然出现一个“超级 AI”,它更可能表现成 研发周期逐渐缩短。比如:

时间迭代节奏
2025一年一个大版本
2026半年
2027三个月
2028一个月

然后某一天大家突然发现:

原来 AI 技术进步的时间尺度已经完全变了。

这才可能是真正意义上的“智能爆炸”。不是某一天突然 BOOM! 而是:

人类逐渐发现,自己已经跟不上下一代 AI 的迭代速度。


二十三、这也是为什么个人认为“速度”比“智商”更值得关注

个人们经常问:GPT、Claude、Gemini 谁更聪明?这当然重要。但如果讨论 RSI,还有一个更加重要的问题:

它们多久能变得更聪明一次?

假设:

模型能力变化花的时间
模型 A智商 100 → 110一年
模型 B智商 100 → 110一个月

那么真正改变世界的,可能不是模型 B 第一次出现时有多聪明,而是:模型 B 的下一代又需要多久?

如果:

graph LR
    A["100"] -->|"1 个月"| B["110"]
    B -->|"1 个月"| C["130"]
    C -->|"1 个月"| D["180"]
    D -->|"1 个月"| E["300"]

那么事情就完全不同了。


二十四、这其实也是这篇论文最深层的问题

它不是在问:

AI 会不会越来越聪明?

因为答案几乎已经确定。它真正问的是:

AI 会不会帮助个人们更快地制造更聪明的 AI?

如果答案是“不会”,那么 AI 发展依然主要受人类研发速度限制。如果答案是“会”,那么:

AI 进步速度就有可能成为一个动态变量。

这是完全不同的世界。


二十五、个人认为未来应该观察的不是“AI 末日倒计时”,而是几个非常朴素的数据

1. AI 自动完成 AI R&D 的比例

graph LR
    A["1%"] --> B["10%"]
    B --> C["30%"]
    C --> D["50%"]
    D --> E["80%"]
    E --> F["95%"]

2. AI 能独立工作的时间

graph LR
    A["5 分钟"] --> B["1 小时"]
    B --> C["8 小时"]
    C --> D["1 天"]
    D --> E["1 周"]
    E --> F["1 个月"]

3. AI 发现的研究成果是否真正泛化

而不是只针对 benchmark 优化。

4. AI 是否能自己发现新的 AI 算法

而不是只执行人类已经设计好的算法。

5. 最关键:下一代 AI 的研发周期是否越来越短

如果这些指标同时出现持续改善,那么 RSI 就不再只是理论上的讨论,它就开始变成一个:可以测量的工程现象。


二十六、所以,Hinton 真正值得听的地方,不是“他预测了什么”

而是:他正在提醒个人们换一个角度看 AI。

阶段个人们怎么看 AI
以前AI 是一种产品。
现在AI 是一种生产工具。
下一阶段AI 是生产 AI 的生产工具。

这三个阶段,看起来只差几个字,实际上完全不同。


二十七、最后用一句最简单的话总结

如果把 AI 比作汽车:

  • 普通 AI → 帮你开车。
  • 更强的 AI → 帮你造车。
  • 而 RSI 真正意味着 → AI 帮你造出更会造车的 AI。

然后这个新的 AI:

再造出更会造 AI 的 AI。

如果这个循环越来越快,那么真正发生变化的,就不只是 AI 的能力,而是:

AI 能力的增长速度。

这才是 Hinton 等人这篇论文真正值得关注的地方。

所以,与其问:

“AI 会不会智能爆炸?”

不如问一个更加工程化的问题:

“从今天开始,AI 是否已经开始显著缩短制造下一代 AI 所需要的时间?”

如果答案有一天变成:是,而且越来越明显。 那么 RSI 就不再是科幻概念,它会变成个人们每天都能观察到的现实。

而那一天真正值得担心的,可能也不是“AI 有没有超过人类”,而是:

人类还能不能跟上 AI 自己加速的速度。


二十八、RSI 和 Harness 的重要区别

RSI 是让 AI 越来越会“自己变强”;Harness 是让 AI 在“自己变强/自己干活”的过程中,始终被系统约束在可控轨道里。

如果你说的 Harness 是现在 AI Agent / Coding Agent 语境里的 “harness engineering(缰绳式工程)”,那它和 Hinton 等人讨论的 RSI(Recursive Self-Improvement,递归自个人改进),其实是两个方向完全不同、但恰好可以拼在一起的逻辑。

一句话:

RSI 是让 AI 越来越会“自己变强”;Harness 是让 AI 在“自己变强/自己干活”的过程中,始终被系统约束在可控轨道里。

可以把它理解成:

RSI: 能不能让马越来越强?

Harness: 马再强,缰绳怎么握?

1. 两者解决的问题不同

RSIHarness
核心问题AI 能不能递归提高自身能力?AI 如何可靠地完成复杂任务?
关注点能力增长行为控制
核心机制AI → 改进 → 更强 AI → 再改进AI → 工具 → 环境 → 检查 → 反馈
目标加速 intelligence / R&D提高可靠性、可控性、成功率
主要风险自个人加速失控Agent 跑偏、犯错、破坏系统
本质正反馈负反馈 / 闭环控制

这点非常重要。

2. RSI 是“正反馈”

RSI 最简单的数学直觉是:

graph LR
    A["AI 能力 ↑"] --> B["AI 研发能力 ↑"]
    B --> C["研发效率 ↑"]
    C --> D["下一代 AI 能力 ↑"]
    D --> E["研发能力进一步 ↑"]
    E --> F["……"]
    F -.-> B

这是一个正反馈回路。所以 RSI 最关心的是:

下一轮是不是比上一轮更快?

如果:

graph LR
    A["AI₁"] -->|"需要 1 年"| B["AI₂"]
    B -->|"需要 6 个月"| C["AI₃"]
    C -->|"需要 3 个月"| D["AI₄"]
    D -->|"需要 1 个月"| E["AI₅"]

那么真正发生变化的不是单纯的能力,而是:

能力增长的时间常数正在下降。

这才是所谓 intelligence explosion 最值得关注的地方。

3. Harness 恰恰反过来

Harness 的思路更像:

graph LR
    A["目标"] --> B["Agent"]
    B --> C["工具"]
    C --> D["执行"]
    D --> E["观察结果"]
    E --> F["验证"]
    F --> G["纠错"]
    G --> H["继续执行"]
    H -.-> D

也就是说:不要相信模型一次输出就是正确的。 而是给它:

  • 工具
  • 文件系统
  • Git
  • 测试
  • Linter
  • 编译器
  • 沙箱
  • 权限
  • 状态
  • Checkpoint
  • 回滚
  • 人工审批
  • 自动验证

让 Agent 在一个可控环境里面不断试错。这就是 Harness。所以 Harness 的底层思想其实很像:

不要试图让模型永远正确,而是让错误变得可检测、可恢复、可回滚。

这个思想非常工程化。

4. 一个特别好理解的例子

比如让 Claude Code / Codex:“重构整个支付系统。”

裸模型模式:

graph LR
    A["用户"] --> B["LLM"]
    B --> C["输出代码"]
    C --> D["结束"]

问题很明显。模型说:“完成了。”但到底有没有完成?不知道。

Harness 模式:

graph LR
    A["Agent"] --> B["写代码"]
    B --> C["编译 / Test"]
    C -->|"失败"| D["修复"]
    C -->|"成功"| E["下一任务"]
    D --> A

于是 Agent 不需要“神奇地一次写对”。它可以:写 → 测 → 错 → 修 → 测 → 修 → 成功。

这就是 Harness 最核心的价值。

5. 但这里出现一个很有意思的交叉点

Harness 其实可能成为 RSI 的基础设施。 这是个人认为这两个概念真正有意思的地方。因为 RSI 要实现:

graph LR
    A["AI"] --> B["自己研发"]
    B --> C["产生改进"]
    C --> D["验证改进"]
    D --> E["部署新版本"]
    E --> F["继续研发"]
    F -.-> B

这里面最难的事情之一就是:验证。 而 Harness 恰恰就是在解决:

如何让 Agent 在复杂环境中可靠地执行、验证、纠错。

所以未来可能形成:

graph LR
    A["RSI
能力递归增长"] --> B["AI Research Agent"] B --> C["Harness
执行 / 验证 / 约束"] C --> D["新实验 / 新模型"] D --> E["新 AI"] E --> A

所以:

Harness 可以看成 RSI 的“基础设施层”。

6. 甚至可以把它理解成“发动机”和“变速箱”

这个比喻个人觉得特别准确。

  • RSI 像 发动机越来越强,它解决:能不能产生越来越大的能力?
  • Harness 像 变速箱 + 刹车 + 方向盘 + 道路系统,它解决:这么强的动力,能不能稳定地转化成有效行动?

于是:

RSI = 能力增长

Harness = 能力控制与执行

一个负责 “越来越强”,一个负责 “越来越可靠”。

7. 更有意思的是,两者甚至存在某种“张力”

如果 Harness 太严格:

graph LR
    A["权限限制"] --> B["工具限制"]
    B --> C["审批"]
    C --> D["人工确认"]
    D --> E["Agent 自由度下降"]

那么 Agent 的研发效率可能下降。这对于 RSI 来说未必是好事。

反过来,如果 Harness 极度开放:

graph LR
    A["Agent"] --> B["无限工具"]
    B --> C["无限权限"]
    C --> D["无限实验"]
    D --> E["自主修改"]
    E --> F["自主部署"]

那么研发效率可能非常高。但:

可控性也可能迅速下降。

所以真正高级的系统不是“Harness 越强越好”,而是:

在安全边界内,把 Agent 的自由度最大化。

8. 这其实可以形成一个非常漂亮的控制理论结构

把 AI Agent 看成一个控制系统:

graph LR
    A["目标"] --> B["Agent"]
    B --> C["行动"]
    C --> D["环境"]
    D --> E["状态"]
    E --> F["Harness"]
    F --> G["反馈"]
    G --> B

这实际上就是一个:闭环控制系统。 Agent 不断行动,环境不断反馈,Harness 不断验证,Agent 根据反馈修正行为。

9. 而 RSI 是在这个闭环上再加一个“元循环”

普通 Agent:

graph LR
    A["Agent"] --> B["完成任务"]
    B --> C["反馈"]
    C --> D["修正行为"]
    D -.-> A

RSI:

graph LR
    A["Agent"] --> B["完成任务"]
    B --> C["总结经验"]
    C --> D["改进自己的研发能力"]
    D --> E["产生更强 Agent"]
    E --> F["完成更复杂任务"]
    F --> G["总结经验"]
    G -.->|"……"| D

于是出现:Loop inside Loop。 也就是:

graph LR
    A["Agent
(Harness 小循环)"] --> B["Action"] B --> C["Verify"] C --> D["Feedback"] D --> A D --> E["更强 Agent"] E --> F["更强 Harness"] F --> G["更强研发能力
(RSI 大循环)"] G -.-> A

这个结构(注意是小循环!)就非常有意思了。

10. 所以个人会这样给两者下定义

  • RSI: 让 AI 成为自己的研发者。
  • Harness: 让 AI 在成为自己的研发者之后,仍然能够被验证、约束和控制。

这两个东西其实不是竞争关系,反而可能是:

未来 Agentic AI 的两个正交维度。

11. 如果再往前推一步

未来真正厉害的 AI 系统,很可能不是一个“大模型”,而是:

graph LR
    A["人类目标"] --> B["Orchestrator"]
    B --> C["Agent Harness
权限 / 工具 / 状态
Sandbox / Test / Git
Verify / Rollback"] C --> D["Research Agents"] D --> E["AI R&D"] E --> F["新模型"] F --> G["新 Research Agent"] G --> H["RSI"] H --> I["……"]

所以个人甚至觉得:

如果 RSI 是“AI 自个人进化”的理论,那么 Harness 是把这种能力变成工程系统的现实路径之一。但从商业逻辑的角度来说,各个主流厂商应该会搞自己的一套标准😄。

而真正值得关注的未来,不是单纯 “模型 IQ 有多高?”,而是:

“一个 AI Agent 在 Harness 中,可以连续自主工作多久,并且还能可靠地产生下一代能力?”

如果这个时间从 10 分钟 → 1 小时 → 1 天 → 1 周 → 1 个月 不断增长,同时 AI 开始参与 AI 本身的研发,那么 RSI 才真正从论文里的假设,逐渐变成现实中的工程现象。

这两个概念放在一起,其实比单独讨论“AI 会不会失控”有意思得多。


附:参考相关原始论文资源

Alan Chan et al., What if automating AI R&D triggers an intelligence explosion?, arXiv:2609.36054, 2026. (arXiv)

这篇论文的作者名单中包括 Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki、Eric Horvitz、Dawn Song、Jeff Clune 等。论文核心讨论的是 AI R&D 自动化、研发回报、反馈循环以及由此可能产生的 intelligence explosion,而不是提出一个新的 RSI 模型或算法。(arXiv)

[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析

https://www.wdft.com/8560250d.html

Author

Jaco Liu

Posted on

2026-10-06

Updated on

2026-10-06

Licensed under