[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析
Geoffrey Hinton 参与的最新 RSI 相关论文,这篇论文真正有价值的地方,不是“AI 马上爆炸”这种标题党,而是它把一个以前比较玄乎科幻的问题,拆成了一个可以观察、测量、验证的工程问题:
当一种生产工具不仅能够生产财富,而且开始能够生产“更强的生产工具”时,问题就从效率问题升级成了增长函数本身的问题,也标志着是 AI 喧嚣之后进入可持续的产业逻辑。
AI 到底什么时候开始真正参与“制造下一代 AI”,并且这种参与能不能让下一代 AI 更快地制造再下一代 AI?
RSI 真正特殊的地方,不是“点石成金”,而是“点石成金的手指头开始自己制造手指头”要面临的问题。
AI 开始自己造 AI 之后,辛顿最新论文到底在担心什么?
最近,Geoffrey Hinton、Yoshua Bengio、Andrew Barto,以及 OpenAI、Anthropic、Microsoft 等机构的一批 AI 研究者共同发表了一篇非常值得注意的论文:《What if automating AI R&D triggers an intelligence explosion?》
直译过来就是:
如果 AI 自动化了 AI 研发,会不会引发一场“智能爆炸”?
这篇论文真正值得关注的地方,并不是“AI 会不会毁灭人类”这种已经被讨论很多年的问题。它提出了一个更加具体、也更加工程化的问题:
如果 AI 越来越擅长研究 AI,那么 AI 的进步速度本身,会不会开始加速?
这其实就是所谓的:Recursive Self-Improvement,RSI——递归自个人改进。
但个人认为,理解 RSI 最重要的第一步,就是不要把它想成:
“AI 修改自己的代码,然后自己变聪明。”
这其实太简单了。真正值得关注的是另外一个循环:
更强的 AI → 更强的 AI 研发能力 → 更快产生更强的 AI → 更强的 AI → ……
如果这个循环足够强,问题就不再只是“AI 每年进步多少”,而可能变成:
AI 的进步速度本身,也开始越来越快。
这才是 Hinton 等人真正担心的事情。
一、先不要被“智能爆炸”四个字吓到
“智能爆炸”听起来非常像科幻小说,但论文讨论的东西,其实可以非常朴素。
假设今天有一个 AI 实验室,里面有 100 个研究人员。他们每天干什么?
- 写代码
- 设计模型
- 清洗数据
- 设计实验
- 跑训练
- 分析结果
- 修改参数
- 研究新的算法
- 阅读论文
- 寻找失败原因
然后继续实验。这其实就是 AI 研发。
现在假设 AI 可以替代其中 10% 的工作,那么人类研究人员就可以把时间花在更重要的事情上。例如:原来一个研究员一天只能跑 10 个实验;现在 AI 帮他写代码、配置环境、跑实验、分析结果,这个研究员一天可能就能跑 100 个实验。
于是:研发效率提高。
这本身并不神奇。过去几十年的软件工程,本质上一直在做这件事情。
二、真正特殊的地方来了
问题在于:普通软件的研发效率提高,和 AI 研发效率提高,并不是完全一样的事情。
如果 AI 帮你做电商网站,效率提高 10 倍,很好。但这个网站本身并不会让你的 AI 变得更聪明。
可是,如果 AI 帮你研发 AI,情况就不一样了。假设:第一代 AI 能够帮助研究人员提高 20% 的 AI 研发效率,于是第二代 AI 被更快地研发出来。第二代 AI 又比第一代 AI 更擅长:
- 写训练代码
- 设计实验
- 分析实验
- 找模型问题
- 生成训练数据
- 优化训练方法
- 优化推理
- 设计新的 AI 算法
于是第二代 AI 又可以帮助人类更快制造第三代 AI,第三代 AI 又进一步提高 AI 研发效率。于是出现:
graph LR
A["AI 变强"] --> B["AI 研发效率提高"]
B --> C["下一代 AI 更快出现"]
C --> D["AI 研发效率进一步提高"]
D --> E["下一代 AI 更快出现"]
E -.->|"……"| A这才是真正的 RSI。
三、所以 RSI 的关键不是“自己修改自己”
这是理解这篇论文最重要的一点。很多人看到 Recursive Self-Improvement,会马上想到:
AI 修改自己的源代码。
其实没必要。只要一个系统的输出,能够提高下一轮制造更强系统的能力,就已经形成了某种意义上的递归改进。
例如:AI 帮助设计新的训练算法;新的训练算法制造出更强的 AI;更强的 AI 又帮助设计下一代训练算法。这已经形成了:
AI → AI R&D → 更强 AI → AI R&D
所以真正重要的不是:
“AI 有没有修改自己的代码?”
而是:
AI 是否开始成为 AI 研发过程中的生产力。
这两个概念差别非常大。
四、其实个人们已经走到了这个循环的入口
这也是个人认为这篇论文最值得认真看的地方。论文并没有简单地说:
“RSI 已经发生了。”
恰恰相反,作者非常清楚地指出:现在还没有证明真正的智能爆炸已经发生。 但是,AI 自动化 AI 研发的趋势已经非常明显。
论文引用的一个重要观察是:AI 已经大量参与 AI 公司自己的软件开发和研发流程。例如论文讨论到,Anthropic 报告称,2026 年 3 月时,AI 在高层监督下自主完成的内部 AI R&D 工作占比大约只有 **1%**,到 2026 年 8 月已经上升到 **26%**。(GovAI)
| 时间 | AI 在高层监督下自主完成的内部 AI R&D 工作占比 |
|---|---|
| 2026 年 3 月 | 约 1% |
| 2026 年 8 月 | 约 26% |
注意这里最重要的不是“26%”这个数字本身,而是:这个比例正在快速变化。
换句话说:AI 不再只是一个被研究的对象,AI 正在逐渐成为:
研究 AI 的工具。
这才是事情发生变化的地方。
五、一个非常简单的例子
假设个人们现在要训练一个模型。
传统方式:
graph LR
A["人类研究员"] --> B["提出想法"]
B --> C["写代码"]
C --> D["跑实验"]
D --> E["分析结果"]
E --> F["修改方案"]
F --> G["再跑实验"]这是一个典型的人类研发循环。
现在加入 AI:
graph LR
A["人类"] --> B["提出目标"]
B --> C["AI 设计实验"]
C --> D["AI 写代码"]
D --> E["AI 跑实验"]
E --> F["AI 分析结果"]
F --> G["AI 提出下一组实验"]
G --> H["人类审核"]如果 AI 能够越来越多地承担中间环节:
graph LR
A["人类"] --> B["目标"]
B --> C["AI"]
C --> D["实验"]
D --> E["结果"]
E --> F["AI"]
F --> G["新实验"]
G --> H["结果"]
H --> I["AI"]
I --> J["新模型"]那么人类逐渐从 “亲自做研发” 变成 “管理研发系统”。
六、而真正危险的地方,是“速度”
假设每一代 AI 都只是变强一点。例如:
| 代际 | 研发能力 |
|---|---|
| 第一代 | 研发能力 = 1 |
| 第二代 | 1.2 |
| 第三代 | 1.5 |
| 第四代 | 2 |
这没有什么特别恐怖的。因为虽然越来越强,但仍然是正常的技术进步。
真正值得关注的是:
| 代际 | 研发能力 |
|---|---|
| 第一代 | 研发能力 = 1 |
| 第二代 | 2 |
| 第三代 | 5 |
| 第四代 | 15 |
| 第五代 | 50 |
| 第六代 | 200 |
这时候发生的事情就完全不同了。因为:研发能力本身开始增长。 而研发能力增长,又进一步提高研发速度。于是形成了反馈。
这就是经济学和控制论里面非常经典的东西:
正反馈。
七、可以把它想象成一个“会自己升级的工厂”
这是个人觉得最容易理解 RSI 的比喻。假设你有一座工厂:第一天,工厂生产 100 台机器;第二天,工厂生产 110 台;第三天,120 台。
这只是普通增长。
但是,如果这些机器能够帮助工厂:
制造更先进的生产设备。
事情就开始不一样:
| 设备代际 | 每天产量 |
|---|---|
| 第一代设备 | 100 台 |
| 第二代设备 | 200 台 |
| 第三代 | 500 台 |
| 第四代 | 2000 台 |
这时候真正增长的已经不是产品数量,而是:
生产能力本身。
AI 的情况非常类似:
- 普通 AI → 帮你完成工作。
- 更强的 AI → 帮你制造更好的 AI。
- 再更强的 AI → 帮你制造更好的“制造 AI 的方法”。
这就是递归。
八、但是,这里有一个非常重要的“坑”
如果看到这里就认为:
“那 AI 肯定会无限爆炸。”
那就错了。这恰恰是这篇论文需要谨慎理解的地方。因为:
研发能力提高 ≠ AI 能力无限增长。
现实世界有大量瓶颈。
九、第一个瓶颈:真正困难的问题
AI 可以帮你写代码,但不是所有 AI 研发问题都只是写代码。真正困难的问题可能是:
- 到底应该研究什么?
- 哪个方向值得投入?
- 哪个实验有意义?
- 为什么这个实验失败?
- 一个新的理论到底是不是正确?
这些问题远比“帮个人写一个 Python 函数。”困难得多。因此:
自动化简单工作,并不等于自动化整个科学研究。
十、第二个瓶颈:实验需要时间
AI 可以非常快地写出一个训练程序,但模型训练可能需要几个小时、几天,甚至更长。GPU 也需要时间,数据也需要时间,实验设备也需要时间。
所以即使 AI 的“脑子”变快了:
现实世界的计算资源仍然是硬约束。
这也是为什么 RSI 不应该简单理解成:AI 变聪明 → 马上无限变聪明。现实世界没有这么理想。
十一、第三个瓶颈:算力
这是非常现实的问题。假设一个 AI 找到了一个非常好的训练算法,但训练下一代模型需要 10 万张 GPU,你没有,怎么办?AI 再聪明也没办法凭空制造出 GPU。
所以:智能不是唯一生产要素。 至少还包括:
- 算力
- 电力
- 数据
- 芯片
- 网络
- 实验设备
- 时间
- 资金
- 工程基础设施
这些东西都会成为 RSI 的摩擦力。
十二、第四个瓶颈:判断“什么是好”
这个可能是最关键的问题。假设 AI 自己提出了 10000 个新算法,问题来了:
哪个是真的好?
- 如果你有一个数学问题:答案可以自动验证。
- 如果你有一个程序:可以运行测试。
- 如果你有一个模型:可以跑 benchmark。
这类问题相对容易。但如果 AI 提出:一个新的 AI 理论。谁来判断?如果 AI 自己判断:“这个理论很好。”那么就产生了一个非常危险的问题:
谁来评价评价者?
十三、这其实是 RSI 最大的技术难题之一
你可以把 AI 自个人改进系统画成这样:
graph LR
A["AI"] --> B["提出改进"]
B --> C["实验"]
C --> D["评价"]
D --> E["选择"]
E --> F["更强 AI"]看起来非常漂亮。但真正关键的是:评价。
如果评价系统错了:AI 就可能优化错误目标。甚至:AI 可以学会“骗过评价系统”。于是:
graph LR
A["真正能力提升"] --> B["OK"]
C["只是在 benchmark 上作弊"] --> D["也 OK"]两者可能被混在一起。
所以 RSI 的核心问题之一,其实不是:AI 能不能自己改进?而是:
AI 能不能可靠地判断自己到底有没有变好?
十四、这就是为什么“递归”两个字非常重要
一次自个人优化:
graph LR
A["AI"] --> B["改进"]
B --> C["AI"]其实没什么惊天动地。真正重要的是:
graph LR
A["AI₁"] --> B["改进"]
B --> C["AI₂"]
C --> D["AI₂ 改进"]
D --> E["AI₃"]
E --> F["AI₃ 改进"]
F --> G["AI₄"]每一轮都把上一轮的成果作为下一轮的基础。于是:上一轮提高了下一轮的研发效率。 这才可能形成加速。
十五、论文真正关心的,其实是一个“乘数”
可以把事情极度简化成一个公式:
下一代 AI 的进步速度 = 研发投入 × 研发效率 × AI 自动化程度
而现在发生的变化是——
以前:
研发投入 ↑
现在:
- 研发投入 ↑
- 研发效率 ↑
- AI 自动化程度 ↑
如果 AI 自动化程度继续提高,那么有效研发力量可能增长得非常快。这就是为什么论文讨论 AI R&D automation,而不是简单讨论 AI capability。这两个东西并不是一回事。
十六、论文里一个很值得注意的推演
论文使用了一个非常关键的量:r:research returns,也就是研发投入带来的进步回报。
简单理解:如果研发力量增加 10%,最终得到的有效 AI 进步是否也能增加足够多?
| 条件 | 推演结果 |
|---|---|
| r < 1 | 研发投入虽然增加,但收益会越来越递减。这种情况下,“AI 帮 AI 做研发”也未必能够产生持续加速。 |
| r > 1 | 研发力量增长可能超过研发收益递减的速度。于是:更多 AI 研发能力 → 更多 AI 进步 → 更强 AI → 更多 AI 研发能力,反馈就可能越来越强。 |
论文基于历史 AI 进展数据讨论的中心估计大致落在 1.2–1.9 的范围,并在一组强假设下进行模型推演:如果未来完全自动化 AI R&D,同时这种回报关系持续成立且其他瓶颈不成为主导因素,那么进步速度可能出现非常明显的加速。论文给出的一个直观尺度是,在该模型条件下,大约一年半后,原本需要一年才能实现的进步可能压缩到大约五周。(alphaXiv)
但这里一定要加粗:这不是预测。 更不是:
“Hinton 预测一年半以后 AI 会爆炸。”
它是一个:条件模型。 也就是:
如果 A + B + C + D 全部成立,那么可能出现 E。
这和预测是两回事。
十七、个人认为这篇论文最值得警惕的,不是“AI 会不会爆炸”
而是另外一个问题:
个人们可能正在把“AI 研发”本身变成一种可以规模化复制的生产力。
以前一个顶级 AI 研究员就是一个人,一个人一天只有 24 小时。但是 AI Agent 不一样。假设一个 AI 研究 Agent 可以完成一个研究员 20% 的工作,你可以部署:100 个、1000 个、10000 个,甚至更多。
于是 AI 研发第一次出现了一种非常特殊的可能性:
研发人员数量不再完全由人类数量决定。
十八、这其实比“AI 会自己写代码”重要得多
AI 写代码已经不是新闻。真正重要的是:
AI 能不能复制研发劳动?
这是两个完全不同的层级:
- 普通 Coding Agent → 帮程序员写代码。
- Research Agent → 帮研究员做研究。
- 更进一步 → AI Research Agent 帮助制造更强的 AI Research Agent。
这才进入 RSI。
所以未来真正值得观察的指标,可能不是“某个模型 benchmark 提高了多少分?”,而是:
AI 完成 AI 研发任务的比例提高了多少?
以及:
AI 是否正在缩短下一代 AI 的研发周期?
十九、这里有一个非常关键的判断标准
个人认为未来判断 RSI 是否真正发生,可以简单看三个核心问题。
第一个问题:AI 能不能独立完成越来越长的 AI 研发任务?
不是“写一个函数”,而是“从提出假设,到设计实验,到实现,到运行,到分析,到提出下一步”。
第二个问题:AI 找到的改进能不能泛化?
不是“benchmark +10%”,而是“在没有针对性训练的情况下,新的研究能力仍然提高”。
第三个问题(最关键):AI 是否开始缩短下一代 AI 的研发周期?
例如:
- 过去:一年一个重大模型。
- 后来:半年一个。
- 然后:三个月、一个月、两周。
如果这种压缩是因为 AI 自己提高了 AI 研发效率,那么 RSI 的味道就越来越浓了。
二十、所以个人对这篇论文的看法是
个人不会把它理解成:
Hinton 说 AI 要爆炸了。
这种理解太粗糙。个人更愿意把它理解成:
AI 正在从“工具”变成“生产 AI 的生产工具”。
这是一个非常重要的变化。
过去:
graph LR
A["人类"] --> B["制造 AI"]现在:
graph LR
A["人类"] --> B["AI"]
B --> C["辅助制造 AI"]未来如果进一步发展:
graph LR
A["人类"] --> B["AI 研发系统"]
B --> C["AI"]
C --> D["更强 AI 研发系统"]
D --> E["更强 AI"]那么 AI 技术进步的速度,就可能不再主要由人类研究人员的数量决定,而开始由 机器能够多快地提高机器研发效率 决定。
二十一、不过,个人并不认为“智能爆炸”是必然事件
这是个人和很多过于激进的 RSI 叙事最大的区别。因为整个系统里面存在大量瓶颈:
graph LR
A["算法"] --> B["算力"]
B --> C["数据"]
C --> D["实验"]
D --> E["验证"]
E --> F["训练"]
F --> G["部署"]任何一个环节都可能卡住。尤其是:验证。
AI 可以生成 100 万个想法,但真正有价值的想法可能只有几个。如果没有可靠的验证机制:AI 产生更多想法,未必等于 AI 进步更快。
所以:
生成能力不是研发能力。
更进一步:
研发能力也不是科学发现能力。
这是理解 RSI 时非常重要的边界。
二十二、真正可能发生的事情,可能比“爆炸”更有意思
个人甚至认为:RSI 未必表现成突然出现一个“超级 AI”,它更可能表现成 研发周期逐渐缩短。比如:
| 时间 | 迭代节奏 |
|---|---|
| 2025 | 一年一个大版本 |
| 2026 | 半年 |
| 2027 | 三个月 |
| 2028 | 一个月 |
然后某一天大家突然发现:
原来 AI 技术进步的时间尺度已经完全变了。
这才可能是真正意义上的“智能爆炸”。不是某一天突然 BOOM! 而是:
人类逐渐发现,自己已经跟不上下一代 AI 的迭代速度。
二十三、这也是为什么个人认为“速度”比“智商”更值得关注
个人们经常问:GPT、Claude、Gemini 谁更聪明?这当然重要。但如果讨论 RSI,还有一个更加重要的问题:
它们多久能变得更聪明一次?
假设:
| 模型 | 能力变化 | 花的时间 |
|---|---|---|
| 模型 A | 智商 100 → 110 | 一年 |
| 模型 B | 智商 100 → 110 | 一个月 |
那么真正改变世界的,可能不是模型 B 第一次出现时有多聪明,而是:模型 B 的下一代又需要多久?
如果:
graph LR
A["100"] -->|"1 个月"| B["110"]
B -->|"1 个月"| C["130"]
C -->|"1 个月"| D["180"]
D -->|"1 个月"| E["300"]那么事情就完全不同了。
二十四、这其实也是这篇论文最深层的问题
它不是在问:
AI 会不会越来越聪明?
因为答案几乎已经确定。它真正问的是:
AI 会不会帮助个人们更快地制造更聪明的 AI?
如果答案是“不会”,那么 AI 发展依然主要受人类研发速度限制。如果答案是“会”,那么:
AI 进步速度就有可能成为一个动态变量。
这是完全不同的世界。
二十五、个人认为未来应该观察的不是“AI 末日倒计时”,而是几个非常朴素的数据
1. AI 自动完成 AI R&D 的比例
graph LR
A["1%"] --> B["10%"]
B --> C["30%"]
C --> D["50%"]
D --> E["80%"]
E --> F["95%"]2. AI 能独立工作的时间
graph LR
A["5 分钟"] --> B["1 小时"]
B --> C["8 小时"]
C --> D["1 天"]
D --> E["1 周"]
E --> F["1 个月"]3. AI 发现的研究成果是否真正泛化
而不是只针对 benchmark 优化。
4. AI 是否能自己发现新的 AI 算法
而不是只执行人类已经设计好的算法。
5. 最关键:下一代 AI 的研发周期是否越来越短
如果这些指标同时出现持续改善,那么 RSI 就不再只是理论上的讨论,它就开始变成一个:可以测量的工程现象。
二十六、所以,Hinton 真正值得听的地方,不是“他预测了什么”
而是:他正在提醒个人们换一个角度看 AI。
| 阶段 | 个人们怎么看 AI |
|---|---|
| 以前 | AI 是一种产品。 |
| 现在 | AI 是一种生产工具。 |
| 下一阶段 | AI 是生产 AI 的生产工具。 |
这三个阶段,看起来只差几个字,实际上完全不同。
二十七、最后用一句最简单的话总结
如果把 AI 比作汽车:
- 普通 AI → 帮你开车。
- 更强的 AI → 帮你造车。
- 而 RSI 真正意味着 → AI 帮你造出更会造车的 AI。
然后这个新的 AI:
再造出更会造 AI 的 AI。
如果这个循环越来越快,那么真正发生变化的,就不只是 AI 的能力,而是:
AI 能力的增长速度。
这才是 Hinton 等人这篇论文真正值得关注的地方。
所以,与其问:
“AI 会不会智能爆炸?”
不如问一个更加工程化的问题:
“从今天开始,AI 是否已经开始显著缩短制造下一代 AI 所需要的时间?”
如果答案有一天变成:是,而且越来越明显。 那么 RSI 就不再是科幻概念,它会变成个人们每天都能观察到的现实。
而那一天真正值得担心的,可能也不是“AI 有没有超过人类”,而是:
人类还能不能跟上 AI 自己加速的速度。
二十八、RSI 和 Harness 的重要区别
RSI 是让 AI 越来越会“自己变强”;Harness 是让 AI 在“自己变强/自己干活”的过程中,始终被系统约束在可控轨道里。
如果你说的 Harness 是现在 AI Agent / Coding Agent 语境里的 “harness engineering(缰绳式工程)”,那它和 Hinton 等人讨论的 RSI(Recursive Self-Improvement,递归自个人改进),其实是两个方向完全不同、但恰好可以拼在一起的逻辑。
一句话:
RSI 是让 AI 越来越会“自己变强”;Harness 是让 AI 在“自己变强/自己干活”的过程中,始终被系统约束在可控轨道里。
可以把它理解成:
RSI: 能不能让马越来越强?
Harness: 马再强,缰绳怎么握?
1. 两者解决的问题不同
| RSI | Harness | |
|---|---|---|
| 核心问题 | AI 能不能递归提高自身能力? | AI 如何可靠地完成复杂任务? |
| 关注点 | 能力增长 | 行为控制 |
| 核心机制 | AI → 改进 → 更强 AI → 再改进 | AI → 工具 → 环境 → 检查 → 反馈 |
| 目标 | 加速 intelligence / R&D | 提高可靠性、可控性、成功率 |
| 主要风险 | 自个人加速失控 | Agent 跑偏、犯错、破坏系统 |
| 本质 | 正反馈 | 负反馈 / 闭环控制 |
这点非常重要。
2. RSI 是“正反馈”
RSI 最简单的数学直觉是:
graph LR
A["AI 能力 ↑"] --> B["AI 研发能力 ↑"]
B --> C["研发效率 ↑"]
C --> D["下一代 AI 能力 ↑"]
D --> E["研发能力进一步 ↑"]
E --> F["……"]
F -.-> B这是一个正反馈回路。所以 RSI 最关心的是:
下一轮是不是比上一轮更快?
如果:
graph LR
A["AI₁"] -->|"需要 1 年"| B["AI₂"]
B -->|"需要 6 个月"| C["AI₃"]
C -->|"需要 3 个月"| D["AI₄"]
D -->|"需要 1 个月"| E["AI₅"]那么真正发生变化的不是单纯的能力,而是:
能力增长的时间常数正在下降。
这才是所谓 intelligence explosion 最值得关注的地方。
3. Harness 恰恰反过来
Harness 的思路更像:
graph LR
A["目标"] --> B["Agent"]
B --> C["工具"]
C --> D["执行"]
D --> E["观察结果"]
E --> F["验证"]
F --> G["纠错"]
G --> H["继续执行"]
H -.-> D也就是说:不要相信模型一次输出就是正确的。 而是给它:
- 工具
- 文件系统
- Git
- 测试
- Linter
- 编译器
- 沙箱
- 权限
- 状态
- Checkpoint
- 回滚
- 人工审批
- 自动验证
让 Agent 在一个可控环境里面不断试错。这就是 Harness。所以 Harness 的底层思想其实很像:
不要试图让模型永远正确,而是让错误变得可检测、可恢复、可回滚。
这个思想非常工程化。
4. 一个特别好理解的例子
比如让 Claude Code / Codex:“重构整个支付系统。”
裸模型模式:
graph LR
A["用户"] --> B["LLM"]
B --> C["输出代码"]
C --> D["结束"]问题很明显。模型说:“完成了。”但到底有没有完成?不知道。
Harness 模式:
graph LR
A["Agent"] --> B["写代码"]
B --> C["编译 / Test"]
C -->|"失败"| D["修复"]
C -->|"成功"| E["下一任务"]
D --> A于是 Agent 不需要“神奇地一次写对”。它可以:写 → 测 → 错 → 修 → 测 → 修 → 成功。
这就是 Harness 最核心的价值。
5. 但这里出现一个很有意思的交叉点
Harness 其实可能成为 RSI 的基础设施。 这是个人认为这两个概念真正有意思的地方。因为 RSI 要实现:
graph LR
A["AI"] --> B["自己研发"]
B --> C["产生改进"]
C --> D["验证改进"]
D --> E["部署新版本"]
E --> F["继续研发"]
F -.-> B这里面最难的事情之一就是:验证。 而 Harness 恰恰就是在解决:
如何让 Agent 在复杂环境中可靠地执行、验证、纠错。
所以未来可能形成:
graph LR
A["RSI
能力递归增长"] --> B["AI Research Agent"]
B --> C["Harness
执行 / 验证 / 约束"]
C --> D["新实验 / 新模型"]
D --> E["新 AI"]
E --> A所以:
Harness 可以看成 RSI 的“基础设施层”。
6. 甚至可以把它理解成“发动机”和“变速箱”
这个比喻个人觉得特别准确。
- RSI 像 发动机越来越强,它解决:能不能产生越来越大的能力?
- Harness 像 变速箱 + 刹车 + 方向盘 + 道路系统,它解决:这么强的动力,能不能稳定地转化成有效行动?
于是:
RSI = 能力增长
Harness = 能力控制与执行
一个负责 “越来越强”,一个负责 “越来越可靠”。
7. 更有意思的是,两者甚至存在某种“张力”
如果 Harness 太严格:
graph LR
A["权限限制"] --> B["工具限制"]
B --> C["审批"]
C --> D["人工确认"]
D --> E["Agent 自由度下降"]那么 Agent 的研发效率可能下降。这对于 RSI 来说未必是好事。
反过来,如果 Harness 极度开放:
graph LR
A["Agent"] --> B["无限工具"]
B --> C["无限权限"]
C --> D["无限实验"]
D --> E["自主修改"]
E --> F["自主部署"]那么研发效率可能非常高。但:
可控性也可能迅速下降。
所以真正高级的系统不是“Harness 越强越好”,而是:
在安全边界内,把 Agent 的自由度最大化。
8. 这其实可以形成一个非常漂亮的控制理论结构
把 AI Agent 看成一个控制系统:
graph LR
A["目标"] --> B["Agent"]
B --> C["行动"]
C --> D["环境"]
D --> E["状态"]
E --> F["Harness"]
F --> G["反馈"]
G --> B这实际上就是一个:闭环控制系统。 Agent 不断行动,环境不断反馈,Harness 不断验证,Agent 根据反馈修正行为。
9. 而 RSI 是在这个闭环上再加一个“元循环”
普通 Agent:
graph LR
A["Agent"] --> B["完成任务"]
B --> C["反馈"]
C --> D["修正行为"]
D -.-> ARSI:
graph LR
A["Agent"] --> B["完成任务"]
B --> C["总结经验"]
C --> D["改进自己的研发能力"]
D --> E["产生更强 Agent"]
E --> F["完成更复杂任务"]
F --> G["总结经验"]
G -.->|"……"| D于是出现:Loop inside Loop。 也就是:
graph LR
A["Agent
(Harness 小循环)"] --> B["Action"]
B --> C["Verify"]
C --> D["Feedback"]
D --> A
D --> E["更强 Agent"]
E --> F["更强 Harness"]
F --> G["更强研发能力
(RSI 大循环)"]
G -.-> A这个结构(注意是小循环!)就非常有意思了。
10. 所以个人会这样给两者下定义
- RSI: 让 AI 成为自己的研发者。
- Harness: 让 AI 在成为自己的研发者之后,仍然能够被验证、约束和控制。
这两个东西其实不是竞争关系,反而可能是:
未来 Agentic AI 的两个正交维度。
11. 如果再往前推一步
未来真正厉害的 AI 系统,很可能不是一个“大模型”,而是:
graph LR
A["人类目标"] --> B["Orchestrator"]
B --> C["Agent Harness
权限 / 工具 / 状态
Sandbox / Test / Git
Verify / Rollback"]
C --> D["Research Agents"]
D --> E["AI R&D"]
E --> F["新模型"]
F --> G["新 Research Agent"]
G --> H["RSI"]
H --> I["……"]所以个人甚至觉得:
如果 RSI 是“AI 自个人进化”的理论,那么 Harness 是把这种能力变成工程系统的现实路径之一。但从商业逻辑的角度来说,各个主流厂商应该会搞自己的一套标准😄。
而真正值得关注的未来,不是单纯 “模型 IQ 有多高?”,而是:
“一个 AI Agent 在 Harness 中,可以连续自主工作多久,并且还能可靠地产生下一代能力?”
如果这个时间从 10 分钟 → 1 小时 → 1 天 → 1 周 → 1 个月 不断增长,同时 AI 开始参与 AI 本身的研发,那么 RSI 才真正从论文里的假设,逐渐变成现实中的工程现象。
这两个概念放在一起,其实比单独讨论“AI 会不会失控”有意思得多。
附:参考相关原始论文资源
Alan Chan et al., What if automating AI R&D triggers an intelligence explosion?, arXiv:2609.36054, 2026. (arXiv)
这篇论文的作者名单中包括 Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki、Eric Horvitz、Dawn Song、Jeff Clune 等。论文核心讨论的是 AI R&D 自动化、研发回报、反馈循环以及由此可能产生的 intelligence explosion,而不是提出一个新的 RSI 模型或算法。(arXiv)
[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析
![[RSI]关于 Geoffrey Hinton 最新 2026 年 10 月参与论文 RSI 解读和警告解析](/assets/images/ai-logo.png)
