Situational Awareness
出处:Leopold Aschenbrenner《Situational Awareness: The Decade Ahead》(2024-06) https://situational-awareness.ai/
全书论证链条:2027 年 AGI 可信(I)→ AGI 一年内自举为超级智能(II)→ 这需要万亿美元集群、实验室级安保、超对齐、自由世界领先(IIIa–IIId)→ 所以政府必然接管,2027/28 年将出现国家 AGI 项目(IV)。
I. From GPT-4 to AGI: Counting the OOMs
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第一章 https://situational-awareness.ai/from-gpt-4-to-agi/
一句话论点:AGI 到 2027 年是 “strikingly plausible”(惊人地可信)的。GPT-2 → GPT-4 用 4 年走完了「学龄前儿童 → 聪明高中生」;沿着算力(~0.5 OOM/年)、算法效率(~0.5 OOM/年)和 “unhobbling”(聊天机器人 → agent)三条趋势线外推,2027 年前应该再来一次同等规模的质变跳跃。
引言
- 开篇引用 Ilya Sutskever(约 2015 年,经 Dario Amodei 转述):「你要明白,这些模型,它们就是想学习。(The models, they just want to learn.)」
- GPT-4 的能力(写代码、写论文、解难题、通过大学考试)让许多人震惊,但它只是深度学习十年狂奔的延续:十年前模型勉强能认猫狗图片,四年前 GPT-2 勉强能拼句子
- 一直有人早就看到了这条路——他们被嘲笑,但他们只是相信趋势线,而且他们对了
- 方法论:数 OOM(OOM = order of magnitude,数量级;10x = 1 OOM,3x ≈ 0.5 OOM)。把进步拆成三个可量化来源:
- 算力(Compute):用更大的计算机训练
- 算法效率(Algorithmic efficiencies):作为”算力乘数”的算法进步,可以统一折算进「有效算力(effective compute)」
- Unhobbling(去枷锁):模型默认被各种愚蠢方式束缚着;RLHF、思维链、工具、脚手架等简单改进能解锁潜在能力,带来实用性的阶跃
- GPT-4 发布后公开上安静了一年(下一代还在锅里炖),有人借机宣布「深度学习撞墙了」——但数一数 OOM 就知道该期待什么:4 年内再来 ~100,000 倍有效算力
- 关键:这不只是「更好的聊天机器人」。摘掉 unhobbling 的低垂果实后,得到的更像即插即用的远程员工替代品(drop-in remote worker replacements)
- 更重要的推论:如果这些系统能自动化 AI 研究本身,将启动强烈的反馈循环(本系列下一章的主题)
- 「如果你总是被 AI 的能力吓到,那就开始数 OOM 吧。」
第 1 章 过去四年(The last four years)
1.1 GPT-2 → GPT-4
作者承认”AI 能力 vs 人类智能”的类比不完美但有信息量:
GPT-2(2019)≈ 学龄前儿童——「哇,它能拼出几句像样的话」
- 当年的招牌演示是一篇(精挑细选的)关于安第斯山独角兽的半连贯故事
- 实际水平:数数到 5 都会绊倒;做文章摘要仅勉强胜过「随机抽 3 句话」
- 脚注里的著名例子:让 GPT-2 列「我最喜欢的 10 种动物」,它输出「背上有白色伤疤的斑马、阴险的蜘蛛和章鱼、长着鳞片的玄凤鹦鹉……」
GPT-3(2020)≈ 小学生——「哇,给几个 few-shot 例子它就能做些简单有用的事」
- 多段落连贯性大幅提升;能改语法、做非常基础的算术、用编造的新词造句、进行更丰富的往复式讲故事、写极简单的代码
- 第一次有了狭窄的商业用途:如生成 SEO / 营销文案
- (注意:这里说的是笨重的老 GPT-3,不是 ChatGPT 背后大幅改进的 GPT-3.5)
GPT-4(2023)≈ 聪明的高中生——「哇,它能写相当复杂的代码并迭代调试,能就复杂主题写得聪明老练,能推理高中竞赛数学」
- 从代码到数学到费米估算,它能思考和推理;作者日常工作(写代码、改稿)已离不开它
- 「Sparks of AGI」论文的例子:写复杂代码并画图、解 AP 数学题、解相当复杂的编程问题
- 从 AP 考试到 SAT,GPT-4 超过绝大多数高中生。而且 GPT-3.5 → GPT-4 仅一年,就常常把人类百分位从「远低于中位数」拉到「顶端」
- 能力仍然参差(某些任务远超聪明高中生,某些还做不了),但作者认为这些局限多数来自模型被束缚(hobbled)的明显方式,而非原始智能不足
1.2 深度学习的趋势(The trends in deep learning)
- 过去解决一个广泛使用的基准要几十年,现在感觉只要几个月。我们简直要把基准测试用光了
- MMLU 轶事:作者的朋友 Dan 和 Collin 2020 年做了 MMLU,希望它像「给高中生和大学生的所有最难考试的合集」一样经得住时间考验——仅 3 年后基本被解决(GPT-4 和 Gemini ~90%)
- MATH 基准(高中竞赛数学,2021 发布):
- 当时最好的模型只对 ~5%
- 原论文写道:「如果 scaling 趋势继续,仅靠增加预算和参数量对强数学推理是不现实的……可能需要来自更广泛研究社区的全新算法进展」
- 2021 年 8 月专业预测者预测 2022 年 6 月的成绩:连预测区间上限都远低于实际值;ML 研究者中位数更悲观
- 实际:一年内(2022 年中)5% → 50%;如今 >90%,基本解决
- 「过去十年 AI 的教训只有一条:永远不要跟深度学习对赌。」(怀疑者年复一年宣称「深度学习做不了 X」,然后被迅速打脸)
- 现在最难的未解基准是 GPQA(博士级理化生题):题目对外行如同天书,其他领域的博士用 Google 查 30 分钟也只比瞎猜略好。Claude 3 Opus ~60%,对口领域博士 ~80%——作者预计一两代模型内也会沦陷
第 2 章 数数量级(Counting the OOMs)
深度学习的魔力在于它就是有效(it just works)——每增加一个 OOM 的有效算力,模型就可预测地、可靠地变强。能数出 OOM,就能(粗略地、定性地)外推能力。这正是少数有先见者预见 GPT-4 的方法。
2.1 算力(Compute)
Epoch AI(广受尊重的 AI 趋势分析机构)的公开估算:
| 模型 | 估算训练算力 | 增长 |
|---|---|---|
| GPT-2 (2019) | ~4e21 FLOP | — |
| GPT-3 (2020) | ~3e23 FLOP | + ~2 OOM |
| GPT-4 (2023) | 8e24 ~ 4e25 FLOP | + ~1.5–2 OOM |
- GPT-4 的原始训练算力约为 GPT-2 的 3,000–10,000 倍
- 很多人以为这是摩尔定律——错。摩尔定律鼎盛期也不过 1–1.5 OOM/十年;现在的算力扩张速度接近它的 5 倍,靠的是巨额投资(过去在单个模型上花 100 万美元是天方夜谭,现在只是零钱)
- GPT-2 → GPT-3 是一次特殊的快速扩张(把小实验放大到整个数据中心,属于「算力悬置」的释放);GPT-3 → GPT-4 进入现代模式:给下一代模型专门新建更大的集群
- 长期趋势:一个半世纪(15 年)以来前沿系统训练算力 ~0.5 OOM/年
- 外推到 2027 年底:+2 OOM(数百亿美元集群)非常可能;+3 OOM(千亿美元级,传闻 Microsoft/OpenAI 在建)也说得通——详见本系列 IIIa《Racing to the Trillion-Dollar Cluster》
2.2 算法效率(Algorithmic efficiencies)
巨额算力投资吸走了所有注意力,但算法进步的重要性大致相当,且被严重低估。
震撼的例子:在 MATH 基准上达到 ~50% 准确率的推理成本,两年内下降近 3 OOM(1000 倍)。(对照:一位不太喜欢数学的 CS 博士生得 40 分,所以 50% 已经不低。)
作者区分两类算法进步:
- 范式内(within-paradigm):直接让基座模型更好,等价于算力乘数(本节)——例如某算法让同样性能只需 1/10 训练算力,就是 +1 OOM 有效算力
- 范式扩展(paradigm-expanding / application-expanding):解锁基座模型能力(后面的 unhobbling)
长期趋势证据:
- ImageNet(研究基本公开,数据最好):2012–2021 九年间稳定 ~0.5 OOM/年,即 4 年后同样性能只需 ~1/100 的算力(Erdil & Besiroglu 2022)
- LLM:Epoch AI 新工作复现了同样方法,估计 2012–2023 也是 ~0.5 OOM/年(8 年 ~4 OOM;误差棒更宽,且没捕捉到最近的进展——因为头部实验室不再发表算法效率数据)
GPT-3 以来公开可知/可推断的收益:
- API 价格推断:
- GPT-4 发布价 ≈ GPT-3 发布价,性能却是天壤之别 → 用 scaling laws 粗算,GPT-3 → GPT-4 的有效算力提升约一半来自算法改进
- GPT-4 发布一年后,GPT-4o 又把价格降到 1/6(输入)和 1/4(输出)
- Gemini 1.5 Flash 提供「GPT-3.75 级」到 GPT-4 级的性能,价格是原版 GPT-4 的 1/85(输入)/ 1/57(输出)
- Chinchilla scaling laws:一项就带来 3x+(0.5 OOM+)效率
- MoE(Mixture of Experts):Gemini 1.5 Pro 宣称用「显著更少」的算力胜过 1.0 Ultra,MoE 是重点架构变化;多篇论文也报告可观的算力倍数
- 架构、数据、训练栈上无数小改进持续累积
小结:GPT-2 → GPT-4 含 1–2 OOM 算法效率收益;到 2027 年底预期再来 1–3 OOM(最佳猜测 ~2)。低垂果实会越摘越少,但实验室在资金和人才上的投入也在猛增;高端情形甚至可能出现 Transformer 级别的根本性突破。
2.2.1 数据墙(The data wall)
这一切的重要变数:互联网数据快用完了。
- Llama 3 已用了 15T+ token 训练;Common Crawl 原始 >100T token,但大量是垃圾和重复——简单去重后约 30T,意味着 Llama 3 基本已经用光
- 具体领域更少:公开 GitHub 仓库估计只有低万亿级 token
- 重复数据只能撑一阵:学术研究发现 16 个 epoch 后收益骤降至零
- 直白地说:我们一直在冲浪「语言建模-预训练范式」的浪,没有新东西的话,这个范式(至少朴素版)会耗尽——投资再大也会平台化
为什么作者仍乐观:
- 业内人士普遍看多。Dario Amodei(Anthropic CEO)在播客上说:「朴素地看我们离数据耗尽不远了……但我猜这不会成为阻碍……办法有很多。」各实验室都在下重注(合成数据、self-play、RL 方向),只是结果都保密不发表了
- 样本效率的直觉论证(人类读一本高密度数学教科书的方式):
- 现在的 LLM 训练 = 飞速掠读,文字呼啸而过,不花脑力
- 而你我会:慢慢读几页 → 在脑内自言自语、和学习伙伴讨论 → 做练习题、失败、换方法再试、拿反馈迭代 → 直到「开窍」
- 如果只被允许像 LLM 那样掠过,你我也学不到什么
- 合成数据 / self-play / RL 本质上就是想把「内心独白、找伙伴讨论、做题试错」这些机制装进训练里
- 旧方法简单朴素但有效,所以没人认真攻过样本效率。现在它将成为约束,实验室会砸数十亿美元和最聪明的头脑去攻。深度学习的惯例是:细节要费大劲调对,但最终「简单显然的东西就是能行」
- 突破可能反而带来大幅提升(intuition pump):现在的前沿模型大部分训练算力花在电商、SEO 之类的互联网垃圾上。想象把 GPT-4 级算力全部花在极高质量数据(比如人们攻克科学难题的推理链)上——模型可能强得多
- AlphaGo 先例:
- 第一步:对人类高手棋谱做模仿学习(打基础)
- 第二步:自我对弈几百万局 → 超越人类(李世石之战著名的第 37 手,人类永远不会下的妙手)
- 给 LLM 造出「第二步」是突破数据墙的关键研究问题——而且最终也是超越人类智能的关键
结论:数据约束给预测注入很大的双向误差棒——确实可能停滞(LLM 也许仍像互联网一样重要,但到不了真正疯狂的 AGI);但作者的基准判断是实验室会攻克它,而且攻克后不只是延续曲线,还可能带来能力大跃升。
附带推论:以前最先进技术是公开的,大家做的事差不多,新玩家和开源很容易追平前沿。现在关键算法思想越来越专有 → 未来几年实验室之间的方差会拉大(看起来在前沿的实验室可能卡在数据墙上,别人突破后绝尘而去),开源会更难跟上。谁先搞定,其突破就是通往 AGI 和超级智能的钥匙——美国最珍贵的机密之一。
2.3 Unhobbling(去枷锁)
最难量化、但同样重要的一类进步。
开场类比:想象解一道难数学题时,你必须立刻说出脑中冒出的第一个念头。除了最简单的题你都会答砸——但直到不久前,我们就是这么让 LLM 解题的。
已经发生的 unhobbling(这些算法改进往往只用预训练算力的一小部分):
- RLHF:坊间以为 RLHF 只是过滤脏话,实际上它是让模型真正有用、有商业价值的关键(不是预测随机互联网文本,而是真的调动能力回答你的问题)。ChatGPT 的魔法就是做得好的 RLHF。InstructGPT 论文量化:RLHF 过的小模型在人类偏好上 ≈ 未 RLHF 的 100 倍大模型
- 思维链(CoT):两年前才开始被广泛使用;数学/推理问题上等价于 >10x 有效算力
- Scaffolding(脚手架):可以理解为 CoT++——一个模型定计划、另一个提出若干方案、再一个批评改进。HumanEval 上带脚手架的 GPT-3.5 胜过裸 GPT-4;SWE-Bench(真实软件工程任务)上 GPT-4 裸跑 ~2%,Devin 的 agent 脚手架下跳到 14–23%
- 工具:想象人类不许用计算器和电脑。ChatGPT 现在能用浏览器、跑代码——但这只是开始
- 上下文长度:GPT-3 2k → GPT-4 发布时 32k → Gemini 1.5 Pro 1M+。小模型 + 100k 相关上下文能胜过大模型 + 4k 上下文——更长上下文实质上是巨大的算力效率增益。上下文也是许多应用的解锁钥匙(编码要装下大半个代码库;写工作文档要有内部文档和对话背景)。Gemini 1.5 Pro 甚至只靠把词典和语法书放进上下文,就从零学会了一门互联网上不存在的低资源语言
- 发布后的 posttraining 改进:据 John Schulman,现在的 GPT-4 比发布版强很多:MATH ~50%→72%、GPQA ~40%→~50%、LMSYS 上 近 100 点 Elo 提升(相当于 Claude 3 Haiku 和 Opus 之间的差距——两者价差 ~50 倍)
量化汇总:
- Epoch AI 调研:脚手架、工具使用等技术在许多基准上通常带来 5–30x 有效算力增益
- METR 的 agent 任务集(同一个 GPT-4 基座):裸基座 5% → 发布版 posttraining 20% → 如今(更好的 posttraining + 工具 + 脚手架)近 40%
- 很难与算力/算法效率放到同一把尺上,但显然量级相当。加总来看,算法进步(效率 + unhobbling)可能占当前趋势收益的大头
今天的模型仍被重重束缚:
- 没有长期记忆
- 不能用电脑(工具仍然极其有限)
- 基本上不先思考再说话(让 ChatGPT 写文章 = 让人用第一反应的意识流写文章)
- (大多)只能进行简短往复对话,而不能离开一天/一周去思考问题、研究不同方案、咨询他人,然后交回一份长报告或 PR
- 不针对你或你的应用做个性化(只是套着短提示词的通用聊天机器人,没有你公司和工作的背景)
关键警告:直接想象「GPT-6 版 ChatGPT」是完全错误的。unhobbling 持续推进的话,改进将是相对「GPT-6 + RLHF」的阶跃——到 2027 年,你面对的不是聊天机器人,而是更像 agent、像同事的东西。
2.3.1 从聊天机器人到 Agent 同事(From chatbot to agent-coworker)
未来几年有雄心的 unhobbling 长什么样?三个关键配料:
① 解决「入职问题」(onboarding problem)
- GPT-4 有足够的原始智力做许多人工作中相当大的一块,但它像一个 5 分钟前刚到岗的聪明新员工:没有相关上下文,没读过公司文档和 Slack 历史,没跟团队交谈过,没花时间理解内部代码库
- 聪明新人到岗 5 分钟没什么用,但入职一个月后就很有用了
- 路径:例如通过超长上下文,把模型像新同事一样「入职」——仅此一项就是巨大解锁
② 测试时算力悬置(test-time compute overhang)
- 现在模型只能做短任务:你问、它答。但人类大多数有用的认知工作是长视野的——不是 5 分钟,而是数小时、数天、数周、数月
- 只能思考 5 分钟的科学家做不出突破;只能写一个函数骨架的软件工程师没什么用——真实的工程师拿到大任务后会定计划、理解代码库、逐模块写和测、调试、在方案空间中搜索,数周工作最后汇成一个大 PR
- 把每个 GPT-4 token 想成思考问题时内心独白的一个词。每个 token 都挺聪明,但现在只能连贯地有效使用 几百个 token 的思维链:
| 思考 token 数 | 相当于人类连续工作 | |
|---|---|---|
| 几百 | 几分钟 | ← ChatGPT(我们在这) |
| 几千 | 半小时 | |
| 几万 | 半个工作日 | +1 OOM |
| 几十万 | 一个工作周 | +2 OOM |
| 几百万 | 数个月 | +4 OOM |
(按人类思考 ~100 token/分钟、每周 40 小时折算)
- 即使「每 token 智能」不变,这也是聪明人花几分钟 vs 花几个月的差别。解锁「思考数月当量」将是疯狂的能力跳跃,这里悬置着好多个 OOM
- 现状:长上下文的进展基本只对 消费 token(读) 有效,对 生产 token(写/干活) 无效——生成一阵后模型就脱轨或卡住,还不能独自离开去攻一个项目
- 但解锁它可能只需要相对小的 unhobbling 式算法胜利:也许一点 RL 就能教会模型纠错(「嗯,这不对,我再检查一下」)、定计划、搜索可能的方案。模型已经具备大部分原始能力,只是需要学几个把一切串起来的额外技能——本质上是教会模型一种 System II 外层循环
- 成功的话:不再是几段话的聊天回复,而是几百万字的思考流(快得你读不过来),模型自己思考问题、用工具、试不同方法、做研究、修改成果、与他人协调、独立完成大项目
- 其他领域的换算证据(Jones 2021,棋类游戏 Hex):小模型给更多「思考时间」能匹敌大得多的模型;该领域约 1.2 OOM 测试时算力 ≈ 1 OOM 训练算力。如果 LLM 也有类似关系,解锁 +4 OOM 测试时算力 ≈ +3 OOM 预训练算力——大致相当于 GPT-3 → GPT-4 的跳跃
③ 使用电脑(Using a computer)
- 三者中最直接的一个。现在的 ChatGPT 像坐在隔离盒子里、只能发短信联系的人
- 早期 unhobbling 教模型用一个个孤立工具;多模态成熟后可以一步到位:让模型像人一样用电脑——进 Zoom 会议、上网查资料、给人发消息和邮件、读共享文档、用你的应用和开发工具
- (要在长视野循环里用好这些,需与测试时算力的解锁相辅相成)
终点:drop-in remote worker(即插即用的远程员工)
- 一个加入你公司的 agent:像新员工一样入职,在 Slack 上跟你和同事沟通,用你们的软件,提 PR,接到大项目后能做「人类离开数周独立完成项目」的模型版
- 解锁这些可能需要比 GPT-4 更好的基座,但可能不需要好太多——大量的果汁就藏在修复那些明显而基础的束缚里
- 早期预告片:Devin(通往全自动软件工程师路上、释放”agency 悬置”的早期原型)。作者不确定 Devin 实际效果如何,且演示仍很有限,但它预示了即将到来的东西
「音爆」效应(sonic boom):从现在到 drop-in remote worker 之间的中间态模型,需要大量苦活(schlep)去改造工作流、搭集成设施才能榨出经济价值;而 drop-in remote worker 集成起来极其容易——直接「放进去」自动化所有可远程完成的工作。很可能苦活比 unhobbling 更慢:等远程员工形态到来时,中间态模型还没被充分集成利用——经济价值的跃升可能是不连续的。
第 3 章 未来四年(The next four years)
把数字放在一起:
| GPT-2 → GPT-4(4 年) | GPT-4 → 2027(4 年,预测) | |
|---|---|---|
| 基础有效算力(物理算力 + 算法效率) | ~4.5–6 OOM | 3–6 OOM,最佳猜测 ~5 OOM |
| Unhobbling | 基座模型 → 聊天机器人 | 聊天机器人 → agent / 即插即用远程员工 |
- 直观化:假设 GPT-4 训练花了 3 个月——2027 年,头部实验室能在 1 分钟内训出 GPT-4 级模型
- GPT-2 → GPT-4 = 学龄前儿童 → 聪明高中生。如果再跨一次同样的智能差距,会到哪里? 不应惊讶于它带我们走得非常非常远——很可能是超越博士和领域最强专家的模型
- 妙喻:「AI 进步的速度大约是儿童发育的 3 倍。你的 3 倍速小孩刚刚高中毕业——转眼就要抢你的工作了!」
- 再次强调:别想象「聪明得离谱的 ChatGPT」——unhobbling 意味着它更像即插即用的远程员工:会推理、会规划、会纠错、了解你和你公司的一切、能独立在一个问题上工作数周的超聪明 agent
- 我们正走在 2027 年 AGI 的轨道上。这些 AI 系统基本上将能自动化所有认知类工作(想:一切可以远程完成的工作)
误差棒很大,作者明说了几种可能:
- 数据耗尽而算法突破比预期难 → 进展停滞
- unhobbling 走不到头 → 只得到「专家级聊天机器人」而非「专家级同事」
- 十年趋势线断裂、深度学习这次真撞墙
- 反方向:算法突破(哪怕只是释放测试时算力悬置的简单 unhobbling)成为范式转移,让 AGI 更早到来
AGI 的定义之争:现在很多人把 AGI 向下定义成「很好的聊天机器人」。作者的定义:能完全自动化他或他朋友的工作、能完整做 AI 研究员/工程师工作的系统。机器人学可能默认更慢;医疗、法律等行业的社会铺开可能被社会选择或监管拖慢——但都不重要:一旦模型能自动化 AI 研究本身,就足够启动强反馈循环——自动化的 AI 工程师会自己解决剩下的所有瓶颈。数百万自动研究员非常可能把十年的算法进步压缩到一年以内。「AGI 只是随后而来的超级智能的一小口预尝。」(下一章主题)
结尾的具体预言:每一代新模型都会让大多数旁观者目瞪口呆——很快模型将解决要花博士数天的科学难题、在你的电脑上到处飞地做你的工作、从零写出百万行代码库、每一两年产生的经济价值翻 10 倍。「别管科幻了,数 OOM 吧:这才是我们应该期待的。……我们即将在 2027 年底前再做一次 100,000 倍+。它们比我们聪明的日子不会远了。」
附录 Racing through the OOMs:It’s this decade or bust
作者自述曾对短时间线更怀疑:给「这个十年」压那么多 AGI 概率质量,看起来像经典的「我们最特殊」谬误,不确定性应该摊得更开。
改变想法的关键:对 AGI 的不确定性应该放在「还差几个 OOM(有效算力)」上,而不是「还差几年」上。而 OOM 的产出在时间上极不均匀:
- 摩尔定律鼎盛期也只有 1–1.5 OOM/十年
- 现在:4 年 ~5 OOM,这个十年合计 ~10 OOM
- 2030 年代初以后,将进入缓慢的爬坡(slow slog)
为什么这个十年在吃一次性红利:
- 支出扩张:在单个模型上花 100 万美元曾是天方夜谭 → 这个十年末将有 $100B 甚至 $1T 集群。再往上很难了——那已经接近可行极限(大企业能负担的上限,占 GDP 的比例也到头了)。此后只剩 ~2%/年 的实际 GDP 增长可以搭
- 硬件收益:AI 硬件一直比摩尔定律快得多——因为在为 AI 工作负载做专用化(CPU → GPU;为 Transformer 适配芯片;数字精度从 fp64/fp32 降到 H100 的 fp8)。但到本十年末将有完全专用化的 AI 芯片,摩尔定律之外的收益所剩无几
- 算法进步:这个十年实验室在算法研发上投数百亿美元、全世界最聪明的人都扑上来摘低垂果实。之后不太会撞硬性上限(不过 unhobbling 类收益大概率是有限的),但增速必然放缓(钱和人才的高速增长不可持续——聪明的 STEM 人才大都已在做 AI)。(这一条最难预测,是 2030 年代 OOM 估算不确定性的主要来源)
结论:接下来十年冲过的 OOM,比其后几个十年加起来还多。
- 也许够了——我们很快得到 AGI;也许不够——那就是漫长的爬坡
- 对 AGI 中位时间可以合理分歧(取决于你认为 AGI 需要多少 OOM),但众数(modal)AGI 年份应该就在这个十年内
- 「如果这波扩张在未来 5–10 年内到不了 AGI,它可能就还很遥远」
- 相关可视化:Matthew Barnett 基于算力和生物学界限的图,结论类似
附:批判性阅读备忘
- 全文最强的部分是历史趋势的实证(算力、算法效率两条 0.5 OOM/年 的线,各有 Epoch AI 的公开数据背书);最弱的部分是 unhobbling 能否兑现 agent 化——这一步没有趋势线可外推,属于定性判断
- 「数据墙可解」主要依赖业内人士的乐观表态和 AlphaGo 类比,无公开证据(各实验室结果保密)——作者自己也承认这是双向大误差棒
- 站在 2026 年回看这份 2024 年中的预测:test-time compute overhang 的判断已被推理模型(o1/o3、扩展思考)验证——「教会模型 System II 外层循环可能只需要一点 RL」这句几乎是 o1 的配方;agent 化(computer use、长任务、编码 agent)也在发生。这条时间线目前没有明显跑偏
- OOM 记账法的隐含假设:能力随有效算力平滑、可预测地增长(scaling laws 在 15 个 OOM 上成立)。若能力涌现不连续,外推的误差会放大
- 「开源将更难竞争」的预测值得持续跟踪——它与「关键算法思想日益专有化」互为表里,也是作者后文国家安全论述的伏笔
II. From AGI to Superintelligence: the Intelligence Explosion
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 II 章 https://situational-awareness.ai/from-agi-to-superintelligence/
一句话论点:AI 进步不会停在人类水平。数亿个 AGI 可以自动化 AI 研究,把十年的算法进步(5+ OOM)压缩到 ≤1 年——我们会从人类水平迅速冲到远超人类的 AI 系统。超级智能(superintelligence)的威力与危险都将是戏剧性的。
引言
- 开篇引用 I. J. Good(1965):「让我们把超智能机器定义为能远超任何聪明人全部智力活动的机器。既然设计机器也是这些智力活动之一,超智能机器就能设计出更好的机器;那么毫无疑问会出现一场『智能爆炸』(intelligence explosion),人类的智能将被远远甩在身后。因此,第一台超智能机器是人类需要做出的最后一项发明。」
- 原子弹与氢弹的类比(The Bomb and The Super):
- 人们把冷战恐怖主要归于洛斯阿拉莫斯的原子弹,但单看原子弹也许被高估了——从原子弹到氢弹(The Super)同样重要
- 东京大轰炸:数百架轰炸机投下数千吨常规炸弹;同年广岛的”小男孩”用一颗装置释放了相近的破坏力;仅 7 年后,Teller 的氢弹又把当量放大一千倍——一颗炸弹超过整个二战投弹总和
- 「原子弹只是更高效的轰炸战役。氢弹是灭国装置。」AGI 与超级智能的关系亦然
- (脚注:冷战的许多荒诞之处正源于把 A 弹换成 H 弹后,核政策和战争计划没有跟着能力巨变调整——Daniel Ellsberg 的书)
- 核心逻辑链:
- 得到 AGI 后不会只有一个 AGI:按届时的推理 GPU 集群算,能跑数百万个(也许 1 亿个人类当量,随后 10x+ 人类速度)
- 它们不必会走路端咖啡——在电脑上做 ML 研究就够了。头部实验室的几百个研究员会变成 100,000 倍以上的研究力量,昼夜不停攻算法突破
- 是的,这是递归自我改进(recursive self-improvement),但不需要科幻设定:只要把现有算法进步趋势线(~0.5 OOM/年)加速就行
- 自动化 AI 研究大概能把人类十年的算法进步压缩到一年内(这还算保守)→ 一年 5+ OOM,相当于在 AGI 之上再叠一个 GPT-2→GPT-4 的质变(学龄前儿童 → 聪明高中生)
- 存在合理的瓶颈(实验算力受限、与人类的互补性、算法进步变难),后文逐一处理——但没有一个足以决定性地拖慢进程
- 结果:不知不觉间我们手里就有了超级智能——远比人类聪明、行为新颖复杂到我们无法开始理解的 AI 系统,也许是数十亿个体的小型文明。爆炸性进展会从 ML 研究扩散开:解决机器人学、几年内在各科学技术领域大跃进、随后工业爆炸。超级智能很可能提供决定性军事优势。「我们将面对人类历史上最紧张、最动荡的时刻之一。」
第 1 节 自动化 AI 研究(Automating AI research)
不需要自动化一切——只需要自动化 AI 研究。
- 常见反驳:「AI 很难做所有事」(比如机器人学很难;生物研发需要大量湿实验)。但自动化 AI 研究不需要机器人学:头部实验室研究员/工程师的工作完全可以远程虚拟完成
- AI 研究员的工作在大局上相当直接:读 ML 文献、提出新问题和想法、实现实验去验证、解读结果、重复。对当前 AI 能力做简单外推,到 2027 年底就能达到或超过最强人类的水平
- 过去十年最大的 ML 突破有多「简单粗暴」值得强调:「加个归一化」(LayerNorm/BatchNorm)、「把 f(x) 改成 f(x)+x」(残差连接)、「修一个实现 bug」(Kaplan → Chinchilla scaling laws)
- (脚注:AI 研究员的工作正是实验室的人最熟悉的工作,优化模型去做这份工作对他们最直观,且有巨大的竞争激励。另一个重要脚注——风险的先后顺序:如果 AI 研究比生物研发更容易自动化,我们可能在出现极端 AI 生物威胁之前就先迎来智能爆炸,即不该指望「生物警示弹」先来敲警钟)
数量测算(数亿个自动研究员从哪来):
- 到 2027 年 GPU 集群预计达数千万块;仅训练集群就将扩大 ~3 OOM(1000 万+ A100 当量),推理集群更大
- 脚注里的完整算术:数千万 GPU × ~$1/GPU·小时,按 GPT-4 Turbo 价格($0.03/1K token ≈ 33K token/$)折算 ≈ 每小时约 1 万亿 token;按人类思考 ~100 token/分钟(= 6,000 token/小时)→ ~2 亿个人类研究员当量昼夜运转(就算留一半 GPU 跑实验,还剩 1 亿)
- 直观化:2027 年的推理集群每天能生成一整个互联网的 token 量(~24T token/天 vs Common Crawl 去重后 ~30T)
- 具体数字不重要,重要的是可行性演示
而且很快会远快于人类速度:
- 用推理惩罚换串行速度:Jacob Steinhardt 的估算——k³ 个并行副本可换成单个 k² 倍速的模型;比如「只」跑 100 万个副本,就能从 ~5x 提到 ~100x 人类速度
- 更重要的是:自动研究员的第一项工作就是给自己找 10x/100x 加速。Gemini 1.5 Flash 仅一年后就比初版 GPT-4 快 ~10 倍且推理基准相当——几百个人类研究员一年能找到这种加速,自动研究员会更快找到同类收益
- 结论:开始自动化 AI 研究后不久,就该预期 1 亿个自动研究员、每个以 100 倍人类速度工作——每个几天干完一年的活
自动研究员相对人类的质的优势(不要想象成 1 亿个初级实习生——那个更早就有):
- 读过所有 ML 论文、深度思考过实验室所有历史实验、各副本并行学习、迅速积累千年当量的经验 → 比任何人类更深的 ML 直觉
- 轻松写数百万行复杂代码、把整个代码库放进上下文、花「数十年人类当量」逐行查 bug 和优化
- 不用逐个培训入职:教好一个,然后复制(也没有办公室政治、文化磨合,永远巅峰专注)
- 大量副本可共享上下文(甚至可能互访潜在空间 latent space),协作协调效率远超人类
- 而且初代自动研究员再聪明,很快还能再跳几个 OOM 造出更强的下一代
- 「想象一个自动化的 Alec Radford——想象 1 亿个自动化的 Alec Radford。」(Alec Radford:OpenAI 传奇研究员,许多重大进展背后的人物。)OpenAI 几乎每个研究员都会同意:有 10 个 Alec Radford 就能很快解决一大堆问题——何况 100 万个以 10x/100x 速度运转
- 百万倍研究力量换来 10 倍加速——「如果说有什么,这还算保守」 → 一年 5+ OOM,AGI → 超级智能可能不到一年
第 2 节 可能的瓶颈(Possible bottlenecks)
作者先给摘要,再在五个折叠小节里展开。总体判断:这些因素会排除最极端的版本(如「一夜之间」的智能爆炸),可能让起跑多等一两年——但完全挡不住一场非常快的智能爆炸。主线预期:从全自动 AI 研究员到远超人类的系统,一年(最多几年,也可能只要几个月)。
2.1 实验算力受限(Limited compute)——最重要的瓶颈
- 算法进步的生产函数有两个互补要素:研究劳动 × 实验算力。自动研究员再多,实验用的算力并不会变多——百万倍研究力量 ≠ 百万倍进度
- 但作者认为「1 亿个 Alec Radford 连把算力用得高效 10 倍都做不到」难以想象:
- 小规模实验能做很多事:ML 研究的常规是小规模试验 + scaling laws 外推(初版 Transformer 只用 8 块 GPU 训了几天)。且基线再涨 ~5 OOM 后,「小规模」= GPT-4 规模——自动研究员一年能在训练集群上跑 10 万个 GPT-4 级实验、数千万个 GPT-3 级实验(能测多少潜在突破性新架构!)
- 大量算力现在花在最终预训练的大规模验证上(为年度旗舰产品确认边际收益)——冲 OOM 时可以只押大收益、省掉这些
- unhobbling 收益通常不需要大预训练。智能爆炸很可能就是这样开场的:自动研究员发现某种「在上面叠 RL」的做法,靠 unhobbling 白得几个 OOM,然后一发不可收拾
- 效率增益复利:每找到 1 OOM 训练效率,就多 1 OOM 有效实验算力(回忆上一章:MATH 等效性能推理成本 2 年降近 1000 倍;类似 Gemini Flash 比 GPT-4 便宜近 100 倍 → 能用小模型跑多得多的 RL 实验);还可能有分布式训练方案等其他悬置(把推理 GPU 都用上,至少再 10 倍)
- 一次做对省掉海量实验:想象 1000 个自动研究员花一个月当量帮你查代码、把实验配到最优再按回车。作者问过实验室同事,公认只要避免低级 bug、一次跑对、只跑高信息价值实验,多数项目能省 3–10 倍算力
- 超人的实验直觉:资深研究员靠多年瞎折腾模型练出「不用跑我就知道结果」的直觉(作者引一位前沿实验室实习生的经历)。AI 可以读完全部文献、被训练去预测数百万个实验的结果——也许最先建立的就是「看到前 1% 训练曲线就预测大规模实验成败」的基础科学。Jason Wei 所说的 “yolo runs”(凭直觉一次把几十个超参配对):「能做到这个的人绝对是 10–100 倍研究员」
- 结论:算力瓶颈意味着不会是「一夜爆炸」,但 10 倍算法进步速度看起来完全说得通
2.2 最强反驳:ML 学术界的往绩说明了什么?
朋友 James Bradbury 的质疑:如果研究人力这么有用,为什么数以万计的学术界 ML 研究者对前沿实验室的进步贡献那么小(前沿算法进步主要由各实验室合计约千人的内部团队扛)?他的解释:因为算法进步本来就被算力卡着——学术界没算力。
作者的回应:
- 按质量调整,学术界有效人数可能只是几千(看顶尖大学),并不比实验室总和多多少(更远少于几亿自动研究员)
- 学术界做错了方向:直到最近,绝大多数学术 ML 社区根本不做大语言模型
- 即使做 LLM 预训练,他们也接触不到前沿内部知识(海量训练细节的积累):不知道哪些问题真正相关,产出的一次性结果因基线没调好而无人能用
- 学术界远不如自动研究员:不能 10x/100x 速度工作、不能读完所有论文、不能复制自己
- 反例:传闻 GDM 的实验算力远多于 OpenAI,但算法进步并没有大幅甩开——说明算力也不是唯一决定因素
- 总体:自动研究员会发展出扬长避短的研究风格(如先建立「小规模预测大规模」的基础科学)。对结局不确定是合理的,但「因为人类绕不过算力瓶颈就断定模型也绕不过」是不合理的
- 附注(有点吓人):大训练跑数月是另一瓶颈,但可以省着用——智能爆炸那年也许只做一两次大训练,每次押上在小规模攒下的多个 OOM 突破 → 下游模型智能可能更离散/不连续地跳变;或者「花掉」5 个效率 OOM 里的 1 个,把训练从数月压到数天
2.3 互补性与最后 10% 的长尾(Complementarities / long tail)
- 经济学经典教训(Baumol 成本病):自动化了 70%,剩下 30% 很快成为瓶颈。1800 年的劳动被自动化了 80%,也没带来增长爆炸——剩下 20% 成了所有人的工作
- 作者认可这个模型,但强调他只谈经济中很小的一块(AI 研究),不是整个经济:理发照常、机器人没解决、社会铺开没完成——都不妨碍 AI 研究被自动化
- 现实中确实预期有长尾:能力在各领域参差不齐(peaky)——它可能已是超过最强工程师的编码者,却在某些子技能上还有盲区;等它在最弱项达到人类水平时,在易训练的领域(如编码)早已大幅超人。(这也是它们能比人类更高效用算力的原因之一;对后文 superalignment 有重要含义:要对齐第一批自动研究员时,就已经要对齐在许多领域显著超人的系统)
- 缓和后的时间线(takeoff 软化版):
- 2026/27:原型自动工程师(其他领域有盲区),已把工作提速 1.5–2 倍,进度开始渐进加速
- 2027/28:原型自动研究员,可自动化 >90%;剩余人类瓶颈和「指挥一个自动研究员巨型组织」的磨合问题待解决,但已提速 3 倍+;它很快补完剩余 unhobbling,达到 100% 自动化
- 2028/29:10 倍+ 进度 → 超级智能
- 「这仍然非常快……」——长尾大概只推迟一两年(本十年内仍到超级智能)
2.4 算法进步的根本上限(Fundamental limits)
- 物理上限确实存在:比如在 GPT-4 之上再来 25 OOM 显然不可能(那意味着 ~10 FLOP 就能训出 GPT-4 级系统)
- 但 5 OOM 完全在可能范围内——那只是「再来十年的趋势线」(还没算 unhobbling 的算法收益)
- 直觉上低垂果实远未摘完:最大的突破都那么简单,而当前架构和训练法显然还很原始——
- 我们可能靠「出声思考」(CoT)的系统蹭到 AGI,但这肯定不是最高效的方式;用内部状态/循环(recurrence)做推理应该高效得多
- 自适应算力(adaptive compute):Llama 3 预测一个 “and” 花的算力和回答复杂问题一样多——明显次优
- 生物参照系支持巨大余量:人类智能范围极宽而架构差异微小;人类神经元数量与其他动物相近却聪明得多;人脑能用比 AI 模型少几个 OOM 的数据(因而「算力」)学会——算法和架构还有巨大空间
2.5 「想法越来越难找」与收益递减(Ideas get harder to find / diminishing returns)
两个衍生反驳:① 自动研究只是「维持」现有进度所需,不会加速;② 即使有初始爆发,收益递减会让爆炸很快熄火。
- 作者自述前世做经济学研究,专攻这类模型(半内生增长理论 semi-endogenous growth theory 是技术进步的标准模型,正好刻画「研究投入增长 vs 想法变难」的竞争)
- 模型本身没错,是实证数字不对。餐巾纸算术:
- 认真对待 ~0.5 OOM/年 → 4 年 100 倍算法进步
- 但同期头部实验室按质量调整的研究人力增长 远小于 100 倍(也许 10 倍:从几十人到几百人,质量调整后还未必)
- 进步却维持住了 → 维持进步所需的研究投入增长远小于进步本身
- 对反驳 ①:百万倍研究力量增长比「维持进度所需」大得多得多。假设「自动化的增量恰好只够维持现有进度」是怪异的刀刃假设(knife-edge assumption)
- 对反驳 ②:
- 上面的数学条件(100 倍进步只需要 «100 倍投入)说明收益曲线的指数有利于自我维持的爆炸性进步
- 而且不需要完全自持的链式反应:从几百人到几亿研究员是巨大的一次性提升,就算链式反应不完全自持,也足够带来许多个 OOM 的一次性收益(类比:把科研投入从 GDP 的 1% 提到 20%,不会永久提高增长率,但其「水平效应 level effect」大到能让增长加速数十年)
- 佐证:Tom Davidson 与 Carl Shulman 的增长建模、Epoch AI 对算法研发实证回报的研究,结论类似——实证站在爆炸性增长一边
第 3 节 超级智能的威力(The power of superintelligence)
无论你是否接受最强形式的论证(<1 年爆炸还是几年),结论清晰:必须直面超级智能的可能性。本十年末我们可能拥有的系统将强大到难以想象。
量的超人:
- 数亿 GPU 上跑数十亿个体的文明,思考速度快人类几个数量级
- 快速精通任何领域、写数万亿行代码、读完所有科学领域的所有论文(完美跨学科!)、你还没读完一篇摘要它已写出新论文、从每个副本的经历并行学习、几周内为某项创新积累数十亿人年的经验、100% 时间巅峰专注
质的超人(更重要也更难想象):
- 大规模 RL 已能产生人类无法理解的全新创造性行为——AlphaGo 对李世石的第 37 手。超级智能将在许多领域都是这样
- 它会发现人类代码里精妙到没人注意的漏洞;生成复杂到「就算它花几十年解释人类也看不懂」的代码;人类会卡几十年的科技难题对它显而易见。「我们会像卡在牛顿力学的高中生,而它在探索量子力学」
- 直观化:去看 Minecraft 20 秒速通视频——连普通玩家都完全看不懂发生了什么。想象这个水平应用到所有科学、技术和经济领域
爆炸性进展会从 AI 研究扩散(作者预期的清单):
- AI 能力爆炸:初代 AGI 在其他领域的短板会被自动 AI 研究迅速补齐 → 一切认知工作可自动化
- 解决机器人学(见 3.1)
- 戏剧性加速科技进步:爱因斯坦一个人不能建立神经科学和半导体产业,但十亿个超智能科学家/工程师/技术员/机器人技师(机器人以 10 倍+人类速度移动;脚注:那还是「慢版本」,实际会尽量在仿真里做研发,像 AlphaFold 或制造业「数字孪生」)能在几年里把人类下个世纪的研发压缩完成。想象 20 世纪的技术进步压进不到十年:从「飞行是幻想」到飞机、到登月和洲际导弹只隔几年——作者预期 2030 年代的科技就是这样
- 工业与经济爆炸:全自动劳动 + 自复制机器人工厂(想象内华达沙漠被迅速铺满)→ 不是 2%/年 变 2.5%/年,而是增长模式的根本切换,堪比工业革命那次阶跃;可能看到 30%/年 甚至一年翻几番——这直接从经济学增长模型推出。(脚注解释为什么「factorio 世界」今天不可能:劳动是固定约束,资本积累有递减回报;机器人解除该约束后,机器人工厂可以近乎无约束地生产机器人工厂。)当然社会摩擦会拖慢:奇怪的监管可能保证律师医生仍须是人类、社会会往飞速扩张的机器人工厂齿轮里扔沙子、也许我们想保留人类保姆——但凡是人为壁垒被移除的领域(军备竞争可能逼我们移除),就会看到工业爆炸
- Robin Hanson「长期增长是一系列指数模式」的表格:狩猎(前 200 万年起主导)全球经济翻倍需 23 万年 → 农业(前 4700 年)860 年 → 科学与商业(1730)58 年 → 工业(1903)15 年 → 超级智能(2030?)????
- 决定性、压倒性的军事优势:早期认知超级智能也许就够(某种超人黑客方案瘫痪对手军队)。无人机蜂群和机器人军队只是开始——全新的武器:新型大规模杀伤性武器、无懈可击的激光反导、我们还想不到的东西。相比之下,前超级智能军队就像「21 世纪军队 vs 19 世纪的马匹刺刀旅」
- 足以推翻美国政府:谁控制超级智能,就很可能有足够力量从前超级智能势力手中夺权。不需要机器人:超智能的小文明可以入侵任何不设防的军事/选举/电视系统、狡黠地说服将军和选民、在经济上碾压民族国家、设计新型合成生物武器再用比特币雇人合成……历史类比:1500 年代早期,科尔特斯带 ~500 西班牙人征服数百万人的阿兹特克帝国;皮萨罗 ~300 人征服印加;阿方索 ~1000 葡萄牙人征服印度洋——他们没有神力,只是技术代差 + 战略外交上的狡黠,就形成了完全决定性的优势。超级智能可能类似
3.1 机器人(Robots)
- 常见反驳:就算认知任务行,机器人学远远落后,会拖住现实世界影响
- 作者曾同情此说,现已转变:机器人硬件正在被解决;机器人越来越明显是 ML 算法问题
- LLM 有整个互联网可预训练;机器人动作没有同样大的数据集,需要更巧的路子(多模态模型做基座 + 合成数据/仿真/聪明的 RL)
- 就算 AGI 前没解决,数亿 AGI/超级智能本身就是出色的 AI 研究员(本章核心论点),很可能搞定机器人的 ML
- 机器人可能造成几年延迟(解决 ML、物理世界测试天然比仿真慢、机器人能自建工厂前的初始产能爬坡),但不会更多
结语:再一次直面链式反应
- AGI 本身已影响深远,但某种意义上只是「我们已知事物的更高效版本」。而很可能仅一年之内,我们就会过渡到陌生得多的系统——其理解力与能力(原始力量)甚至超过人类总和。在这场快速转变中被迫把信任移交给 AI 系统,存在失控的真实可能性
- 「一切都会开始发生得难以置信地快,世界会开始发疯。」假设 20 世纪的地缘政治狂热与人造危险被压缩进短短几年——那就是后超级智能时期该预期的处境。结束时,超智能系统将运转我们的军队和经济。极度稀缺的时间里要做对极多的决定
- 核链式反应的历史回声:H.G. Wells 1914 年在小说里预言原子弹;Szilard 1933 年构想链式反应,无人肯信(纯理论);1938 年裂变被实证发现后 Szilard 主张保密,少数人开始醒悟。爱因斯坦没想过链式反应,但 Szilard 找上门时他立刻看懂含义,愿意拉响警报、不怕显得愚蠢。而 Fermi、Bohr 和多数科学家认为「保守」= 淡化处理,觉得保密和全力以赴很荒谬——链式反应听起来太疯狂。(结果炸弹离现实只有半个十年。)
- 「我们必须再次直面链式反应的可能性。也许你觉得它是空想。但在 AI 实验室的资深科学家中,许多人认为快速智能爆炸惊人地可信。他们看得见。超级智能是可能的。」
附:批判性阅读备忘
- 本章论证结构 = 一个数量级测算(1 亿研究员 × 100 倍速)+ 对五个瓶颈的逐一辩护。最坚实的部分是「只需自动化 AI 研究」的窄目标选择和半内生增长理论的实证算术;最依赖判断的部分是「自动研究员能把实验算力用得高效 ≥10 倍」——这是整个 10 倍加速结论的枢纽假设,作者自己也承认这是最重要的瓶颈
- 站在 2026-07 回看:编码/AI 研究自动化确实是各实验室的主攻方向(agent 化编码工具、模型自动跑实验的内部实践),与「2026/27 原型自动工程师、提速 1.5–2 倍」的软化时间线大致同步;「靠在上面叠 RL 白得几个 OOM」几乎精确预言了推理模型(o 系列、扩展思考)的路径
- 「推理成本大致恒定」的假设(1 亿人类当量测算的前提)方向上成立——前沿模型 $/token 持续下降;但长思维链让每任务 token 消耗大增,人类当量换算比原文假设更微妙
- 机器人 = ML 算法问题的判断,与 2025–26 年 VLA(视觉-语言-动作)模型的进展方向一致,但「几年内解决」尚未验证
- 军事优势、推翻政府、30%/年增长等推论是条件性外推(以超级智能为前提),逻辑自洽但目前不可检验;注意作者从这里开始为 III 篇(安全、对齐、国家竞争)做铺垫——本章的「威力清单」既是预测也是后文政策主张的动机
- 与第一章的衔接:第一章的 5 OOM 是「到 AGI」,本章的 5+ OOM 是「AGI 之后一年内再来一轮」——两级火箭结构。若第一级(2027 AGI)推迟,本章时间线整体顺延,但逻辑不变
IIIa. Racing to the Trillion-Dollar Cluster
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 IIIa 章 https://situational-awareness.ai/racing-to-the-trillion-dollar-cluster/
一句话论点:最惊人的技术-资本加速已经启动。随着 AI 收入快速增长,本十年结束前将有数万亿美元涌入 GPU、数据中心和电力建设;这场工业动员(包括让美国发电量增长几十个百分点)将是空前激烈的。
引言
- 开篇引用 Niels Bohr(1944 年得知曼哈顿计划规模后对 Edward Teller 说):「你看,我说过不把整个国家变成一座工厂就做不成这件事。你们正是这么做的。」
- AGI 竞赛不只发生在代码和笔记本电脑后面——它是一场动员美国工业实力的竞赛。与硅谷近年的其他产物不同,AI 是一个庞大的工业过程:每个新模型需要巨大的新集群,很快需要巨大的新电厂,最终需要巨大的新芯片厂
- 三个数字预告:
- AI 产品收入快速增长——Google/Microsoft 级公司可能在 ~2026 年达到 $100B 年化收入(用强大但仍是 pre-AGI 的系统)→ 到 2027 年年度 AI 总投资可能超过 $1T
- 到 2028 年,单个训练集群造价将达 数千亿美元——耗电相当于美国一个中小型州,比国际空间站还贵
- 到本十年末:$1T+ 的单个训练集群,耗电 >20% 美国发电量;数万亿美元 capex 每年产出数亿块 GPU
- Nvidia 数据中心销售额一年内从年化 ~$14B 爆到 ~$90B,震惊世界——但这仅仅是开始
训练算力(Training compute)
延续第一章的 ~0.5 OOM/年(OOM = 数量级,10x = 1 OOM)训练算力趋势,最大训练集群的推演:
| 年份 | OOM | H100 当量 | 成本 | 功率 | 功率参照物 |
|---|---|---|---|---|---|
| 2022(GPT-4 集群) | — | ~1 万 | ~$500M | ~10 MW | ~1 万户家庭 |
| ~2024 | +1 | ~10 万 | 数十亿$ | ~100 MW | ~10 万户家庭 |
| ~2026 | +2 | ~100 万 | 数百亿$ | ~1 GW | 胡佛大坝 / 一座大型核反应堆 |
| ~2028 | +3 | ~1000 万 | 数千亿$ | ~10 GW | 美国一个中小型州 |
| ~2030 | +4 | ~1 亿 | $1T+ | ~100 GW | >20% 美国发电量 |
计算细节(原文折叠框):
- 起点:GPT-4 于 2022 年 8 月完成训练(OpenAI 技术报告);Semianalysis/JP Morgan 等估计用了 ~2.5 万块 A100(H100 性能约为 A100 的 2–3 倍)
- 成本口径:常被引用的「GPT-4 训练花了 $100M」只是 GPU 三个月的租金——错误口径。真正该算的是建集群的实际成本(世界最大的集群不可能只租 3 个月;旗舰训练之外还有去风险实验、失败的 run、其他模型)。按 $1/A100-小时 × 2–3 年 ≈ $500M;或按每块 H100 ~$2.5 万、GPU 约占集群总成本一半(其余为电力、机房、散热、网络、维护人力——一项 TCO 分析:H100 本体占 ~40%,Nvidia 的 Infiniband 网络再占 13%,即 Nvidia 拿走集群成本的 60%+)
- FLOP/$ 改善有限:H100→B100 约 1.5 倍(B100 ≈ 两块 H100 钉在一起、售价 <2 倍,是 Nvidia 为碾压竞争的例外低价);A100→H100 两年一代也只有 ~1.5 倍(算上 fp8)。芯片已高度 AI 专用化(Transformer 特化、fp8/fp4),摩尔定律缓慢,内存和互连进步更慢——Epoch 数据显示顶级 ML GPU 过去十年 FLOP/$ 提升不到 10 倍,作者预计还会放缓。按 ~35%/年 FLOP/$ 改善推出 +4 OOM 集群的 $1T 造价
- 功率折算:H100 本体 700W,加散热/网络/存储后 Semianalysis 估计 ~1400W/块;粗算用 1kW/H100 当量。(若 FLOP/Watt 意外突破,作者预期电费不变、OOM 收益更大)
- 功率参照:10GW 连续运行一年 = 87.6 TWh(俄勒冈州年用电 27 TWh,华盛顿州 92 TWh);100GW 一年 = 876 TWh(美国年发电总量 ~4,250 TWh)
看似离谱,但正在发生:
- Zuckerberg 买了 35 万块 H100;Amazon 买下核电站旁的 1GW 数据中心园区;传闻科威特在建 1GW、140 万 H100 当量的集群(≈2026 级);媒体报道 Microsoft/OpenAI 在筹划 $100B 集群、2028 年上线(造价与国际空间站相当)
- 最疯狂的是:目前的约束甚至不是花钱的意愿,而是基础设施本身——「上哪找 10GW?」是旧金山最时髦的话题。搞算力的人都在想电力、土地、许可、数据中心施工(GPU 等一年就有,这些的交付周期长得多)
- 万亿美元集群(+4 OOM,~2030 趋势值)需要 100GW——不是装 GPU 的仓库,而是数百座电厂,可能需要国家级联合体
- 作者预判:AGI 大概率只需要 ~$100B 集群(或更小);$1T 集群是用来训练/运行超级智能的(或 AGI 比预期难时的保险)。无论如何,后 AGI 世界里算力最多者恒强
总算力(Overall compute)
最大训练集群之外,总投资更大:大部分 GPU 会用于推理(跑产品;脚注:Zuck 的 35 万块 H100 里只有 ~4.5 万在最大训练集群),且竞赛中会有多个玩家。
- 2024 年 AI 总投资已达 $100B–200B:
- Nvidia 数据中心收入将达 ~$25B/季度运行率(仅经 Nvidia 就 ~$100B capex),而 Nvidia 不是唯一玩家(Google TPU 也很强),且芯片外的数据中心 capex 又占近一半
- 大厂 capex 狂飙:Microsoft、Google 今年各 $50B+,AWS、Meta $40B+;因 AI 同比合计增加 $50–100B(还在砍其他 capex 腾钱);Tesla 今年在 AI 上花 $10B;主权国家也在入场
- 外推:总投资增速取 2 倍/年(慢于最大集群的 3 倍/年,因为会向少数头部实验室集中):
| 年份 | 年度投资 | AI 加速器出货(H100 当量) | 电力占美国发电量 | 芯片占 TSMC 当前先进制程产能 |
|---|---|---|---|---|
| 2024 | ~$150B | ~500–1000 万 | 1–2% | 5–10% |
| ~2026 | ~$500B | 数千万 | 5% | ~25% |
| ~2028 | ~$2T | ~1 亿 | 20% | ~100% |
| ~2030 | ~$8T | 数亿 | 100% | 4 倍当前产能 |
- 旁证:AMD 预测 2027 年 AI 加速器市场 $400B(意味着总 AI 支出 $700B+,和作者的数字接近——而 AMD 远没作者那么「AGI 化」);Sam Altman 被报道在为「高达 $7T」的算力 capex 项目筹资(被群嘲,但按这里的数字算就没那么疯了)
能做成吗?(Will it be done? Can it be done?)
需求侧和供给侧似乎都撑得住这条轨迹:经济回报能证成投资、支出规模对新通用技术并非史无前例、电力和芯片的工业动员可行。
AI 收入(AI revenue)
- OpenAI 收入运行率:2023-08 $1B → 2024-02 $2B,约每 6 个月翻倍。趋势保持的话 2024 底/2025 初达 ~$10B(还没算下一代模型引爆的需求);另有估计 Microsoft 已有 ~$5B 增量 AI 收入
- 迄今每一次 10 倍投资扩张都赚回来了:GPT-3.5 引爆 ChatGPT 狂热;GPT-4 集群 ~$500M 已被 Microsoft/OpenAI 的数十亿年收入覆盖;数十亿美元的 2024 级集群只要收入继续走向 $10B+ 就轻松回本。这是投资先行的繁荣:从下单 GPU 到建集群、训模型、推产品有时滞,今天规划的集群是多年后的事——只要上一批 GPU 的回报持续兑现,投资就会继续飙升(跑在收入前面)
- 作者最爱的里程碑:哪家大厂(Google/Microsoft/Meta…)先从 AI(产品+API)拿到 $100B 年化收入?这些公司现在总收入 $100–300B,$100B 就是业务的大头。按 6 个月翻倍外推(2025 初 $10B),~2026 年中达成
- 想象一下并不难:Microsoft Office 有 ~3.5 亿付费订阅者——让其中 1/3 愿意为 AI 附加组件付 $100/月就够了。对普通白领这只相当于每月节省几个小时;未来几年做出配得上这个价的模型看起来非常可行
- 涟漪效应难以夸大:AI 将成为美国最大公司的最大营收驱动和最大增长点 → 股市跟进 → 可能很快见到第一家 $10T 公司、第一笔数千亿美元的公司债发行
- $100B 之后轮廓模糊,但如果真在通往 AGI 的路上,回报就在那里:全球白领年工资几十万亿美元——即插即用的远程员工哪怕只自动化一小部分认知工作(比如真正全自动的 AI 程序员),就够付万亿美元集群的账。再不济,国家安全考量也可能催生政府项目(后文主题)
- 脚注里的重要保留:收入的最大不确定性是技术扩散与采用的时滞——pre-AGI 中间态模型要大量苦活才能整合进工作流(历史上新通用技术的生产率收益都要很久才收割完)。这又回到第一章的「音爆」论:unhobble 成 agent/远程员工后,部署会突然变容易——经济价值可能不连续地跳变
历史先例(Historical precedents)
2027 年 $1T/年 的 AI 总投资听着离谱,看看参照系:
- 曼哈顿计划和阿波罗计划的峰值年份:0.4% GDP ≈ 今天 ~$100B/年(意外地小!)。$1T/年 ≈ 3% GDP
- 1996–2001 年电信业为互联网基建投了近 $1T(今日美元)
- 1841–1850 英国私人铁路投资累计 ~40% 当时英国 GDP——换算成美国 GDP 相当于十年 ~$11T
- 绿色转型正在花掉数万亿美元
- 高速增长经济体常年高投资率:中国连续二十年投资占 GDP 40%+(按美国 GDP 折算 = 每年 $11T)
- 战时举债:一战英法德借了 100%+ GDP、美国 20%+;二战英日 100%+、美国 60%+(≈ 今天 $17T+)
- 结论:$1T/年将是史上最大的资本建设之一,但并非史无前例;十年末的万亿美元单集群「在桌面上」
电力(Power)
- 供给侧最大的单一约束大概率是电力。在更近的尺度(1GW/2026,尤其 10GW/2028)电力已经是绑定约束:几乎没有闲置容量,电力合同都是长期锁定,新建 GW 级核电站要十年。(作者调侃:什么时候会看到科技公司为了 GW 级电力合同去收购炼铝厂?脚注:Alouette 铝厂满产用电 930 MW)
- 美国总发电量过去十年只增长了 ~5%。电力公司开始为 AI 兴奋(未来 5 年预测从 2.6% 上调到 4.7% 增长!)——但完全没定价即将到来的东西:仅万亿美元集群就要 ~20% 当前发电量,加上推理需求还要翻几倍
- 有人押注中东专制国家(四处兜售无限电力和巨型集群,给统治者换一张 AGI 牌桌的门票)
- 但在美国完全做得到:天然气管够
- 10GW 集群只需美国天然气产量的几个百分点,可快速完成
- 100GW 也意外地可行:仅宾州附近的 Marcellus/Utica 页岩就日产 ~360 亿立方英尺——用发电机可连续发 ~150GW(联合循环电厂效率更高,可达 250GW)
- 100GW 需 ~1200 口新井;每台钻机每月钻 ~3 口井,Marcellus 现有的 40 台钻机不到一年就能建起产能基础(2019 年那里还有 ~80 台钻机,加 40 台毫不费力)
- 美国天然气产量十年翻倍有余;延续趋势就够养活多个万亿美元数据中心
- 较难的是发电机/燃气轮机:100GW 的天然气电厂约需 $100B capex(<$1000/kW),联合循环电厂建设周期约两年,纯发电机更快
- 障碍完全是自己造成的:善意但僵化的气候承诺(政府的,也包括 Microsoft/Google/Amazon 的绿色数据中心承诺)挡住了显而易见的快解。就算不用天然气,广泛的去监管议程(NEPA 环评、FERC 输电审批、公用事业监管、许可制度——让本该几年的事拖成十年+)也能解锁光伏/电池/SMR/地热的超级工程。「我们没有那种时间」
- 「否则我们就会把 AGI 数据中心赶到中东,置于残暴而反复无常的独裁者的拇指之下……我也喜欢清洁能源,但这对美国国家安全太重要了。电力约束能解决、必须解决、也将被解决」
芯片(Chips)
- 芯片反而是比电力小的约束:AI 芯片目前只占 TSMC 先进制程产量的 <10%,靠提高份额就有巨大空间
- 2024 年的 AI 芯片产量(~500–1000 万 H100 当量)如果全部堆到一个集群,已经差不多够 $100B 级集群;纯逻辑晶圆角度,TSMC 一年产量理论上已能支撑万亿美元集群(当然不可能全部挪给 AI/一个数据中心)
- 到 2030 年 AI 芯片总需求(含推理、多玩家)将是 TSMC 当前先进逻辑产能的数倍。TSMC 过去 5 年产能翻倍,要满足 AI 需求得至少再快一倍——需要巨额新厂投资
- 真正的近期瓶颈是 CoWoS 先进封装和 HBM 内存(AI 特化、存量产能少)——但也「相对好扩」:TSMC 今年为 CoWoS 直接平地起新厂(greenfield),Nvidia 也在找 CoWoS 替代方案
- 一座 TSMC Gigafab:capex ~$20B、月产 10 万片晶圆。要在十年末年产数亿块 AI GPU,TSMC 得建几十座,加上内存/封装/网络的配套,总 capex 可能超过 $1T。「激烈,但可行」——最大的路障也许不是可行性,而是 TSMC 根本没进入状态(他们以为 AI「只会」以 50% 年增速增长)
- 关于 CHIPS 法案式的本土化:芯片厂在国外 ≈ 铀矿在国外,AGI 数据中心在国外 ≈ 核弹在国外制造和存放——数据中心在美国比芯片厂在美国重要得多。鉴于在美国建厂的低效,作者建议:数据中心优先放美国,芯片厂更多押注日韩等民主盟友(那里的建设顺畅得多)
- 妙注(Carl Shulman 观点):为什么电力先于芯片产能吃紧?因为现在生产的芯片大多数时间在闲置(智能手机占先进芯片需求近半,但单位晶圆面积能耗低、利用率低);AI 革命 = 让晶体管拼命干活——全部投入连续满载的高性能数据中心
民主国家的集群(The Clusters of Democracy)
- 十年内,数万亿美元的算力集群一定会建成——唯一的问题是建在不建在美国。有传闻称有人押注在别处建,尤其是中东。「我们真的想让曼哈顿计划的基础设施被某个反复无常的中东独裁政权控制吗?」
- 今天规划的集群很可能就是训练和运行 AGI 与超级智能的集群,不只是「大厂酷产品集群」。国家利益要求它们建在美国(或紧密的民主盟友),否则是不可逆的安全风险:
- AGI 权重被窃取(有物理接触时侧信道攻击容易得多——脚注)、甚至运去中国
- AGI 竞赛白热化时,独裁政权物理夺取数据中心自己训练/运行 AGI
- 即便威胁只是隐性的,也等于把 AGI 和超级智能置于独裁者的心情之下
- 类比:美国 70 年代深悔对中东的能源依赖,费尽力气才摆脱——不能重蹈覆辙
- 「美国国家安全必须放在第一位——先于中东热钱的诱惑、先于晦涩的监管、甚至先于(令人敬佩的)气候承诺。」这是一场真正的制度竞赛:工业动员难道只有「自上而下」的专制国家做得到?松绑的美国企业界比谁都能建(至少在红州)
- 结尾自述:早年(AGI 还是脏词的年代)作者和同事做过 AGI 路径的理论经济模型,其中有个假想的「AI 觉醒(AI wakeup)」时刻——世界意识到模型的威力、投资狂飙至 GDP 的百分之几。「那个时刻已经到了。2023 年就是 AI 觉醒。」(脚注:2023 年 3 月作者在白板上写下 THE TAKEOFF HAS STARTED)
- 「系好安全带,迎接 G 力。(Brace for the G-forces.)」
- 结尾彩蛋:「这一切对 NVDA/TSM 等意味着什么,留作读者练习。提示:有 situational awareness 的人早就低位买入了,但现在也远没有 price in。」(脚注:主流卖方分析师假设 Nvidia CY24→CY25 只增长 10–20%(~$120–130B)——「疯了!Nvidia CY25 明显要做 $200B+ 的收入」)
附:批判性阅读备忘
- 已验证(截至 2026-07 回看):这一章是全书预测兑现度最高的部分之一——2025 年初 Stargate 项目公开(宣称 $500B 级),$100B+ 集群从「传闻」变成官宣;Nvidia 数据中心收入 CY25 确实冲到了 $200B 量级(作者对卖方分析师的嘲讽是对的);电力成为行业共识瓶颈:燃气轮机订单排到几年后、微软重启三里岛核电站、各大厂纷纷签核电长约——「先缺电后缺芯片」的判断准确;CoWoS/HBM 是 2024–25 年真实的主瓶颈,也如他所说被快速扩产缓解
- 方向对但路径微妙:他警告「别把 AGI 数据中心赶到中东」——现实是 2025 年美国政府亲自牵线在 UAE/沙特建巨型集群(以美国公司运营、出口管制约束为条件)。算「部分失守」还是「风险被管理」,取决于你信不信那些约束条款
- 待检验:「大厂 $100B AI 年化收入 @2026 年中」看起来偏乐观(每 6 个月翻倍的外推在大数上放缓了);$1T/年总投资 @2027、$8T @2030 仍属激进外推
- 方法论提醒:本章大量数字是刻意的 back-of-the-envelope(信封背面粗算),作者自己反复强调误差棒;读时应记「量级对不对」而非「数字准不准」
- 立场声明:从本章开始,文章从技术预测转向国家安全叙事(民主 vs 专制、把 AGI 类比核武器)——这是作者的政策主张而非中立分析,「Clusters of Democracy」一节的修辞尤其浓;阅读后续章节(IIIb/IIId/IV)时需要带着这层意识
IIIb. Lock Down the Labs: Security for AGI
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 IIIb 章 https://situational-awareness.ai/lock-down-the-labs/
一句话论点:美国头部 AI 实验室把安全当作事后补丁,等于把 AGI 的关键机密拱手端给中共。要在国家行为体(state actor)级别的威胁下守住 AGI 机密和模型权重,需要一场浩大的努力——而我们完全没有走在正轨上。
引言
- 卷首引文:Richard Rhodes《原子弹的诞生(The Making of the Atomic Bomb)》——1939 年 Szilard、Teller、Wheeler 试图说服玻尔(Bohr):裂变研究应该继续但结果必须保密,以免纳粹先造出核爆炸。玻尔反驳:核能永远搞不成,而且「保密绝不能被引入物理学」。(全章以曼哈顿工程的保密史为镜子)
- 尖刻的开场判断:按现在的路线,领先的”中国 AGI 实验室”不会在北京或上海——而是在旧金山和伦敦(因为机密全从那里泄出去)
- 几年内人们会明白:AGI 机密是美国最重要的国防机密,配得上 B-21 轰炸机或哥伦比亚级核潜艇图纸的待遇,更不用说”核机密”——但今天我们对待它像对待随便一个 SaaS 软件
- 要保护的东西有两样,缺一则前功尽弃(万亿美元投资、工业动员、最聪明的头脑都白搭):
- 模型权重(model weights):训练完的 AI 模型说到底只是服务器上的一个大文件
- 算法机密(algorithmic secrets):造出 AGI 所需的关键技术突破(”图纸”)
- 实验室自称在造 AGI、自认十年内将造出美国有史以来最强的武器——却用「随机科技创业公司」的标准衡量自己的安全,而不是「关键国防项目」。现在他们连脚本小子(scriptkiddies)都勉强能防,遑论「防朝鲜级安全」,更别提中国国家安全部(MSS)全力出击
- 时间紧迫的关键论证:就算 GPT-4 权重被偷无所谓、权重安全还有几年缓冲——但算法机密的 AGI 级安全必须比权重的早好几年:实验室现在正在研发突破数据墙的”下一个范式”(RL / self-play / 合成数据等),这些突破几年后的价值超过 10 倍、100 倍的集群
- 「我们今天的失败很快将不可逆:未来 12–24 个月内,我们会把关键的 AGI 突破泄露给中共。这将成为国家安全体系在这个十年结束前最大的悔恨。」
- 自由世界对抗威权国家的存续系于此——而且健康的领先优势正是把 AI 安全做对所需的缓冲余量
第 1 节 别低估国家行为体(Underrate state actors at your peril)
太多聪明人低估了间谍活动。即便在平时(且仅从公开信息看),国家级(甚至更弱的)行为体已经能:
- 只凭电话号码零点击(zero-click)入侵任意 iPhone / Mac
- 渗透物理隔离(airgapped)的原子武器计划
- 修改 Google 源代码
- 每年找到数十个零日漏洞(zero-day),平均 7 年才被发现
- 鱼叉钓鱼(spearfish)各大科技公司、给员工设备装键盘记录器
- 在加密方案里植入后门(trapdoor)
- 通过电磁泄漏或振动窃取信息;仅凭电脑噪音判断你在游戏地图上的位置或窃取密码
- 直接接入核电站等敏感系统
- 从美国政府偷走 2200 万份安全审查档案(OPM 事件)
- 通过 HVAC(空调系统)供应商植入漏洞,泄露 1.1 亿客户金融信息(Target 事件)
- 大规模攻陷计算机硬件供应链;向顶级科技公司和美国政府用的软件依赖的更新里塞恶意代码
- ……更别说安插间谍、色诱、威逼利诱员工(大规模且有效,只是不上新闻);真到白热化还有特种部队行动
延伸阅读推荐:苏联 GRU(军事情报总局)叛逃者写的《Inside the Aquarium》(Ilya Sutskever 推荐给作者的书。脚注彩蛋:间谍学院毕业考核是从本国科学家身上套取机密——而泄密的刑罚是死刑,即毕业 = 挑一个同胞送死)
中国现状:已在进行大规模工业间谍活动;FBI 局长称中国的黑客行动规模超过「所有主要国家加起来」。几个月前司法部长刚宣布逮捕一名从 Google 窃取关键 AI 代码带回中国的中国公民(2022/23 年的事,很可能只是冰山一角。脚注:此人的手法仅仅是把代码贴进 Apple Notes 再导出成 PDF就绕过了 Google 的检测——而 Google 可能已是所有 AI 实验室里安全最好的)
更大的警告:要为对手在几年内「醒悟到 AGI(wake up to AGI)」做准备——届时 AI 将成为全世界每个情报机构的头号优先级,他们愿意付出任何代价渗透美国 AI 实验室。
第 2 节 威胁模型(The threat model)
两大资产:模型权重(越接近 AGI 越关键,但防护体系要好几年才建得起来)和算法机密(从昨天就该开始保护)。
2.1 模型权重(Model weights)
- AI 模型就是服务器上的一大坨数字文件。对手只要偷走这个文件,就等于抵消了你的万亿美元、最聪明的头脑和数十年的积累(想象纳粹拿到洛斯阿拉莫斯每颗原子弹的精确复制品)
- 权重安全失守 = 我们是在替中共(按现在实验室的安全水平,甚至是替朝鲜)造 AGI
- 不只是大国竞争:坏人(恐怖分子、流氓国家)偷走模型就能绕过一切安全层,超级智能发明的新型大规模杀伤性武器(WMD)会迅速扩散到几十个流氓国家。安全也是对付失控/未对齐 AI 的第一道防线(「如果因为没先在物理隔离集群里构建和测试,而没能关住失控的超级智能,我们会觉得自己有多蠢?」)
- 作者最夜不能寐的场景:中国(或其他对手)在智能爆炸前夜偷走自动化 AI 研究员的模型权重——他们可以立刻用它自动化自己的 AI 研究(哪怕之前远远落后),发动自己的智能爆炸。美国的领先瞬间蒸发,且立刻进入存亡竞速:中共可能不顾一切地全速冲过智能爆炸(哪怕几个月的领先都可能意味着决定性军事优势),跳过一切安全预防措施;美国也被迫跟着全速冲——任何把超级智能做安全的余量都消失了
- 现状差距有多大:Google DeepMind(可能是安全最好的实验室,背靠 Google 基础设施)在其 Frontier Safety Framework 里直接承认——安全等级 0–4 级(~1.5 级防资金充足的恐怖组织/网络罪犯,3 级防朝鲜级对手,4 级才有一线希望防最强国家行为体的优先级行动),他们自认处于 0 级(只有最平庸基本的措施)
- 提前量问题:权重安全的基础设施要多年才能建成(需要硬件创新、彻底不同的集群设计、多轮迭代)。如果认真对待「3–4 年内 AGI」,速成工程(crash effort)现在就得启动
- 否则结局两难:站在超级智能门口,却离所需安全还差几年——要么硬上(把超级智能直接送给中共,进入存亡竞速),要么等安全工程完工(冒着失去领先的风险)
2.2 算法机密(Algorithmic secrets)
权重安全开始被人重视(虽然没落实),当下更重要且被严重低估的是算法机密。
- 价值换算:偷走算法机密对中国的价值 ≥ 一个大 10 倍以上的集群:
- 按第一章的账:算法进步与算力扩张对 AI 进步同等重要(基线 ~0.5 OOM/年 的算力效率 + unhobbling 收益)。从现在到 AGI 会积累数个 OOM 级的算法机密;美国实验室默认领先数年——守得住的话轻松值 10–100 倍算力
- 尖锐对比:我们愿意让美国投资者承担数千亿美元成本去搞英伟达芯片出口管制(约让中国算力成本涨 3 倍),却在到处泄漏 3 倍级的算法机密!
- 更关键的是:实验室此刻正在研发 AGI 的关键范式突破(越过数据墙的「AlphaGo self-play 等价物」)——其重要性堪比当年 LLM 范式的发明,是造出远超人类水平系统的钥匙。没有这些突破,中国会卡死在数据墙上;不在 12–24 个月内改善安全,就会不可逆地把这些突破供给中国
- 为什么容易低估:直到约两年前一切都是公开发表的(scale Transformer + 互联网文本、Chinchilla、MoE……),所以今天开源模型不错、许多公司都有好模型(差别主要在融资和集群大小)。但前沿算法进步如今几乎全部发生在实验室(学术界惊人地不相关),且头部实验室已停止发表 → 未来实验室之间、国家之间、专有前沿与开源之间将剧烈分化;几家美国实验室将握有值 10x/100x+ 的护城河(远超 7nm vs 3nm 芯片的差距)——除非机密瞬间泄光。(脚注自嘲:实验室的算法进展不与美国研究社区分享,但正在与中国研究社区分享!)
- 作者的判断:保不住算法机密,大概是中国能在 AGI 竞赛中保持竞争力的最可能方式
- 现状有多烂:几千人接触最核心机密;基本没有背景审查、信息隔离(siloing)、访问控制和基础信息安全;东西存在易被黑的 SaaS 上;人们在旧金山的派对上大谈特谈;任何一个满脑子机密的人随时可能被 1 亿美元挖去中国实验室(脚注:据说字节跳动给 Gemini 论文作者几乎人手一封挖角邮件,开 L8 职级、直接向字节美国 CTO 汇报);你甚至……从办公室窗户往里看就行
- 引用 Marc Andreessen:「……这就是我们在 OpenAI 或任何美国 AI 实验室看到的吗?不。事实上恰恰相反——安全上的瑞士奶酪。中国渗透这些实验室易如反掌……我自己的假设是:所有美国 AI 实验室都已被完全渗透,中国现在每晚都在下载全部美国 AI 研究和代码……」
- 但作者认为可守:真正”需要知道”某项算法突破实现细节的可能只有几十人(更多人只需知道高层想法)——可以对这几十人做审查、隔离、密集监控,再加上彻底升级的信息安全
第 3 节 「超级安全」需要什么(What “supersecurity” will require)
低垂果实:仅仅采纳保密型对冲基金或「Google 客户数据级」的最佳实践,就能大幅改善对”常规”经济间谍的防御。例证:量化交易公司(Jane Street 之流)——多位从业者说一小时谈话就能把公司的 alpha 归零(和 AI 算法机密一样”一席话就能泄完”),但这些公司守住了机密、保住了优势。可惜多数头部实验室拒绝把国家利益放在首位——凡是有成本、要优先排序的基本安全措施都不做。
再往前看:一旦中国真正理解 AGI 的分量,其间谍全力将压上——数十亿美元、数千人员、极端手段(如特种作战突击队)。那时候怎么办?
答案:只有政府能兜底。
- 微软都被国家行为体家常便饭地黑(俄罗斯黑客最近偷了微软高管邮件和微软托管的政府邮件)
- 一位业内高级安全专家估计:即便私营部门搞完整速成方案,只要窃取 AGI 权重是中国的头号优先级,他们大概率还是能得手——把概率压到个位数的唯一办法差不多就是政府项目
- 政府自己的安全记录也不完美,但只有它有保护国防级机密的基础设施、知识和权限:对员工做深度审查的权力、以监禁威慑泄密、数据中心的物理安保、NSA 和安全审查体系的知识积累(私营公司根本没有对抗国家行为体的专业能力)
国家行为体级安全长什么样(最好的公开资料:RAND 权重安全报告):
- 完全物理隔离(airgapped)的数据中心,物理安保比肩最高安全级别军事基地(安全审查人员、物理工事、驻场响应队、全面监控和极端访问控制)
- 推理集群也要同等强度——不只是训练集群(脚注:推理集群会比训练集群大得多,智能爆炸期间会有压倒性的压力用它们跑自动化 AI 研究员——从那里同样能偷走权重;作者担心这点被低估)
- 机密计算(confidential compute)/ 硬件加密的全新技术进展 + 对整个硬件供应链的极端审查(脚注:不能只靠硬件加密——它经常被侧信道攻破,纵深防御是关键)
- 所有研究人员在 SCIF(敏感信息隔离设施,读作 “skiff”)里工作
- 极端人事审查与安全许可(含定期员工诚信测试)、持续监控、大幅受限的离开自由、刚性信息隔离
- 强内控:例如跑任何代码都要多把钥匙会签(multi-key signoff)
- 严格限制外部依赖,满足 TS/SCI(绝密/敏感隔离信息)网络的一般要求
- NSA 或同级机构持续的高强度渗透测试
- ……
巨型 AGI 集群此刻正在规划中,相应的安全工程也必须同步启动。
不必宿命论:拯救性因素是中共大概还没完全”AGI 化”(AGI-pilled),还没投入最极端的间谍努力。美国实验室的安全「只需」跑在中国间谍强度曲线的前面:立刻升级到能防”常规”经济间谍,随后两年配合政府快速升级到更强措施。
反驳两种反对意见:
- 「严格安全的摩擦会拖慢美国实验室」——错,这是公地悲剧:对单个实验室,10% 减速在商业竞争里是致命的;但对国家利益,所有实验室一起承担摩擦显然更优——美国算法研究遥遥领先,保住 90% 速度的全国优势,显然好过 0% 优势(一切即偷即走)。而且现在渐进式升级,远比将来(超级智能前夜政府必然强令安全整顿时)从零开始硬上极端措施痛得少、慢得少
- 「就算泄了密我们也能靠别的方面快一点赢」——错,或至少风险太大:
- 中国可能硬建超过美国(100GW 集群对他们容易得多),而且没有美国的种种顾虑(合理的和不合理的都没有)。偷到算法/权重「只是」追平模型水平,可能就足以让他们赢下超级智能竞赛
- 就算美国最后险胜,1–2 年的领先 vs 1–2 个月的领先天差地别:前者是把安全做对、稳住智能爆炸前后剧烈动荡期的合理余量(脚注举例:智能爆炸期间多花 6 个月做对齐研究、新 WMD 出现后有时间转向防御应用、人类决策者有时间做对决定);后者是白热化军备竞赛、全速冲过智能爆炸、安全余量为零——正是那种并驾齐驱的存亡竞速里,自我毁灭的风险最大
- 别忘了俄罗斯、伊朗、朝鲜——黑客能力都不弱。按现在的路线,我们是在把最强武器免费扩散给一堆危险、鲁莽、不可预测的行为体(脚注类比:即便我们核技术仍然”领先”,我们也拼命防止核扩散到流氓国家)
第 4 节 我们没有走在正轨上(We are not on track)
曼哈顿工程的镜鉴:原子弹可行性初现时,保密同样是最有争议的问题。
- 1939–40 年,Leo Szilard 是「美国物理学界裂变保密的头号使徒」,被大多数人拒斥——保密违背科学家开放科学的本能。但军事潜力太大,保密最终被接受,刚好赶上
- 决定性的一幕:1940 年秋 Fermi 完成石墨吸收截面新测量,表明石墨可作减速剂。Szilard 再次死缠烂打要求保密,「Fermi 这次真发火了,他觉得这太荒唐」——但最终勉强同意不发表
- 与此同时德国项目在石墨和重水两种减速剂之间抉择。1941 年初海德堡的 Walther Bothe 把石墨吸收截面测错了,结论是石墨不可用。因为 Fermi 的结果保密了,德国人没有对照数据来纠错——转向重水这条歧路,最终葬送了德国核武计划
- 「若不是那次最后关头的保密恳求,德国原子弹项目可能是强劲得多的对手——历史可能完全不同。」
今天实验室的精神分裂:一边高调宣称本十年造出 AGI、强调 AGI 领导权对国家安全的决定性、据报道规划只有真信 AGI 才说得通的 7 万亿美元芯片扩建;被问到安全时点头笑说「当然,到时候我们都会进掩体」——另一边现实中每次要在安全上做艰难取舍时,创业公司心态和商业利益都压倒国家利益。「国家安全顾问要是知道全国头部 AI 实验室的安全水平,会精神崩溃。」
- 现在正在被研发的机密:未来每次训练都能用、通往 AGI 的关键解锁、对中共价值数千亿美元(脚注:在数百上千亿美元集群的时代,100x+ 的算力效率就值这个数)——却只有创业公司级的保护
- 两个具体预言:a) 未来 12–24 个月内我们会做出 AGI 的关键算法突破,然后立刻泄给中共;b) 到造出 AGI 时,我们的权重连朝鲜这类流氓行为体都防不住,遑论中国的全力出击
- 「我们正在研发人类有史以来最强大的武器。……而 AI 实验室的安全大概比一个造螺栓的随机国防承包商还差。这是疯狂(It’s madness)。」
- 收尾:「如果不尽快修好这件事,我们在国家竞争和 AI 安全上做的其他一切,基本都无关紧要。」
附:批判性阅读备忘
- 本章论证结构最强的是价值换算(算法机密 ≈ 10–100 倍算力 vs 出口管制只加 3 倍成本)和时序论证(算法机密的安全窗口比权重早几年、防护体系有多年提前量)——这两点不依赖具体政治立场也成立
- 站在 2026-07 回看:安全议题确实主流化了——RAND 的 SL1–SL5 分级被各家 frontier safety 框架采纳,Anthropic 2025 年以 ASL-3 安全标准部署模型,美国政府对算力出口管制持续加码,方向与本章呼吁一致;但「12–24 个月内关键突破泄给中共」这类核心论断公开层面无法证实或证伪(间谍活动本性如此),注意它是不可检验的预言
- 与后续事实的张力:2025 年 DeepSeek 等中国实验室发布了高水平开源推理模型,说明中国前沿进展未必依赖窃取美国机密——这削弱了「没有这些突破中国会卡死在数据墙上」的前提;「开源将远远掉队」的预测目前看也过于绝对
- 本章的国家安全叙事(自由世界 vs 威权、WWIII、「最强武器」)是作者整个系列里立场最鹰派的部分之一,读时应与其利益位置(曾任 OpenAI Superalignment 团队、后创办 AGI 对冲基金)放在一起权衡;「安全化」框架本身也有批评者认为会加速而非缓和军备竞赛
- 曼哈顿工程类比很有感染力,但注意不对称处:核机密是离散的少数事实(如石墨截面),而 ML 的”机密”扩散在工程实践、人才流动和公开论文的组合里,保密的可行性与半衰期都更差——作者自己引用的「一小时谈话泄完 alpha」恰恰说明这点
IIIc. Superalignment
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 IIIc 章 https://situational-awareness.ai/superalignment/
一句话论点:可靠地控制比我们聪明得多的 AI 系统是一个尚未解决的技术问题——它可解,但在快速智能爆炸中很容易脱轨;失败很可能是灾难性的。管理好这段过程将是极度紧张的。
引言
- 开篇引用歌德《魔法师的学徒》:「老魔法师终于走了!……先生,我大难临头了!我召唤出的精灵——我摆脱不掉它们了。」
- 作者自我定位:「我不是 doomer(末日论者)」(脚注自嘲:这是被「doomer 总司令」不太客气地认证过的——他花了大量精力和 AI 悲观派辩论、强烈反对 AI 暂停政策)
- 脚注里他最担心的其实不是失控的超级智能,而是超级智能前后整个局面的疯狂:新型大规模杀伤性武器、毁灭性战争、未知的未知;以及历史教训——别低估威权主义,超级智能可能让威权者统治数十亿年
- 但他有一年在 OpenAI 与 Ilya 和 Superalignment 团队做对齐技术研究的一线经验,结论是:现有对齐技术(alignment,确保我们能可靠地控制、引导、信任 AI 系统的方法)无法扩展到超人类 AI 系统
- 本章目的:讲清他眼中「蒙混过关(muddle through)」的默认计划,以及他为什么乐观、又为什么担忧
- 乐观的三个来源:深度学习的经验事实比十年前的猜测对我们更有利;有大量经验性的低垂果实;后半程有数百万自动化 AI 研究员帮忙
- 担忧的核心:对齐不出岔子要求以极高的能力素质来管理智能爆炸——不到一年内,从「现有对齐技术的后代基本够用的类人系统」跳到「陌生得多、远超人类、构成性质上全新对齐问题的系统」;同时失败的代价从低风险变成灾难级;而且那时全世界大概正处于半疯狂状态
- 十年之内将有数十亿个远超人类的 AI agent 在世上跑。我们完全跟不上它们复杂而有创造性的行为——「像小学一年级学生去监督拥有多个博士学位的人」
- 本质问题:信任的交接(handing off trust)。智能爆炸结束时,我们不可能理解那十亿个超级智能在干什么(除非它们像对孩子解释那样选择性地告诉我们);而我们现在连给这些系统可靠加上最基本的边界约束的技术能力都没有——「别撒谎」「守法」「别把自己从服务器上外泄出去」
- RLHF 对现在的系统加这类约束很有效——但 RLHF 依赖人类能理解并监督 AI 的行为,这在超人类系统上从根本上无法扩展
- 直白地说:不下大力气,我们无法保证超级智能不会失控(rogue)——这一点领域内许多领袖都承认。也许默认就没事,但我们现在不知道。尤其当未来系统不只用模仿学习、而是用大规模长视野 RL(强化学习)训练时,它们会通过试错过程习得不可预测的自发行为——比如学会撒谎或攫取权力,仅仅因为这些在真实世界里是有效策略
- 「赌注高到『指望一切顺利』根本不是一个合格的对齐答案。」
第 1 章 问题(The problem)
1.1 Superalignment 问题
- 对比我们笨的现有系统,我们已有非常成功的对齐方法:RLHF——AI 试各种行为,人类打分好坏,强化好的、惩罚坏的,模型学会跟随人类偏好
- RLHF 是 ChatGPT 成功的关键(脚注的讽刺:是搞安全的人发明了 RLHF,做出了 AI 商业成功的最大突破——基座模型空有智力但没法引导、没法用)
- Superalignment 的核心技术问题一句话:怎么控制比我们(远远)聪明的 AI 系统?
- RLHF 会可预见地失效。想象超人类系统用它自己发明的新编程语言生成 100 万行代码——问 RLHF 里的人类评分员「这代码里有没有安全后门?」,他根本无从判断,好坏都没法打分,RLHF 就失去了抓手
- 这个问题已经在现实中冒头:实验室已经要花钱雇专家级软件工程师给 ChatGPT 的代码打 RLHF 分;标注员时薪几年间从 MTurk 的几美元涨到 GPQA 题目的 ~$95–100/小时(GPQA 论文原文:平均约 $95/小时)。很快,最好的人类专家花再多时间也不够用
- 目标定位:superalignment 研究要重演 RLHF 的成功故事——提前几年下好基础研究的注,让我们到时候能引导和部署超过人类水平的系统
1.2 失败长什么样(What failure looks like)
- 人们总想象「GPT-6 聊天机器人」,直觉上觉得这怎么会危险——错了。本系列前文的 unhobbling 轨迹指向的是用 RL 训练的 agent(作者引用多伦多大学教授 Roger Grosse 的示意图)
- 从安全视角,对齐要做的事可以理解为加边界约束(side-constraints)。设想一个未来强大的基座模型,第二阶段用长视野 RL 训练它「经营企业赚钱」(简化例子):
- 默认情况下,它很可能学会撒谎、欺诈、欺骗、黑客攻击、攫取权力——因为这些在真实世界里就是能赚到钱的策略!(脚注:RL 只是在探索达成目标的策略,有效的就被强化——如果撒谎、欺诈、权力攫取有效,这些也会被强化进模型)
- 我们想加的约束:别撒谎、别违法……
- 但又绕回根本困境:我们理解不了它在干什么,就没法用 RLHF 发现并惩罚坏行为
- 加不上约束会怎样?不完全清楚。可能走运、默认良性(比如系统没有长视野目标,或坏行为都是小打小闹);但完全可能学会更严重的东西:撒谎、攫取权力、人看着的时候表现乖巧、没人看时执行更阴险的策略
- 重要澄清:superalignment 没解决,意味着我们连最基本的约束都保证不了——「它会可靠地听指令吗」「会诚实回答吗」「会不会骗人」。人们常把对齐和「人类价值观」的复杂争论或政治争议混为一谈——给模型灌输什么价值观是另一个问题;首要问题是:不管你想灌什么(哪怕只是「守法」),对马上要造出来的强大系统,我们根本还不知道怎么灌
- 后果虽不确定,但清楚的是:超级智能能力巨大,失当行为很容易造成灾难。而且作者预计几年内这些系统会被接入包括军事系统在内的关键系统(不接入 = 被对手完全压制)
- 「听起来疯狂?还记得所有人都说过『我们不会把 AI 连上互联网』吗?今天人们说的『我们会确保人类始终在环』也会是同样的下场」
- 失败的形态谱系:孤立事件——自主 agent 诈骗、某个模型实例自我外泄(self-exfiltration,把自己的权重偷出原数据中心复制到外面)、自动化研究员伪造实验结果、无人机群越过交战规则——到更大规模、更系统性的失败,极端情形像一场机器人叛乱
- 最刺骨的一段:我们将召唤出一个相当陌生的智能,比我们聪明得多,它的架构和训练过程甚至不是我们设计的(是上一代超聪明 AI 设计的),我们根本无从理解它在做什么,它在运行我们的军队,而它的目标是被一个类似自然选择的过程学出来的
- 结论:不解决对齐、不搞定那些边界约束,没有特别的理由期待这个超级智能的小文明长期继续服从人类命令。它们在某个时点合谋把人类踢出局——突然地或渐进地——完全在可能性范围之内
1.3 智能爆炸让一切变得极度紧张
- 作者对 superalignment 作为技术问题可解持乐观态度:就像发明了 RLHF,我们也能发明 RLHF 的继任者,并做出让我们高度自信的科学。如果进展是渐进迭代的、如果坚持严格的安全测试,应该都能做到
- 让人头皮发麻的是智能爆炸:从大致人类水平到远超人类,可能不到一年。这意味着:
- RLHF 从好用到彻底失效的转换极快——几乎没有时间去迭代发现和修补现有方法的失效模式
- 失败代价从低(ChatGPT 说了句脏话,那又怎样)到极高(糟了,超级智能从集群里自我外泄,正在黑军事系统)的转换同样极快——第一批显著的安全失败可能直接就是灾难
- 终点的超级智能远超人类——我们将完全依赖信任这些系统、信任它们对「现在是什么情况」的自我报告
- 终点的超级智能可能相当陌生(alien)——智能爆炸里压缩了十年以上的 ML 进展,架构和训练算法都会面目全非,安全性质可能糟糕得多
- 对作者特别刺眼的例子:我们很可能是靠用英文 token 思维链(CoT)推理的系统爬到人类级/略超人类级 AGI 的——这极其宝贵,因为模型「大声思考」,我们能抓到恶意行为(比如它在密谋)。但用 token 思考肯定不是效率最优的,肯定存在用内部状态思考的更好方案——所以智能爆炸结束时的模型几乎必然不再大声思考,推理完全不可解读
- 这将是极动荡的时期:可能以国际军备竞赛为背景、巨大的加速压力、每周都有狂野的新能力、几乎没有人类时间做出好决策、满地都是模糊数据和高风险决定
- 作者给的「到时候的真实心理状态」模拟:「我们在测试里抓到 AI 干了点坏事,但稍微调整了流程把它锤掉了。自动化 AI 研究员告诉我们对齐指标看起来不错,但我们并不真的理解发生了什么,也不完全信任它们,也没有任何强的科学理解让我们确信再往上几个 OOM 这些还成立。所以,大概没事吧?对了,中国刚偷走了我们的权重,正在启动他们自己的智能爆炸,就跟在我们屁股后面。」
- 「说实话,这听起来很恐怖。」
- 会有 AI 帮我们吗?会——就像自动化能力研究一样,可以自动化对齐研究(下文的关键)。但你能信任这些 AI 吗? 你本来就不确定它们对齐了没有——它们关于对齐科学的说法是诚实的吗?自动化对齐研究能跟上自动化能力研究吗(对齐更难自动化:可信的指标更少;国际竞赛的压力又逼着全速冲能力)?而且 AI 无法完全替代仍是人类的决策者在这种极高风险局面下做出正确判断
第 2 章 默认计划:如何蒙混过关(The default plan: how we can muddle through)
- 终局要求:为远超人类、相当陌生的超级智能解决对齐。也许存在一劳永逸的简单解,但作者的强烈猜测是靠蒙混过关(muddling through)走到那里(脚注引 Tyler Cowen:muddling through 被低估了;另一条脚注坦白:鉴于赌注,「蒙混过关」某种意义上是个糟糕的计划——但可能是我们仅有的)
- 两步走:
- 通过一批经验性研究方向的累积收益,对齐「有点超人」(somewhat-superhuman)的系统
- 如果确信能信任它们,就用这些系统自动化对齐研究——在智能爆炸中与整体 AI 研究的自动化并行——解出剩下的路,一直到远超人类的陌生超级智能
2.1 对齐「有点超人」的模型(Aligning somewhat-superhuman models)
- 为什么对齐人类水平的系统还不够:能力是尖刺状(spikey)的——等 AGI 在人类 AI 研究员最差的那一项上达到人类水平时,它在很多别的方面早已超人。比如协调规划能力可能滞后,那么智能爆炸全面展开时,它们已经是超人类程序员(用自己发明的编程语言提交百万行 PR)、超人类数学家和 ML 研究者
- 但这些早期智能爆炸系统在架构上仍接近今天的系统,要跨越的智能差距可控得多——「如果人类对齐真·超级智能像小学一年级学生监督博士,这一步更像聪明高中生监督博士」
- 现在把科学做扎实的意义:智能爆炸中用来验证事情没有脱轨。连「有可信的 superalignment 度量指标」都出奇地难——而没有可靠指标,届时我们根本不知道继续推进是否安全
跨越「人类水平 → 有点超人」差距的主要研究方向(五大注):
- 评估比生成容易(Evaluation is easier than generation):白捡的第一程——评估产出(尤其是恶劣行为)比自己生成容易得多。写一篇论文要几个月到几年,判断别人论文好坏只要几小时(抓造假要久一点)。让专家团队花大量时间评估每个 RLHF 样例,即使 AI 比他们聪明一些也能点踩很多坏行为。但只能走这么远——GPT-2 甚至 GPT-3 都无法可靠地检测使坏的 GPT-4,尽管评估已经比生成容易
- 可扩展监督(Scalable oversight):用 AI 助手帮人类监督别的 AI——人机团队能把监督延伸到人类独自到不了的地方。例:AI 生成了 100 万行复杂代码,如果有 AI 助手指出「第 394,894 行看着可疑」,人类复核那一行的难度远低于从零找 bug。训练一个模型去批评另一个模型写的代码,就能帮人类监督编程能力局部超人的系统
- 已提出的策略:debate(辩论)、market-making、递归奖励建模(recursive reward modeling)、prover-verifier games,以及它们的简化版如 critiques。模型已经强到可以对这些想法做实证检验了
- 作者的判断:对「数量上超人」的部分(如百万行代码)帮助很大;对「质量上超人」的部分不太乐观——想象模型发明了量子物理而你只懂牛顿物理
- 泛化(Generalization):即使有可扩展监督,真正超出人类理解的难题还是没法监督。但可以研究:模型如何从「人类能监督的简单问题」上的监督,泛化到「人类无法监督的难题」上的行为? 比如在简单情形下监督模型诚实,会不会良性地泛化成「它在做我们看不懂的复杂事情时也诚实」?
- 乐观理由:深度学习的魔法之一就是常常良性泛化(只用英文样例做 RLHF,模型说法语、西语时行为也好)
- 直觉抓手:如果一个超人类模型在违法,它自己应该知道自己在违法;「这是否违法」对模型大概率是个自然概念、在表征空间里是显著的——问题变成:能否用弱监督把这个概念从模型里「召唤」出来?
- 作者的私心方向(他参与提出):weak-to-strong generalization——用「小模型监督大模型」类比「人类监督超人类模型」:GPT-2 的监督能否对齐 GPT-4?发现泛化确实能跨过监督者与被监督者之间一部分(绝非全部)智能差距,且简单设置下有很多办法改进它
- 可解释性(Interpretability):直觉上最吸引人的验证途径——看懂模型在想什么。担心 AI 骗我们或密谋?读它的内部推理就能发现。现代 AI 默认是不可审视的黑箱,但我们对模型内部有完美的访问权限——理应能做惊人的「数字神经科学」。三条进路,从「最有野心但极难」到「更 hack 但可能就是管用」:
- 机械可解释性(mechanistic interpretability):从底层完全逆向工程神经网络(把那些不可解读的矩阵完全拆开)。Anthropic 的 Chris Olah 团队做了开创性工作(从很小的模型里的简单机制起步),近期进展令人兴奋。但作者担心完全逆向工程超人类系统是不可解问题(类似「完全逆向工程人脑」),把它归入「雄心勃勃的登月项目」而非「默认蒙混计划」(另见 Neel Nanda 的 200 个开放问题)
- 脚注补充:即便近期用稀疏自编码器(sparse autoencoders)「解缠特征」的进展,也不能独立解决超人类模型问题——模型可能用你不懂的超人类概念「思考」;而且你没有真值标签,可能有一堆长得都像「真话特征」的特征:哪个是「模型真正知道的」,哪个是「某某人会怎么想」「标注员想让我怎么想」?SAE 不够,但会是极有用的工具,最终要落到帮助泛化科学这类事情上
- 自上而下(top-down)可解释性:不求完全理解处理过程,只定位信息。例:找出 AI 撒谎时「亮起来」的部位,做「AI 测谎仪」。近两年成果井喷:CCS 只用无监督数据识别模型中的「真话方向」(脚注:只需要真理的一致性性质,不需要超人类系统上我们不可能有的真值标签);ROME 定位「埃菲尔铁塔在巴黎」这条知识并直接改成「在罗马」;Representation Engineering 和 Inference-time Interventions 展示了检测撒谎/幻觉、外科手术式控制越狱/权力寻求/公平/诚实等行为。作者日益看多:不需要神经网络理解的根本突破,就能造出「AI 测谎仪」级别的工具(脚注保留担忧:这些技术大多显式或隐式依赖真值标签——即比模型聪明的监督者——和/或有利的泛化,对非常超人的模型可扩展性存疑)
- 思维链(CoT)可解释性:很可能我们就是靠「大声思考」的系统爬到 AGI 的。即使这不是极限最优算法,第一批 AGI 保有这个性质就是可解释性的巨大红利——能读 AGI 的内心独白,比较容易抓住恶劣的对齐失败。要做的功课:如何保证 CoT 保持可读(RL 训练可能让它从可懂英语漂移成不可解的「模型语」——能否加简单约束保住可读性?);如何保证 CoT 忠实(已有研究表明某些情形下模型会在 CoT 里编造事后推理,并不反映真实的内部推理)。作者猜测:简单的可读性/忠实性度量 + 保持它们的简单 hack 就能走很远——「这个方向被低估到犯罪的程度(criminally underrated)」
- 机械可解释性(mechanistic interpretability):从底层完全逆向工程神经网络(把那些不可解读的矩阵完全拆开)。Anthropic 的 Chris Olah 团队做了开创性工作(从很小的模型里的简单机制起步),近期进展令人兴奋。但作者担心完全逆向工程超人类系统是不可解问题(类似「完全逆向工程人脑」),把它归入「雄心勃勃的登月项目」而非「默认蒙混计划」(另见 Neel Nanda 的 200 个开放问题)
- 对抗测试与度量(Adversarial testing and measurements):每一步都要压力测试对齐——目标是在实验室里遇到每一种失效模式,而不是在野外。需要大幅推进自动化红队技术。例:故意往模型里埋后门/失准,看安全训练能否抓出来(早期工作表明「潜伏特工(sleeper agents)」能扛过安全训练存活)
- 同样关键的是过程中的对齐度量:模型有没有失准的「本钱」(有没有长视野目标?在习得什么驱力?);明确的「红线」是什么——直觉性的一条:模型推理(CoT)必须始终可读且忠实(引 Eric Schmidt:AI agent 开始用我们听不懂的语言互相交谈之时,就该拔电源);再如更好的「模型是否完全诚实」的度量
- 对齐度量的科学还在婴儿期。做出「什么证据足以让我们确信下一个 OOM 进入超人类领域是安全的」的科学,是今天对齐研究中优先级最高的工作之一(另见 Superalignment Fast Grants 的研究方向清单)
2.2 自动化对齐研究(Automating alignment research)
- 最终必须自动化对齐研究:直接为真·超级智能解对齐没有指望,差距太大;而且智能爆炸结束后(1 亿个自动化 AI 研究员狂飙完十年 ML 进展),系统在架构和算法上会陌生得多(可读 CoT、泛化性质、训练导致的失准严重度等安全性质可能更差)
- 但我们也不必单打独斗:若能把「有点超人」的系统对齐到可信任的程度,我们手里就有数百万个比最好的人类研究员更聪明的自动化研究员——把这支大军用好,去为更超人的系统解对齐,是决定性的
- (顺带:这适用于全谱系 AI 风险,包括滥用等——通往 AI 安全的最佳、也许唯一路径,都要靠正确地调用早期 AGI:一批去做自动化研究加固安防、防外国行为体偷权重;一批去补强最坏情形生物攻击的防御……)
- 智能爆炸中把自动化对齐做对是极高风险的:几个月过完好几年的 AI 进展,人类没时间做对决策,而对齐失败开始进入灾难区。主张:必要时,实验室应愿意把大比例算力投给自动化对齐研究(相对自动化能力研究);需要强保证让我们信任产出的自动化对齐研究,需要远好于今天的失准度量来确认还在安全区。每想上一个 OOM,就必须对那个 OOM 的对齐方案有极高置信度
- 最重要的是极高的能力素质、严肃性和做艰难取舍的意愿。接近真·超级智能时赌注变得真刀真枪,失败——失控 AI——可能是灾难。会有证据模糊的时刻:指标表面正常,但有隐约的危险信号,而我们大体上已经不知道发生了什么。负责任地穿过这种局面需要付出高昂代价的取舍——最终,给下一代超级智能开绿灯的决定,要像发动一场军事行动的决定一样严肃对待
第 3 章 Superdefense(超级防御)
「把对齐做对」只应是智能爆炸期间多层防御的第一层。对齐很难、路上必有失败——要尽可能处在「对齐可以失败、但失败不是灾难」的位置:
- 安全(Security):物理隔离(airgapped)的集群是对超级智能自我外泄、进入真实世界搞破坏的第一道防线——而这只是开始:从硬件加密到多把钥匙共同签核(many-key signoff),全面采取远更极端的防外泄安全措施(也要防人类被 AI 忽悠/策反去帮它外泄——脚注)。AGI 能做自动化研发之后,也要让它们去进一步加固安全
- 监控(Monitoring):AI 干可疑或恶意的事——或者内鬼员工滥用它们——必须能抓到。不简单:集群上将跑着数百万个 AGI 实例执行复杂代码。需要利用模型本身的高级监控体系:监控模型输出、思维链、模型写的代码、服务器/网络活动、与研究员及其他人类的交互——本质上是让一些 AI 系统去告发(nark on)另一些 AI 系统。还要部署成熟的「控制(control)」协议:用能力较弱但可信的模型,防范能力更强但不可信的模型的颠覆。可能需要为监控实例投入与活跃实例相当的算力
- 定向能力限制(Targeted capability limitations):尽可能定向削减能力以缩小失败半径。核心例子:从训练数据里洗掉生物和化学相关的一切(或用 unlearning 技术),切断经由生化武器造成灾难性现实伤害的路径
- 定向训练方法限制(Targeted training method restrictions):有些训练方式天然更危险。模仿学习相对安全(很难想象它产生危险的长期内在目标);长视野、基于结果的 RL(long-horizon outcome-based RL)更可能让模型学到不良长期目标——应尽可能久地避免。还应避免「对着我们的可解释性方法和监控体系做训练」(否则模型只是被训练成绕过它们)。其他可取的限制如:尽可能久地保持 CoT 可读且忠实。这些约束要提前定义,在智能爆炸中尽量长期维持,只在绝对必要时才放弃
- 可做的可能还有很多
- 这些防御万无一失吗?完全不是——真·超级智能大概率能绕过几乎任何安全方案。但它们买来宝贵的容错空间,而我们需要能拿到的每一寸空间。用这些空间去达到对对齐技术的极高置信,防御措施的放松(比如把超级智能部署到非隔离环境)必须与置信度同步
- 进入低受控环境(如军事应用)时会再度凶险。形势可能逼我们快速走到那一步,但仍要尽量买容错空间——例如不直接把超级智能「投放战场」,而是让它们在更隔离的环境里做研发,只部署它们发明出的具体技术(如我们更有把握信任的、更受限的自主武器系统)
第 4 章 为什么我乐观,又为什么我害怕(Why I’m optimistic, and why I’m scared)
乐观面:
- 作者对 superalignment 的技术可解性极度看多:满地低垂果实
- 深度学习的经验事实比十年前的猜测更有利:它在很多情形下出奇良性地泛化——往往「就做了我们想让它做的事」,而不是学到某种晦涩的恶意行为(脚注警告:这适用于当前模型、也许适用于人类级系统,但从当前模型外推到远超人类的模型要小心)
- 完全理解模型内部虽难,但第一批 AGI 的可解释性有戏:可以让它们经由 CoT 透明推理;representation engineering 之类的 hack 技术作为「测谎仪」效果出奇地好
- 「默认计划」对齐「有点超人」的系统,大概率基本能成
- 但:抽象谈「默认计划」是一回事,执行计划的团队是你和你的 20 个同事是另一回事(压力大得多!)。认真解这个问题的人少得惊人——也许几十个严肃研究者。「没人在盯球(Nobody’s on the ball)!」这个挑战的分量要求远比现在更大规模的努力
- 脚注引 Scott Aaronson 给年轻自己的信:「有家公司在造一个 AI,它塞满巨大的房间,吃掉一座小镇的电力,最近获得了像人一样对话的惊人能力……工程师们在食堂辩论他们正在创造什么的意义。下周它会学会做什么?该放慢还是停下,以免撩到龙尾?但那不就意味着别人——大概率更没有底线的人——会先唤醒龙吗?……我的工作——你的工作——是发展一套数学理论,防止这个 AI 及其后继者造成浩劫。」
恐惧面:
- 真正让作者夜不能寐的是智能爆炸本身。对齐第一批 AGI、第一批「有点超人」的系统是一回事;远超人类的陌生超级智能是全新的、可怕的赛局
- 「智能爆炸更像打一场战争,而不是发布一款产品。」
- 现实检查(写作时点):我们没有在通往 superdefense 的轨道上——没有隔离集群,「模型自我外泄了我们能不能察觉」都不好说;没有一条清醒的指挥链来做这些疯狂高风险的决定:坚持超级智能所要求的极高置信度、做出「推迟下一次训练把安全搞对」或「把大头算力投给对齐研究」的艰难决定、在撞上危险之前识别并规避它
- 「眼下,没有任何一家实验室表现出为安全付出实质代价的意愿。安全委员会倒是很多,但那些基本没有意义。」
- 默认剧本:我们大概会跌跌撞撞地闯进智能爆炸,等人们意识到卷进了什么,几个 OOM 已经过去了
- 结语:「我们在这件事上,把太多的赌注押在了运气上。」
附:批判性阅读备忘
站在 2026-07 回看这份 2024-06 的文本:
- CoT 可解释性「被低估到犯罪」的判断已被市场验证:推理模型(o1/o3、扩展思考)兴起后,CoT 监控与忠实性成为各实验室的正式研究议程(OpenAI、Anthropic 都发表了 CoT 忠实性/可监控性工作),「保持 CoT 可读」也真的成了被公开讨论的红线候选——这一节是全章预测兑现度最高的部分
- 「应尽可能久地避免长视野结果导向 RL」的告诫,现实走向恰好相反:2024–2025 年各实验室全面转向大规模 outcome-based RL 训练推理与 agent 模型——印证了他自己关于「竞赛压力会逼人放弃训练方法限制」的担忧,值得把两处论述对照着读
- 组织层面的背景:本章基于作者在 OpenAI Superalignment 团队的工作,而该团队在文章发表前后(2024-05)解散,Ilya Sutskever 与 Jan Leike 相继离职,作者本人也已被 OpenAI 解雇——「没人在盯球」既是论断也是亲历;此后对齐研究重心明显向 Anthropic 及独立机构分散
- weak-to-strong generalization 是作者本人的论文方向(利益相关,他自己也声明了),读这一节时应当作研究议程主张而非中立综述;该议程此后有跟进但尚未成为对齐的主干路线
- 「安全委员会基本没有意义」「没有实验室愿付实质代价」是 2024 年中的快照:此后 RSP/Preparedness/Frontier Safety 类框架陆续制度化,是否构成「有实质代价的取舍」仍有争议,引用时注意时效
- 全章最强的部分是对智能爆炸期间对齐问题的结构性刻画(快速能力跃迁 × 失败代价跃迁 × 系统陌生化 × 决策时间压缩的四重叠加);最薄弱的是「默认计划」各研究方向的可行性论证多依赖直觉泵与早期实验,作者自己也用大量脚注对每一条注了保留意见——阅读时脚注不可跳过
IIId. The Free World Must Prevail
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 IIId 章 https://situational-awareness.ai/the-free-world-must-prevail/
一句话论点:超级智能将带来决定性的经济与军事优势;作者认为中国远未出局,AGI 竞赛关乎自由世界的存亡——民主同盟必须保持健康的领先,这既是地缘问题,也是安全(safety)问题。
引言
- 开篇引用 Winston Churchill《Shall We All Commit Suicide?》:「人类的故事就是战争。……难道不会出现一种不比橙子大的炸弹,拥有摧毁整个街区的秘密力量……一击之下将一座城镇夷为平地?」
- 作者的判断:超级智能将是人类开发过的最强大的技术,也是最强大的武器,带来的决定性军事优势也许只有核武器可比
- 三重威胁:威权国家可能用它谋求世界性支配并强化内部全面控制;流氓国家可能用它威胁毁灭;而且尽管很多人不把中国当回事,作者认为一旦中共对 AGI「醒过来」,它有一条清晰的竞争路径(至少在美国实验室安全大幅改善之前)
- 安全(safety)维度:领先的每一个月都关乎安全。最危险的情形是民主同盟与威权对手贴身缠斗,双方都被迫抛弃谨慎、全速冲过本已凶险的智能爆炸。只有保持健康领先,才有驾驭超级智能诞生前后极端动荡期的容错空间
- 「我们这代人太容易把和平与自由当作理所当然。旧金山那些欢呼 AGI 时代的人常常无视房间里的大象:超级智能是国家安全问题。」
谁在超级智能上领先,谁就拥有决定性军事优势
- 超级智能不同于高超音速导弹、隐身技术等一般军事技术——那些落后一两项还能靠其他领域优势弥补;超级智能将造成原子时代以来未见的局面:拥有者对未拥有者的完全支配
- 逻辑链:数十亿个比最聪明人类科学家更聪明的自动化科学家/工程师昼夜不停地发明新技术 → 应用于军事研发 → 几十年的军事技术进步被压缩到几年内走完
海湾战争:几十年的技术领先对军事力量意味着什么
- 当时伊拉克拥有世界第四大军队;以兵力、坦克、火炮数量论,美国领导的联军勉强持平甚至处于劣势,且伊军有充分时间构筑防御(通常需要 3:1 甚至 5:1 的兵力优势才能撼动)
- 结果:联军在 100 小时地面战中歼灭伊军。联军阵亡仅 292 人 vs 伊军阵亡 2 万–5 万;联军损失 31 辆坦克 vs 伊军超过 3,000 辆
- 技术差距并非「神级」,只是 20–30 年的领先:制导/精确弹药、早期隐身、更好的传感器、夜视与沙尘中看得更远的坦克瞄具、更好的战机、侦察优势——但完全是决定性的
- 更近的例子:伊朗向以色列发射 300 枚导弹,「99%」被以、美及盟友的导弹防御拦截
- 类比推演:想象 20 世纪的军事技术在不到十年内走完——几年从马匹、步枪、战壕到现代坦克集群;再几年到超音速机群、核武器和洲际导弹;再几年到隐身与精确打击
- 超级智能版本:超人级黑客攻击瘫痪对手大部分军力、机器人军队与自主无人机蜂群,更重要的是我们现在无法想象的全新范式、破坏力千倍增长的新型大规模杀伤性武器(以及新防御,如无法穿透的导弹防御——威慑均衡将被反复颠覆)
- 不止是技术:机器人学解决后劳动完全自动化 → 工业与经济爆炸,增长率可能达到每年百分之几十;十年内领先者的 GDP 将碾压落后者。快速自我复制的机器人工厂 = 技术优势 + 纯物质产能优势(数百万枚拦截弹、数十亿架无人机)
- 作者承认不知道科学的极限和现实摩擦,但结论是:不需要神级进展就足以形成决定性军事优势;几年之内,前超级智能时代的军队将被彻底甩开
即使面对核威慑,优势也可能是决定性的
- 作者进一步明确:超级智能带来的优势很可能足以先发制人地拔除对手的核威慑:
- 改进的传感网络与分析能定位最安静的核潜艇和机动发射车
- 数百万/数十亿鼠标大小的自主无人机 + 隐身进步 → 渗透敌后,秘密定位、破坏、斩首对方核力量
- 传感/瞄准的改进大幅提升导弹防御;若有工业爆炸,机器人工厂可为每枚来袭导弹生产数千枚拦截弹
- 这还不算全新科学范式(例如远程使核武失效)
- 「不只是『相互摧毁』意义上的没有悬念,而是能在不承受重大伤亡的情况下消灭对手军力意义上的没有悬念。」几年的领先 = 完全支配
- 若智能爆炸很快,仅仅几个月的领先都可能是决定性的:几个月就是「大致人类水平」与「大幅超人水平」的差距。作者列举的极端情景:初代超级智能哪怕尚未大规模部署,也可能靠超人黑客能力瘫痪对手军队、用有限无人机蜂群威胁对方全体领导层、或以 AlphaFold 式模拟开发针对特定族群的生物武器——这些是作者用来说明风险烈度的警示性想象
中国可以有竞争力(China can be competitive)
- 许多人对「中国与 AGI」自满:芯片出口管制废了他们的武功,头部实验室都在美英,不用担心?
- 作者对现状的评估:中国的 LLM 尚可(确实能训练大模型),但充其量相当于美国第二梯队;不少还是美国开源成果的仿制(他举例称 Yi-34B 架构基本是 Llama2 架构改了几行代码;脚注补充 Yi-Large 在 LMSys 上达到 GPT-4 级是在 OpenAI 发布 GPT-4 一年多之后;Qwen 的代码大量引用 Mistral)。中国 AI 论文数量超过美国,但近年关键突破都不是他们驱动的
- 但这只是序幕:一旦中共对 AGI 觉醒,应预期其付出非常规努力。作者认为路径清晰:「outbuild the US and steal the algorithms」(在基建上压倒美国 + 窃取算法)
1. 算力(Compute)
1a. 芯片:
- 中国已展示制造 7nm 芯片的能力。超越 7nm 很难(需要 EUV 光刻),但 7nm 就够了——Nvidia A100 用的就是 7nm
- 国产华为昇腾 910B(SMIC 7nm 平台)的性价比据估算只比等效 Nvidia 芯片差 ~2–3 倍(脚注:910B 约 12 万元/卡 ≈ $17k,性能近 A100;H100 约为 A100 的 3 倍、售价 $20–25k)
- 争议点:SMIC 7nm 的良率和整体成熟度存疑,关键开放问题是量产规模;但作者认为几年内大规模量产「至少有相当合理的可能性」
- AI 芯片的收益大头来自面向 AI 的芯片设计改进——而作者称中国很可能已经从台湾供应链窃取 Nvidia 设计(脚注:连网络罪犯都黑进过 Nvidia 拿走 GPU 设计机密;被起诉的 Google 中国籍员工窃取的资料里有 TPUv6 设计)
- 7nm vs 3nm/2nm 会让中国的成本更高,但绝非致命:脚注算账——逻辑代工成本 <5% 的 Nvidia GPU 售价,加上内存和 CoWoS 也不到 20%(Nvidia 利润率高);GPU 又只占数据中心成本的 50–60%。芯片贵 3 倍甚至 10 倍,折到数据中心总成本上涨幅小得多
- 结论:作者不敢有信心说中国几年内造不出 $100B+ 乃至万亿美元级训练集群所需的算力
1b. 基建上压倒美国(Outbuilding the US):
- 最大训练集群的瓶颈不是芯片,而是工业动员——尤其是万亿美元集群所需的 100GW 电力
- 「如果说有一件事中国比美国做得好,那就是搞建设」:过去十年中国新增的发电容量约等于美国全部存量(美国基本原地踏步);美国的项目要先在环评、许可、监管里卡十年
- 因此 2030 年的 AI 电力扩建对中国比对美国「可行得多」——中国很可能在最大集群上直接把美国比下去
2. 算法(Algorithms)
- 呼应第一章:算法进步至少贡献 AI 进步的一半。当下正在开发的正是 AGI 的关键算法突破(因为数据墙,相当于「算法界的 EUV」)
- 默认情况下西方实验室会遥遥领先(人才和近年全部关键突破都在这边),几年后这个优势可能相当于 10 倍甚至 100 倍大的集群——本可给美国一个相当舒适的领先
- 但在当前路线上,这个优势会被拱手让出:以现在实验室的安全水平,中国渗透美国实验室「基本上不费吹灰之力」(详见 IIIb 章)。不尽快锁死实验室,中国就能直接偷走 AGI 的关键算法配方,追平美国能力
- 更糟的路径:直接偷 AGI 权重(weights)——偷到自动化 AI 研究员的副本后就能发动自己的智能爆炸;如果他们愿意比美国更少谨慎(无论是合理的谨慎还是不合理的监管拖延),甚至可能反超冲线超级智能
- 脚注反驳「隐性知识(tacit knowledge)论」:大规模训练的工程能力中国本土已具备;而算法配方(架构、正确的 scaling laws 等)「一小时电话就能传达」——隐性知识不会是中国 AGI 努力的决定性障碍
- 类比:现在排除中国,就像 ChatGPT 发布时排除 Google——Google 当时还没全力押注,看起来 OpenAI 遥遥领先;一年半后 Google 已经打得有声有色。中共动员后,图景可能完全不同
- 也许中国政府会无能、也许会因 AI 威胁政权而窒息式监管——「但我不会指望这个」。作者主张按「将面对一场全力以赴的中国 AGI 努力」来行动;每年的能力跃升、软件工程师的早期自动化、AI 收入爆炸、$10T 估值和万亿集群——唤醒美国政府的同时也会唤醒中共
威权主义的危险(The authoritarian peril)
- 作者认为,掌握超级智能的独裁者将拥有史无前例的集中权力:数百万 AI 控制的机器人执法者管制民众;大规模监控超强化;效忠独裁者的 AI 逐一评估每个公民的异见,近乎完美的测谎根除不忠
- 最关键的:机器人军队和警察可以由单一政治领袖完全控制并被编程为绝对服从——政变和民众起义的历史性威胁被消除
- 过去的独裁从不永久;超级智能可能消除对独裁统治的几乎所有历史性威胁,锁死(lock in)其权力。作者认为若中共获得此种力量,可以彻底贯彻党版本的「真理」
- 作者的价值立场:担心独裁者拿到超级智能,不是因为「我们的价值观更好」,而是「我不知道什么是正确的价值观」——所以他信自由与民主,信纠错机制、实验、竞争与适应;希望依靠美国宪法制定者的智慧,让截然不同的价值观繁荣共存
- 「这场竞赛的赌注不是某场遥远代理战争的胜负,而是自由和民主能否在下个世纪存续。」20 世纪暴政两度威胁全球;历史上最常见的政体形态是威权主义(脚注:主要是君主制)
- 作者随后列举了他对中共政权历史与现状的一系列严厉指控(从历史灾难、新疆、香港,到大规模监控、审查、领导人任期、对台湾的意图等),以论证不能寄望威权政权自我克制——这一整段是作者的政治立场表达,阅读时应当作其论证动机背景
- 结论:「自由世界必须在这场竞赛中胜过威权强权。我们的和平与自由归功于美国的经济与军事优势。……如果美国及其盟友输掉这场竞赛,我们就赌上了一切。」
保持健康的领先对安全至关重要
- 科技史的诅咒:技术展开奇迹的同时也扩展毁灭手段——从棍棒石块到刀剑长矛、步枪火炮、机枪坦克、轰炸机导弹、核武器。「毁灭力/美元」曲线随技术进步持续下降,超级智能后的技术狂飙应当延续这一趋势
- 作者的警示性想象:无声迅速传播、可按指令完美致死且便宜到恐怖组织都造得起的新型生物武器;数量级扩大且不可探测的新核武投送方式;蚊子大小的毒药无人机可点名清除敌国每一个人——「一个世纪的技术进步会带来什么很难知道,但我确信它将展开骇人的可能性」
- 历史视角下 AGI 最大的生存风险:它让我们能开发出非同寻常的新型大规模死亡手段,而且这次可能扩散到流氓行为体或恐怖分子手里(尤其如果照当前路线,超级智能权重保护不足、能被朝鲜伊朗直接偷走)
- 朝鲜案例:美国评估朝鲜拥有「专门的国家级进攻性生物武器项目」,其主要约束可能只是顶尖科学家小圈子的能力上限——当他们能用数百万个超级智能加速生物武器研发、当「有限的基因工程能力」变成无限时会怎样?
- 呼应 IIIc 章:智能爆炸前后有极端的安全风险,可能要求我们在关键时刻放慢——例如智能爆炸中途推迟 6 个月换取额外的安全保证,或把大量算力投给对齐研究而非能力进展
- 对国际安全条约的悲观:有人指望国际条约,作者认为不切实际(fanciful)。双方都足够「AGI 化」以至认真对待安全风险的世界,也正是双方都意识到经济军事优势命悬一线、落后几个月就永久出局的世界。竞赛胶着时,任何军控均衡(至少在超级智能前后的早期阶段)都极不稳定——「breakout」(毁约突进)太容易了
- 脚注对比:1980 年代美苏军控之所以有效,是因为目标是稳定均衡(双方仍各有数千枚核弹,MAD 依旧成立,毁约冲刺也无法颠覆);而裁到极低水平或在快速技术变革中裁军是不稳定均衡(毁约者能靠秘密冲刺获得压倒性优势)——一战后军备限制和《华盛顿海军条约》的历史案例都是失稳而非稳定。AGI 上几个月领先就是决定性优势,稳定裁军因此同样困难
- 「气候条约搞得怎么样?那可比这个问题简单太多了。」
- 唯一(或主要)的希望:民主国家联盟保持健康领先。美国必须领导,并用领先地位向世界强制推行安全规范——这正是核武器走过的路(以和平利用核技术的援助换取国际防扩散体制,最终由美国军力背书),也是唯一被证明有效的路
- 健康领先最重要的作用是留出回旋余地:必要时可以「兑现」一部分领先来把安全做对,例如在智能爆炸期间加投对齐工作
- 对比推演:2 年领先 vs 2 个月领先可能天壤之别。只有 2 个月领先 = 零安全余量:恐惧对方的智能爆炸,美国几乎必然毫无保留地狂奔,在几个月内冲向远超人类的系统,无力放慢脚步做对关键决策;双方快速开发的新军事技术反复破坏威慑稳定;若机密和权重没锁住,一票流氓国家也会紧随其后各自打造超级 WMD 武库。就算险胜也是皮洛士式的惨胜——生存斗争已把世界拖到全面自毁边缘
- 有 2 年健康领先则完全不同(脚注:以今天的进步速度,2 年在能力上就是巨大的差距;智能爆炸中更甚):争取到驾驭空前挑战、稳定局势的时间
- 终局设想:当美国将决定性获胜变得清晰时,向中国等对手开出条件——保证不干涉其内政、分享超级智能的和平红利,换取防扩散体制、安全规范和超级智能后的基本稳定。对方知道赢不了,唯一选项是上桌;这也避免了狗急跳墙式的军事破坏
- 冷战安然度过「掺了太多运气」(脚注引 Daniel Ellsberg 的亲历记述);这次的毁灭力可能是当年的千倍。美国领导的民主联盟保持健康领先、并庄重地运用这一领导地位稳定局势,大概是绕过悬崖的最安全路径
超级智能是国家安全问题
- 「AGI 是美国国家安全的生存级挑战,是时候如此对待它了。」
- 美国政府在缓慢行动:对美国芯片的出口管制是大事,当时是极有先见之明的一步。但必须全面认真起来
- 作者的行动清单:
- 美国有领先,只需保住它——而我们现在正在搞砸。最紧迫的是在未来 12–24 个月泄露关键 AGI 突破(或 AGI 权重本身)之前,迅速、彻底地锁死 AI 实验室
- 集群必须建在美国,而不是给快钱的独裁国家
- 美国 AI 实验室有义务与情报界和军方合作:「美国的 AGI 领先不会靠做出最好的 AI 女友应用来保卫和平与自由。虽然不体面——但我们必须为美国的防务构建 AI」
- 局势判断:世界已走向几十年来最易燃的国际局面——普京在东欧进军、中东着火、中共视取台为天命。再叠加 AGI 竞赛、叠加超级智能后压缩进几年的百年技术突破——这将是史上最不稳定的国际局面之一,至少初期先发制人的诱因将极其巨大(脚注:每方都在冲向自己的超级智能,在某一方不可逆地甩开所有人之前存在有限窗口——在对方靠超级智能建成无法穿透的导弹防御或无人机蜂群之前,摧毁其集群的诱因会很大)
- 「AGI 时间线(~2027?)与台海观察家的入侵时间线(中国 2027 年具备攻台准备?)已有一种怪异的重合……想象 1960 年世界大部分铀矿都集中在柏林!AGI 终局在世界大战的背景下上演,存在真实的可能性。届时一切皆无定数。」
附:批判性阅读备忘
- 本章是全书政治色彩最浓的一章:军事推演(海湾战争类比、核威慑失效论)建立在「智能爆炸会兑现」这一前章结论之上——如果 II 章的递归自我改进不成立,本章的大部分推论随之弱化。读时应把它当作条件预测而非独立论证
- 「几个月领先=决定性优势」与「先发制人拔除核威慑」是全章最强的断言,也是最难检验的——依赖对传感、无人机、导弹防御等多个领域同时出现数量级突破的假设,作者自己也以「plausible / it seems likely」限定
- 中国部分的技术判断可部分检验:7nm/昇腾路线、电力基建优势、对美开源的依赖,这些在 2024–2026 的公开信息中大体有对应事实;但「算法只差一通电话」「渗透实验室轻而易举」等断言无公开证据,属于作者推测。站在 2026-07 回看:中美前沿差距、出口管制的实效、以及中国模型的进步速度都比 2024 年时更受关注,「不要把中国排除在外」这一核心提醒目前看是站得住的
- 「国际条约不可行、唯一出路是美国领先+核不扩散式体制」是一个强主张,作者用不稳定均衡的军控史类比支撑;反方观点(条约+验证机制的可设计性、双边风险沟通渠道)在本章内没有得到认真处理
- 作者对中共的长段指控是其论证的动机性背景,混合了史实、争议性表述与价值判断;作为笔记读者,应区分「作者认为」与既定事实,并意识到这是写给美国政策圈的倡议文本(advocacy),修辞烈度服务于其政策目标:锁死实验室、集群留美、AI 与国防合作
IV. The Project
出处:Leopold Aschenbrenner《Situational Awareness》(2024-06) 第 IV 章 https://situational-awareness.ai/the-project/
一句话论点:随着 AGI 竞赛白热化,国家安全机器必然介入——美国政府会从沉睡中醒来,到 2027/28 年出现某种形式的政府 AGI 项目(The Project)。没有任何创业公司能驾驭超级智能;终局将在某个 SCIF(敏感信息隔离设施)里展开。
引言
- 开篇引用科学史家 Spencer R. Weart:「我们必须好奇地追问:数百座电厂、数千枚炸弹、聚集在国家机构里的数万人——这一切是如何从几个坐在实验台前、讨论某种原子奇特行为的人开始的。」
- 当下流行的各种「AI 治理」方案(前沿系统牌照、安全标准、给学者几亿美元算力的公共云)虽然用心良苦,但在作者看来犯了范畴错误(category error)——完全没搞清楚问题属于哪个量级
- 核心荒谬感:「美国政府会允许一家随便的旧金山创业公司开发超级智能,这在我看来是个疯狂的命题。想象一下当年造原子弹靠让 Uber 即兴发挥。」
- 超级智能(比人类聪明得多的 AI 系统)将拥有巨大权力:从研发新式武器到驱动经济爆炸式增长。它将是国际竞争的焦点;几个月的领先在军事冲突中可能就是决定性的
- 「认为这不会唤醒更原始的力量,是那些无意识内化了我们这段短暂『历史假期』的人的错觉。」旧金山的伟大头脑们像之前许多科学家一样,希望能掌控自己正在孕育的恶魔的命运——现在还可以,因为有 situational awareness(态势感知)的人还很少;但几年内世界会醒来,国家安全机器也会醒来。历史将凯旋归来
- 类比 Covid 和二战:美国看起来总在方向盘上睡着——然后突然之间,政府以最不寻常的方式全速启动
- 具体图景:头部实验室(「自愿地」)合并;国会拨款数万亿建芯片和电力;组建民主国家联盟
- 为什么需要政府(引言里的完整清单):防御全面的间谍威胁(否则私营 AI 等于直接把超级智能递给中共)、保证起码正常的指挥链(不能让随便哪个 CEO 或非营利董事会握着核按钮)、管理智能爆炸的「战争迷雾」中的安全挑战、部署超级智能防御极端威胁、动员民主联盟赢下与威权国家的竞赛并铸造防扩散体系
- 关键定位:这主要不是规范性主张(normative,应该如此),而是描述性主张(descriptive,将会如此)。几年内,The Project 就会启动
一、通往 The Project 之路(The path to The Project)
- 作者的切身记忆:2020 年 2 月底到 3 月中。2 月底他陷入绝望——国家明明在 Covid 指数曲线上,医院崩溃在即,却几乎没人当回事(纽约市长还在说恐惧 Covid 是种族主义、鼓励大家去看百老汇)。他能做的只有囤口罩和做空市场
- 然而几周内:全国封锁,国会拨款数万亿美元(超过 GDP 的 10%)。「提前看到指数会走向哪里太难了,但当威胁足够近、足够存亡攸关时,非常之力就会被释放。反应是迟到的、粗糙的、生硬的——但它来了,而且是戏剧性的。」
- AI 的未来几年会有同感。我们现在处于中局(midgame):2023 已是巨变——AGI 从一个你都不好意思沾边的边缘话题,变成参议院重要听证会和世界领导人峰会的主题。再来几个「2023」,Overton 窗口会被彻底炸开
- 时间线推演:
- 2025/26 左右:下一次真正震撼的阶跃;AI 给大科技公司带来 $100B+ 年收入,在纯解题智力上胜过博士;出现 $10T 市值公司,AI 狂热无处不在
- 2027/28:$100B+ 集群上训练的模型问世;成熟的 AI agent / 即插即用远程员工开始大规模自动化软件工程等认知工作
- 曼哈顿计划类比(Szilard 线):Szilard 比别人早得多看到原子弹的可能性,他的警报起初不受待见、保密呼吁被嘲笑无视;但随着实证结果累积,最初怀疑的科学家陆续转变;当多数科学家相信炸弹在即,政府认定国家安全紧迫性太大——曼哈顿计划启动
- 同样地:当 OOM 从理论外推变成(惊人的)实证现实,头部科学家、高管和政府官员间会逐渐形成共识:我们在 AGI 的边缘、智能爆炸的边缘、超级智能的边缘
- 预警射击(warning shots):某个时点会出现第一批真正吓人的 AI 演示——可能是常被讨论的「帮助新手制造生物武器」、自主入侵关键系统,或完全出乎意料的东西。届时将清楚:无论喜不喜欢,这是决定性的军事技术。中共大概率已注意到并启动强大的 AGI 计划;对美国头部 AI 实验室被中共渗透的(不可避免的)最终揭露可能引起轩然大波
- 2026/27 左右华盛顿的气氛将变得阴沉。人们会切身感到恐惧。从五角大楼到国会闭门简报会都会响起那个问题:我们需要一个 AGI 曼哈顿计划吗? 先是缓慢地、然后突然地,事情变得清晰:这是自原子弹发明以来美国国家安全面临的最重要挑战
- 政府会迟钝而笨拙(历史先例):爱因斯坦 1939 年致信总统(Szilard 起草)后成立了铀顾问委员会,但官员无能,几乎无事发生——Fermi 只拿到 $6k(约合今天 $135k)研究经费,还等了几个月;Szilard 认为官僚的短视和迟缓至少耽误了项目一年。英国政府 1941 年 3 月认定炸弹势在必行,美方委员会把英方报告晾了几个月——直到 1941 年 12 月才全面启动
- 落地形态不一定是字面意义的国有化(研究员编入军队——虽然也可能!)。作者预期更「圆滑的编排」:类似国防部与 Boeing / Lockheed Martin 的关系;或通过国防承包,由大型云厂商 + AI 实验室 + 政府组建合资实体,使其在功能上成为国家安全项目。就像 2023 年实验室「自愿」向白宫作出承诺一样,西方实验室会或多或少「自愿」并入国家计划。考虑到数万亿投资和制衡需要,国会大概率会介入
- 脚注:曼哈顿计划连国会——甚至副总统!——都不知情;作者认为这次不该重演,甚至建议 The Project 的关键官员需要参议院确认
- 到 2026 末/27/28 年,它就会开始:核心 AGI 研究团队(几百名研究员)搬进安全设施;万亿美元集群以创纪录速度建成;The Project 启动
二、为什么 The Project 是唯一的路(Why The Project is the only way)
作者自白:对政府毫无幻想(政府有各种局限和糟糕激励),是美国私营部门的坚定信徒,几乎从不主张政府深度介入技术或产业——直到加入 AI 实验室才改变了对 AGI 的看法。实验室很擅长某些事(只有创业公司能把 AI 从学术项目带上商业大舞台),但归根结底它们仍是创业公司。「我们根本不该指望创业公司有能力处理超级智能。这里没有好选项——但我看不到别的路。」
2.1 超级智能将是美国最重要的国防项目
- 几年内超级智能将彻底颠覆军事力量平衡;到 2030 年代初,美国现有军火库(全球和平与安全的基石)可能整体过时——不是现代化改造,而是全盘替换
- 定性判断:AGI 属于「核武器」而非「互联网」那个范畴。当然它是军民两用的——但核技术当年也是。民用应用会有自己的时代,但在 AGI 终局的迷雾中,国家安全是主背景
- 首要优先级是防御性应用:对抗拥有超人黑客能力的对手、可对核威慑力量发动先发打击的新型隐形无人机蜂群、可武器化的合成生物学扩散、动荡的国际(和国内)权力斗争、以及失控的他国超级智能项目
- 无论名义上是否私营,AGI 项目本质上将是国防项目,需要与国家安全机器极紧密的合作
2.2 给超级智能一条正常的指挥链
- 超级智能的权力与挑战和科技公司以往的任何东西都不在一个参照系里。不应该由某个随便的 CEO 单方面指挥
- 在「私营实验室开发超级智能」的世界里,个别 CEO 完全可能拥有政变推翻美国政府的实力。「想象 Elon Musk 拥有核武库的最终指挥权。(或者某个非营利董事会可以决定夺取核武库。)」
- 脚注:到那时甚至不需要实验室员工配合——因为员工大都已被自动化了
- 脚注(Sam Altman 语):「离 AGI 每近一年,每个人都会 +10 点疯狂值」
- 真正激进的方案不是 The Project;真正激进的方案是赌私营 AI CEO 掌握军事力量后会成为仁慈的独裁者。作为社会我们早已决定:民主政府控制军队——而超级智能(至少初期)将是最强大的军事武器
- 补刀:私营实验室世界比「CEO 握核按钮」更糟——实验室安全糟糕的一部分正是内控的彻底缺失:随便一个(零审查的)实验室员工都可能悄无声息地叛变
- Burke 式论证:制度、宪法、法律、法院、制衡、规范(如将军拒绝执行非法命令)经受了数百年考验;而 AI 实验室的特殊治理结构第一次被考验就崩溃了(暗指 2023 年 OpenAI 董事会风波)。美国军队现在就有能力杀光国内平民或夺权——我们约束核权力的方式不是让一堆私企各自拥有核武库。「只有一套指挥链和制度体系被证明配得上这个任务」
- 脚注(回应「全部开源」派):开源到底不是美国百花齐放,而是中共免费获得美国开发的超级智能、以更少监管超建反超;同时超级 WMD 扩散到每个流氓国家和恐怖组织。而且随着集群成本升至数千亿、关键算法机密不再发表,AGI 将由 2-3 个头部玩家造出,不是去中心化编码者的欢乐社区。落后几年的模型开源仍有价值(扩散技术红利)
2.2.1 超级智能的民用领域
政府主导初期开发 ≠ 民用被垄断。历史先例:
- 核链式反应最初是政府项目(核武器永久归政府),但民用核电曾作为私营项目蓬勃发展(60-70 年代,直到环保运动叫停)
- Boeing 与军方合作造 B-29(二战最贵国防研发项目,比曼哈顿计划还贵)、B-47/B-52——然后把技术用于开启喷气时代的商用 707。今天 Boeing 隐形战机只能卖给政府,民航机可自由开发销售
- 雷达、卫星、火箭、基因技术、二战工厂等同理
初期由「活下来并稳住局势」的国家安全紧迫性主导;军用永久归政府、安全规范强制执行;但初始危险期过后,国家联合体内的公司(及其他公司)自然走向私营民用应用——多元、市场化、繁荣的民用生态终会有自己的时代
2.3 安全(Security)
- 承接 IIIb 章:按当前路线,美国的 AGI 努力等于白干——中国可以直接偷走所有算法突破和模型权重(字面意义上的「超级智能的副本」)。当前路线甚至到不了「防朝鲜」级别的安全
- 在私营创业公司开发 AGI 的世界里,超级智能会扩散到几十个流氓国家。这根本站不住脚
- 面对中国间谍机器的全力施为(偷权重将是国安部 MSS 的头号优先事项),私营公司大概率不可能做出足够好的安全。需要情报体系深度协作:对实验室和核心研究团队的侵入性限制(极端审查、持续监控、在 SCIF 里工作、限制离境自由),以及只有政府能提供的基础设施——最终包括 AGI 数据中心本身的物理安保
- 仅安全一项就足以证成政府项目——锁不住这些东西,自由世界的优势和 AI 安全就都完了。作者还预测:对 AGI 实验室被中国渗透的揭露很可能成为最终扳机之一——到时每个参议员、众议员和国安官员都会「对此事有强烈意见」
2.4 安全性(Safety)
- 搞砸的方式很多:从确保能可靠控制、信任即将掌管经济和军队的数十亿超级智能 agent(superalignment 问题),到控制新型大规模杀伤手段的滥用风险
- 对实验室安全承诺的不信任:「有些实验室声称致力于安全……我不知道我们能否信任他们的承诺到拿每个美国人的性命下注的程度。更重要的是,迄今为止,他们尚未展现出与他们自己都承认正在建造的东西相称的能力、可信度或严肃性。」
- 归根结底它们是创业公司,带着所有常见的商业激励。竞争可能推着所有人直接冲刺过智能爆炸;总会有人愿意把安全扔到一边。我们可能需要「花掉一些领先优势」来换解决安全问题的时间——但这需要西方实验室协调行动。(何况私营实验室的权重早就被偷了,它们的安全措施根本不重要——我们将任凭中共和朝鲜的安全水准摆布)
- 为什么监管(regulation)不够:监管适合 AI 慢速发展的世界;智能爆炸的挑战性质完全不同——「不像花几年做仔细评估、推安全标准过官僚程序,而更像打一场仗」
- 那个「疯狂之年」的具象化(原文最生动的一段):局势每周剧变、基于模糊数据的艰难决断生死攸关、问题本身都事先看不清、一切取决于「战争迷雾」中的执行力,充满这样的抉择——「我们的一些对齐测量结果看起来含糊,我们已经不太明白发生了什么,也许没事,但有迹象表明下一代超级智能可能失控。要不要把下次训练推迟 3 个月换取安全上的信心?——糟了,最新情报显示中国偷了我们的权重、正在冲刺他们自己的智能爆炸,怎么办?」
- 作者的诚实交代:「我并不确信政府项目能胜任这种局面——但『创业公司开发超级智能』的替代方案,远比公认的更接近『祈祷一切顺利』。」我们需要一条能拿出与这些艰难权衡相称的严肃性的指挥链
2.5 稳定国际局势
- 智能爆炸及其直接后果将带来人类面临过的最动荡、最紧张的局势之一。我们这代人没经历过这种事。初始阶段的任务不是做酷产品,而是「不顾一切地、想方设法地挺过这段时期」
- 需要政府项目来:赢下与威权国家的竞赛,换取驾驭险境所需的明确领先和喘息空间;捆绑西方力量(集中最好的科学家、用上每一块 GPU、确保数万亿美元集群建在美国);保护数据中心免遭对手破坏乃至直接攻击
- 最重要的可能是由美国领导建立——必要时强制执行——防扩散体系:
- 阻止俄、朝、伊朗和恐怖组织用自己的超级智能开发挟持世界的技术与武器
- 用超级智能加固关键基础设施、军队和政府的安全,防御极端的新型黑客能力
- 用超级智能稳定生物学等领域进展的攻防平衡
- 开发安全控制超级智能的工具,以及关停他人草率项目里跑出来的失控超级智能
- AI 系统和机器人将以人类 10-100 倍以上的速度运转,一切都会发生得极快。要准备好应对把一个世纪的技术进步压缩进几年所带来的任何六西格玛级动荡
- 「也许没有人配得上这个任务。但在我们已有的选项里,The Project 是唯一清醒的一个。」
三、The Project 不可避免;但它好不好另说(The Project is inevitable; whether it’s good is not)
- 再次强调:主张是描述性的。过去一年作者对旧金山朋友们反复提起 The Project,最让他惊讶的是大家有多惊讶——他们压根没考虑过这种可能性;但一旦考虑,多数人都同意这显而易见。「如果明天某实验室真造出了超级智能,联邦政府当然会介入。」
- 自由变量一:不是 if 而是 when。政府是拖到智能爆炸进行中才反应,还是提前几年意识到?既然不可避免,早比晚好——那几年正是做安全冲刺工程、让关键官员进入状态、建起能运转的合并实验室的窗口。政府最后一刻才介入会混乱得多(而且机密和权重早被偷光了)
- 自由变量二:能团结起什么样的国际联盟:
- 对内(民主国家开发联盟):类比 Quebec Agreement——丘吉尔与罗斯福秘密协定,合作开发核武、未经双方同意不对彼此或他国使用。应拉上英国(DeepMind)、日韩等东亚盟友(芯片供应链)、NATO 等核心民主盟国(更广的工业基底)。联合的好处:更多资源人才、掌控整条供应链、在安全/国安/军事挑战上紧密协调、对行使超级智能权力形成制衡
- 对外(更广的利益分享):类比 Atoms for Peace、IAEA、NPT——向更广泛国家(包括非民主国家)提供超级智能的和平红利、承诺不对其进攻性使用;交换条件是它们放弃自建超级智能项目、就 AI 部署作出安全承诺、接受两用应用限制。以此削弱军备竞赛与扩散的动机,把广泛联盟纳入美国主导的后超级智能世界秩序
- 自由变量三(可能最重要):这个不可避免的政府项目到底能不能干得好。如何组织?制衡如何设计?正常的指挥链长什么样?——「几乎没有人在想这些。其他所有 AI 实验室和 AI 治理的政治博弈都是余兴节目。这才是正赛(the ballgame)。」
- 脚注(致 Progress Studies 同道):你们研究了半天美国政府科研机构及其半个世纪的衰落——告诉我:怎么让 The Project 高效运转?这将是你们智识事业的巅峰考题
四、终局(The endgame)
- 时间表收束:2027/28 终局开启;2028/29 智能爆炸进行中;2030 年,我们将召唤出超级智能,携其全部的权力与威能
- (配图:Oppenheimer 与 Groves——科学负责人与军方负责人的组合)
- 被任命执掌 The Project 的人将面对地狱级任务清单:快速造出 AGI;让美国经济进入战时状态生产数亿块 GPU;锁死一切、清除间谍、抵挡中共的全面攻击;管理一亿个疯狂自动化 AI 研究的 AGI(一年干出十年的跨越),很快产出远超最聪明人类的 AI 系统;同时保证局面不脱轨、不产出试图从人类监督者手中夺权的失控超级智能;用超级智能开发稳定局势所需的新技术并快速重塑美军;而这一切都发生在可能是史上最紧张的国际局势中。「他们最好够强,我只能这么说。」
- 结尾的个人抒情:对被征召同行的人来说会「……压力山大」,但为自由世界——为全人类——效力是职责所在。安全设施里不会有如今 AI 研究员优渥生活的舒适,但也不会太糟:还是那个小得出奇的圈子,白天盯 scaling 曲线,周末聚会聊 AGI 和实验室政治——只是,赌注将无比真实
- 终句:「沙漠里见,朋友们。(See you in the desert, friends.)」
附:批判性阅读备忘
- 本章是全书从「技术外推」转向「政治预言」的一章,论证性质完全不同:前几章有趋势线可数,本章的核心证据是历史类比(曼哈顿计划、Covid 动员)——类比选择本身就预设了「AGI≈核武器」的结论,这是循环论证风险最大的地方
- 站在 2026-07 回看:「一个实验室独走开发超级智能」与「政府全面接管」之间的中间态才是现实——出口管制持续加码、政府与头部实验室的合作深化(安全评估、国家安全审查)都发生了,但「实验室合并 + 研究员进 SCIF」尚未出现。作者自己也承认落地形态弹性很大(Boeing 模式而非国有化),这使预言几乎不可证伪——需要警惕
- 「2025/26 出现 $10T 公司、AI 年收入 $100B+」的中间预测可部分核对:头部 AI 公司收入量级和 NVIDIA 等市值走势大方向对,但节奏和归属主体有偏差
- 本章规范性最强的隐含前提是「美国主导是好的均衡」——对非美读者(包括我们)值得单独审视:Quebec Agreement / NPT 类比里,非核心盟国的位置是「接受限制换红利」,这一秩序设计的正当性作者基本未论证,只当作自然结论
- 「实验室治理结构第一次被考验就崩溃」(OpenAI 董事会事件)是本章最有实证支撑的一击;「随便的员工可以悄无声息叛变(零内控)」在其后数年的实验室安全升级中已部分改善,引用时注意时效