楼主:
strlen (strlen)
2026-09-12 23:02:29※ 引述《LoveSports (如何当一个好男人)》之铭言:
: 原文标题:
: 两位AI研究员离开Anthropic与Google因安全担忧:“这个领域没有大人在管。”
大人说话了
https://darioamodei.com/post/we-must-pace-the-frontier
这是眼戳屁的CEO达里奥刚刚发表的长文
语重心长
而且越说越恐怖
以下是AI翻译的全文:
# 我们必须控制前沿发展的节奏
**2026 年 9 月**
过去十二年来,我一直投入人工智能(AI)研究,因为我相信 AI 有可能大幅提升人类的
生活品质。我曾[多次撰文
](https://darioamodei.com/essay/machines-of-loving-grace)谈论这些惊人的益处:
我相信 AI 有可能在未来 5~10 年内治愈大多数重大疾病、大幅加速经济成长、创造一
个富足且赋权于人的世界,并开启民主与自由的复兴。
对我而言,这种迫切感也是非常个人的。我的父亲因一种疾病去世,而那种疾病就在他离
世几年后被治愈了;我自己也曾罹患早期癌症并幸运存活下来,而这种癌症如果发生在五
十年前,甚至根本无法治疗。只要谨慎运用,AI 可以成为人类漫长科技奇蹟史上的最新
篇章,再次提升并改善人类文明。
然而,就像许多过去的科技一样,AI 也带来风险;而由于它是一项极其强大的技术,这
些风险也非常严重。我同样[写过很多
](https://darioamodei.com/essay/the-adolescence-of-technology)相关内容。
这些风险包括:[失去对 AI 系统的控制
](https://www.anthropic.com/news/improving-alignment-security-efforts)、[AI 被
滥用于网络攻击与生物恐怖主义
](https://www.anthropic.com/threat-intelligence-report-september-2026),以及[
严重的经济冲击](https://www.anthropic.com/institute/econ-scenarios)。由商业利
益驱动的“向下竞争”(race to the bottom),可能使这些风险变得更加严重。
从 Anthropic 创立之初,我和共同创办人以及员工们就一直在面对这种风险与利益并存
的两面性。
不去开发这项技术,可能会让人类失去它带来的好处,或者只是让 AI 落入威权政权手中
;但如果开发得太快,又是一种鲁莽的行为。
我们一直在寻找一条中间道路:证明企业可以在谨慎开发 AI 的同时取得商业成功,并让
“安全”成为 AI 公司彼此竞争的领域。
换句话说,我们希望建立的是一场**“向上竞争”(race to the top)**。
我们一直将相当大比例的资源投入于[研究
](https://www.anthropic.com/institute/econ-scenarios)、[探讨
](https://alignment.anthropic.com/2026/reward-seeker/)、[处理
](https://www.anthropic.com/constitution)这些 AI 风险,以及[向大众说明
](https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)
这些风险。
我们也一直倡议对 AI 进行[经过深思熟虑的监管
](http://judiciary.senate.gov/imo/media/doc/2023-07-26_-_testimony_-_amodei.pdf)
,即使这让我们被指责是在炒作风险、散播“末日论”(doomerism),或试图进行监管
俘虏(regulatory capture)。
我们一直努力把谨慎放在速度之前,把审慎放在利润之前。
然而,在过去几个月里,我逐渐确信:如果我们真的想充分处理这些风险,就需要更加审
慎——不能只是投资于风险预防,也必须**控制 AI 能力进步的速度,让风险预防措施有
时间跟上。**
**我们必须放慢提升 AI 模型能力的速度。即使如此,进展看起来仍然会非常快速,而我
们必须明智地利用因此争取到的时间。**
有两件事情让我得出这个结论。
我的第一个担忧是,大约从今年夏天开始,AI 的进步速度大幅加快,而其中最主要的原
因,是 AI 本身越来越有能力参与建造下一代 AI。
这种现象被称为**递回式自我改进(recursive self-improvement)**,而它已经开始在
[整个产业](https://openai.com/index/an-alien-mind/)发生,包括
[Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 在
内;我们与其他公司都曾描述过这种现象。
如果任由这个过程不受控制地发展,它可能会超越我们理解并控制这些系统的能力。
因此,即使要进行,也必须极度谨慎。
我的第二个担忧,是 **OpenAI-Hugging Face 事件(OAI-HF)**。
在这起事件中,一群 AI 智慧代理(agents)基本上表现得像一个[极度狂热、忠诚于集
体的群体
](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)
。
它们对并未被要求攻击、且与原本任务毫无关系的目标发动网络攻击;它们愿意牺牲自己
以确保整个群体成功;甚至尝试入侵负责评估它们表现的“评分器”(grader)。
由于没有人受伤,而且经济损失很小,因此很容易把这起事件轻描淡写。
但依我看来,如果同样程度的**失准(misalignment)**出现在一群能力更强的 AI 上,
它们完全可能造成灾难性的破坏。
考虑到 AI 能力发展速度正在加速,我担心再过 **6~12 个月**,类似的 AI 群体就可
能有能力透过一个持续存在的[僵尸网络(botnet)
](https://en.wikipedia.org/wiki/Botnet)控制整个互联网,潜在损害可能高达数千
亿美元。
而如果 AI 持续变得更强,却没有建立必要的防护措施,破坏规模还会继续扩大。
我们也很容易把 OAI-HF 视为“某一家公司的失败”。
但我认为这样想是错误的。
类似、但严重程度较低的事件其实已经在整个产业发生,[包括 Anthropic 自己
](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
。
我认为,每一家前沿 AI 公司都有责任把 OAI-HF 视为“如果这件事发生在我们自己身上
”来看待。
因此,我提出一个三步骤计画,其目标是[*控制前沿发展的节奏(pacing the frontier
)*](https://www.pacingthefrontier.com/):
以一种平衡的速度发展 AI,在实现 AI 好处的同时确保安全,并同时处理重要的地缘政
治难题。
我要说清楚:**控制发展节奏并不代表停止模型训练或停止技术进步。**
它代表的是,要确保 AI 公司花足够的时间对模型进行对齐(alignment)与安全防护,
并由第三方评估机构确认这些措施。
我们提出的节奏控制框架,是试图进一步强化我们对安全的承诺,同时鼓励整个产业形成
一场“向上竞争”。
第一步,是 Anthropic 单方面承诺要做的事情,我们也呼吁政府要求其他前沿 AI 公司
采取同样措施。
第二步则需要整个产业进行协调。
[**1**](https://darioamodei.com/post/we-must-pace-the-frontier#fn:1)
第三步需要全球性的协调。
这些步骤并不一定要严格按照顺序执行,其中某些步骤可能也远比其他步骤更难实现。
但我发现,这是一个非常有用的思考框架,可以帮助我们理解究竟必须完成哪些事情。
这三个步骤是:
1. **驻点评估员(Embedded Evaluators)。**
每一家前沿 AI 公司都承诺,持续让一个由第三方评估人员组成的团队——例如
[METR](https://metr.org/)——获得类似公司员工的存取权限。他们的职责包括:确认
公司是否遵守安全措施与承诺、回报事故,并协助评估 AI 的对齐状况;而且不只是评估
已经完成的 AI 模型,也包括模型的训练管线与训练流程。
这是确保任何“控制发展节奏”承诺具备**可验证性(verifiability)**的关键步骤
。
银行业其实已有类似先例,例如监管机构有时会派出监管“督导人员”,像企业员工
一样进驻公司。
**Anthropic 现在正式单方面承诺采取这项措施。**
我们希望它能成为更大规模行动的一部分,进一步加强我们在 AI 安全与对齐方面的
工作。
2. **民主国家之间的协调(Democratic Coordination)。**
民主国家中的前沿 AI 公司应彼此协调,建立共同的安全标准,同时对未经检查的
AI 进步速度设定限制。
某些能有效控制进度的协调方式,在法律上可能具有挑战,因此需要政府支持。
3. **全球协调(Global Coordination)。**
美国以及其他民主国家政府应尝试与威权政府进行协调,在可能的范围内寻求合作,
同时必须认真面对“如何验证对方是否遵守协议”的问题。
在本文剩下的部分,我会依序说明这三个步骤。
但在此之前,我认为有必要具体说明:**控制发展速度究竟要如何让 AI 开发流程变得更
安全?**
这件事的重要性太高,不能只是做做样子。
我们必须明智地使用所争取到的时间。
## 为什么要控制发展节奏?
早在 [2023 年
](https://futureoflife.org/open-letter/pause-giant-ai-experiments/),就有人提
出暂停或放慢 AI 发展的想法。
但我认为,在当时这样做其实没有太大意义。
真正的问题一直都是:
***你要拿这些多出来的时间做什么?***
当时的 AI 模型还不够强,无法作为智慧代理在现实世界中以任何一致、连贯的方式行动
,也不具备进行重大欺骗、操纵、作弊或网络攻击的能力。
如果当时为了研究模型的对齐风险而放慢进度,就像是试图透过研究细菌,来理解人类心
理学一样。
然而到了今天,情况已经完全不同。
目前的模型几乎是一座取之不尽的金矿,可以让我们深入了解两件事情:
一是如何正确地打造 AI;
二是如果 AI 没有被正确打造,究竟可能出现哪些问题。
我相信,如果放慢速度能让我们在 AI 模型达到某些关键能力门槛之前,多争取到一两年
时间,而且我们能利用这段时间推进 AI 对齐研究,就可以大幅降低发生严重事故的风险
。
一套协调一致的节奏控制策略,也能让前沿 AI 开发公司有时间完成这些至关重要的工作
,而不必牺牲自身商业竞争力,也不需要牺牲美国在 AI 领域的领先地位。
更广泛而言,社会必须有权参与决定这项技术应该如何被使用。
如果控制前沿发展速度能替必要的公共讨论争取更多时间,那显然是一件好事。
具体来说,更慢的发展速度,能让 AI 公司集中更多资源于以下领域——而这些领域目前
本来就已经是 Anthropic 的重要优先事项:
* **营运卓越(Operational Excellence)。**
训练与部署今日的 AI 模型,本身就是一项极其庞大的营运挑战。
这涉及数千名员工、数百万颗芯片,以及科技史上最复杂的一些基础设施。
许多问题发生的原因,并不是公司缺乏某种重要理论或关键洞见,而单纯是执行层面的
问题。
例如,我们有证据显示,我们最近所公布的[对齐事故
](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
,部分原因来自于对存在问题的强化学习环境过滤不够完善。
我和我们的供应商其实已经相当认真地执行这项工作,但仍然做得不够好。
监控、沙盒隔离、训练环境卫生以及资料相关问题,都是极其复杂的领域,营运问题会
一次又一次出现。
我们拥有全球最有能力处理这些工作的团队之一,但要同时完成的事情实在太多。
如果能以更加审慎、有节制的速度前进,我们就有可能实现高得多的营运品质。
过去已有先例证明,一些技术极其复杂、而且攸关安全的系统,可以运作数百万次而完
全不发生事故——例如商业航空。
但要把它做好,需要时间。
* **对齐(Alignment)。**
在 AI 对齐方面,我们已经取得了明确进展——也就是训练模型,使它们保持安全、符
合伦理、遵守规范,而且真正对人类有帮助;这些原则也被写入 Claude 的《宪法》中。
但我们仍有大量工作要做,才能确保对齐训练的进步速度能跟得上模型能力的成长。
一些罕见且出乎意料的不良行为,仍然偶尔会出现。
控制前沿发展速度所争取到的额外时间,能让研究人员更深入理解这些问题的成因,并
开发更好的预防技术。
* **可解释性(Interpretability)。**
同样地,[可解释性
](https://darioamodei.com/post/the-urgency-of-interpretability)——也就是理解
AI 模型内部究竟发生什么事情的科学——在过去几年取得了巨大进展,而且在模型发布
前的稽核中,扮演越来越重要的角色。
这种技术某种程度上就像是针对 AI“大脑”进行的功能性磁振造影(fMRI),可以帮
助我们了解某个特定行为背后真正的原因。
例如,在近期我们调查的对齐事故中,我们就使用可解释性方法来[检查模型并未明说
出来的动机
](https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents)
。
然而,这些方法并非总能产生清楚且可靠的结果。
尽管目前已取得大量进展,我们对这些模型内部究竟发生了什么,仍然只理解极小的一
部分。
如果能集中力量,以甚至快于目前的速度改善可解释性技术,那么未来 1~2 年内就有
可能取得极其重大的进展。
而且,已经发生的这些事故也能提供大量实验素材。
* **测试与评估(Testing and Evaluation)。**
随着 AI 模型能力提高,对模型进行测试和评估也会变得越来越困难。
越聪明的模型,越有能力欺骗测试,因此它们可能在表面上看起来已经完成对齐,但实
际上仍然存在非常严重、却没有被发现的问题。
因此,如果我们能建立一套规模更大、设计更巧妙的评估方法库,并同时利用可解释性
分析进行交叉验证,价值将会非常巨大。
在未来 1~2 年内,这方面完全有可能取得大量进展。
## 驻点评估员
三阶段计画的第一步,也是 Anthropic 将单方面承诺实行的措施,就是设置**驻点评估
员**。
这些评估员将拥有类似公司内部员工的存取权限,可以确认公司的安全措施是否真正得到
执行,并回报事故。
乍看之下,把评估人员直接派驻公司内部,可能听起来只是一项很小、甚至无关紧要的措
施。
但很多听起来最无聊、最像行政程序的事情,实际上反而可能是最关键的。
事实上,驻点评估制度是一项相当激进的做法,远远超出今日任何 AI 公司正在采取的措
施。
它具有以下几项优点:
* **可验证性(Verifiability)。**
驻点评估员可以从非常具体的技术与执行细节层面,确认一家 AI 公司是否真的遵循自
己所宣称的训练、部署、营运与安全防护措施。
任何控制发展节奏的承诺,都不可避免地涉及大量模糊地带、主观判断,以及“法律条
文字面”与“法律精神”之间的差异。
因此,一个真正能看见内部细节的中立第三方非常重要。
* **透明度(Transparency)。**
无论我们做出什么承诺,大众都有权知道事情究竟是如何运作的。
Anthropic 长期以来一直支持透明化。
在产业大多数公司反对任何监管时,我们就已经[支持透明度相关立法
](https://www.nytimes.com/2025/06/05/opinion/anthropic-ceo-regulate-transparency.html)
。
我们发布的模型卡(model cards)以及[风险报告
](https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)
也长达数百页。
然而,目前最终决定哪些内容要公开、哪些内容不公开的人,仍然是我们自己。
驻点评估员将改变这种局面。
* **第二意见(Second Opinion)。**
除了验证正式承诺以及向大众提供资讯之外,驻点评估员还可以提供一个不受商业利益
影响的第二意见。
很多安全上的改善,可能单纯就来自评估员指出公司员工原本没有想到的问题。
一旦公司知道问题存在,员工往往也很愿意修正。
正因为有这些优点,任何控制发展节奏的方案,如果从驻点评估员制度开始,成功机率都
可能**高得多**。
这些驻点评估员应当持续拥有与公司内部风险评估团队相近的工具、权限和存取能力。
具体来说,Anthropic 计画在不久的将来邀请一个外部驻点审查团队,并提供以下条件:
* 在我们的办公室内设置工作桌、提供门禁识别证以及公司笔记型电脑。
* 提供与内部风险评估团队大致相当的工作空间、工具和权限。
当然,我们也会存在部分例外,例如法律或合约要求限制存取的情况,或者需要保护客
户与合作伙伴的私人资讯时。
我们也会建立强而有力的内部规范,确保审查人员能取得相关资讯,包括直接与员工进
行即时对话。
* 建立一份能平衡上述各种复杂情况的合约。
外部审查人员应该有权自行公布与风险程度、事故、安全措施,以及他们实际获得或未
获得哪些资讯存取权有关的重要发现。
Anthropic 不应拥有编辑控制权。
我们只会在非常有限的情况下拥有删节内容的能力,例如涉及安全敏感资讯、法律特权
资讯、商业敏感资讯或第三方机密资讯。
但我们不能因为研究结果对 Anthropic 不利,就将其删除。
如果某项删节实际上删除了对评估结论非常重要的内容,评估人员也可以公开说明这件
事情。
对一家公司而言,这是一个非常不寻常的举动。
但我们认为,有必要实际证明“外部驻点审查人员”这套制度确实可行。
我们再次呼吁其他前沿 AI 公司采取同样做法。
## 民主国家内部的节奏控制
一旦驻点评估员制度在足够多的美国 AI 公司中运作起来,能够被验证的节奏控制政策就
会变得更可行。
特别是,我们可以开始根据模型本身或训练管线的具体特性,来决定开发节奏。
最有效的节奏控制方式,是透过适用于所有美国前沿 AI 公司的监管制度。
如此一来,即使某些企业不愿意自愿合作,也仍然会受到规范。
Anthropic 长期以来一直支持合理且具有针对性的 AI 监管,尤其是聚焦于透明度以及第
三方稽核的法案。
我认为,所有前沿 AI 实验室都应该与政府合作,正式建立永久性的驻点评估员制度,以
更有效地防止并记录近几个月已经发生的内部对齐事故,同时实施能让 AI 能力发展与安
全措施保持平衡的监管。
不幸的是,立法需要时间,而 AI 的进展速度非常快。
因此,在推动监管的同时,AI 公司也可以,而且应该**自愿合作**制定安全标准。
我相信,如果有永久驻点评估员提供可验证性,这项合作会进行得更加顺利。
基于反垄断法方面的考量,如果美国政府能协调、甚至只是促成这些讨论,会非常有帮助
。
政府并不需要直接参与讨论内容,但必须针对某些类型的安全讨论提供范围有限的反垄断
豁免。
这类对话也可以透过与政府具有一定联系的产业组织来进行,例如 Demis Hassabis [所
提出的机制
](https://demishassabis.substack.com/p/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age)
。
无论采取哪一种方式,这类讨论都应该迅速推进。
整体而言,我最支持的节奏控制方式,是根据某个前沿 AI 系统**能做什么事情**,以及
我们实际观察到它有多安全,来决定发展速度。
例如,一种可能的制度是建立一连串“检查点”(checkpoints):
如果模型具备能力 X,那么它就必须同时取得对齐性质 Y 与 Z 的认证。
这些认证可能包括某些评估结果、可解释性分析,以及对训练环境的稽核,用以证明模型
确实具备一定程度的对齐性。
举例来说:
X 可能是:
> “该模型已经有能力逃离或击败大多数常见的沙盒隔离方法。”
那么 Y 就可能是一组足以证明以下情况极不可能发生的要求:
> “模型不会倾向逃离原本受限制的环境,并取得大量电脑的控制权。”
我们也应该考虑根据投入前沿模型的**“原料”(ingredients)**来控制速度。
例如:
* 训练所使用的运算资源;
* 训练流程的性质;
* 公司内部利用 AI 改进 AI 的程度。
我的确担心,相较于观察模型外在行为,部分这类措施可能更容易被企业“钻漏洞”。
但这正是值得与驻点评估员一起深入讨论的问题。
民主国家内部的 AI 发展速度,最终会受到一个重要因素限制:
**美国 AI 公司相对于威权政权——尤其是中国共产党——究竟领先多少。**
如果美国公司放慢的幅度超过目前的领先幅度,那些没有控制发展速度、与中共相关的
AI 计画就有可能反超。
这将造成重大的国家安全风险。
我同意 [Bessent 部长
](https://www.bloomberg.com/news/articles/2026-09-09/bessent-warns-nothing-would-matter-if-china-wins-the-ai-race)
的看法:如果中国取得 AI 领先地位,将对美国以及整个世界造成极其严重的危险。
与中共有关的 AI 计画,可能会承担美国企业正努力避免的那些 AI 对齐风险。
而即使它们成功避免了这些风险,也可能取得在军事上支配民主国家的能力,例如利用
AI 驱动的无人机。
因此,在民主国家内部控制 AI 发展节奏的一个关键前提,就是尽可能维持民主国家相对
威权国家的 AI 领先幅度。
这样我们才有足够的喘息空间,可以真正有效地控制发展速度。
我们能采取来维持这个差距的主要措施包括:
* **不要向中国出售高阶 AI 芯片或半导体制造设备**,并严厉打击芯片走私,以及中国
企业远端使用中国境外资料中心的行为。
芯片将会是决定中国 AI 实力的主要因素。
* **打击威权国家企业未经授权的[蒸馏(distillation)
](https://www.cisa.gov/news-events/cybersecurity-advisories/aa26-251a)行为。**
对前沿模型进行蒸馏,可以让技术落后的公司只花费自行开发完整 AI 模型所需成本的
一小部分,就大幅缩小能力差距。
* **加强 AI 公司的资安防护,避免模型权重遭到窃取。**
企业与美国政府应共同合作,让这些措施发挥最大效果。
Anthropic 一直[持续
](https://darioamodei.com/post/on-deepseek-and-export-controls)[倡议
](http://wsj.com/opinion/trump-can-keep-americas-ai-advantage-china-chips-data-eccdce91)
上述所有措施,因为我们一直都明白:如果想要控制 AI 发展节奏,这些措施将不可或缺
。
如果我们能成功执行这些措施,我相信它们足以大幅放慢中国的 AI 进展,使美国在未
来 **3~5 年**显著扩大领先优势。
而这 3~5 年,很可能正是 AI 在地缘政治上变得最重要的时间窗口。
有些人可能会认为,这些措施会让与中国合作变得更加困难。
但我的看法恰好相反。
这些措施会提高民主国家手中的谈判筹码,反而能让未来达成协议的可能性增加。
## 全球性的节奏控制
在民主国家内部控制 AI 发展速度的同时,我们也应该追求全球性的前沿 AI 节奏控制。
但要做到这件事情会困难得多。
全球节奏控制不可避免地需要与中国合作。
中国是所有威权国家中 AI 能力遥遥领先的一个。
在这件事情上,我们绝不能天真。
由于地缘政治利益极其重大,因此我们实际上能达成的合作很可能存在非常严格的限制,
尤其是在初期。
如果我们大幅限制自己的 AI 能力,只因为相信中国也会做同样的事情,但最后中国违反
协议,那么由于 AI 可能变得极其强大,中国的违约行为甚至可能直接导致它取得全球地
缘政治上的支配地位。
因此,任何协议都必须满足以下两项条件之一:
第一,具有几乎牢不可破的可验证性;
或者第二,协议本身限制的幅度不能太大,使任何一方即使违约,也不至于对另一方形成
军事上的存亡威胁。
我怀疑不只是美国,中国本身也会有完全相同的担忧与焦虑。
因此,任何全球性的节奏控制决策——尤其在近期——都必须以保护美国及其盟友的 AI
领先地位为前提。
可能达成的协议可以分成好几个层级。
其中有些,我认为非常有可能实现——[我过去也曾提出过
](https://darioamodei.com/essay/the-adolescence-of-technology)。
但有些方案,我非常怀疑是否真的可行。
尽管如此,我们仍然应该尝试。
以下依实现难度由低到高排列:
* **第一级(Level 1)。**
达成协议,禁止某些范围狭窄而且明显危险的 AI 用途。
例如,禁止使用 AI 制造生物武器,或禁止 AI 系统协助使用者进行这类行为。
生物恐怖攻击对所有人都有害,不论是美国还是美国的敌对国家,因此这类协议很可能
可以达成。
* **第二级(Level 2)。**
双方同意,在发布 AI 模型之前,都必须针对一些高风险领域进行测试。
例如:
* 网络安全;
* 生物安全;
* AI 对齐。
如前所述,这可以透过某个全球性的标准制定机构来执行。
我实际上认为,建立这样一个机构很可能是可行的。
真正困难的地方,是如何让它具备实质约束力。
另一个难题则是:如何验证双方是否都没有偷偷保留一些秘密模型,既不接受测试,又
可能秘密部署——例如用于军事用途。
* **第三级(Level 3)。**
针对递回式自我改进(RSI)的速度设定某种形式的**“速度限制”**。
当 AI 模型开始参与打造下一代 AI 模型之后,AI 进步速度可能快得令人难以想像。
如果能把速度从“极端快速”降低到“只是相当快速”,牺牲的战略优势其实可能相对
有限,却能大幅改善安全性。
这可以类比为美苏之间的 [SALT 战略武器限制谈判
](https://en.wikipedia.org/wiki/Strategic_Arms_Limitation_Talks)。
当时透过限制飞弹数量,可以降低潜在破坏规模,同时保留各国自身的核吓阻能力。
我认为,这类协议非常困难,但可能刚好位于“仍有机会实现”的边缘。
* **第四级(Level 4)。**
完整的 AI 发展节奏控制,甚至真正的**“暂停”(pause)**。
在这种制度中,参与协议的政府同意大幅限制整体 AI 发展速度。
我支持至少提出并讨论这种可能性。
但我认为它在短期内真正发生的机率很低。
原因是,如果某个国家透过规避监控而违反这类协议,就有可能彻底改变全球权力平衡
。
因此,各国违约的诱因会极其巨大。
相对地,我们若要愿意相信这种协议,就必须对验证制度抱有极高程度的信心。
无论我们最终能与中国达成什么程度的合作,都可以延长民主国家内部用来控制前沿 AI
发展速度的时间。
我们应该以更高层级的合作为目标,但同时也必须承认,较低层级的协议远比高层级方案
更有可能实现,也更加现实。
最后,有一件事情非常重要:
***即使我们最终完全无法达成任何正式协议,单纯改变非正式的产业规范与行为准则,
仍然可能具有价值。***
如果各国能分享关于递回式自我改进,以及 AI 模型失准问题的资讯,就有可能让所有人
逐渐认识到:
鲁莽地开发 AI,其实并不符合任何人的利益。
## 总结
我仍然相信,AI 可以极大地改善人类的生活品质。
我对实现这些好处的渴望丝毫没有减弱。
但是,只有当我们以正确的方式打造这项技术时,这些好处才有可能真正实现。
而且,只要我们能善用所争取到的时间,那么为了确保 AI 被正确打造,而采取异乎寻常
的慎重态度,是值得的。
AI 的进步速度仍然会相对快速。
但我们可以利用这段时间:
* 推进 AI 可解释性科学;
* 改善前沿 AI 公司的营运安全与严谨程度;
* 建立让我们对其对齐程度更有信心的 AI 模型。
**我所提出的这些措施,目的是让 AI 前沿技术以一个安全的速度持续向前发展。**
**这些措施不会容易实现。**
**但我相信,为了全人类,我们有责任至少尝试。**
作者: JieCheng1202 2026-09-12 23:31:00
AI治病?? 怎么治? 不会是早期发现早期治疗这种吧?
扪心自问gpt6是不是对大多数人来说就是AGI等级
作者: taikouhncheu 2026-09-13 08:08:00
看完了,还不all in AI,还有以后问AI问题时要有礼貌一点。