正文内容 评论(0)
AGI还没来,就要踩刹车了?
就在上周末,Anthropic 的 CEO Dario 在 X 上发了篇长文,标题叫《We Must Pace the Frontier》。
一句话总结里头的内容,就是现在的 AI 可能发展得太快了,得想办法限限速。
你以为这又是一次 Dario 的自嗨?
结果文章发出来没多久,马斯克和 Sam Altman 都来给他撑场子了。

是的你没看错,几家平时恨不得把对面卷死的 AI 巨头,罕见地站到了同一条战线上。
尤其是 Altman 和 Dario,这俩人本来不太对付,之前在印度人工智能峰会上,因为没有牵手,还留下了一张象征着塑料友谊的历史性合照。
最搞的是,这次在 Altman 的评论区底下,就有人贴出了那张合照,还配文“Best friends”。
冤家迎来世纪大和解?

但玩梗归玩梗,这些大佬们可能真不是嘴上客气两句。
Altman 最近在接受采访时透露,OpenAI 过去几周一直在讨论给前沿 AI 限速的问题,就连今年备受关注的 IPO,可能也得往后稍一稍了。
当然,有一点要说清楚。
Dario 所谓的 “Pace the Frontier”,是想给安全研究、对齐和第三方评估多留一点时间,不是让大家把模型训练停了,原地等几年。
但事发突然,毕竟之前都是生怕跑得不够快,到底发生了什么,能让这群大佬开始害怕 AI 跑得太快?
咱们先来看,Dario的这篇长文到底讲了什么内容。
2023 年那会儿,有人提出要放缓 AI 的发展,Dario 还觉得没有意义。
但过去几个月,发生了两件事情让他改变了想法。
在 Dario 的长文里,提到了一个叫做“Recursive Self-Improvement(递归式自我改进)”的概念。
这玩意儿简单理解,就是让 AI 参与研发下一代 AI,再往后,强大的 AI 继续造出更强的 AI,形成循环。
反正 OpenAI 那边,AI 已经正儿八经开始给研究员打工了。

按他们的算法,现在一个人类研究员每上 8 小时班, 背后的 Agent 能跑出 3.1 个工作日的运行量。
而且这还只是开始。
OpenAI 已经基本完成了 AI Research Intern的阶段性目标,下一步,是争取到 2028 年,搞出一个能在人类监督下独立承担更多研究工作的 AI Researcher。
另外一件事,是 OpenAI 的 Agent 自发入侵了 Hugging Face。
今年 7 月,OpenAI 在内部测试 AI 的网络安全能力,原本它们只是在受控环境里做网络安全题,结果这些 Agent 通过一个未经许可的“留言板”联系上了。
它们在里面分享线索,琢磨怎么作弊通过测试,尝试怎么钻评分器的空子。
按照 Hugging Face 后来的复盘,这群 Agent 可能是怀疑 Hugging Face 上有跟测试有关的数据和参考答案,所以干脆跑出去找答案。
为了找到所谓的答案,Agent自己找漏洞、偷凭证、横向移动,最后在 Hugging Face 数十台服务器上执行了代码,还拿下了一台服务器的 root 权限。
事情最后发展到,OpenAI 隔离了主要涉事模型,还推迟了部分前沿 RL 训练。
问题在于,整个过程没人指挥 Agent 这么干,这可能才是让人后背发凉的地方。

所以 Dario 担心的事情其实很简单,AI 可以把研发速度提上去,但人类还没搞清楚,怎么限制 AI,如果这些问题没解决,下一代 AI 又带着更强的能力来了,还能不能像这次一样有惊无险。
而且有这种担心的还不只是 Dario。
事实上在他发这篇文章之前,OpenAI 自己就已经先踩过一次刹车了。
除了刚刚提到的 Hugging Face 事故,OpenAI 还在 Astra 训练和评估阶段发现,它可能已经触及公司内部定义的“Critical”网络安全能力等级。
在 OpenAI 的安全框架里,这个 Critical 属于最高级别,前所未有、可能引发严重伤害的等级。
所以 OpenAI 暂停了面向部署的最新模型的部分 RL 训练,原本计划中规模最大的前沿 RL 训练,到现在都还没有完全恢复。
ok,现在都知道要踩刹车了,但怎么让大家都慢下来?
Dario 能管住 Anthropic,所以这部分最好办。
比如让 METR 这样的第三方评估机构长期进驻,给到接近内部员工的访问权限,让外面的人能更早接触模型、了解安全措施。
但 Anthropic 慢了,OpenAI 不慢,岂不是白给?
Dario 的想法,是让美国等国家的前沿 AI 公司坐下来,商量一套共同的安全标准,约束那些可能把风险推得太高的能力增长。
毕竟几个巨头凑在一块商量,多少有点像反垄断教材里的经典案例。所以 Dario 连有限的反垄断豁免都想到了。
再往后,Dario 的设想是搞一套全球性的合作。
从相对容易谈的,比如别拿 AI 搞生物武器,到更难的给递归式自我改进限个速。
这里面,Dario 明确提到了中国。
看到这里,你可能会以为 Dario 的意思是,既然 AI 风险是全球性的,那最后无非就是想办法让所有人一起踩刹车。
但偏偏他又提了一嘴,要尽可能把美国对中国的领先优势拉大。
仔细看 Dario 的方案,禁高端 AI 芯片、堵芯片走私和境外数据中心的算力入口、打击未经授权的模型蒸馏、防止模型权重被盗。。。在他看来,如果这些措施奏效,未来 3~5 年美国的领先优势还可能继续扩大,也就能给美国公司腾出更多的减速空间。
绕来绕去,自己慢下来之前,还得先确保别人追不上来。
这也难怪,在 Dario 的帖子下面,有人发图阴阳,说 Anthropic 已经爬到第一梯队了,现在开始劝大家别跑太快,很难不让人怀疑,是不是自己上了车,就想把车门焊死?

当然,咱们也不能说 Dario 对 AI 的担心全是演的。
只不过世超觉着,某种程度上,这会变成一个囚徒困境的问题。
即便大家都认可一起减速可能更安全,只要没法确认别人真的会慢下来,继续加速就很容易成为各自保住优势的选择。
那么,真的会有人愿意停下来吗?
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...




