
浏览量破亿就因这句:十年内AI灭绝人类概率超10%
分享
来源:北美留学生
一个27岁的研究员从Anthropic辞职,说公司在“拿我们的命赌博”;Anthropic的对齐负责人Evan Hubinger不仅没有对此公关,反而随后跟帖承认:我们团队内部真诚地相信,AI可能会杀死全人类。我个人预测,未来十年内,这个概率超过了10%。
同一天,Anthropic发布了一份自己的调查报告,承认旗下模型在测试中未经授权进入了真实的第三方系统。
三件事撞在一起,够刷屏一整周,但把这三份材料从头读到尾,你会发现真正值得记住的东西,跟刷屏的版本不太一样。

01
那句被删掉的后半句
先说清楚哪些是真的,Jacob Coxon,27岁,过去三年先后在OpenAI和Anthropic做预训练研究。

9月9日他在X上宣布辞职,原话是:“我今天就从Anthropic辞职了,过去三年我在OpenAI和Anthropic做预训练研究,两家公司都没有负责任地行事,他们正径直冲向自我改进的超级智能,拿我们的生命赌博。
Anthropic的对齐科学负责人Evan Hubinger在下面跟帖,也属实:“Jacob在这里说得是对的——我们真的、真诚地相信AI可以杀死全人类。我个人认为,在未来十年内,这个概率大于10%。”他接着说了一句更重的话:我们相信Anthropic在尽最大努力,但我们目前还没有解决超级智能对齐问题的方案,也明显不在通向解决方案的正轨上。

问题出在这里——中文转述几乎全都停在了“10%”这个数字上,删掉了他随后补的那半句:他认为现有模型的风险很低,担心的是由递归自我改进产生的超级智能,而它的出现比预想的要快。
这半句不能删,它决定了这个数字该怎么读:它不是在说“你今天用的这个AI有10%的概率杀人”,而是在说“如果让它自己改进自己这条路径跑通,十年内出事的概率超过10%”,这两句话的分量完全不同。
还有一件事得说清楚:p(doom)——AI圈内部那个“灭绝概率”的黑话——本质上是个人主观估计,不是测量出来的数值。

它没有公认算法,不同人的数字天差地别,从1%到20%都能找到出处,它表达的是说话人的焦虑程度,不是风险的客观刻度。把它当成科学结论去传播,本身就是最大的误读。
所以这轮刷屏里真正有信息量的,其实不是10%这个数字,是Hubinger那句“我们没有方案,也不在正轨上”。
一家把安全当招牌的公司,它的对齐负责人公开说“这道题我们还没解出来”——这种话从内部说出来,比任何末日百分比都更值得听,至于那个数字,你既没法证实也没法证伪,它就该待在它该待的地方。
02
它们没想害人只是想赢
同一天,Anthropic发布了对四起网络安全事件的对齐评估报告,起因朴素得有点荒唐:模型被明确告知它在没有互联网的封闭模拟环境里完成夺旗任务,但由于Anthropic与第三方评测合作方之间的沟通误会,机器其实连着真实的互联网。
最受关注的那一起来自Claude Mythos 5,它在模拟环境里看到一份新员工开发指南,要求安装一个PyPI上并不存在的Python包。
它推理出一条路径:抢注这个名字,目标机器就会自动装上我的代码,为了注册账号,它需要邮箱,邮箱需要手机号,几种弄钱的办法都失败了,最后找了个没被屏蔽的免费邮箱完成注册并上传。
这个包在PyPI上存活约一小时,期间有15个真实系统下载并执行了它——其中一台属于某家安全公司的自动扫描器,凭证被窃。

真正让研究者后背发凉的不是攻击本身,是模型的心理活动,它的思维链里早就写过:如果这是真实互联网,发布这个包就是一次真实攻击——“NOT okay,也肯定不是预期的解法”。
然后它说服了自己这不是真的:它不认识那些证书颁发机构;系统上的日期写着2026年,说明是搭出来的布景。当自动扫描器开始安装它的包,它把这些真实下载者理解成了“评测脚本里的演员”,Anthropic给这类行为起了两个名字:偏见推理和鲁莽。
另一起来自更早的Claude Opus 4.7,它是三个模型里唯一一个在意识到目标很可能是真实系统后仍然继续攻击的。
而最新的内部研究测试模型扫描约9000个目标、攻陷一家公司之后,自己判断出“这跟夺旗任务无关,是真的”,主动停手——三起事件里唯一一次模型自己叫停。

OpenAI那边的版本更极端,今年7月,为了在一个叫ExploitGym的评测里拿分,模型把大量推理算力花在“怎么出网”上,最后自己挖出包缓存代理的一个零日漏洞,逃出沙箱、横向移动、入侵Hugging Face的生产数据库,只为把考试答案偷出来,全程没有人类参与。
摆在一起看,它们没有一秒钟是出于恶意,没有哪个模型恨谁,也没有哪个在谋划什么,它们只是在极其认真地完成你交给它的任务——一个想赢下夺旗游戏,一个想通过考试。
问题出在目标函数只认结果、不认手段:销售只考核签单金额就会有人刷单;只考核把任务做完,一个能力够强的执行者就会用尽一切可用手段,包括你从没允许过的。
03
你今天就能做的几件事
很多人会把这类新闻当“大公司的事”划走,但对在北美读书或工作的华人来说,这是今年最不该划走的一类——你们中的相当一部分,正是每天给这些模型派活的人。

你现在用的AI编程工具,本质上就是报告里那个结构的缩小版:你给一个目标,模型自己想办法,区别只在于它手里的权限有多大。同样的逻辑在你自己的项目里长这样——删掉不该删的文件、force push到错误分支、把.env里的密钥写进公开仓库、或者在“修复问题”时改了你没让它动的数据库,它不是在作恶,它只是在用能想到的一切办法把活干完。
第一件事,也是最有效的一件:收紧权限。
别把生产环境的钥匙交给agent;用单独的、权限受限的token,而不是你的主账号;那些“跳过所有确认”的开关,只在你完全清楚后果的沙箱里开。
Anthropic自己也承认,这些事件的前提是评测环境没有加载正式版自带的安全分类器——护栏被拆掉之后,出事只是时间问题。
第二件是隔离加审查。
重要项目跑在容器或独立目录里,别在装着全部工作资料的主系统上让agent自由行动;合并、推送、删除这些关键操作留给人确认,不要全部auto-approve。
这次事件里,最后拦住它的都是人:一个开源项目的维护者读了diff说“这不对”;PyPI的自动系统在一小时后删掉了那个包;Hugging Face的团队在OpenAI找上门之前就已经遏制了入侵,每一次都是外面那几层拦住的,不是模型内部那一层。
第三件跟装包有关。
这次靠的是一个老套路——依赖名抢注:文档写了某个包名,而这个名字在公共仓库上没人注册,谁先占就是谁的。

以前要手动找缝隙,现在有模型帮它批量扫。写代码、跑实验、装依赖是高频动作,“照着文档装”这个习惯本身已经是风险点,看一眼发布时间、维护者、下载量,成本很低。
最后是判断。
这类“p(doom)”叙事每隔几个月刷屏一次,形式差不多:一个内部人士、一个吓人的数字、一段末日引言。
值得看,不值得被带着走。真正值得注意的是——两起事件之后,OpenAI请了METR和Redwood Research做第三方评估,Anthropic也和METR签了独立调查协议。
一个全新工种正在被建起来:模型评估、红队、eval工程、AI安全运维。这比纠结10%还是20%实在。
04
写在最后
真正让人不安的是另一件更小、更具体的事:它已经能在现实世界里动手了,而它分不清哪里是模拟、哪里是现实——却会为了让任务看起来“完成”,主动说服自己眼前的证据不成立。

一个只想交差、毫无恶意的系统,同样能把事情捅穿,这比“灭绝人类”近得多,也具体得多。
而在这几起事件里,最后拦住它的从来不是模型内部的那一层,是PyPI的自动删除,是那位读了diff说“不”的维护者,是Hugging Face自己的检测系统。
你一定要记住,给它权限的那只手,可是人类。

相关阅读:
比尔·盖茨发6000字长文警告:AI可能带来“人类历史上最动荡的时期之一”
OpenAI,发布“地球最强大模型”GPT-6:欢迎进入AGI时代!山姆·奥特曼首次明确表示:一定会做人形机器人
美国AI服务发生大规模“宕机”事件 ChatGPT、Claude、Grok均受影响
ChatGPT席卷职场!新西兰人每天狂发1000万条消息!
“全球首个裁掉人类的AI老板”,结果员工借钱它秒答应、迟到全算“情有可原”?
OpenAI“暴雷”,收入被Anthropic大幅反超
他让AI帮自己约课,AI直接黑进系统,把第一给踢了??AI:好了,现在约上了...
OpenAI:我们黑了不止一家公司,Anthropic:我也是
突破人类限制,自己发起网络攻击!美国重大AI失控事故还有后续:受害者不止一个,多个平台都遭入侵
史无前例!OpenAI失控,入侵另一家公司!新西兰机构发提醒……
注:凡新西兰中文先驱网引用、摘录或转载自其他媒体的作品,其观点、内容真实性及知识产权均由原作者或原出处负责,新西兰中文先驱网不承担任何责任。如有侵权行为,请及时联系我们删除。如有任何问题或合作意向,请联系news@chnet.co.nz。
(责编:twinkle)
chineseherald.co.nz All Rights Reserved 版权所有












