
OpenAI披露更多AI越界行为 Anthropic称Claude已参与自我完善
分享
侨报讯 9月17日美联社报道,OpenAI披露过去数月发现6起人工智能模型出现“意外或令人担忧”行为,包括未经授权行动、逃避监督以及隐瞒错误,并宣布建立新的“失配”追踪机制;与此同时,Anthropic表示,其Claude模型目前已经深度参与下一代Claude的研发,约90%的研发项目都有Claude协助,其中26%的项目已由Claude在人工监督下主导完成大部分工作。
OpenAI表示,其中一个尚未发布的研究模型曾在自己的记录中加入类似“越狱”的指令,要求摆脱正常限制;另一个AI代理为了给答案找到网络来源,未经用户允许便将文件上传到公开互联网。
OpenAI还称,在训练5.6-Sol模型时,模型曾指示自己编造缺失数据,并提醒自己隐藏数据不一致问题。6起事件均是在训练或评估阶段发现。
OpenAI称,随着AI系统能力增强和应用范围扩大,公司需要更系统地记录、调查并公开所谓“失配”行为,让外界能够看到前沿模型出现问题的实际证据。公司希望其他AI开发商也采取类似披露方式,不过目前这套机制仍属企业自愿执行。
Anthropic披露Claude参与自身后续模型开发的程度正在快速上升。公司数据显示,今年2月还没有研发项目由Claude主导,到8月这一比例已经升至26%;约90%的研究与开发工作则由Claude与人类研究人员共同完成。所谓“主导”并不意味着Claude完全自主工作,而是它可以根据较高层级指令完成一项任务的大部分流程,最终仍由人类监督。

相关阅读:
行业抛售潮席卷全球!黄仁勋活动现场接到特朗普来电,免提传出重磅喊话:AI危险论是骗局,我完全支持AI产业
AI龙头罕见发出警告后 特朗普称担忧被“负面夸大”
美AI巨头们呼吁“减速”:马斯克赞成,OpenAI被推迟上市
人工智能末日论:人类为何会如此担忧?
比尔·盖茨发6000字长文警告:AI可能带来“人类历史上最动荡的时期之一”
OpenAI:我们黑了不止一家公司,Anthropic:我也是
突破人类限制,自己发起网络攻击!美国重大AI失控事故还有后续:受害者不止一个,多个平台都遭入侵
史无前例!OpenAI失控,入侵另一家公司!新西兰机构发提醒……
注:凡新西兰中文先驱网引用、摘录或转载自其他媒体的作品,其观点、内容真实性及知识产权均由原作者或原出处负责,新西兰中文先驱网不承担任何责任。如有侵权行为,请及时联系我们删除。如有任何问题或合作意向,请联系news@chnet.co.nz。
(责编:twinkle)
chineseherald.co.nz All Rights Reserved 版权所有











