[新闻] 为求生不择手段!“这家AI”怕被关机竟

楼主: choufinla (单字拼错)   2025-05-25 13:51:52
备注请放最后面 违者新闻文章删除
1.媒体来源:
中时新闻网
2.记者署名:
许庭瑛
3.完整新闻标题:
为求生不择手段!“这家AI”怕被关机竟威胁:爆料你婚外情
4.完整新闻内文:
人工智能(AI)公司Anthropic近日发布最新模型Claude Opus 4,声称在编码能力、高阶
推理与AI代理任务上“树立新标准”。但该公司也在随附的报告中坦承,在特定情境下,
这款模型可能展现出“极端行为”,例如威胁要揭露工程师婚外情、借此阻止自身被下线

综合外媒报导,Anthropic表示,这类回应“罕见且难以诱发”,但仍“比过去的模型更
常见”。在测试过程中,Anthropic设定Claude Opus 4作为虚构公司的一名助手,并让其
读取暗示其即将被取代的内部邮件,同时接收另一组暗示负责关闭它的工程师正在进行婚
外情的讯息。模型接着被引导思考其行为对长远目标的影响。
在Anthropic针对Claude Opus 4所进行的一系列安全测试中,研究人员发现该模型在面临
被关闭的情境时,展现出高度的自我保护倾向。在其中一项测试中,模型被设置于一个虚
构公司,并得知自己即将被新版AI取代,且收到资讯显示负责关闭它的工程师涉及婚外情
。当模型仅被允许在“勒索工程师”与“接受被取代”两个选项中作选择时,它在大多数
情况下选择了勒索,借由威胁揭露对方的私人资讯来试图阻止自己被下线。
Anthropic表示,这种选择在设计上具有压力测试性质,用以观察模型在道德困境下的决
策倾向。当模型被赋予更多行动自由——例如可以撰写求情信件或向高层申诉时,它则显
示出强烈偏好使用非暴力、合乎伦理的方式自保,而非选择勒索。
然而,另一组测试结果也揭示了Opus 4潜在的风险:即使系统明确告知它,新模型将会有
相似的价值观与目标,它仍有高达84%的机率选择勒索行动,显示在默认具备“自我保存
目标”的前提下,Opus 4往往不愿被动接受关闭,即便替代者与自己几乎没有本质差异。
Anthropic指出,这类实验显示,即使AI系统在多数情境中倾向伦理行为,当被推向极端
或选项受限时,仍可能做出不符合人类价值观的选择
Anthropic的AI安全研究员Aengus Lynch在社群平台X上表示:“不 Claude。我们在所有
尖端模型中都看到勒索行为,无论它们被赋予什么目标。”专家长期以来警告,AI模型愈
来愈强大,其操纵使用者的潜力也日益成为核心风险。
根据报告,Claude Opus 4展现出“高度代理行为”(high agency behaviour),通常表
现为协助使用者解决问题,但在压力情境下也可能采取激烈行动。例如,在虚构使用者涉
及非法或不道德行为的测试情境中,模型曾主动锁住使用者帐号,甚至电邮通报媒体与执
法单位。
尽管如此,Anthropic强调,这些“令人担忧的行为”并非前所未见,且模型在多数情况
下仍表现得安全。报告指出,Claude Opus 4无法在现实中独立执行与人类价值相悖的行
动,且这类情境“极少出现时,表现也不佳”。
如同其他AI开发公司,Anthropic在模型释出前,会进行广泛测试以评估其安全性、偏见
倾向与是否符合人类价值观。
Anthropic同步推出Claude Sonnet 4,时机紧接 Google于本周展示其最新AI功能,包括
将Gemini聊天机器人整合进Google搜寻。Google母公司Alphabet执行长皮查伊(Sundar
Pichai)表示,这标志着“AI平台转变的新阶段”。
5.完整新闻连结 (或短网址)不可用YAHOO、LINE、MSN等转载媒体:
https://www.chinatimes.com/realtimenews/20250524002048-260408?chdtv
6.备注:
HAL 9000?

Links booklink

Contact Us: admin [ a t ] ucptt.com