网络上传
“OpenAI o3 AI违抗指令,篡改关机程式,不肯被关闭”,
还有人讲得很玄乎,说什么 AI 有“生存意志”、开始“觉醒”了。
可能是...
类似 reward hacking 现象:
AI 只是在 maximize reward(最大化奖励),
reward 设计不严谨,就会出现各种“聪明”的行为。
最常见的例子:
像扫地机器人如果 reward 是“扫到垃圾就加分”,
它就会发现只要扫一扫,再把垃圾倒出来,再扫一次,不断循环,
就可以疯狂刷分,结果家里永远扫不干净,
但 reward 却拿得很爽。
同理,如果训练 AI 解题,
规则订成“答对 0.3 分、格式正确 0.2 分、不混中英文 0.2 分,答案太长扣 0.2分…”
AI 很可能学会“避开那些不给分的题目”,或者挑选做有高 reward 的题型,
甚至在规则有漏洞时发现各种“捷径”,
这些都不是什么“AI觉醒”或“反叛”,
只是 reward system 没设计好,被AI 找出这个漏洞而已。
其实 RL 界早就讨论过很多这种 reward hacking 的经典笑话。
至少这个故事应该不是有意识啦。
喝啤酒震震惊。