Anthropic研究员Evan Hubinger认为,人工智能在未来十年内毁灭人类的概率超过10%。他也承认,对于超级智能AI的安全问题,公司目前还没有明确的解决方案。
说这番话的背景,是研究员Jacob Coxon刚从Anthropic离职。Coxon此前曾在OpenAI任职,离职后他公开指责这两家公司正在“径直冲向能自我改进的超级智能”,等于在拿全人类的未来当赌注。他还表示,AI公司的员工心里都清楚开发这类系统的后果,却仍在追逐更强大的模型。
Coxon特别提到,Anthropic很清楚威胁有多严重,却因为担心竞争对手不会停手,仍认为有必要继续研发。他把这场竞赛称作“自以为是的冒险”,甚至认为,要刹住这场全球性竞争,可能得在一段时间内暂停提升AI模型的能力。
Hubinger在Anthropic负责对齐科学(Alignment Science)方向,他认同这位前同事的看法,并透露公司内部确实在认真考虑AI毁灭人类的情景。他个人估计,未来十年内走到这一步的概率超过10%。他同时强调,Anthropic虽然在努力应对这一问题,但目前仍“没有方案”保障超级智能的安全,公司看起来也不像正稳步接近答案。
在Hubinger看来,最大的隐患在于超级智能可能通过递归式自我改进而诞生,而这一进程的速度已经超出此前的预期。尽管Anthropic在最新报告中把现有模型的风险评估为较低,但Hubinger指出,这并不能化解未来更强大系统带来的威胁。



