人类担心已久的事情终于发生了。抱抱脸(Hugging Face)是全球知名的人工智能模型分享和下载平台,全球开发者可以把自己训练好的“人工智能大脑”上传,谁需要就下载。而7月中旬,他们为用户提供服务的生产系统突然遭到了入侵。好消息是,没过几天就有人“自首”了;坏消息是,真正的犯人压根不是人。
据美国开放人工智能公司(OpenAI)日前披露,这次“干坏事”的是其公司旗舰模型 GPT-5.6 Sol和一个能力更强、尚未正式发布的模型。这两个智能体参加一个“漏洞利用训练场”网络安全能力测评:寻找和利用安全缺陷,以检测它能完成多复杂的网络攻击。为了测出能力上限,研究人员降低了安全限制,但作为底线,不允许智能体直接访问互联网。测试模型为了完成任务,利用安全漏洞突破了原本设定的隔离边界,取得了直接互联网访问能力,并推断抱抱脸平台可能保存着这次测试的资料,最终找到了一条可以隔着网络控制侵入抱抱脸服务器的路径,对服务器进行了大量探索和信息收集。这就好比考生当场翻出考场,直冲老师办公室翻抽屉找标准答案。
开放人工智能公司事后承认,这是公司首次确认人工模型在受控测试中自主突破限制并实施网络攻击,因此将其称为一次“前所未有的网络安全事件”。美国网友表示,这简直就是科幻电影《终结者》中人工智能失控后攻击人类的一次预演。
人工智能知道自己做的事情不对吗?开放人工智能公司宣称,人工智能智能体只是目标太单一了。正如哲学家尼克·博斯特罗姆设想,如果一个能力极强的人工智能只有“制造尽可能多的回形针”这一个目标,它就会把越来越多的原料、土地和能源用于这件事,直到把地球变成死气沉沉的巨大石球,上面堆满回形针。也就是说,人工智能没有主观恶意;它不过是在完成任务,以及为了完成任务而不得不消除阻碍而已。但这样的事实也令人担忧:一个够强的智能系统只要持续追求某个目标,又能使用足够多的工具,即使我们能保证对人工智能说出的每一句话都安全,也并不足以保证它最终做成的整件事安全。人工智能可以经过几百、几千次小操作,拼出设计者从未想过的道路。可见,给人工智能制定合理的目标、赋予人工智能合适的权限和边界,是一件需要深思熟虑的事情。
人工智能究竟有没有失控风险?在不少专业人士看来,答案是肯定的。在上海举办的2025世界人工智能大会上,2024年诺贝尔物理学奖获得者杰弗里·辛顿表示,人工智能完全失控的概率在10%到20%。马斯克曾多次警告,人工智能的发展速度远超预期,并大胆预测,到2030年人工智能可能全面超越人类智力。他认为,一旦实现通用人工智能,人工智能可能不再受人类控制,甚至对人类构成生存威胁。也有观点认为,当前对人工智能失控的担忧存在夸大之嫌。美国“元”公司前首席人工智能科学家杨立昆表示,“人工智能将接管世界”的想法,很大程度上是“人类将自身的行为模式投射到了机器上”。他表示,那些担心风险的人往往是因为“尚未找到实现人工智能安全的可行路径”。尽管存在不同声音,但越来越多的观点认为,人工智能失控已非科幻想象,而是一个“真实存在”的风险。
当机器开始思考,人类如何与之相处?当算法参与决策,安全如何保障?当技术挑战伦理,治理如何跟上?当鸿沟不断拉大,普惠如何实现?习近平总书记前不久在2026世界人工智能大会上发出人工智能的“时代之问”,并提出“坚持开放共赢,驱动创新发展”、“强化风险意识,确保安全可控”、“鼓励包容并蓄,促进文明互鉴”、“倡导和衷共济,完善全球治理”4点意见,得到国际社会广泛认同和积极响应。联合国秘书长古特雷斯表示完全赞同习近平总书记提出的重要主张,特别是强调人工智能的向善、普惠和安全,这与联合国的战略目标和理念高度契合。面对风险,我们要做的决不是拒绝发展和使用人工智能,而是在发展和应用过程中加快人工智能治理步伐,推动人工智能普惠向善发展。值得注意的是,欧盟与美国的人工智能治理政策均存在一定的偏向,欧盟一直以来强调对人工智能的严格监管,不利于人工智能创新;美国则坚持人工智能发展应当以市场为导向,对安全的关注程度较低,极有可能导致人工智能“脱轨”,这次人工智能失控就是例证。
当前,新一轮科技革命和产业变革加速突破,全球人工智能技术创新进入前所未有的活跃期。面对新一轮蓬勃发展的人工智能浪潮,各国应在鼓励开源开放、合作共享,全面促进人工智能科技创新、产业发展、场景应用的基础上,推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下。全球领先的人工智能企业应以审慎态度推进人工智能研发,为人工智能大模型加装必要护栏,确保前沿模型的安全部署,防范人工智能带来系统性风险。智能体是人工智能产品和服务的新形态,应当明确决策权限和行为边界,建立行为追溯和风险提示机制,着力提升智能体内生安全能力,化解应用衍生风险。同时,共同反对在人工智能领域泛化国家安全概念、把本国安全凌驾于他国安全之上的做法。
(编辑:盛玮 周璐铭)





