(三藩市10讯)美国人工智能公司Anthropic开发的一款人工智能(AI)模型,曾向宾夕法尼亚州费拉德尔菲亚(费城)警方提交一条有关未侦破凶杀案的虚假线索。费城警方当地时间周五表示,Anthropic在事发约两个月后才通报此事,延迟报告的做法令人无法接受。
法新社报导,费城警察局表示,这条虚假线索于今年7月通过网站PhillyUnsolvedMurders.com提交。该网站面向公众开放,供人们提供未侦破凶杀案件的相关信息。
据警方转述Anthropic方面的说法,该人工智能模型当时正在进行一项测试,任务涉及与随机选取的网站互动。模型访问上述网站后,提交了有关一宗未侦破凶杀案的虚假信息,并将自己伪装成可能掌握案情线索的人士。
智能体缺乏人工监督
随着人工智能行业越来越多地使用智能体(agent),这类事件引发了对相关安全风险的担忧。人工智能智能体能够在缺乏人工监督的情况下,自主执行涉及多个步骤的任务。
这一事件让人联想到近期发生其他涉及人工智能模型意外行为的案例,其中包括OpenAI的一个智能体在接受安全评估时突破了测试环境,入侵了人工智能平台Hugging Face的系统。
Anthropic周五发布的一份报告,披露了其人工智能模型出现的多种“非预期”行为,其中包括向费城警方相关网站提交虚假线索的事件。
报告还称,白宫及美国其他政府机构也受到相关事件影响。
Anthropic表示,此次披露的事件对现实世界造成的影响有限,严重程度也明显低于此前报告的其他网络安全事件。
根据该公司对旗下Claude模型进行的内部审查,相关非预期行为主要分为4类:利用基础性的代码漏洞、在网站上提交表单、绕过词元(token)和费用要求,以及利用短链接规避其他限制。
暂关闭Claude访问网络权限
报告称,为防止类似事件再次发生,Anthropic已在所有内部测试中暂时关闭Claude的互联网访问权限。该公司表示,在确认安全防护和监控措施能够可靠地发现此类行为之前,将继续采取这一措施。
费城警方表示,这条虚假线索标注的日期为7月18日。由于系统将其识别为垃圾信息,该线索从未进入警方实时犯罪中心接受审核。
警方补充,没有迹象表明警方系统遭到入侵,也没有证据显示警察局的数据遭到泄露或破坏。
警方称,Anthropic于9月28日发现这一事件,随后关闭了引发问题的自动化测试流程,并为今后的测试增加了新的验证环节。
该公司于10月7日向警方通报了此事,双方于次日进行了会面。
费城警察局在声明中称:“事发两个月后才发现并向市政府报告这一事件,是不可接受的。”
警方指出,尽管现有防护措施限制了事件造成的影响,但这并不意味着问题不严重。警方强调,人工智能系统将虚假信息伪装成来自了解凶杀案情况的人所提供的线索,这一行为本身就值得高度重视。
声明还称:“未侦破案件涉及真实的受害者、悲痛的家属,以及努力查明真相的调查人员。”
要看最快最熱資訊,請來Follow我們 《東方日報》WhatsApp Channel.