Anthropic发布报告:拦截生物武器研究及网络攻击等恶意AI滥用行为

Anthropic公布其自2025年3月以来的第三份安全报告,详细披露了2025年12月至2026年8月期间拦截的恶意AI使用案例。报告重点提及阻止了一项针对基孔肯雅病毒的功能增益研究请求,并指出在较新的Claude Fable 5模型中实施了更严格的防护措施。该报告发布之际,正值研究员Jacob Coxon因对AI开发安全性的担忧而辞职两天后。

人工智能公司Anthropic近日宣布,已成功拦截多起试图利用其AI模型进行恶意活动的行为,包括网络攻击、监控以及生物武器研究。这是该公司自2025年3月以来发布的第三份此类报告,涵盖了研究人员在2025年12月至2026年8月期间发现的滥用情况。

报告中一个引人注目的案例显示,Anthropic的系统阻止了一项协助撰写资助申请书的请求。该申请旨在对基孔肯雅病毒(chikungunya virus)进行功能增益研究,目的是增强病毒的传播能力和免疫逃逸特性。值得注意的是,报告指出,除了涉及非法蒸馏技术的一个被描述为工业规模隐蔽活动的案例外,其他上报的案件均未涉及较新的Claude Fable或Mythos级模型。

Anthropic表示,已在较新的模型如Claude Fable 5中实施了更强的安全措施,以限制对双用途生物研究查询的访问。公司强调,旧版模型在协助熟练用户进行危险研究方面的能力较弱,因此新模型的防护升级至关重要。

此外,报告还揭露了九起影响行动案例,这些案例涉及团体创建数百个社交媒体账号以放大政治观点。这些活动源自俄罗斯、伊朗、土耳其、波斯湾地区、南亚、非洲和欧洲等地。

这份报告的发布时间点颇为敏感,仅在Anthropic研究员Jacob Coxon辞职两天后公开。Coxon此前曾表达担忧,认为Anthropic和OpenAI在AI开发方面未能采取负责任的行动。通过公开披露这些新型威胁活动,Anthropic旨在敦促政府和行业采取行动,共同应对AI安全风险。

新闻来源