AI击败AI！谷歌研究团队利用 GPT-4 击败 AI-Guardian 防篡改系统

2025-05-20 11:33:40 | 来源: AICG工具箱

8月2日报道丨谷歌研究团队进行一项实验研究，他们使用 OpenAI 的 GPT-4聊天机器人来攻破其他机器学习模型的安全防护措施。这项实验证明了聊天机器人作为研究助手的价值。具体来说，谷歌 Deep Mind 的研究科学家 Nicholas Carlini在一篇题为“AI-Guardian 的 LLM 辅助开发”的论文中，探讨了如何通过指导 GPT-4设计攻击方法并撰写攻击原理的文本，以欺骗 AI-Guardian 的防御机制。AI-Guardian 是一种防御对模型的攻击的系统，旨在检测可能被篡改的图像以欺骗分类器。

GPT-4会发出用于调整图像的脚本（和解释）来欺骗分类器——例如，让它认为某人拿着枪的照片是某人拿着无害苹果的照片——而不会引发 AI-Guardian 的怀疑。AI-Guardian 旨在检测图像何时可能**纵以欺骗分类器，而 GPT-4的任务是逃避该检测。

通过 GPT-4的帮助，攻击者能够成功地破解 AI-Guardian 的防御，使其从98% 的稳健性降低到仅8%。然而，AI-Guardian 的开发者指出，这种攻击方法可能在改进的版本中失效。

据了解到，GPT-4作为研究助手的价值在于它能够快速生成代码，并且不会分心或疲劳，始终可用于完成指定的任务。然而，依赖 GPT-4并不完全解除人类合作者的责任，因为它仍然需要人类提供正确的提示并修复生成的代码中的错误。虽然 GPT-4还存在一些限制，但随着大型语言模型的改进，它们将为计算机科学家提供更多时间来开展有趣的研究问题。

上一篇： AI一键总结！YouTube测试新功能：利用AI自动生成视频概要 下一篇： 最后一页

热门榜单

1

Hi Echo — 网易有道

类型：常用AI

查看

1
Hi Echo — 网易有道
常用AI
2

万相营造

类型：常用AI

查看

2
万相营造
常用AI
3

TextGPT-短信访问chatgpt服务

类型：常用AI

查看

3
TextGPT-短信访问chatgpt服务
常用AI
4

Find Your Next Book--AI荐书

类型：常用AI

查看

4
Find Your Next Book--AI荐书
常用AI
5

摩笔马良

类型：常用AI

查看

5
摩笔马良
常用AI
6

美图设计室

类型：常用AI

查看

6
美图设计室
常用AI
7

Canva可画

类型：常用AI

查看

7
Canva可画
常用AI
8

通义点金

类型：常用AI

查看

8
通义点金
常用AI
9

可灵AI

类型：常用AI

查看

9
可灵AI
常用AI
10

讯飞智文 — 科大讯飞

类型：常用AI

查看

10
讯飞智文 — 科大讯飞
常用AI

热门资讯