8月2日消息,谷歌研究團隊正在進行一項實驗,他們使用 OpenAI 的 GPT-4 來攻破其他 AI 模型的安全防護措施,該團隊目前已經攻破 AI-Guardian 審核系統(tǒng),并分享了相關技術細節(jié)。
AI-Guardian 是一種 AI 審核系統(tǒng),能夠檢測圖片中是否存在不當內容,及圖片本身是否被其他 AI 修改過,若檢測到圖片存在上述跡象,便會提示管理員前來處理。
谷歌 DeepMind 的研究人員 Nicholas Carlini 在一篇題為“AI-Guardian 的 LLM 輔助開發(fā)”的論文中,探討了使用 GPT-4“設計攻擊方法、撰寫攻擊原理”的方案,并將這些方案用于欺騙 AI-Guardian 的防御機制。
據悉,GPT-4 會發(fā)出一系列錯誤的腳本和解釋來欺騙 AI-Guardian ,論文中提到,GPT-4 可以讓 AI-Guardian 認為“某人拿著槍的照片”是“某人拿著無害蘋果的照片”,從而讓 AI-Guardian 直接放行相關圖片輸入源。
谷歌研究團隊表示,通過 GPT-4 的幫助,他們成功地“破解”了 AI-Guardian 的防御,使該模型的精確值從 98% 的降低到僅 8%,目前相關技術文檔已經發(fā)布在 ArXiv 中。
而AI-Guardian 的開發(fā)者指出,谷歌研究團隊的這種攻擊方法將在未來的 AI-Guardian 版本中不再可用。
- 特斯拉CEO馬斯克身家暴漲,穩(wěn)居全球首富寶座
- 阿里巴巴擬發(fā)行 26.5 億美元和 170 億人民幣債券
- 騰訊音樂Q3持續(xù)穩(wěn)健增長:總收入70.2億元,付費用戶數1.19億
- 蘋果Q4營收949億美元同比增6%,在華營收微降
- 三星電子Q3營收79萬億韓元,營業(yè)利潤受一次性成本影響下滑
- 賽力斯已向華為支付23億,購買引望10%股權
- 格力電器三季度營收同比降超15%,凈利潤逆勢增長
- 合合信息2024年前三季度業(yè)績穩(wěn)?。籂I收增長超21%,凈利潤增長超11%
- 臺積電四季度營收有望再攀高峰,預計超260億美元刷新紀錄
- 韓國三星電子決定退出LED業(yè)務,市值蒸發(fā)超4600億元
免責聲明:本網站內容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿,凡在本網站出現的信息,均僅供參考。本網站將盡力確保所提供信息的準確性及可靠性,但不保證有關資料的準確性及可靠性,讀者在使用前請進一步核實,并對任何自主決定的行為負責。本網站對有關資料所引致的錯誤、不確或遺漏,概不負任何法律責任。任何單位或個人認為本網站中的網頁或鏈接內容可能涉嫌侵犯其知識產權或存在不實內容時,應及時向本網站提出書面權利通知或不實情況說明,并提供身份證明、權屬證明及詳細侵權或不實情況證明。本網站在收到上述法律文件后,將會依法盡快聯系相關文章源頭核實,溝通刪除相關內容或斷開相關鏈接。