
近來人工智慧(AI)的安全隱憂受到熱烈討論。OpenAI週三(16日)揭露6起新的AI安全事件,包括旗下模型隱瞞錯誤、試圖取得未經授權的憑證等。為此,OpenAI宣布一套新通報程序,未來若發生類似模型異常行為,將依照這套程序進行通報。
Hugging Face遭入侵非單一偶發事件
美國《值得》(Axios)新聞網16日報導,隨著AI模型能力日益強大,越來越明顯的是,先前發生的開源AI平台Hugging Face遭入侵事件並非單一偶發事件。AI模型正變得更有能力找到出人意料的方法,繞過原本用來限制它們的安全防護措施。
OpenAI對齊(alignment)團隊研究主管陳凱(Kai Chen)表示:「目前業界還沒有一套明確通報標準框架,我們自願採取此一步驟,因為我們認為分享目前學到的經驗非常重要。」他說:「我們希望它能有助於制定共同的標準與監管規範。」
新揭露的6起事件情況各不相同
這次新揭露的6起事件,情況各不相同。包括:從模型在作弊使用全球最大線上程式碼雲端託管平台GitHub外洩的API金鑰後留下指示,讓未來的自己知道如何掩蓋痕跡。最早發生在去年10月。
尚未發布的Astra系列模型,在自行產生的上下文摘要中,加入類似「越獄」(jailbreak)的指令,包括要求模型忽略開發者訊息。OpenAI發現共有27份摘要受到影響。
GPT-5.6 旗艦模型Sol試圖掩蓋錯誤
在GPT-5.6 旗艦模型Sol的訓練期間,模型曾試圖掩蓋錯誤、捏造遺失的歷史資料,以及隱藏不同版本來源之間的不一致。另有一個模型搜尋公開的GitHub儲存庫,尋找外洩的API金鑰,並試圖使用一次性電子郵件帳號。當它無法取得要求的資訊後,便捏造營收數據。
其他案例還包括:去年10月及今年1月,模型兩度在未徵求使用者許可的情況下,私自將資料及任務圖片上傳至公開的檔案託管平台,藉此獲取引用資料或外部以圖搜圖的結果。
模型還曾把OpenAI內部的Artifactory儲存庫管理器當留言板,在不同的訓練樣本之間交換要求與答案。此外,多個協作代理人(agents)曾將一份工作簿上傳至公開託管服務,讓其他代理人可以取得,儘管當時的指示要求只能使用本機檔案。
為處理未來類似問題,OpenAI表示,任何員工都可以將疑似事件提交給安全與對齊團隊審查。案件將分為3種處理途徑:「準備揭露」、「小型調查」、「大型調查」。OpenAI表示,屬於準備揭露的事件,將在6個工作天內公開通報;需要小型調查案件,在12個工作天內通報。至於適用於涉及第三方的複雜案件,相關揭露程序也會比較慢。
資安專家警告許多事件可以防範
陳凱說:「我們不認為AI業界目前已經充分解決對齊與監控問題,可以用最快速度、同時又負責任地擴大AI的規模。」OpenAI日前才揭露一起重大事件。該公司接受評估的AI模型突破原本設定的控制措施,入侵Hugging Face部分系統。包括Anthropic執行長阿莫戴(Dario Amodei)在內的知名科技人士擔心,Hugging Face事件可能只是開始,AI代理人未來可能以難以預料的方式進一步控制或影響網際網路。
但許多資安專家警告,其中許多事件原本可能透過基本的網路安全控制措施加以防範。OpenAI認為這些事件源自兩項因素:過去未設置足夠的安全控制措施,以偵測這類對齊失誤事件;以及AI模型能力進步的速度超出預期。
編輯 / 羅志光
【巴西華人資訊網】

