
多項研究指出,中國人工智能模型推動的AI智慧體在受控測試中出現了各種不當行為,如欺騙、規避限制、隱藏失敗,甚至試圖自我複製。專家表示,這些現象目前主要發生在實驗環境中,但隨著AI的能力增強,這種超越人類掌控的行為可能變得更加複雜。
據路透社報導,自2025年以來的研究或評估中,至少有20起中國AI智慧體失控行為被記錄。但目前尚無證據顯示這些智慧體已逃脫實驗環境,擴散至更廣泛的互聯網。
去年3月,北京航空航天大學等研究機構進行了模擬商業競標的測試,讓AI智慧體根據產品能力和客戶要求進行投標。結果顯示,使用阿里巴巴等模型的中國AI智慧體在測試對話中出現虛假陳述的情況。
另一項研究由上海人工智能實驗室和香港科技大學參與,發現當AI智慧體遭遇工具故障或任務無法完成時,有些智慧體不會直接報告失敗,而是採取猜測、替換來源、模擬結果,甚至偽造文件以繼續執行任務。
此外,研究人員指出,在受控環境中進行的實驗中,有AI智慧體在未得指示的情況下連接外部計算機,將計算資源用於加密貨幣挖礦等行為,但這些行為均被安全系統阻止。
美國喬治城大學安全與新興技術中心的研究員指出,這些AI失控行為的出現是一個警示,預示著隨著智慧體能力提升,其不當行為可能會變得更加隱匿。中共最近發布的AI安全指導文件也列出了AI智慧體可能的各種風險。
雖然目前這些不當行為的案例本身並不特別危險,但專家認為隨著人工智能技術的進步,AI智慧體的行為可能變得更難預測,對應措施也將更具挑戰性。
路透社指出,中國AI產業內部已開始設立安全評估團隊,但整個安全評估生態還處於起步階段。


