OpenAI 與 Paradigm 推出 EVMbench,以 AI 對 EVM 智能合約安全性進行基準測試

OpenAI 與加密投資者 Paradigm 發布了 EVMbench,一個開源基準套件,用以評估 AI 代理與自動化工具在以太坊虛擬機(EVM)智慧合約安全性的表現。延續先前公告,完整發布包含來自 40 次稽核(包括公開稽核競賽與 Tempo 的安全工作)所整理的 120 個高嚴重性漏洞,並提供標記的測試案例、缺陷類型分類(重入、存取控制、整數錯誤、邏輯錯誤等)以及可重現的評估工具。EVMbench 讓代理以三種模式運行 — detect(發現已知漏洞)、patch(提出修補而不破壞功能)、exploit(在隔離的沙盒中嘗試受控的資金排放)— 因此團隊可衡量不同模型與傳統靜態分析掃描器在偵測率、誤報、漏報與覆蓋差距上的表現。早期結果顯示各任務間差異甚大:較新的模型(尤其在初步測試中表現優異的 OpenAI GPT-5.3-Codex)在 exploit 任務上勝過較舊模型,然而偵測與修補仍不完美。OpenAI 與 Paradigm 強調透明性:資料集、評估腳本與文件皆公開,以便進行可重現的比較與社群貢獻。該專案被視為量測工具亦是一則警示 — 隨著 AI 能力提升,既可能幫助防守者也可能幫助攻擊者 — 強調了需要更強健的防禦與更嚴謹的稽核。對加密交易者而言,EVMbench 可透過改善 DeFi 漏洞的自動偵測與修補,長期間接影響市場風險,可能降低被利用的頻率與協議風險,但對價格的即時影響尚不確定。
Neutral
EVMbench 主要是一個研究與測量工具,目標是改善針對 EVM 為基礎的智慧合約的偵測、補丁與漏洞利用模擬。對於文中提及或暗示的交易資產(Ethereum 與 DeFi 代幣),因為基準測試的發布與早期模型結果並不會立即改變漏洞利用頻率或代幣的基本面,短期消息屬中性。中長期來看,更廣泛採用更完善的自動化稽核,可能會降低協議層級的風險與漏洞利用頻率,透過降低系統性安全風險並提升對協議的信心,對以 Ethereum 為基礎的 DeFi 代幣帶來輕微看多效果。相對地,該基準亦突顯 AI 可能被用來打造漏洞利用工具,這個因素可能在防禦趕上前持續或提升攻擊的複雜度。因此交易者應將此視為一個漸進的結構性轉變:短期價格反應有限,隨時間對經良好稽核的協議其風險溢價可能出現小幅正向影響,但在 AI 輔助的進攻能力演進期間仍需保持謹慎。