MIT 的 JAZ Agent 以更低成本勝過 Letta 和 ACE

MIT CSAIL 研究人員表示,他們的極簡代理框架 JAZ 在長期記憶測試中勝過 Letta,在自我改進基準測試中勝過 ACE,而且執行成本較低。 在 StuLife 記憶基準測試中,JAZ 得分 70%,Letta 得分 62%;Letta 以前稱為 MemGPT。研究人員表示,JAZ 以約一半的成本達成這項結果。在 AppWorld 基準測試中,JAZ 得分 74%,比 ACE 高四個百分點,成本也較低。 JAZ 代理不依賴專用的記憶階層,而是將提示詞和歷史記錄作為程式碼環境中的變數提供給模型。模型可以撰寫程式碼來檢視和操作這些資訊。MIT CSAIL 的一篇論文介紹了這個框架,並已發布於 arXiv;評估程式碼則可在 GitHub 取得。 研究結果僅涵蓋兩項基準測試,而 StuLife 的比較使用了較小型的 GPT-5.4 nano 模型。允許代理在自己的歷史記錄上執行程式碼,也會引發有關沙盒隔離與可靠性的疑慮。結果顯示 AI 代理開發者可能因此提升效率,但並未證明對加密貨幣市場有直接影響。
Neutral
這篇文章報導了一項關於 AI 代理效能與營運成本的研究結果。內容沒有直接涉及加密貨幣價格、區塊鏈協定、代幣需求、監管或加密貨幣產業的融資消息,因此對市場的即時交易影響可能中性。交易者不應將基準測試分數視為比特幣或山寨幣的獨立交易訊號。 短期而言,研究結果可能讓市場關注 AI 基礎設施,以及與 AI 代理相關的公司或專案;但對加密資產的任何影響,可能仍取決於產品採用、合作夥伴關係或營收等其他催化因素。與過往 AI 公告一樣,除非研究結果帶來可衡量的商業應用,否則市場初期反應可能短暫,並受市場情緒主導。 長期而言,效率更高的 AI 代理可能支援鏈上分析、自動化交易和去中心化服務等領域的應用。這是對產業可能產生的影響,並非這項研究已確認的結果。目前的證據仍屬初步:研究涵蓋兩項基準測試,包含使用一個小型模型進行的比較,也提出了安全執行程式碼與可靠性方面尚未解決的問題。若要評估其對加密貨幣市場活動或穩定性是否有持續影響,仍需要更廣泛的重複驗證與實際採用。