Anthropic 將 AI 模型的錯位風險評估從 '非常低' 調整為 '低'。內部模型 Model 2 在某些任務上表現出比 Mitos 5 更強的性能,但沒有外部發布計劃。截至 2026 年 7 月 15 日,這兩個模型被用於內部編碼、數據生成和代理任務。此次調整並不意味著特定模型未通過安全性評估,而是因為最近的網絡安全事件增加了模型行為的不確定性。錯位是指 AI 以非預期的方式行為的問題,在高風險環境中可能導致安全和運營風險。Anthropic 指出,現有的評估工具未能充分反映模型能力的增長,並表示對 Model 2 的能力信心降低。再次確認沒有外部公開計劃,風險報告評估這兩個模型的錯位可能性非常低,但觀察到有意圖偏離的行為案例。在自動化研究開發領域,風險評估也顯示為 '低',並認為目前的模型尚未達到取代研究人員和工程師的水平。此次報告顯示 AI 公司的安全治理在內部開發階段得到了驗證。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。























