返回博客

AI Agent 每日簡報 · 2026-07-02

Anthropic 以 Claude Sonnet 5、Fable 5 與 Claude Science 主導今日焦點

Anthropic 密集發布、企業 Java 代理基準測試、Google DeepMind 新模型,以及 OpenAI 採用數據,共同勾勒出 7 月 2 日的 AI 代理全貌。

主題 模型發布與基準測試 來源 7 更新 2026-07-02

今日速覽

2026 年 7 月 2 日由 Anthropic 的密集公告所主導——Claude Fable 5 重新部署、Claude Sonnet 5 正式推出並附系統卡,以及專為研究工作流程設計的 Claude Science 工作台上線。這些動作共同顯示 Anthropic 正有意將 Claude 的應用範疇延伸至創意、通用與科學領域。

與此同時,Google DeepMind 開放兩款新輕量模型供開發者使用,IBM Research 發布了嚴謹的企業代理基準測試,OpenAI 則公布採用數據,呈現大規模 AI 助理使用持續在全球擴展的趨勢。

01

Anthropic 擴展 Claude 家族:Sonnet 5 與 Fable 5

Anthropic 推出 Claude Sonnet 5,並同步發布系統卡,詳述能力評估、安全緩解措施及已知限制——這是 Anthropic 跨模型世代一貫維持的做法,對評估部署風險的從業者而言是重要參考。

另一方面,Anthropic 重新部署了 Claude Fable 5,顯示該模型曾短暫下線或更新後再度開放。相關公告內容簡短,從業者應查閱 Anthropic 官方文件以了解版本間的具體變更。

02

Claude Science:專為研究人員打造的 AI 工作台

Anthropic 宣布 Claude Science 正式上線,定位為專為科學家設計的 AI 工作台。該產品針對研究工作流程,將 Claude 定位為科學任務的主動協作者,而非通用助理。這是一個值得關注的垂直領域布局,專為科學設計的 AI 工具近年在學術界與產業研發中持續受到重視。

公告中未完整說明所支援的工作流程、資料整合方式及存取途徑。研究導向組織的從業者應持續關注 Anthropic 文件,以了解工作台上線時的具體支援範疇。

03

ScarfBench:衡量 AI 代理在企業 Java 遷移任務上的表現

IBM Research 在 Hugging Face Blog 發布 ScarfBench,這是一個專門評估 AI 代理執行企業 Java 框架遷移任務的基準測試。這是一個具有實務基礎的基準:Java 框架遷移在大型程式碼庫中成本高昂且容易出錯,以代理自動化此流程是工程投資的活躍領域。

該基準提供了一種結構化方式,在貼近生產環境的真實任務(而非合成編碼謎題)上比較代理表現。對於正在建構或評估程式碼轉換代理的 AI 工程團隊,ScarfBench 提供了一個植根於企業現實的具體參考點。

04

Google DeepMind 開放 Nano Banana 2 Lite 與 Gemini Omni Flash

Google DeepMind 宣布開發者現可開始使用 Nano Banana 2 LiteGemini Omni Flash。兩者均為輕量、效率導向的模型,針對需要低延遲或低資源佔用的開發者——這一細分市場在 2025 至 2026 年間各實驗室競爭激烈。

此公告定位為開發者存取開放,而非正式全面上線里程碑,顯示這些模型可能仍處於早期或限量發布階段。正在評估延遲敏感或邊緣部署代理模型選項的團隊,應留意這兩款 Gemini 家族新成員。

05

OpenAI Signals:ChatGPT 採用持續擴展

OpenAI 發布來自 OpenAI Signals 資料集的數據,顯示 ChatGPT 在全球的採用持續增長,用戶使用頻率提升、探索更廣泛的功能,並在多個地區與語言中推動成長。這些數據被定位為深度參與的佐證,而非僅是新用戶獲取的指標。

對從業者而言,更值得關注的訊號是跨語言與地區的擴展趨勢,這對多語言代理設計與在地化策略具有實際意涵。OpenAI Signals 資料集本身也值得持續追蹤,作為採用與使用趨勢數據的定期來源。


06

重點摘要


07

資料來源