Overview

一次升級三件事

過去半年大家都在談 AI 代理人,但實際把代理人放到生產環境就會發現幾個硬傷:跑一陣子就忘記之前學過什麼、複雜任務只有一個 agent 在做、結果好不好沒有客觀標準。Anthropic 這次的 Managed Agents 更新,剛好就是針對這三個痛點。

5 月 6 日 Code with Claude 開發者大會上,Anthropic 一次端出三項新功能:dreaming(背景複盤)、multi-agent orchestration(lead agent 拆任務給 sub-agent,最多 20 個並行)、outcomes(獨立 grader 用 rubric 評分)。三項都進 research preview。

Managed Agents 的設計假設不再是「使用者問一句、agent 答一句」,而是「使用者給一個跨小時、跨 session、跨工具的任務,agent 自己拆解、分工、執行、評估、改進」。

Capabilities

三項新功能

01 · Dreaming

背景複盤

排程的背景進程,會去翻過去 agent 的工作紀錄,提取重複出現的模式、整理進記憶庫。下次 agent 上工,就帶著這些累積的經驗。簡單講,就是讓 agent 在「閒置」時自己進化。

02 · Multi-agent

分身協作

Lead agent 接到複雜任務,可以拆成子任務,分派給最多 20 個 sub-agent 並行處理。每個 sub-agent 有自己的上下文視窗、各做各的,lead agent 再彙整。從一個人變成一個小組。

03 · Outcomes

Rubric 自評

你寫一份「成功標準」(rubric),一個獨立的 grader 在自己的上下文視窗裡,照著 rubric 評估 agent 的產出。Grader 看不到 agent 的推理過程,所以不會被它說服——只看結果是否達標。

Why it matters

把 agent 基礎設施搬上 LLM 廠商

過去要做出能跑長時程任務的 AI 代理人,開發者得自己處理一堆 orchestration 細節:sub-agent 怎麼分工、context 怎麼隔離、記憶怎麼持久化、產出怎麼評分。每個團隊都在重發明同一套輪子。

Managed Agents 這次更新等於 Anthropic 把這些常見模式內建進服務裡:你不用自己刻 sub-agent 協調邏輯,不用自己寫評分機制,不用自己排程記憶整理。剩下能差異化的,是任務本身的 domain knowledge 和 rubric 怎麼設計。

20
sub-agent 最大並行數
跨 session 持久記憶
2
grader 與 agent 上下文隔離
How to use

實際上會長怎樣

典型用法分三步:

設定
定義任務目標、可用工具、成功 rubric。Rubric 是一份描述「什麼叫做完成」的清單——可以是質性條件,也可以是量化指標。
執行
Lead agent 接到任務,自己拆解、調度 sub-agent、處理錯誤恢復、跨 session 接力。執行期間可能用到外部工具或 API。
評估與複盤
獨立 grader 用 rubric 打分。Dreaming 進程在背景把這次任務的模式整理進記憶,下次同類任務就更有效率。

適用情境是 Anthropic 直接指出的三類:coding、finance、legal——共同特徵是工作流長、需要多步驟推理、產出有明確品質標準。

Context

AI agent 競賽的下一回合

2026 上半年 LLM 廠商的競爭主軸明顯從「誰的模型最聰明」轉向「誰的 agent 最能做事」。OpenAI 4 月推出 GPT-5.5 主打 agentic,Google 4 月在 Cloudflare 平台上線 Agent 系列,Anthropic 這次 Managed Agents 三件式是同一場戰役的另一個動作。

差別在切入角度:OpenAI 把 agent 能力嵌進模型本身,Anthropic 則把 orchestration、評分、記憶整理這些「平台級」工作打包成服務。對開發者來說,這代表選擇變多——可以用更聰明的模型自己刻 agent 框架,也可以用 Managed Agents 直接借框架。

Research preview 階段沒有公開定價、沒有 GA 時間表。Anthropic 過去 preview 到 GA 通常是幾個月內,可以持續追蹤。