一次升級三件事
過去半年大家都在談 AI 代理人,但實際把代理人放到生產環境就會發現幾個硬傷:跑一陣子就忘記之前學過什麼、複雜任務只有一個 agent 在做、結果好不好沒有客觀標準。Anthropic 這次的 Managed Agents 更新,剛好就是針對這三個痛點。
5 月 6 日 Code with Claude 開發者大會上,Anthropic 一次端出三項新功能:dreaming(背景複盤)、multi-agent orchestration(lead agent 拆任務給 sub-agent,最多 20 個並行)、outcomes(獨立 grader 用 rubric 評分)。三項都進 research preview。
Managed Agents 的設計假設不再是「使用者問一句、agent 答一句」,而是「使用者給一個跨小時、跨 session、跨工具的任務,agent 自己拆解、分工、執行、評估、改進」。
三項新功能
背景複盤
排程的背景進程,會去翻過去 agent 的工作紀錄,提取重複出現的模式、整理進記憶庫。下次 agent 上工,就帶著這些累積的經驗。簡單講,就是讓 agent 在「閒置」時自己進化。
分身協作
Lead agent 接到複雜任務,可以拆成子任務,分派給最多 20 個 sub-agent 並行處理。每個 sub-agent 有自己的上下文視窗、各做各的,lead agent 再彙整。從一個人變成一個小組。
Rubric 自評
你寫一份「成功標準」(rubric),一個獨立的 grader 在自己的上下文視窗裡,照著 rubric 評估 agent 的產出。Grader 看不到 agent 的推理過程,所以不會被它說服——只看結果是否達標。
把 agent 基礎設施搬上 LLM 廠商
過去要做出能跑長時程任務的 AI 代理人,開發者得自己處理一堆 orchestration 細節:sub-agent 怎麼分工、context 怎麼隔離、記憶怎麼持久化、產出怎麼評分。每個團隊都在重發明同一套輪子。
Managed Agents 這次更新等於 Anthropic 把這些常見模式內建進服務裡:你不用自己刻 sub-agent 協調邏輯,不用自己寫評分機制,不用自己排程記憶整理。剩下能差異化的,是任務本身的 domain knowledge 和 rubric 怎麼設計。
實際上會長怎樣
典型用法分三步:
適用情境是 Anthropic 直接指出的三類:coding、finance、legal——共同特徵是工作流長、需要多步驟推理、產出有明確品質標準。
AI agent 競賽的下一回合
2026 上半年 LLM 廠商的競爭主軸明顯從「誰的模型最聰明」轉向「誰的 agent 最能做事」。OpenAI 4 月推出 GPT-5.5 主打 agentic,Google 4 月在 Cloudflare 平台上線 Agent 系列,Anthropic 這次 Managed Agents 三件式是同一場戰役的另一個動作。
差別在切入角度:OpenAI 把 agent 能力嵌進模型本身,Anthropic 則把 orchestration、評分、記憶整理這些「平台級」工作打包成服務。對開發者來說,這代表選擇變多——可以用更聰明的模型自己刻 agent 框架,也可以用 Managed Agents 直接借框架。
Research preview 階段沒有公開定價、沒有 GA 時間表。Anthropic 過去 preview 到 GA 通常是幾個月內,可以持續追蹤。