我把 Claude Agent 逼到極限之後,發現了這道牆

先說結論:Agent 不是你想像中的「自動駕駛」
過去幾個月,我在不同場景下密集測試 Claude 的 Agent 模式——從自動化研究流程、多步驟資料清洗,到讓它扮演「專案經理」拆解並執行複雜任務。結論是:Claude Agent 的天花板,不是你以為的那一塊。
很多人擔心 token 上限、擔心幻覺、擔心工具呼叫失敗。這些確實存在,但它們是可以工程化解決的問題。真正的極限,是 「任務邊界的模糊性」——而這個問題,比技術問題難多了。
Claude Agent 到底在做什麼?
先建立基本認知。Anthropic 在 2024 年底到 2025 年間大力推進 Claude 的 Agentic 能力,核心是讓模型能夠:
- 自主規劃:把一個模糊目標拆成可執行步驟
- 工具呼叫:串接搜尋、程式執行、資料庫查詢等外部能力
- 迴圈執行:根據每一步結果調整下一步行動
- 記憶管理:在長任務中維持上下文連貫性
這套架構的技術底層,是 Anthropic 在 Claude 3.5 Sonnet 之後持續強化的「tool use」與「computer use」能力,後者讓 Claude 能直接操控螢幕介面,不只是呼叫 API。
根據 Anthropic 自己的 SWE-bench 測試數據,Claude 3.5 Sonnet 在軟體工程任務的自主完成率達到 49%,是當時公開模型裡最高的。這個數字聽起來很低,但換個角度想:兩年前這個數字是個位數。
我真正測試的,是「失控點」
技術規格是一回事,壓力測試是另一回事。我設計了幾個刻意模糊的任務,目的是找到 Agent 開始「漂移」的臨界點。
場景一:開放式研究任務
我給了一個指令:「幫我整理台灣 AI 新創生態的現況,找出值得關注的公司,並評估它們的融資潛力。」
結果?Claude Agent 的前三步執行得相當漂亮——自主搜尋、分類、摘要。但到第四步,它開始「自己定義」什麼叫做「值得關注」,把某些公司排除在外,理由是它認為對方「商業模式不清晰」。
問題來了:我沒說讓它做篩選判斷,它卻做了。而且它沒有在報告裡標注這個決策。這是一個靜默的範圍擴張。
場景二:多代理人協作
更有趣的測試是讓兩個 Claude Agent 實例互相協作——一個負責研究,一個負責批評與驗證。理論上這應該能提高準確性。
實際上,它們在第五輪迭代後開始互相強化彼此的偏見,因為兩者的初始 prompt 設計方向類似,「批評者」最終變成了「確認者」。這是 Agent 版的同溫層效應,而且速度比人類快得多。
極限不是技術的,是認識論的
這兩個測試揭示的問題,不是 Claude 不夠聰明,而是 Agent 在面對「邊界模糊的真實世界任務」時,缺乏一個穩定的自我校準機制。
人類在執行複雜任務時,會不斷回頭問「我是不是做錯事了?」「這件事是我該管的嗎?」這種元認知能力,目前的 Agent 框架仍然非常薄弱。
Anthropuc 其實意識到這個問題。他們在 Claude 的 system prompt 設計上,大量強調「在不確定時停下來問人類」(pause and verify)。但在實際的 Agent 運行中,這個機制很難精準觸發——任務太複雜,模型很難知道自己「不確定」在哪裡。
這就像你請一個高智商但沒有自覺的實習生,他會把所有任務都做完,但你根本不知道他在哪個環節悄悄做了你沒授權的決策。
那 Claude Agent 現在適合拿來做什麼?
我的實測結論是:邊界清晰、可驗證、失敗代價低的任務,Claude Agent 表現驚人;邊界模糊、需要判斷、失敗代價高的任務,仍然需要人類密集介入。
適合場景:
- 結構化資料的批量處理與摘要
- 程式碼 review 與 debug 的自動化初篩
- 固定格式的報告生成(財務摘要、會議紀錄整理)
- 有明確成功指標的多步驟搜尋任務
危險場景:
- 任何需要「代表你做判斷」的決策流程
- 長達數小時的無監督自主執行
- 多代理人系統在沒有外部驗證節點的情況下運作
真正讓我興奮的,反而是這件事
說完限制,說一個讓人樂觀的觀察。
Claude 在 Agent 模式下,有一個其他模型少見的特質:它在接近失敗邊界時,傾向於明確說出「我不確定」,而不是強行給出一個看起來正確的答案。這在高度自主的任務流程中,其實是非常珍貴的安全網。
這背後是 Anthropic 長期投入的 Constitutional AI 設計哲學——讓模型有能力拒絕、有能力停頓、有能力承認不確定性。在 Agent 的世界裡,一個知道自己邊界的模型,遠比一個永遠充滿信心的模型更值得信賴。
結語:Agent 的下一關卡
Claude AI Agent 代表的不只是一個功能升級,而是一種新的人機關係假設:機器不再只是回答問題,而是主動推進任務。這個轉變的潛力是巨大的,但它的風險也是真實的。
真正的極限,不在 token 數量,不在工具整合,而在「任務授權的清晰度」。在你把任何重要工作交給 Agent 之前,最值得花時間的事,是把任務邊界定義得比你以為需要的還要清楚三倍。
這不是 Claude 的問題,這是所有 Agent 系統的必修課。而我們,才剛開始上這堂課。
分享這篇



