技術

AI自動編寫並發布程式碼,資深開發者效率卻降低19%

Susan Hill

像是 Devin、Claude Code 與 GitHub Copilot Workspace 這類軟體代理,如今能夠接收任務描述、讀取程式碼庫、撰寫對應程式碼、執行測試直到通過,然後自動開啟一個拉取請求(pull request)——全程無需開發者親手輸入任何一行指令。由 Cognition AI 打造的 Devin,是在獨立隔離的雲端環境中完成這一切。在其生產環境用戶群中,由它自主開啟的拉取請求有 67% 被成功合併。Claude Code 則能讀取整個儲存庫、跨多個檔案規劃修改、執行測試套件,並在每一步之間不須額外指示就持續迭代。這些工具目前已用於實際生產環境,而非停留在研究預覽階段。

它們與早期程式碼生成工具之間最大的差別,在於那個反饋迴圈。一個建議引擎只是生成文字然後停下來;而一個自主代理則會生成程式碼、執行它、讀取回傳結果,然後再試一次。底層的架構在各工具之間大致相同:一個大型語言模型讀取脈絡——程式碼庫、問題描述、錯誤日誌——生成一個計畫,再透過 shell 指令、檔案編輯與 git 操作等工具來執行,然後讀取結果並進行修正。這個迴圈會持續進行,直到代理成功完成任務,或是耗盡其資源配額。

取代編輯器的迴圈

目前市面上各工具提供的自主程度橫跨三個層級。在輔助端,GitHub Copilot 會在開發者打字時建議接下來幾行程式碼。再往上一個層級,像是 Cursor 這類跨檔案編輯器,能依照開發者的指示在整個程式碼庫中進行改寫,執行開發者指定的修改。而在自主端,Devin 與同類系統則能在長時間內獨立運作,自主決定要讀取什麼、修改什麼、測試什麼,只有在遇到系統無法獨自處理的核准事項時,才會回報給人類。

衡量這些工具進展的評估框架是 SWe-bench,由普林斯頓大學與史丹佛大學的研究人員共同建立。它會讓代理處理來自開源 Python 專案——例如 Django、Flask、scikit-learn——的實際錯誤回報,並測量代理能正確關閉多少百分比的問題。目前經過篩選的 Verified 子集上最高公開分數是 96%,由 Claude Opus 5 拿下。這個數字代表的確是真正的能力:能夠診斷真實的軟體錯誤、撰寫修復程式碼,並驗證它能通過專案本身的測試。

基準測試沒說的事

那個 96% 的分數帶有一個重要的但書。SWE-bench Verified 是從 500 個精心挑選的任務中篩選出來的。當研究人員改用一個具備抗污染變體的版本——SWE-bench Pro,其設計採用不可能出現在任何模型訓練資料中的問題——某個在 Verified 上得分超過 80% 的舊模型,在 Pro 上的分數就掉到了 50% 以下。部分基準測試的表現,反映的是模型對評測集的熟悉度,而非通用的問題解決能力。這個落差是眾所周知的研究挑戰,並非針對任何特定工具的批評。

另一項研究則發現了更難以解釋的結果。AI 安全研究組織 METR 進行了一項隨機對照試驗,對象是正在維護自己儲存庫的資深開源開發者。結果顯示,使用當前 AI 程式碼工具的開發者,比沒有使用這些工具的人慢 19%——儘管他們自己估計快了 20%。具體原因包括:當代理產生錯誤結果時,花費時間重新下指令;在合併前花時間驗證輸出;以及在「指揮代理」與「追蹤代理做了什麼」之間切換時產生的認知負擔。基準測試衡量的是代理能否在隔離環境中關閉一個明確定義的錯誤;隨機對照試驗則衡量的是開發者在實際一天當中工作得更快與否。兩者測量的是不同的東西。

為何 93% 的採用率只帶來 10% 的吞吐量提升

程式碼自主化在最狹義且明確的任務上表現最佳:一個輸入輸出清楚、可重現的錯誤;一個有精確規格的函式;一個針對行為已定義模組的測試套件。當範圍擴大到需要隱含的架構知識、未記錄的團隊慣例,或是涉及產品方向判斷的任務時,可靠性就會下降——不是因為模型缺乏能力,而是因為這些決策所需的脈絡無法容納在系統中,也無法單從程式碼庫中的檔案推導出來。

實務上的轉變在於工作本身的要求。與自主代理協作的開發者,會花更多時間撰寫精確到足以讓代理執行的規格:詳細的議題描述、清楚的測試合約、明確的驗收標準。他們也會花更多時間審查自己並未撰寫的程式碼,這需要與寫程式不同的注意力——要找出邏輯錯誤、安全漏洞,以及代理自己不會標示出的架構偏移。一份 2026 年針對 12.1 萬名開發者的調查發現,93% 的人經常使用 AI 程式碼工具;而在同一群體中,拉取請求的吞吐量大約只提升了 10%。瓶頸從撰寫程式碼,轉移到了審查程式碼。

目前正在積極開發的下一個階段,是能自行管理工作佇列的代理:接收專案規格、拆解成子任務、在專門模型之間進行委派,並僅將需要人類判斷的決策回報上來。多個開源的多代理程式碼協作框架已在 2026 年問世。但在生產環境中的企業採用仍然有限。Gartner 預測,今年啟動的代理型軟體專案,有相當大的比例將在 2028 年之前被中止——一旦團隊發現受控示範與可靠大規模部署之間的差距有多大。

標籤: , , , ,

討論

共有 0 則留言。