DIGITIMES

AI Agent能力版圖到哪裡了?未來呢?

徐宏民
2026-07-30
AI語音摘要
00:44

Token單價下滑、總消耗量大增,專欄2026年3月分析過,趨勢至今有增無減。新一代前瞻模型朝AI代理(AI Agent)的使用型態設計:這幾個月各家前瞻實驗室競爭加劇,接連發布的新模型能規劃任務、分派工作、運用各種技能與工具、直接操作電腦介面,定價卻更低。AI代理正被快速導入各種知識工作。

那麼,AI代理真的能承接知識工作嗎?能承接多少?尚未承接的部分,是還沒有人投入,還是技術未到?7月初參加在加州聖地牙哥舉辦的計算語言學年會ACL 2026,一場「AI代理人與工作的未來」專題講座(tutorial)把技術現況以及這些問題拆開來看。浮現一張讓人驚訝的能力版圖:AI代理已經站穩的區域,小得出乎意料;版圖之外,一部分是還沒有人投入的空白,另一部分是技術還待克服的難題。

先看站穩的區域。前瞻模型業者OpenAI在2025年推出代理人基準測驗(benchmark)GDPval,從GDP貢獻最大的44種職業中,設計出1,300多項「規格明確」的真實任務(如簡報、財務模型、工程圖說),來測試代理人執行能力,並請同行專家盲評AI與人類的成品。依業者2026年4月發布的最新結果,最強模型的成品已有逾8成被評為不輸人類專家;這套基準2025年9月推出時,這比例還不到5成,再前一代模型也只達到1成出頭。依業者推出這套基準時的估算,完成速度與成本約為人類專家的百分之一。單看這些數字,AI代理似乎已經可以上工。

但這片區域在整個勞動版圖上有多大?ACL會議中主講的CMU團隊把目前43個AI代理基準測驗(學術、產業時常使用的Agent評測任務)共72,342個任務,對應到美國1,016種職業的技能分類(參考美國O*NET職業資訊資料庫)。基準測驗的分布,可當作目前AI代理研發重心地圖:考題集中的地方,訓練資料與研究人力也跟著集中。結果顯示,任務多數落在「取得資訊」與「操作電腦」2項技能,在整體就業所需技能中的權重合計不到5%;投入最深的程式與數學領域,只對應7.6%的就業人口。原因不難理解:這些工作結構化程度高、輸入輸出明確、成功與否可以驗證。

本專欄先前提過,自動化總是先從結構化的場域開始,研發投入也一樣。

版圖之外的第一種空白,是還沒有人投入的高價值區。同一份報告指出,管理、法務、建築工程的工作已高度數位化(約88%、70%、71%),基準測驗的覆蓋卻只有1.4%、0.3%、0.7%,而管理正是以薪資加權後經濟價值集中的領域。這些工作中不少環節有明確的輸入輸出,未必是技術做不到,更可能是還沒有人投入;論文稱之為「錯失的機會」。一旦投入到位,對企業來說,這裡可能是生產力改善較早出現的地方。

第二種空白,是技術還待突破的複雜工作。資料標註平台業者與AI安全研究機構合作的「遠距勞動指數(Remote Labor Index)」,從接案平台選取真實付費委託(3D建模、建築圖說、影音製作、資料分析等,專業者完成一件的中位時間約11.5小時),讓前瞻AI代理端到端執行,再由人類評審對照專業接案者的成品盲評,以此模擬企業交付員工的工作指令。指數2025年10月發布時,最佳模型只有2.5%的專案達到可驗收水準。真實委託的需求模糊、規格多步驟、常要求修改既有成品,這些都還沒被結構化。

長時序的複雜任務是另一道關卡。前述CMU團隊的報告同時量測AI代理自主性:即使在表現最好的軟體領域,任務複雜度一提高,成功率就明顯下滑;其他測驗加入工具中途出錯、給定資訊不完整、需要多人協作等情境後(模擬真實複雜場域),表現同樣走低。

值得注意的是這張版圖移動的速度。2026年7月,研究機構以最新一代模型、搭配更完整的代理人執行環境重測遠距勞動指數:最佳模型的成功率已從2.5%升到15.8%,前後不到1年;同一份更新也指出,絕大多數專案的成品仍達不到專業驗收水準。兩個現象並行:能做的還很少,推進的速度很快。GDPval從1成出頭到逾8成不輸專家,說的是同一件事:AI代理目前的能力版圖比想像中小,但持續擴張中。這類成長難免包含針對測驗最佳化的成分;但這兩套測驗過的是人類專家對真實成品的驗收,能拉高分數的改進,多半也是AI代理真實能力的提升。

目前技術擴張的方向也有跡可循。研發正把做不到的難題當成訓練目標:新一代測驗把出錯、協作、真實委託等情境逐步納入題目,最新的訓練方法把專家驗收的標準(rubric)轉成訓練訊號;今天做不到的清單,很可能就是下一輪訓練資料與運算投入瞄準的地方。還沒有人投入的高價值空白,很可能也將循同一條路逐步被填補。

回到開頭的需求端。目前代理人技能只在結構化的一小塊版圖上站穩,如今的用量成長與供應鏈投資,大致就發生在這一小塊之上(但已相當可觀)。版圖之外的大量工作,仍由人補位:釐清模糊的需求、拆解執行步驟、修正最後的產出;而這些補位動作,專欄近期談過,正是企業在教模型。

目前AI代理能完成的工作比想像中少,但是需求已經這麼大,而技術能力版圖還在往外擴。接下來市場的成長與組織的變動,可能又會超乎我們的想像。

國立台灣大學資訊工程學系教授,曾任鴻海集團與Stellantis合資車用科技公司技術長暨副總經理,推動ADAS及智慧座艙系統產品進入全球車用市場。紐約哥倫比亞大學電機博士,專精於機器學習、電腦視覺、自駕車、機器人等領域。為訊連科技研發團隊創始成員,慧景科技(thingnario)共同創辦人,NVIDIA AI Lab計畫主持人;曾任IBM華生研究中心及美國微軟研究院客座研究員。擔任多家科技公司AI策略顧問,習慣從學術與產業雙重視角檢驗技術發展的機會與挑戰。
智慧應用 影音