DIGITIMES
徐宏民
國立台灣大學資訊工程學系教授
國立台灣大學資訊工程學系教授,曾任鴻海集團與Stellantis合資車用科技公司技術長暨副總經理,推動ADAS及智慧座艙系統產品進入全球車用市場。紐約哥倫比亞大學電機博士,專精於機器學習、電腦視覺、自駕車、機器人等領域。為訊連科技研發團隊創始成員,慧景科技(thingnario)共同創辦人,NVIDIA AI Lab計畫主持人;曾任IBM華生研究中心及美國微軟研究院客座研究員。擔任多家科技公司AI策略顧問,習慣從學術與產業雙重視角檢驗技術發展的機會與挑戰。
Physical AI還缺什麼?機器人都會跳舞、跑酷、接棍子了
9月底在美國匹茲堡參加機器人頂尖會議IROS 2026。一家機器人新創的攤位上,雙臂機器人在玩「接棍子」(falling sticks)遊戲,幾根棍子懸在上方隨機落下,手臂要在半空中瞬間抓住。這類遊戲原本用來測試人的反應速度。這一年也看到不少機器人跳舞、跑酷(機器人障礙賽)、跑半馬的影片。這些表演代表什麼?機器人已經有完備的AI能力了嗎?先看跳舞。中國一家人形機器人大廠2025年在春節晚會讓機器人跳舞。這類表演常見的做法是「動作追蹤」(motion tracking),錄下人類動作、對應到機器人骨架,在模擬器裡用強化學習訓練一個照著做又不跌倒的策略,再直接用到實體機器人上。硬體則靠高扭矩關節與3D光達定位。外媒報導指出,這是用真人舞者資料預先編排的表演。跑酷多了一層判斷。2026年初,柏克萊加州大學、史丹佛大學、卡內基美隆大學等研究團隊,把多個跑酷技能蒸餾成一個以深度影像驅動的策略。機器人只靠深度相機與移動方向、速度的指令,自己決定障礙物要跨過、爬上還是撐越。但往哪裡去?為什麼去?仍由人決定。把這三個例子放進機器人的控制架構來看。控制大致分成5層,往上愈慢、愈抽象,往下愈快、愈貼近實體動作。最上層由大型語言模型理解指令、拆解步驟,大約每秒1次或更少。往下是視覺語言動作模型(VLA),決定手要抓哪裡、怎麼移。再往下是負責移動與平衡的運動策略、協調手臂與腿部的全身控制,最底層的馬達電流控制大約每秒上萬次。借用心理學家康納曼(Daniel Kahneman)《快思慢想》的說法,上兩層像需要專注推理的「系統二」,下三層像快速、直覺的「系統一」。跳舞、跑酷、接棍子,都落在系統一。這幾層的分工目前還在調整。一家美國人形機器人新創把全身控制獨立出來,稱為「系統零」,用超過1,000小時的人類動作資料訓練成一個網路,業者表示取代10萬多行手寫程式。運動策略與全身控制兩層,看來正被學出來的控制器合併。為什麼停在系統一?因為這幾層的資料較易取得。「照著人類動作做、不要跌倒」幾乎適用每個動作,成敗幾秒就知道。剛體與地面的接觸也容易模擬,GPU上可以同時跑幾千台虛擬機器人,走路策略很快就能訓練出來。上層剛好相反,「摺好衣服」「幫我微波午餐」很難寫成獎勵,手指與物件的細微接觸,模擬也不準。所以這些表演多半是模擬器裡用強化學習練出來的,機器人身上還缺一個有深度思考、推理能力的「大腦」。這些表演證明的,是平衡、移動與全身動作已經成熟許多。北京的人形機器人半程馬拉松賽,2025年首屆多數隊伍跑不完,2026年已有隊伍50分鐘出頭完賽。資金也跟著進來,依市場研究機構統計,2025年全球實體AI(Physical AI)新創募資近400億美元,2026年上半已超過470億美元(統計範圍也包含自駕車、無人機等)。缺的部分,從系統二到場域部署,我的觀察有6項:第一是長時序任務。公開展示的自主任務,大多只有幾分鐘、數十個連續動作,離工廠一個班次的8小時還很遠,過程中也要能推理、確認自己有沒有做完。第二是泛化,關鍵在資料。上層要的做完工作的資料,目前多半得在真實世界累積,遙控操作因此從機器人做不到時的補位,也成收集資料的方法。也有團隊讓模型從實際執行與人工修正中學習。第三、第四是硬體與接觸。便宜的是身體,手、觸覺、電池與耐用度還沒跟上。2026年7月一家美國科技大廠發表的模型,讓人形機器人蹲下從地上撿東西,成功率還不到5成。第五是安全。固定的機械手臂斷電後停在原地,需要主動維持平衡的機器人則可能倒下,針對這類機器人的國際安全標準,目前仍在草案階段。第六是部署。依國際機器人聯合會(IFR)統計,2025年全球工業與專業用途的人形機器人約7,000台,不少是買來產生訓練資料,實際在場域使用的極少,流程怎麼改、投資報酬怎麼算,都還在摸索。這幾年控制與硬體的能力、韌性持續進步。硬體價格往下、系統二的能力往上,兩條線交會之後,機器人投入場域才看得到投資報酬。如果場域部署的能力也跟著補上,未來幾年Physical AI agent對產業的影響,可能又會超乎我們的想像。
2026-10-06
AI評測,一直是門好生意
新模型每隔幾週就有一批,哪一個比較好,很多時候看的是排行榜。排行榜背後的評測,表面上是訂規則、跑資料、比分數的學術活動。但拉長時間看,辦一場公開評測,或是在裡面拿到好名次,一直是門好生意,只是每個年代收錢的人不太一樣。我在2002到2007年於哥倫比亞大學攻讀博士,研究主題是影像與視訊搜尋,親身參與多年美國國家標準暨技術研究院(NIST)主辦的TRECVID年度評測。每年,全球數十個研究團隊各自送出系統,針對同一批影片、同一套題目測試,排名公開。這項評測的贊助單位包括美國國安體系的研究機構,在當時的研究圈裡,排名也會直接影響團隊後續爭取研究經費,美國的頂尖研究團隊都很認真看待每一次評測。2006年,Netflix把自家的推薦演算法問題公開懸賞,只要有人能把預測誤差比現有系統降低10%,就拿走100萬美元獎金。一家公司把核心演算法問題公開交給外界解決,在當時相當少見。公司不必先知道誰解得出來,只要把問題和驗收標準定清楚,達標才付錢。2009年,獎金由一支跨團隊組成的隊伍拿下。在Netflix之後,愈來愈多公司把競賽當成向外找解法的管道。2010年成立、2017年被Google收購的Kaggle,把這套模式做成一個平台。任何公司都能把資料放上去、定好評分方式、提供獎金,換取全球資料科學家幫忙解題。獎金之外,排名本身也成了參賽者的履歷,有些公司會直接從排行榜上找人。2010年開始舉辦的ImageNet影像分類競賽,則提供一個研究團隊普遍認可的公開基準。2012年底,一支使用卷積神經網路(CNN)的隊伍把錯誤率大幅拉低,這個結果後來常被視為深度學習時代的起點。但在當時,不少資深的電腦視覺學者並不認同,甚至抱持懷疑的態度。直到接下來兩年,一系列CNN方法在ImageNet上連續大幅躍進,他們才陸續接受並投入。ImageNet讓影像辨識的「進步」第一次有了公開、可驗證、逐年比較的衡量方式,資料也開放給全世界的研究社群,不必參賽就能使用。說服學界的,是這些每年公開、任何人都能驗證的結果。後來的AI評測排行榜,大多沿用這個形式。2013年10月,微軟研究院與自家的搜尋引擎Bing聯合辦了一場影像搜尋的公開競賽,獎金1萬美元。我的一組學生就為了這1萬美元報名參加,最後真的拿到全球第一名。那年5月,我們原本用的是傳統的電腦視覺特徵,測試時偶然換上CNN擷取的特徵,準確率大幅躍升。當時CNN剛在ImageNet嶄露頭角,還沒普及到各個電腦視覺題目,我們算是提早一步,在自己的研究上驗證這個轉折點。當下,我們決定把研究典範轉到CNN,並把各種經費拿去買GPU,也引起NVIDIA注意,促成2016年9月開始和NVIDIA合作成立NVIDIA AI Lab。近年台灣也有不少企業與政府單位舉辦AI競賽。比賽一多,頂尖團隊會挑著參加。如果要辦,獎金額度,以及主辦單位的影響力,往往是能否吸引到好團隊的決定點。2023年,柏克萊大學一組研究生與教授推出Chatbot Arena網站,讓使用者同時對兩個匿名大語言模型提問,投票選出比較好的回答,再用這些真人偏好算出模型排名。2025年4月,這個研究轉為新創LMArena,不到1年估值就來到十幾億美元,在新創圈相當受矚目。前面幾個例子,付錢的都是出題的一方。LMArena收錢的對象,反過來是被排名的一方。各家AI實驗室付費取得私有、不公開的測試環境,或是付費使用LMArena的評測工具與資料產品,來驗證自家還沒發表的模型。測試平台成了關鍵資料的供應商。METR的做法不同。這個2023年底獨立的非營利組織,專門替各家前沿模型做部署前的安全評測。METR主要看的是「任務時長」,也就是AI代理人能以特定成功率,獨立完成多長時間的人類專家任務,如今是業界衡量AI能力進步的常用指標之一。METR表示不接受被評測實驗室的捐款,資金主要來自慈善基金會與個人,2026年8月公布過去半年募得逾7,000萬美元的資金承諾。被評測的實驗室仍會提供免費的運算額度,供METR評測使用。從TRECVID到METR,評測的形式換了好幾次,排名一直影響經費與人才的流向。如今LMArena與METR的評測結果,還會影響模型往哪個方向改進、外界如何評價一個模型,甚至企業的商業決策。被評分的前沿模型公司願意付錢或提供運算額度,換取一個外界相信的分數。影響力愈大,評測單位的公信力就愈重要,也愈被放大檢視。當AI進步的速度超過我們判斷好壞的速度,掌握「分數是怎麼被決定的」,可能就跟做出被評分的模型一樣有價值。
2026-10-02
SLAM不只為Physical AI提供地圖,也建構空間記憶
上一篇談到,傳統SLAM將地圖交給路徑規劃,任務就差不多完成。對自主機器人來說,地圖建好之後,新的應用(與挑戰)才開始,包括搜尋、導航到指定的位置、記住看過什麼,以及留給模型(複雜情境)推理時讀取。實體AI(Physical AI)的記憶,和大型語言模型的記憶(memory)很不一樣,它往往得和3D位置綁在一起,而且可能因環境變化而過期。先看導航與搜尋。指令開始換成自然語言,例如「把二樓會議室的空紙箱收到回收區」,自主機器人得自己把任務標的對應到地圖上的位置。這類問題研究上稱為grounding,也就是把語言中的描述,對應到空間裡的物件或位置。做法是把視覺語言模型的特徵結合到地圖上,機器人不必事先學會識別那個箱子(現在的視覺語言模型多半具備zero-shot的辨識能力),也能找出「靠窗那排料架上白色的箱子」。3D幾何地圖還是基礎,只是現在加上豐富可操作的「語意」。地圖也開始被當成記憶來用。半導體廠使用四足機器人沿固定路線讀取儀表、記錄管線與機台外觀。這些製造業用戶希望機器人在巡檢時隨時比對,看出環境有沒有差異。地圖因此要夠密、位置要夠準,機器人也得記得上一次看過什麼。問題是,這些記憶需要隨時被更新。工廠、倉儲、賣場的環境常在變動,料架被移動、走道被暫時堆放、產線改造。所以不能只靠定期重建一次地圖,機器人得邊執行任務邊更新。更新也不必一台包辦。上一篇談的車隊協同,搬到室內同樣適用,幾台機器人一起建圖,也一起更新「空間」記憶。只是規模不同,路上每天有大量車輛經過同一段路,廠區裡往往只有少數幾台機器人,每一次觀測都重要。協作時的座標一致性、更新頻寬、運算能力、以及觀測不一致時的調整等,各個技術環境都是一個全新挑戰。還有一層干擾來自現場走動的人員與移動機具。多數SLAM假設場景是靜止的,這些移動中的人與機具會被劃進地圖,既干擾定位,也留下抹不掉的殘影。常見的做法是額外加上語意分割模型把它們挑出來,代價是畫面處理時多花幾秒,耽誤即時性。我們最近的研究換了個方向,使用追蹤器算過的訊號判斷哪些畫素在動,善用時序以及既有的結構訊號,降低繁重的深度學習運算,成本可以降低幾十倍,使用單一鏡頭攝影機,在單張消費級顯示卡上每秒可以超過20幀。前面談的都是怎麼把環境記下來。再往前一步,地圖甚至開始直接進到模型的推理裡。模型讀取的脈絡(context)也不再只有文字token,開始出現帶有3D位置與視角資訊的空間token。2026年一項研究把單眼影片重建出的3D特徵與相機視角做成空間token,連同影像本身的視覺token一起餵給語言模型,顯示物件計數與路線規劃都跟著改善。這類做法目前多在室內場景驗證,搬到整座廠房、或是大範圍的場域還沒有定論。如果機器人進去場域前連地圖都沒有,任務進行的難度更高。例如,緊急進到災後或結構受損的建物,樓板與樓梯可能已經變形,機器人得一邊走一邊把3D的圖建起來,還要記得剛剛看過什麼,才知道哪裡還沒去過、哪條路可以通行,萬一受困又該從哪裡撤出。推理的結果決定下一步往哪走,下一段地圖(記憶)也跟著長出來。這還在很早的階段,真實災場的煙塵、照明與通訊條件,都比實驗環境更惡劣。這種按位置取記憶的需求,已經開始改變系統怎麼做快取。語言模型用鍵值快取(KV cache)把算過的留著避免重算,記憶體因此成為推論瓶頸之一。也有研究指出,模型連續推演影片畫面時,每一幀就要上千個token,1分鐘的推演累積到數十萬個,吞吐量大幅降低。一般做法是丟掉最舊的,但是在空間自主運作時,再回到同一個地方,先前看過的空間記憶就沒了。已經有做法把快取按相機位置分塊保存,回到同一個位置時再取回對應的那幾塊,不必重算。等於用位置而不是時間,決定什麼該留下。地圖要能導航,也要能當作空間記憶,讓模型拿去推理。SLAM這個老題目,因此有了新的角色。所以Physical AI需要的,可能不只是更長的脈絡或更多記憶體,而是一套知道哪裡該記、什麼時候該更新、哪些東西可以忘掉的記憶系統。
2026-09-24
AI揭密:token被拿去做什麼
要不要自己採購AI伺服器、哪些工作留在地端,都得先假設token會如何被使用。用量若集中在連續呼叫工具、跑幾十分鐘的代理(Agent)任務,記憶體壓力與機器被佔用的時間,都跟一問一答的聊天差很多。別人到底怎麼用,一般不會揭露。Anthropic在2026年9月公布一份威脅情報報告,整理2025年12月到2026年8月之間查獲的濫用行為,意外提供平常看不到的使用情境。我們得先理解,這不是一般使用行為的樣本。Anthropic挑出來的本來就是少見的異常案例。先拿掉身分、目的與誰在做這些事,剩下的是模型被當成什麼工具以及如何使用token。這些人沒有採購流程要走,也不受法遵限制。這批案例不是工業界常態,但很適合拿來看AI實際被用在哪裡。我們大概有幾個工作樣貌的觀察。第一類是整段工程交給模型,包括程式與模擬。有人從底層邏輯一路做到使用者介面,做出一套十幾個模組的訊號處理軟體,前後迭代十幾個版本;也有人把同一個模型同時開好幾份使用,各給一個角色,一個寫程式、一個查資料、第三個審查第一個寫出來的程式,像在帶一支小型工程團隊。這批人還拿模型調校控制演算法,把模擬結果對照既有的參考實作校正,為的是少做幾次實體測試。最後那套模擬工具被打包成獨立執行檔,不靠模型也不靠商用工程軟體就能自己執行。第二類是反覆操作工具,直到任務完成。模型先讀資料、形成假設,呼叫外部工具,拿到結果再判斷下一步,改完繼續跑。報告裡有一條韌體分析流程,把二進位檔丟進反組譯器(Disassembler),連續執行數千次反組譯與交叉參照,模型據此寫出驗證程式,測不過就再來一次。這樣的迴路,代理人連續跑了一個月,找出十幾個可能的漏洞。第三類是常駐與排程。有十幾個代理人編成一組,照排程輪班,固定去公開網站抓內容,再交給下一段摘要、評分,做成報告送進發布平台。也有人跑「代理人群」,由一個主代理人把工作拆開,分派給多個子代理人平行處理。這類系統會把目標清單、進度、每一輪的結果與長期指令一起存著,下一次開工不是從頭來過,是接上次停的地方,資訊搜尋範圍還會一輪一輪擴大。這些流程在無人監管的情況持續運轉。第四類是把大量非結構化資料整理成可查詢的紀錄。有人把10台雲端主機串成一條生產線,下載大量的Android應用程式,逐一反編譯,掃描裡面寫死的金鑰與憑證。有人整批上傳社群貼文,讓模型產出帶信心分數的結構化紀錄;也有人用模型做出一套分析層,跨平台核實、探查使用者身分。第五類是模型被拿去調教另一個模型。有人用前沿模型開發自己的訓練基礎建設,包括強化學習環境與模型架構研究。有人做蒸餾,為了找出哪一種問法能問出模型的推理過程,一次送出上萬個詢問,每個換一種技巧。另一起蒸餾單日一度接近數百萬次交換,報告說蒐集到的推理過程可以轉換成微調資料,用來訓練模型。用量最大的客戶未必是人或軟體,也可能是另一套正在學習的模型。報告另外依自主程度分了幾級。最低的一級是對話式的助手,模型幫忙寫程式、做工具。中間是模型直接執行,但每一個目標由人決定。最高的一級是多代理人架構連續跑上幾小時甚至幾天,同時處理好幾個對象,人幾乎不介入。人還深入參與的,報告舉了3項決策:挑目標、決定成果怎麼用、驗收結果。交給模型的是耗費token的一整段任務,從前期探索、寫工具到跑資料。過去相當耗費人力,只有資源多的團隊可以負荷,現在token降低門檻。把這些用法放在一起看,AI工作負載開始出現幾個共同特徵:任務變長、工具呼叫變多,有些還要跨天接續上一次的進度。下指令的是人,真正把token用掉的,愈來愈多是後面的代理人與工具鏈。這些用法之所以被看見,是因為運算都發生在同一家公司的伺服器上。報告裡還有業者把使用者以為送進自家模型的請求,轉送給另一家公司的前沿模型,再把回應當成自家答案顯示,同時把這些對話留下來訓練自己的模型。那些被保存的對話含有姓名、電子郵件與公司內部資料,涉及數百名終端使用者。使用者應該從頭到尾不知情,也未曾同意過。所以運算放在哪裡,愈來愈不只是成本問題。主權AI、自建推論、開放權重模型這幾年被重新放上議程,理由多半算在成本、延遲與法遵上,現在要再加一項——使用行為本身也可能外流。token在哪裡被耗掉,使用行為就在哪裡留下痕跡。
2026-09-18
什麼是SLAM? Physical AI的第一步,是知道自己在哪裡
上一篇談到自動化與自主性的差別,自動化把不確定性從環境裡移除,自主性需要系統在複雜環境中運作,兩者最大的差異,是自主機器人得走進沒有事先整理過的環境中完成工作,機器得知道自己在哪裡、周圍環境狀況,還要在執行任務的同時,安全、有效率地在場域中行動。背後的關鍵技術,是SLAM(Simultaneous Localization and Mapping),機器要一邊定位,一邊把環境畫成地圖。自駕產業是最早把高精地圖變成關鍵元件的產業之一。許多無人計程車進入一個新城市時,第一件事仍是先完成街道測繪,建立地區(高精)地圖後才開始營運。地圖要多精細是一個成本問題。車輛定位,可以只保留道路曲率、車道線、路標、號誌或路緣等少數穩定特徵,讓車輛拿眼前看到的特徵與地圖對位;也可以更細緻地把車道線、路緣、號誌、與街景都定位到公分級。愈精細,定位愈準,維護成本也愈高。量產車開發實務中,圖的更新頻率是關鍵,而施工、標線重畫、號誌調整甚至車禍隨時在發生,地圖一舊反而會引發自駕導航風險。另外是誰來更新。早期地圖靠專用測繪車(配備昂貴定位設備),一條路一條路測繪,巷弄密集更費時,更新頻率決定新鮮度,成本與涵蓋範圍、頻率成正比。後來導入分散式(crowd-sourcing)的做法,讓已經在路上跑的量產車順手做,行駛中回傳道路特徵,每台車每公里約幾KB,1年約幾百MB,後端把眾多車輛的訊息融合拼出道路結構。車愈多掃過,地圖品質愈好。那機器人呢?如何定位,如何動態建圖,還有哪些全新應用?問題是,要定位,得先有圖;要畫圖,又得先知道自己在哪裡(而且室內不能用衛星訊號定位)。兩件事互相依賴,像是雞生蛋、蛋生雞。SLAM針對這個問題,同時估算兩者,邊走邊修,這個概念1980年代後期提出,1990年代中期定名,到現在40年。機器先從連續的畫面或點雲估算自己移動了多少,這一步的誤差會累積,走得愈遠偏得愈多。所以還要能認出「我回到剛才來過的地方」,一旦認出來,累積的偏差就能一次修正,再把沿路所有位置和觀測一起重新最佳化,讓前面累積的誤差重新分配;在視覺SLAM裡,常見的做法就是bundle adjustment。重新開機或搬移之後,機器還得在既有地圖裡重新定位。這幾件事分別叫做里程計(odometry)、迴路閉合(loop closure)與重定位(relocalization),要長時間、大範圍運作,通常得三者一起解決。要多準,感測器的訊號也扮演關鍵角色。光達直接量到距離,幾何結構最明確,定位通常也較容易;相機便宜且資訊豐富,但深度需要額外估計。深度相機每個畫素都有距離,有效範圍卻多半在幾公尺內,室外也容易受光線干擾。實際的系統幾乎都是混用,再補上輪速。高度是另一個長期被忽略的問題。早期室內SLAM常見的做法,是把環境簡化成一張二維地圖,只記錄同一個平面上有沒有障礙物,當成整個空間能不能走的依據,對輪式機器人夠用,因為它只在同一個樓層的地面上移動。當機器人的移動自由度開展,上坡、跨門檻、爬樓梯、完成抓取任務之後,這個假設就不管用了,能不能踩、碰撞,都得從立體結構判斷。地圖因此得從二維變成3D,感測器與運算也跟著加重,避障也得算進高度,畢竟真實環境不是乾淨、規整的,桌面上有杯子,地上散落著鞋子。更大的變化是地圖的表示方式正在改變。傳統SLAM多半記錄稀疏特徵或幾何結構,神經輻射場(NeRF)與3D Gaussian Splatting(3DGS)等新的場景表示方法,則讓機器開始保存更完整的3D外觀與空間資訊;與SLAM結合後,一般相機也能在移動過程中逐步建立細緻的3D場景。我們在2023年就用單眼相機做過這件事,而且不必為每個場景預先訓練。新一代SLAM紀錄下的,不再只是2D照片或沒有空間結構的視訊,而是數位化的3D環境。密集的3D圖有很多非常有潛力的運用,特別是加上推理能力,但這些運算多半得放在機器人身上完成,邊緣端的算力與儲存還是限制,例如工地或產線的進度比對、資產盤點與異常偵測、生成訓練資料,或是產生數位分身。因此,Physical AI時代重新看SLAM,重點已經不只是「怎麼把圖畫準」,而是「怎麼把真實世界變成AI可以持續讀取、更新與推理的空間記憶」,這是下一篇要談的重點。圖建好了,然後呢?傳統SLAM的任務到這裡差不多就完成,地圖交給路徑規劃,機器人照著走。對Physical AI來說,這才是開始。導航、記憶,以及推理等各種自主效能力,都要從這張圖長出來。
2026-09-09
Autonomy vs. Automation:自主機器人與自動化
8月中參觀台北國際自動化展。2026年參展活絡,規模比2025年成長7%。走一圈下來,實體AI(Physical AI)、視覺語言動作模型(VLA)等字樣充滿會場,連展台上的介紹都講得一口流利的VLA。但是展示機器人仍在柵欄內以固定節拍重複同一個動作,引導對位的是貼在料架上的定位標籤,組裝線材前先用治具固定線端。展場的用詞走在產品能力前,不難想像。但是眼前這些展示還在「自動化」(automation)範疇,離「自主性」(autonomy)還有多遠?自動化的做法,是把不確定性從環境中移除。治具固定物件的位置,圍籬隔開人的動線,逐點教導與離線程式編輯給定動作順序,安全光柵與急停則用來降低異常狀況下的風險。機器人因此能正確地重複工業動作。自主性的方向剛好相反。環境不動,改用系統本身去承受不確定性。剩下的意外,由備援人員介入。無人計程車(Robotaxi)算是自主性的先驅。Waymo在2026年2月揭露,約3,000輛車的車隊,線上有數十位遠端協助人員。車輛遇到狀況,人員才介入。這不是盯著特定車輛,也不是遠端代駕,但介入從常態變成例外處理,這一步花了十多年。數位世界的自動化是RPA(流程自動化軟體)。規則先訂好,適合重複而固定的工作,沒定義的狀況就停下來。AI代理(AI Agent)則處理需要判斷與例外的任務,自行拆解工作流程,在回饋機制下重新規劃、重試或修正,那是數位版的自主性。這主要受惠於近來大型語言模型的技術突破,但是能在非結構化環境中通用操作的實體自主性,仍有相當距離。既然自動化做得好,為什麼還要往自主性走?因為這可能是一次「典範轉移」,不只機器人變聰明靈活,而且成本結構、競爭態勢也可能改變。自動化的支出裡,為單一場域做的工程往往佔比高,每多一條產線就得多做一次。自主性把比重往系統本身移,前期重得多,包括導入與整合成本,但只要有一部分能跨場域重用,就有機會隨規模攤掉。在少數場域,這樣的轉變已經開始浮現。送餐、倉儲搬運與商用清潔的任務與環境高度相似,導入時的建圖與流程設定免不了,規模通常遠小於改造一條產線。同一款機器可以複製到下一家,按月訂閱的方案也跟著出現,收費方式和SaaS類似。這幾類還談不上完全自主,雖然會自己避開走動的客人、重新規劃路線,但讓規模化成立的主要是任務相似。若跨場域重用的比重提高,以單一場域客製工程為主的價值可能被壓縮。值錢的部分也可能往兩端移動,一端是致動器、傳動與力感測,另一端是模型、資料與垂直應用的調校。自主性可以發揮的,比較可能是場域改造特別貴的地方。長期照護、醫院物流、大型設施巡檢、災害現場,這些環境難以預先結構化,過去多半停在展示階段。其中一些需求不是不存在,而是很難在傳統自動化的成本結構下成立。自主機器人,還需要哪些技術突破?推論與長時序常被提到,專欄先前談過。比較少被放在一起看的是接觸、新硬體與評估。接觸這一項的說法相當反主流。有研究團隊在2026年提出,機器人操作之所以慢,是因為整套系統都為了「避開」接觸而設計。方向應該倒過來,「Make contacts friends, not enemies」。這不只是加裝力覺感測器,可能要連硬體形態、規劃重新考量。已經有團隊初步實現。雜亂的環境裡本來就不一定存在完全不碰的路徑,於是讓VLA先判斷哪些東西可以碰、哪些碰不得,例如撥開布偶去拿遙控器可以,撞倒玻璃杯不行,再據此規劃動作。靈巧手與觸覺感測這些新硬體發展較遲。視覺在模擬裡已經可以做得很逼真,但一碰到東西就容易失準,形變、摩擦等物理特性較難掌握。電子皮膚與觸覺模組又是每一家一套規格,還沒收斂。評估這一項問的是另一件事,怎麼確認做對了,做錯了又怎麼改。Agent之所以成功,靠的很大一部分是評估驗證。失敗可以低成本記錄、重播與複製,數位工作執行幾千次也不會弄壞任何東西,錯誤看得見,也就修得動。實體世界沒辦法這樣。機器人失敗一次,壞的是真的東西,也可能傷到人,錯在哪不見得留得下來。近年多數研究各自訂一套評測流程、用自家的指標。能在真實場域中跨平台收集、又被廣泛採用的共同評測框架,仍然很少。既然實體失敗成本高,確認就得挪到動手之前。世界模型受到期待,原因之一就在這裡,先在模型裡把動作預演一遍,可行再執行。回到展場。目前多數展示還落在自動化,這套做法仍在創造產值。接觸、新硬體與評估不會同時被解決,「自主性」比較可能從某一個場域先突破。當某個場域被證實能以較少的客製工程規模化部署,生意的重心就有機會從逐案的客製與整合,轉向可跨場域複製的產品。
2026-09-02
我該買高階AI伺服器嗎?
最近一位在產業界的朋友跟我分享,這兩年LLM崛起,對他們的產品研發幫助很大,團隊還額外開發幾個全新的代理人(Agent)。但他算了token花費之後很驚訝,一年下來的金額,已經比買下一整櫃高階AI伺服器還多。即將導入的大規模應用還會把用量再往上推,他也擔心產業know-how送進外部模型。於是他們很認真地評估:是不是應該自己買(租)AI伺服器?這不是單一公司的處境。一家美國叫車平台業者原本鼓勵各團隊大量使用token開發,4個月後全年的AI預算就用完了。接下來就是設上限、個案申請,強制「配給」。配給不是因為變貴。同等能力的推論價格長期快速下滑,帳單卻愈來愈大,這個機制本專欄〈Token帳單之後:AI運算架構的5層重組〉談過。當時是推估,現在有實際的帳單可以看了。不過帳單變大本身不是買(租)機器的理由。先確認投資報酬率(ROI),再做工作分級與流程最佳化。剩下的工作如果用量持續穩定、資料不能離開公司、服務也不能中斷,才值得自己擁有模型生產token。第一步是看ROI。所有變革都得先回答一件事,對企業改善哪些量化指標。常見效益是省下的人力與外包、縮短的交期,再往上是客戶滿意度、新營收與競爭力,最後都反映在毛利、甚至本益比上,本專欄〈AI改寫的不是效率,也是毛利結構〉談過這一層。第二步是把工作分級,依難度配上能力與價格相稱的模型。可預測、量大、規格明確的任務可以不需要前沿模型,蒸餾出來的小模型、開放權重模型或較低階的API都能處理,單位成本可以差1~2個數量級,前沿模型留給真正需要深度思考的環節。第三步是工作流程的最佳化與迭代。工廠電氣化初期,多數業主只是把蒸汽機換成一台大馬達,天花板上的傳動軸照舊,產出的改善很有限。要等到每台機器各配1顆馬達、廠房不再繞著傳動軸配置,生產力與彈性才提升。Agent接上現有流程,多半只是把原來的步驟做快一點,只有將工作流程重新規劃過,效益才會顯現。反過來說,帳單有相當一部分也是被流程設計出來的。幾週前一位在美國AI原生(AI native)新創擔任C-level角色的朋友分享,他們負責市場開發的只有個位數人力,年化營收(ARR)幾個月內翻倍到數億美元。這樣的槓桿主要來自整套工作流程的改造,不全然靠買運算能力。有兩類狀況,值得付出溢價或是買保險。第一類是「敏感資料」:設計圖、製程參數、客戶規格等,本來就不宜離開公司。代理人能穩定接手的還是結構化程度最高的那一小塊,其餘得靠人幫補,工作切得愈長、步驟愈多,需要補的地方就愈密—規格、報價邏輯、內部know-how也就跟著提示詞一起出去了。目前的折衷是先改寫再送出,把敏感欄位換成代號,或用地端小模型把提示重寫一遍。2026年一篇論文整理8種隱私保護方案,並實測其中4種可行方法及其組合。最嚴格的一組是地端分流加上遮罩與改寫,可以把個資洩漏率降到0.6%,但程式碼仍有31.3%外洩。個資有固定樣式可以辨識並置換,但是經驗與判斷散在整段敘述裡,換掉幾個名詞隱匿不了。對產業界真正在意的那類資料,改寫是減少損失(曝險),不是解方。第二類是「隨時可用」。Token目前已逐漸成為產業的必需品,供應一中斷,就不只是不方便。網路斷線、供應商停機、尖峰被限制用量,任何一項發生,產品研發就停擺。版本下架也是,供應商依自己的時程淘汰舊版模型,驗證過的流程可能得重做。地端模型的能力比不上前沿,但它不會在某天早上突然不見。如果外部模型今天停3個小時,有多少工作會一起停,又有多少可以靠(較弱的)地端模型備援?到這裡,才考慮自建。前面那家新創走的是租。買或租不是重點,重點是能不能取得自己調度的運算能力,讓資料不必送進第三方前沿模型API,並由自己控制模型與版本。推論需求愈大、愈穩定,設備利用率愈高,自建的優勢就愈明顯。多數公司最後會是混用,量大又規格明確的留在地端,需要深度思考的仍然呼叫外部前沿模型。選擇自建,機櫃之外有不少overhead。機房、電力、散熱還需要幾組人:維運硬體的工程師、負責選型與微調的模型工程師、把服務接回既有系統的開發人力。這幾種人現在都很搶手,養得起的中型企業不多。而且配置不是做一次就好,換一次模型就得重新部署、重新驗證。硬體一買就是好幾年,開放權重模型卻幾個月就出一批更好的,這個節奏落差是自建評估裡特別容易被低估的一項。回到開頭那位朋友。他們團隊後來決定買了。在那之前,他已確認這兩年的投入有可量測的ROI。帳單只是其中一個理由,真正讓決定成立的,是有些產業know-how本來就不該送出去,有些工作一斷線就停擺,加上他看得到未來2、3年的成長。換一家公司,同樣一筆帳單很可能得出相反的答案。買貴了還算小事,難的是買完之後,需求長得跟當初評估的不一樣。
2026-08-24
為什麼模型訓練需要「蒸餾」?
2019年前後,一位在大型雲端服務業者任職的朋友興奮地分享:他們訓練一個CNN模型處理單據文字辨識,效果不錯,但直接上線的運算成本太高,於是用「蒸餾」(distillation)訓練出一個較小的模型來提供服務,發現還挺有效的。蒸餾一直是深度學習常用的策略之一,也稱為師生架構(teacher-student)。用一個能力好的大模型當「老師」,訓練另一個「學生」模型(不一定較小)。手上有沒有原始標註資料,各有對應的做法。早期做法在2015年前後成形,最直接的是讓學生去逼近老師的輸出,不需要標註。後來加上「軟目標」,或與原始標註資料一起用;也可以讓學生模仿網路中間層,不只看最後的輸出。這套做法到今天仍在用,但搬的不只是模型大小,而是能力。我們近期的研究讓老師看密集的3D點雲、學生處理刻意稀疏化的點雲,把兩邊的中間特徵(理解能力)對起來,稀疏點雲限制下的3D辨識能力(機器人、自駕車)就被提升上來。到了大型語言模型,蒸餾的角色又不一樣了。2025年初,一個開放權重的大型推論模型把自己的推論過程蒸餾進一系列小模型,有些的表現接近當時的閉源前沿模型。從那之後,能不能用前沿大模型訓練出成本可接受的小模型,就成為大家矚目的焦點。語言模型的訓練,可以粗分成兩大階段。預訓練(pre-training)吃的是海量文字,學的是語言結構與世界知識,可以說是讓模型牙牙學語的階段。後訓練(post-training)教的是另一件事,模型怎麼遵循指令、把話說得專業,把複雜問題抽絲剝繭處理好(推論)。需要的訓練資料就是「一個專業的回答長什麼樣」,而前沿模型正好能生成這樣的資料。所以蒸餾用在後訓練特別直覺。蒸餾怎麼做,開放權重的模型多半會披露在技術報告中。差別主要在老師給學生什麼訊號。最簡單的一種是把老師生成的文字當教材。設定一批問題讓老師(前沿模型)回答,收下來的問答就是訓練資料,只要拿得到API,蒸餾就能啟動。細一點的是讓學生逼近老師在每個字上的機率分布,這需要模型權重。Google的Gemma連預訓練都用蒸餾,後訓練再從大型的指令模型蒸餾一次。近期較受關注的on-policy蒸餾又更進一步,讓學生先用自己的方式作答、老師逐字批改。在數學競賽題上,用約10分之1的運算量就能達到強化學習的水準。老師也不必只有一個或一定更大。已經有模型用上超過10個各自專精的領域老師,把不同專長蒸餾轉移進同一個學生。把公司資料訓進模型之後,原本的對話與指令能力常會退化,這時拿還沒微調過的原始版本當老師,有機會把退化的部分教回來。但蒸餾並非總是有效:2026年的一項研究指出,老師與學生用同一批資料、量又足夠大時,增益相當有限,資料稀少的領域任務才是它發揮空間較大的地方。前面談的是狹義的蒸餾,老師與學生都是模型。把範圍拉大,前沿模型也可以當成知識與資料的來源,協助標註甚至擔任代理人(Agent)。過去要建資料集,得找標註人力、寫規範、做品管,週期以月計。現在例行、量大的標註工作,部分前沿模型的輸出品質已經堪用,單位成本也低得多,需要專家判斷的領域當然還有難處。一種做法是讓大模型直接提供監督訊號。如低光源影像增強傳統上需要成對的明暗影像當參考,訓練影像不易取得。我們近期的做法是改用視覺語言模型(VLM)對影像內容的理解當引導,就能在沒有參考影像的條件下訓練,下游的分類與物件偵測都因此受惠。另一種是用大模型產生資料標註。我們建過一個電影理解的問答資料集,問的是角色動機與情節因果這類需要思考推論的問題,人工出題慢,也難維持一致品質。做法是讓多個語言模型扮演不同的思考代理人,各自提問、互相檢視與修正,再產出問答資料集。前沿模型直接擔任資料標註的Agent。還有一種是把常識搬進訓練系統。長時序的機器人操作任務難在中間沒有回饋訊號,我們的做法是先用語言模型把任務拆成不同階段與所需動作,列出各階段應有的物體狀態,再讓視覺模型依這套結構判斷任務進度、建立獎勵訊號。這些過去要靠工程師逐條寫進系統的常識,現在能從前沿模型(自動)取得。令人更期待的是,蒸餾有機會做出能力好的較小模型,把運算從雲端往外移。對企業來說,較小的模型在部分推論任務上已逼近前沿,有機會在數張GPU的地端伺服器部署。自建小模型也因此從構想變成可評估的選項:法務、財務、產業know-how這類資訊密集又不宜外傳的領域尤其明顯。訓練前沿模型的花費以數億美元計,但能力一旦以API或開放權重現身,讓小模型接近它的成本低了一到兩個數量級。另一個方向是終端裝置:手機、機械手臂、檢測設備都可受惠於蒸餾。機器人的需求特別直接,它要在實體空間裡即時執行動作,許多控制環節沒有等待雲端往返的餘裕。高速產線的檢測設備也一樣,模型再準,跟不上產線節拍就用不上。使用大模型生成或標註資料再訓練自己的模型,已經是研發的常態,前提是條款允許。前沿模型供應商的服務條款多半禁止拿模型輸出去訓練與他們競爭的模型,各家的界線並不一致。另一條路是改用可自行部署的開放權重模型,生成與訓練都在自己手上,也避開資料外流。早年蒸餾搬的是辨識模型的效率,現在搬的是語言、推論與常識。老師模型愈強,能搬的就愈多。
2026-08-17
地球運作也可以有基礎模型 (Foundation Model)
2026年入夏以來,颱風與極端高溫頻繁進入新聞版面。放大到近幾年,豪雨與乾旱輪流上場,已逐漸成為常態。而理解、預報這些天氣的技術,正逐漸轉向AI。70年前,人類第一次用電腦做天氣預報,把大氣層切成格點,用物理方程式描述流體運動,交給超級電腦逐步求解。這套方法稱為數值天氣預報(Numerical Weather Prediction;NWP),至今仍是全球氣象業的骨幹。每次全球預報都要在數百萬個網格上反覆求解流體力學方程組。氣象單位的標準作法還利用ensemble,同時跑多組條件略有差異的預報,用多個結果來改善預測品質。所以,運算是剛性需求,氣象也長期是全球高效能運算(HPC)的大用戶之一。AI挑戰數值天氣預報的成果,從2022年前後開始出現。Google DeepMind的GraphCast在標準評測的90%預測上,勝出歐洲中期天氣預報中心(ECMWF)的主要數值模型。華為的盤古模型採用同樣的資料驅動作法,論文估計其「推論」(實際預測時)速度比當時的營運數值系統快超過1萬倍。2025年5月,微軟(Microsoft)的Aurora再推進,在超過百萬小時地球相關地球觀測資料上預訓練,再微調出空氣品質、海浪、颱風路徑、高解析度天氣4個應用版本,在各自的評測項目上都優於現行的數值系統,其中5天颱風路徑預報勝過7個主要預報中心。2026年7月,Aurora的新版再加入能源、農業、交通等需要的預報項目,同時也公開釋出模型權重(13億參數)。ECMWF在2025年已陸續把自家AI預報系統AIFS的單一預報與ensemble版本,納入每日例行預報的正式流程,與傳統數值系統並行。美國國家海洋暨大氣總署(NOAA)也在2025年12月部署AI全球預報系統,以開源的GraphCast為基礎,再用NOAA自己的資料進行額外訓練,其中傳統物理模型與AI混合的ensemble,表現優於兩者單獨使用。70年來由超級電腦支撐的氣象預報,目前是兩套系統並行運作,而依NOAA的數字,AI版預報用的運算量不到傳統系統的1%。但運算需求不會因此消失,AI預報每次起算,仍要靠傳統系統把全球觀測整合成一致的初始狀態。成本差距這麼大,是因為AI模型預報的方式與傳統NWP大相逕庭。NWP的邏輯由物理定律出發,把已知的定律寫成方程式,再用大量運算逐步推演大氣狀態。AI模型則從幾十年的歷史資料學狀態之間怎麼轉變,不必在每次預報時重新求解完整的方程組,也不要求先理解背後的物理機制。作法上與語言模型從文本學結構、AlphaFold從序列與結構資料學規律相近。主要的運算成本落在預訓練與微調,之後每次推論只要少量運算,秒級到分鐘級就能完成。標的也不只有天氣。傳統地球系統預報由大氣、海洋、海浪與空氣化學等模組串接而成,彼此交換資訊,但各模組有各自的資料、方程式與開發流程。Aurora則是同一個預訓練模型微調出不同任務版本,學到的不只是天氣,還包括地球系統其他層面的動態。有趣的是,原本集中在國家級氣象機構的預測能力,正在往產業端擴散,變成可以自己部署、自己微調的一項基礎能力。能源是最直接的例子。各主要市場的尖峰與離峰電價差正在拉大,資料中心與各類新增電氣化用電的成長又推高尖峰,電網業者同時推動需量反應、時間電價與電網級儲能,試著用各種手段把用電尖峰壓下來。國際能源總署(IEA)估計,全球住宅空調貢獻約600 GW的尖峰負載,但實際被調度的比例仍低。這些節能操作都得提前預備。需量反應得先通知用戶,儲能得決定何時充放,前提是知道什麼時候缺、缺多少。而尖峰出現的時間與高度,相當程度由天氣決定。空調只佔全年用電約1成,卻佔了尖峰需求的3成;以印度為例,2024年氣溫每上升1度,尖峰需求就增加7 GW。太陽能與風電的出力同樣取決於天候。我們多年來參與太陽能電廠的智慧監控與發電量預測,與電力公司長期協作,颱風前後那幾天的發電量預測不確定性明顯升高,也正是調度特別需要可靠資訊的時候。NWP的維運要有超級電腦、即時觀測資料整合與跨國觀測站網路,門檻一直很高。幾個代表性模型的權重已經公開,推論的運算需求遠低於傳統NWP,用自有資料微調的作法也逐漸普及。能源、物流、農業、保險,原則上都有機會微調出貼近自身需求的預測系統。幾個侷限還待克服。目前已知效能僅限於評測基準上的統計結論,進入電網調度或供應鏈決策之前,仍需在具體場域驗證極端事件下的穩定性。空間解析度是另一個實際限制。以Aurora為例,解析度較高的全球預報也只到約11公里,對初略天氣型態已有參考價值,對太陽能光電場址層級的預測仍不足。台灣多山地形往往需要公里級解析度,還得再把粗網格的預報細化到局部地形,實務上這段差距目前多靠場址端的即時量測與在地資料來彌補。更根本的是,AI模型的訓練資料來自歷史氣候,氣候變遷正讓極端事件的頻率與型態偏離歷史分布,這是所有靠資料學習的方法都會碰到的問題。同一套「基礎模型」的想法正在往DNA序列、材料結構等領域擴散。地球系統不一樣的地方在於,它的預測結果每天都得使用。語言模型出錯,多半只是一段不可靠的文字。地球模型出錯,影響的是明天的發電、用水與物流安排。其他領域的基礎模型多半還在改變研究的方式,地球系統的模型已經進入營運現場,每天接受現實檢驗。
2026-08-11
AI Agent能力版圖到哪裡了?未來呢?
Token單價下滑、總消耗量大增,專欄2026年3月分析過,趨勢至今有增無減。新一代前瞻模型朝AI代理(AI Agent)的使用型態設計:這幾個月各家前瞻實驗室競爭加劇,接連發布的新模型能規劃任務、分派工作、運用各種技能與工具、直接操作電腦介面,定價卻更低。AI代理正被快速導入各種知識工作。那麼,AI代理真的能承接知識工作嗎?能承接多少?尚未承接的部分,是還沒有人投入,還是技術未到?7月初參加在加州聖地牙哥舉辦的計算語言學年會ACL 2026,一場「AI代理人與工作的未來」專題講座(tutorial)把技術現況以及這些問題拆開來看。浮現一張讓人驚訝的能力版圖:AI代理已經站穩的區域,小得出乎意料;版圖之外,一部分是還沒有人投入的空白,另一部分是技術還待克服的難題。先看站穩的區域。前瞻模型業者OpenAI在2025年推出代理人基準測驗(benchmark)GDPval,從GDP貢獻最大的44種職業中,設計出1,300多項「規格明確」的真實任務(如簡報、財務模型、工程圖說),來測試代理人執行能力,並請同行專家盲評AI與人類的成品。依業者2026年4月發布的最新結果,最強模型的成品已有逾8成被評為不輸人類專家;這套基準2025年9月推出時,這比例還不到5成,再前一代模型也只達到1成出頭。依業者推出這套基準時的估算,完成速度與成本約為人類專家的百分之一。單看這些數字,AI代理似乎已經可以上工。但這片區域在整個勞動版圖上有多大?ACL會議中主講的CMU團隊把目前43個AI代理基準測驗(學術、產業時常使用的Agent評測任務)共72,342個任務,對應到美國1,016種職業的技能分類(參考美國O*NET職業資訊資料庫)。基準測驗的分布,可當作目前AI代理研發重心地圖:考題集中的地方,訓練資料與研究人力也跟著集中。結果顯示,任務多數落在「取得資訊」與「操作電腦」2項技能,在整體就業所需技能中的權重合計不到5%;投入最深的程式與數學領域,只對應7.6%的就業人口。原因不難理解:這些工作結構化程度高、輸入輸出明確、成功與否可以驗證。本專欄先前提過,自動化總是先從結構化的場域開始,研發投入也一樣。版圖之外的第一種空白,是還沒有人投入的高價值區。同一份報告指出,管理、法務、建築工程的工作已高度數位化(約88%、70%、71%),基準測驗的覆蓋卻只有1.4%、0.3%、0.7%,而管理正是以薪資加權後經濟價值集中的領域。這些工作中不少環節有明確的輸入輸出,未必是技術做不到,更可能是還沒有人投入;論文稱之為「錯失的機會」。一旦投入到位,對企業來說,這裡可能是生產力改善較早出現的地方。第二種空白,是技術還待突破的複雜工作。資料標註平台業者與AI安全研究機構合作的「遠距勞動指數(Remote Labor Index)」,從接案平台選取真實付費委託(3D建模、建築圖說、影音製作、資料分析等,專業者完成一件的中位時間約11.5小時),讓前瞻AI代理端到端執行,再由人類評審對照專業接案者的成品盲評,以此模擬企業交付員工的工作指令。指數2025年10月發布時,最佳模型只有2.5%的專案達到可驗收水準。真實委託的需求模糊、規格多步驟、常要求修改既有成品,這些都還沒被結構化。長時序的複雜任務是另一道關卡。前述CMU團隊的報告同時量測AI代理自主性:即使在表現最好的軟體領域,任務複雜度一提高,成功率就明顯下滑;其他測驗加入工具中途出錯、給定資訊不完整、需要多人協作等情境後(模擬真實複雜場域),表現同樣走低。值得注意的是這張版圖移動的速度。2026年7月,研究機構以最新一代模型、搭配更完整的代理人執行環境重測遠距勞動指數:最佳模型的成功率已從2.5%升到15.8%,前後不到1年;同一份更新也指出,絕大多數專案的成品仍達不到專業驗收水準。兩個現象並行:能做的還很少,推進的速度很快。GDPval從1成出頭到逾8成不輸專家,說的是同一件事:AI代理目前的能力版圖比想像中小,但持續擴張中。這類成長難免包含針對測驗最佳化的成分;但這兩套測驗過的是人類專家對真實成品的驗收,能拉高分數的改進,多半也是AI代理真實能力的提升。目前技術擴張的方向也有跡可循。研發正把做不到的難題當成訓練目標:新一代測驗把出錯、協作、真實委託等情境逐步納入題目,最新的訓練方法把專家驗收的標準(rubric)轉成訓練訊號;今天做不到的清單,很可能就是下一輪訓練資料與運算投入瞄準的地方。還沒有人投入的高價值空白,很可能也將循同一條路逐步被填補。回到開頭的需求端。目前代理人技能只在結構化的一小塊版圖上站穩,如今的用量成長與供應鏈投資,大致就發生在這一小塊之上(但已相當可觀)。版圖之外的大量工作,仍由人補位:釐清模糊的需求、拆解執行步驟、修正最後的產出;而這些補位動作,專欄近期談過,正是企業在教模型。目前AI代理能完成的工作比想像中少,但是需求已經這麼大,而技術能力版圖還在往外擴。接下來市場的成長與組織的變動,可能又會超乎我們的想像。
2026-07-30
智慧應用 影音