新模型每隔幾週就有一批,哪一個比較好,很多時候看的是排行榜。
排行榜背後的評測,表面上是訂規則、跑資料、比分數的學術活動。但拉長時間看,辦一場公開評測,或是在裡面拿到好名次,一直是門好生意,只是每個年代收錢的人不太一樣。
我在2002到2007年於哥倫比亞大學攻讀博士,研究主題是影像與視訊搜尋,親身參與多年美國國家標準暨技術研究院(NIST)主辦的TRECVID年度評測。每年,全球數十個研究團隊各自送出系統,針對同一批影片、同一套題目測試,排名公開。這項評測的贊助單位包括美國國安體系的研究機構,在當時的研究圈裡,排名也會直接影響團隊後續爭取研究經費,美國的頂尖研究團隊都很認真看待每一次評測。
2006年,Netflix把自家的推薦演算法問題公開懸賞,只要有人能把預測誤差比現有系統降低10%,就拿走100萬美元獎金。一家公司把核心演算法問題公開交給外界解決,在當時相當少見。公司不必先知道誰解得出來,只要把問題和驗收標準定清楚,達標才付錢。2009年,獎金由一支跨團隊組成的隊伍拿下。
在Netflix之後,愈來愈多公司把競賽當成向外找解法的管道。2010年成立、2017年被Google收購的Kaggle,把這套模式做成一個平台。任何公司都能把資料放上去、定好評分方式、提供獎金,換取全球資料科學家幫忙解題。獎金之外,排名本身也成了參賽者的履歷,有些公司會直接從排行榜上找人。
2010年開始舉辦的ImageNet影像分類競賽,則提供一個研究團隊普遍認可的公開基準。2012年底,一支使用卷積神經網路(CNN)的隊伍把錯誤率大幅拉低,這個結果後來常被視為深度學習時代的起點。但在當時,不少資深的電腦視覺學者並不認同,甚至抱持懷疑的態度。直到接下來兩年,一系列CNN方法在ImageNet上連續大幅躍進,他們才陸續接受並投入。ImageNet讓影像辨識的「進步」第一次有了公開、可驗證、逐年比較的衡量方式,資料也開放給全世界的研究社群,不必參賽就能使用。說服學界的,是這些每年公開、任何人都能驗證的結果。後來的AI評測排行榜,大多沿用這個形式。
2013年10月,微軟研究院與自家的搜尋引擎Bing聯合辦了一場影像搜尋的公開競賽,獎金1萬美元。我的一組學生就為了這1萬美元報名參加,最後真的拿到全球第一名。那年5月,我們原本用的是傳統的電腦視覺特徵,測試時偶然換上CNN擷取的特徵,準確率大幅躍升。當時CNN剛在ImageNet嶄露頭角,還沒普及到各個電腦視覺題目,我們算是提早一步,在自己的研究上驗證這個轉折點。當下,我們決定把研究典範轉到CNN,並把各種經費拿去買GPU,也引起NVIDIA注意,促成2016年9月開始和NVIDIA合作成立NVIDIA AI Lab。
近年台灣也有不少企業與政府單位舉辦AI競賽。比賽一多,頂尖團隊會挑著參加。如果要辦,獎金額度,以及主辦單位的影響力,往往是能否吸引到好團隊的決定點。
2023年,柏克萊大學一組研究生與教授推出Chatbot Arena網站,讓使用者同時對兩個匿名大語言模型提問,投票選出比較好的回答,再用這些真人偏好算出模型排名。2025年4月,這個研究轉為新創LMArena,不到1年估值就來到十幾億美元,在新創圈相當受矚目。前面幾個例子,付錢的都是出題的一方。LMArena收錢的對象,反過來是被排名的一方。各家AI實驗室付費取得私有、不公開的測試環境,或是付費使用LMArena的評測工具與資料產品,來驗證自家還沒發表的模型。
測試平台成了關鍵資料的供應商。
METR的做法不同。這個2023年底獨立的非營利組織,專門替各家前沿模型做部署前的安全評測。METR主要看的是「任務時長」,也就是AI代理人能以特定成功率,獨立完成多長時間的人類專家任務,如今是業界衡量AI能力進步的常用指標之一。METR表示不接受被評測實驗室的捐款,資金主要來自慈善基金會與個人,2026年8月公布過去半年募得逾7,000萬美元的資金承諾。被評測的實驗室仍會提供免費的運算額度,供METR評測使用。
從TRECVID到METR,評測的形式換了好幾次,排名一直影響經費與人才的流向。如今LMArena與METR的評測結果,還會影響模型往哪個方向改進、外界如何評價一個模型,甚至企業的商業決策。被評分的前沿模型公司願意付錢或提供運算額度,換取一個外界相信的分數。影響力愈大,評測單位的公信力就愈重要,也愈被放大檢視。
當AI進步的速度超過我們判斷好壞的速度,掌握「分數是怎麼被決定的」,可能就跟做出被評分的模型一樣有價值。