有趣,發生在看懂的途中:Schmidhuber 的壓縮進展理論

AI 大宗師 Schmidhuber 的經典論文導讀|好奇心、創造力、藝術與科學(本文由 GPT-6 Astra 輔助撰寫和編譯)

一個房間完全黑暗,而房間內的攝影機每一秒收到的影像都一樣,沒有輪廓,沒有移動,也沒有新的細節。另一個房間擺著一台電視,螢幕上永遠跳動著雪花。假設這些雪花來自獨立、均勻的隨機抽樣,兩組訊號便處在相反的極端:前者幾乎可以用一句「畫面維持全黑」描述,後者的個別像素難以預測。若把驚訝理解成低機率事件帶來的資訊量,雪花畫面會持續帶來大量資訊。

Jürgen Schmidhuber 提出的問題是:這些資訊還能讓觀察者學到什麼?固定畫面的規則很快就能掌握;噪聲的分布也可以被學會,卻不會因此讓每一次抽樣變得可預測。當這些規律都已被吸收,兩者便缺少持續改善模型的空間。在他的框架中,它們都會變得無聊。

另一類訊號會帶來不同的經驗:起初看來混亂,觀察一陣子後,某種規律逐漸浮現。代理人原本需要很長的描述才能記住它,找到規則後,同一批經驗可以說得更短。壓縮器正在進步,學習曲線仍有斜率。這段由「看不懂」走向「看懂」的過程,就是論文所說的趣味性(interestingness)。意外可能觸發這個過程;單憑意外的程度,還不足以判斷一項經驗是否值得追求。

這個想法出自 Schmidhuber 的〈Driven by Compression Progress〉。預印本初版發表於 2008 年 12 月 23 日,這篇導讀採用的是 2009 年 4 月 15 日修訂的第二版。它的完整標題幾乎把作者的企圖全列了出來:主觀美、新穎、驚奇、趣味、注意力、好奇心、創造力、藝術、科學、音樂與笑話,都可能由一個簡單原則解釋。

正文屬於研究綱領:先給出可計算的人工好奇心框架,再把框架延伸到人類經驗。如何替人工代理人定義內在獎勵(intrinsic reward),是論證最具體的部分;談到審美、意識與藝術時,Schmidhuber 則提出需要另外檢驗的假說。這些層次值得分開閱讀,也留下了一個延伸方向:抽象的創意、品味與好玩,是否能由此取得新的測量方式?

把理解世界改寫成「縮短描述」

論文從物理學談起,若宇宙的歷史可以由某個程式產生,那麼最短的生成程式,就是對這段歷史最精簡的解釋。最短程式通常找不到,因為科爾莫哥洛夫複雜度(Kolmogorov complexity)不可計算;科學家能做的是逐步改善現有描述,用更短、更準確的規律整理已觀察到的現象。

牛頓萬有引力定律是作者的第一個例子:面對大量蘋果落下、行星運動與物體加速的觀察,我們不必逐筆記錄每個位置。只要保存定律、初始條件與必要的偏差,就能重建或預測許多資料。愛因斯坦的廣義相對論又解釋了牛頓理論未能充分描述的現象。從這個角度看,理論進步也可以讀成壓縮進展(compression progress):新理論讓更多觀察共享同一套短描述。

這裡的壓縮不限於 ZIP 檔或影像編碼,只要模型利用規律,減少重建資料所需的資訊,它就在壓縮。預測器(predictor)與壓縮器(compressor)因此緊密相連:神經網路若能從前文預測下一個符號,編碼器便能給高機率符號較短的編碼。資料若形成群集,也可以用「群集中心加上偏差」描述每個樣本。這些方法利用的規律不同,都可能降低完整資料的描述成本。

作者也借用了尚・皮亞傑(Jean Piaget)的同化(assimilation)與調適(accommodation):兒童把新事物放進已有圖式,近似用舊模型編碼新資料;修改圖式以容納新經驗,則像改善模型。Schmidhuber 想替這個心理學直覺補上演算法:模型的描述能力改善多少,就產生相應的獎勵。

這套想法包含一項假設:簡潔解釋過去的規律,往往有助於預測未來,從而幫助代理人規劃行動。作者主張在外在獎勵稀少時,預先加入好奇心機制,可能比等待通用學習器自行發現「建造世界模型有用」更節省運算。但原文也提到「好奇害死貓」的可能性;這套框架沒有保證追求壓縮進展一定有利於外部任務。

四個動作與一個獎勵公式

Schmidhuber 在第 4 至 5 頁把框架濃縮成四個動作。

  1. 保存歷史。 代理人記下感覺輸入、行動與獎勵。論文主張,只要儲存能力允許,就不要丟棄原始經驗,因為它們是日後重新尋找規律的材料。[1]
  2. 改善主觀可壓縮性。 壓縮器尋找歷史中的重複、對稱與可預測部分。規律是否可見,取決於代理人當下的模型、記憶、計算預算與學習演算法。
  3. 把壓縮改善轉成好奇心獎勵。 新模型若能用更少位元描述同一份歷史,節省的位元便形成內在獎勵。資料本身很難壓縮,並不自動產生這份獎勵。
  4. 用強化學習選擇下一步。 控制器(controller)學習選擇有望增加未來累積獎勵的行動,例如移動視線、操弄物體、改變實驗條件,或回到一個尚未理解的問題。

附錄把代理人的生命切成離散時間步。時間 tt 的歷史記為 h(≤t)h(\le t),其中包含輸入 x(t)x(t)、行動 y(t)y(t) 與獎勵 r(t)r(t)。令 C(p,h)C(p,h) 表示壓縮器 pp 對歷史 hh 的壓縮成本。採用作者提出的最直接差分形式,內在獎勵就是:

rint(t+1)=C(p(t),h(≤t+1))−C(p(t+1),h(≤t+1)).\begin{aligned} r_{\mathrm{int}}(t+1) &= C\!\left(p(t),h(\le t+1)\right) \\ &\quad - C\!\left(p(t+1),h(\le t+1)\right). \end{aligned}

式中只有壓縮器版本改變,兩項成本都在同一份歷史上計算。若比較不同資料,資料難度與數量的變化便會混進獎勵。假設舊模型需要一千位元、新模型只需六百位元,進展就是四百位元;若兩者都需要一千位元,這次更新便沒有帶來壓縮進展。

假設預測器猜中了歷史中的大多數事件,重建資料時仍須保存預測器、猜錯的事件、錯誤發生的時間,以及其餘必要資訊。解碼者重跑預測器,再逐項補回差異。預測器本身有多大、殘差與索引要幾個位元,都會影響結果。龐大模型即使能死記資料、做到零預測誤差,整份描述也未必更短。

在附錄 A.1 至 A.3 中,pp 可以理解為能重建歷史的完整程式,包含預測器及重建所需的其他資訊。因此,最簡單的成本 Cl(p,h)=l(p)C_l(p,h)=l(p) 計算的是這個完整程式的位元長度,不能只計神經網路的大小。給定解碼方式與硬體後,模型和未被模型解釋的資料都須納入比較。

作者也考慮執行效率,提出 Clτ(p,h)=l(p)+log2⁡τ(p,h)C_{l\tau}(p,h)=l(p)+\log_2\tau(p,h)。其中 τ\tau 是程式重建歷史所需的執行時間;依這個評分,程式縮短一個位元,與重建時間減半具有相同價值。這項時間成本不直接等於訓練模型或搜尋該程式所花的時間。[2]

整個迴路於是串接起來:行動改變觀察,觀察加入歷史,學習器改善壓縮器,壓縮改善產生內在獎勵,獎勵再塑造下一次行動。傳統無監督學習通常分析已收到的資料;這裡的代理人還要選擇資料來源,形成主動式無監督學習(active unsupervised learning)。

論文沒有指定唯一的壓縮器或強化學習演算法,循環神經網路(recurrent neural network, RNN)、機率模型與程式搜索都是可行的,但會造出能力和偏好不同的觀察者。控制器追求的也是預期未來累積進展:一段暫時沒有收益、卻能通往重要發現的探索,仍可能值得投入。把好奇心說成停留在「能力邊緣」很有直覺,但最優行動還取決於時間、成本與後續機會。

高誤差、信念更新與壓縮進展

開頭的雪花畫面說明了預測誤差(prediction error)的限制,若每次猜錯都給高獎勵,代理人可能長期停留在無法改善預測的噪聲前。反過來,已學會的固定畫面雖然很好壓縮,也不會持續帶來新的壓縮進展。值得探索的資料,需要含有目前尚未掌握、而學習器有機會發現的規律。

Schmidhuber 因而重新界定新穎(novelty)與驚奇(surprise),夏農資訊量(Shannon information)衡量事件在給定機率模型下有多意外;他關注的是事件能否促成學習。原文用「拒絕傳統驚奇」表達立場,但這沒有推翻 Shannon 的定義,而是為好奇心選擇了不同的衡量目標。

第三節回顧 1990 至 1997 年的相關實作,呈現這個目標如何逐步具體化。該節整理先前工作,沒有加入新的實驗。

年代獎勵依據與壓縮進展的關係
1990RNN 的預測誤差把高誤差當成改善機會,容易受到不可預測噪聲吸引。
1991另一個模型預測原預測器的長期變化嘗試估計學習進展;原文報告此機制能學到某些噪聲不再帶來持續的參數改變。
1995觀察前後主觀機率分布的相對熵用資訊增益刻畫信念更新,連到後來稱為 Bayesian surprise 的量。
1997兩個可自我修改的程式模組,對演算法實驗結果下注以對手尚未掌握的規律為探索目標;接受相反預測後,執行實驗並把獎勵轉給勝方。

然而,參數變化量是需要區分的,有可能來自學習,也可能來自優化震盪。貝葉斯驚奇(Bayesian surprise)則以庫爾巴克—萊布勒散度(Kullback–Leibler divergence)比較更新前後對模型假設的信念分布;它衡量信念改變多少。要把信念更新換算成特定編碼方案節省的位元,仍須交代模型與編碼假設。兩者都不能不加條件地代替同一份歷史上的完整成本差。

1997 年的系統把探索再推進一步:模組可以提出實驗,並用執行結果檢查自己的預測。於是,選擇下一個值得問的問題,也成為系統需要學習的能力。

原文還用 π\pi 的數字展開說明統計預測與演算法壓縮的差別:數字看來雜亂,卻可由短演算法依序生成。這個例子不需要預設 π\pi 的各種數字串具有隨機序列的頻率;原文對此做了過強的斷言。π\pi 是否為十進位常態數(normal number),仍未獲證明。[3]

美、趣味與觀察者的學習史

論文把趣味性寫成主觀美(subjective beauty)的一階導數。這個說法需要先限定「美」的範圍:對某位觀察者而言,在他認為可相比較的模式之間,越能由當下壓縮器簡潔描述的模式,就越具有作者所說的純粹主觀美。原文的「可相比較」不能省略;這個定義並未建立一張讓全黑畫面、數學證明與人臉直接競爭的普遍美感排行榜。

簡短證明常讓數學家感到漂亮,對稱圖形也容易被某些觀察者視為美。一個已經完全理解的簡潔圖案,可以繼續很美,卻未必值得一直盯著看。某段音樂的結構初次被聽懂時令人著迷,熟悉之後,同一結構可帶來的學習進展便減少。

為了把這個關係寫清楚,這篇導讀採用 B=−CB=-C 作為示意約定:描述成本降低,主觀美增加。這不是原論文證明的人類美感尺度,而是配合其概念方向的一種寫法。[4] 對同一觀察者及固定資料 DD,可以用長度為 Δt\Delta t 的區間平均變化率,示意這段時間的平均趣味性:

I‾[t,t+Δt](D)∝ΔB(D)Δt=Cold(D)−Cnew(D)Δt.\bar I_{[t,t+\Delta t]}(D)\;\propto\;\frac{\Delta B(D)}{\Delta t} =\frac{C_{\mathrm{old}}(D)-C_{\mathrm{new}}(D)}{\Delta t}.

固定時間步下,成本下降量對應前面的離散獎勵;比較不同長度的區間時,才需要區分總改善量與改善速度。趣味性在這裡已經是美的變化率,規律學會後趨緩的是壓縮進展,趣味性也隨之下降。

觀察者的歷史會改變可用的描述方式,Schmidhuber 在此處用原型臉(prototype face)說明:看過許多臉後,模型可以形成原型,新臉只須記錄相對於原型的偏差。他進一步把鏡中自己的臉與個人偏好連在一起;這是原文的推測,沒有在該文中以人臉評分實驗檢驗。

音樂則可更清楚呈現先備知識的作用,以阿諾・荀貝格(Arnold Schönberg)的十二音列音樂為例,在不熟悉其技法的聽者耳中,結構可能晦澀。了解音列的限制、目標與排列方式之後,聽者多了一套可以搜尋的規則。作品沒有改變,主觀可壓縮性卻可能改變。

熟悉材料提供入口,陌生關係留下學習機會;複雜作品的規律則可能需要多次聆聽或訓練才能掌握。作者沒有為所有人設定秩序與意外的理想比例,因為音樂記憶、感知能力與學習方式都會改變這個過程。

這套美與趣味的定義刻意排除了部分日常經驗,例如:冷天泡熱水澡的舒適,可以來自生理回饋;一首歌也可能因為初吻的記憶而動人。作者把這些來源與內在好奇心獎勵分開。日常審美往往同時包含結構、情緒、身體與社會經驗,壓縮進展在其中能解釋多少,需要另外檢驗。

先看蝴蝶,再看它的生成規則

論文第四節提供三張構圖範例。先看其中的蝴蝶、花與花瓶:

蝴蝶、花與花瓶,由圓弧構成的線條畫
Jürgen Schmidhuber,原論文 Fig. 2,PDF 第 34 頁。原圖說註明先前刊於 Leonardo。

蝴蝶翅膀、花瓣、莖與花瓶的曲線,是否讓你想到一組共同的幾何規則?下一張圖提供作者的構圖骨架。

查看圓形骨架(原論文 Fig. 3)
蝴蝶與花瓶的構圖骨架,顯示各條曲線所屬的分形圓
原論文 Fig. 3,PDF 第 35 頁。每條可見曲線取自某個圓,端點位於圓的相交或相切處。

生成規則從外框圓開始。外框最左端成為另一個同尺寸圓的圓心;兩個等大圓相切或相交的位置,又用來設定新圓的圓心,新圓尺寸取相等或一半。反覆套用這個操作,便形成分形圓(fractal circles)。原本需要各自描述的曲線,可以引用同一套圓系。

這套圓系仍不會自動指定哪些弧段該被保留,若選弧規則本身很複雜,總描述長度也必須把那部分算進去。原文展示了共用的生成結構,沒有提供整幅作品相對於其他編碼方式的完整位元帳本。

若骨架揭露了觀察者先前未掌握的規律,這次理解就符合作者描述的壓縮進展。至於是否因此更喜歡作品,則是另一項可以測量的反應。規則熟悉後,新的壓縮進展可能趨緩;圖片依然可以保有美感,卻不再帶來相同的發現感。

人臉構圖提供另一個例子。密集網格讓眉毛、眼睛、嘴、鼻子與輪廓共享幾何關係;詳細的斜率與縮放比例放在圖下注釋中。

女性臉孔的構圖計畫,三組網格標示五官的位置及形狀
原論文 Fig. 1,PDF 第 33 頁,女性臉孔建構圖(1998)。正方形各邊分成 242^4 等分,以斜率 ±1\pm1、±1/23\pm1/2^3、±23\pm2^3 的直線構成三組網格,再於相鄰平行線間插入等距新線,最後將垂直尺度縮為 1−2−4=15/161-2^{-4}=15/16。原圖說承認皮膚紋理等細節仍含沒有明顯短描述的雜訊;這套規則主要描述五官的位置與形狀。

Schmidhuber 說,這些簡單規則是在數百次失敗嘗試後才找到;完成後的描述很短,搜尋它的過程卻可能很長。這也讓創作與欣賞有了共同之處:創作者找到生成規則,觀眾則可能透過作品重新發現它。這三張圖都沒有附上受試者數與美感評分,因而適合用來展示構圖與學習的可能機制。

注意力、創作與發現

壓縮進展若能帶來獎勵,注意力(attention)便有了方向。代理人把有限時間投向那些尚未理解、又有希望理解的部分。眼睛移向畫面的一角,手伸向某個玩具,科學家改變實驗參數,都是選擇下一批輸入的行動。

看雕塑時,我們會移動身體;看畫時,眼球跳視(saccade)改變進入視網膜的細節;聽音樂時,內部注意力會追蹤低音、旋律或節奏。作品沒有改變,觀察序列卻由行動塑造。對這套框架而言,藝術家添一筆、觀眾換一個角度,都是讓後續經驗出現新結構的方式。

作者說,「好藝術」會讓人看見先前未察覺的關係:兩個熟悉物件以新的方式連接,合起來的描述短於各自描述之和。這能用來理解雙關、拼貼與某些風格創新。若觀眾早已知道連結,或缺少辨認連結的背景,就未必取得相同的進展。藝術家追求的金錢、聲望,以及觀眾的群體認同,則是原文另外區分的獎勵來源。

科學家也會主動產生資料。實驗讓尚未被理論解釋的現象出現,新的定律則縮短觀察的描述。Schmidhuber 把科學與藝術的主要差別放在「規律是否被形式化」:科學通常要求公開說明新規律,讓他人檢查;藝術帶來的結構發現,可能留在知覺或潛意識層次。這是作者在共同框架內提出的區分,並非兩種活動的完整定義。

論文把幅度特別大的壓縮突破稱為發現(discovery)。對牛頓與初次學習重力定律的學生而言,模型都可能改善,但兩人的發現具有不同的歷史意義。個人的新理解與科學共同體的新知識,還需要分開判斷。

笑話與技能學習把這個過程縮到較短的時間尺度。原文沒有拆解具體笑話,只說喜劇演員會讓熟悉概念以新方式連接。沿著這個機制,鋪陳與笑點可以被理解成一次快速重編碼:原有解釋被改寫,幾段資訊忽然能由同一規則連起來。

Schmidhuber 也回憶自己二十五歲後學三球雜耍,從一秒、兩秒、四秒,逐步做到穩定;照鏡子練習時,他發現自己每次進步都會露出笑容。後來,女兒第一次自行站立時,也露出相似的笑容。作者以這兩則軼事說明感覺與動作逐漸變得可預測時,可能伴隨內在獎勵。這個解讀仍容許成功、社會互動與生理回饋共同參與。

自我表徵能解釋到哪裡

歷史中反覆出現的模式,值得由短代碼代替。太陽每天升起,代理人便可能形成「日光」這類內部符號;物體輪廓、聲音單位與動作結果也能組成階層表徵(hierarchical representation)。作者將符號視為高效壓縮的副產品:可重用的內部結構,能幫助預測與重建經驗。

接著,論文做了一次更激進的跳躍。代理人本身參與所有行動與感覺:視角跟著它移動,動作由它發出,獎勵落在它身上。若要壓縮整段歷史,建立一個代表「自己」的內部代碼可能很有效率。當這個自我表徵被啟用時,作者提議把代理人稱為自我覺察或有意識。

這段話位於第 6 至 7 頁,篇幅很短。它提出了自我模型可能有何功能,沒有處理感受質、主觀經驗或不同意識理論的判準。把有效率的自我表徵稱為意識,是定義上的選擇。自我表徵是否出現、它是否改善壓縮,以及系統是否具有主觀經驗,仍是需要分別回答的問題。

一個獎勵公式尚未解決的工程問題

壓縮器可以與控制器非同步運作。控制器不斷行動,壓縮器在背景重新評估歷史、學習並比較版本;某次改善完成時,獎勵可能已經比觸發資料晚了很久。附錄 A.6 甚至提到,改善工作可部分安排在「睡眠」期間。這裡的睡眠是運算時段的類比,表示系統可以稍後重讀舊歷史、嘗試新編碼。

在這種非同步情況下,新舊壓縮器比較的是啟動該輪改善時固定下來的歷史快照,而非各自評估時不斷增長的資料。獎勵到帳後,控制器還得判斷先前哪些行動促成了它。延遲使信用分配(credit assignment)更加困難,反覆評估整段歷史也有成本。

附錄隨後討論 AIXI、其可計算變體、哥德爾機器(Gödel machine)與較務實的 RNN 控制器。AIXI 的理論最優性受所選先驗與環境類等條件約束,而且本身不可計算;其他方法也有運算成本與可證明性限制。這些討論提供候選手段與理論參照,實際系統仍須處理有限資源下的學習、規劃與評估。

從概念例子走到實驗證據

這篇論文統一了一種描述方式:一個計算受限、持續學習的觀察者,因模型改善取得獎勵,並主動尋找有望改善模型的經驗。各種活動可以放進同一框架,但支持它們的證據並不相同。

內在獎勵公式是明確的演算法定義;黑暗與理想隨機噪聲是用來區分誤差與進展的概念例子;1990 年代的系統是先前實作的回顧。人臉、音樂、笑話、雜耍與分形圓,主要展示理論如何解讀經驗;意識則是幅度更大的推測。

原文也引用了人類視覺注意力的實驗,Itti 與 Baldi 在 NIPS 2005 的研究記錄 8 位觀察者觀看影片的眼動;研究使用 50 段影片,共分析 10,192 次眼球跳視,發現 Bayesian surprise 指標比該研究比較的其他計算指標更能預測注視位置。[5] 這項結果支持信念更新與視覺注意力的特定關係,尚未直接測量完整歷史的壓縮改善,也未驗證主觀愉悅等於壓縮進展。

後續研究把學習進展本身納入行為分析,Ten 等人於 2021 年分析 382 位參與者自由選擇學習活動的資料,發現納入學習進展的模型最能解釋任務選擇;對當前熟練程度的敏感性也同時存在。[6] 這為學習進展影響探索選擇提供了實證支持,並未因此涵蓋所有美感、創意或好玩的經驗。

原論文第 16 頁提出的問題仍值得我們進一步追問:當觀察者的預測改善得最快時,主觀獎勵是否也最強?當規律被學會,或持續練習仍無法改善時,這份獎勵是否減弱?若能控制刺激條件與先備知識,追蹤學習曲線、主觀感受和探索選擇,就能逐步檢查三者之間的關係。

我的延伸:讓創意、品味與好玩進入 benchmark

筆者個人認為,一些驚人的事情可能正在醞釀。創意、品味與好玩這些抽象之物,可能藉由 Schmidhuber 的想法取得可操作的量化方式,進而成為更有辨識力的人工智慧評測。當最先進的大型語言模型(SOTA LLM)逐步攻克既有 benchmark,評測也需要捕捉新的能力差異。以下是我沿著這篇論文提出的研究構想,背景是已有可查的不少研究。

Akhtar 等人的 2026 年預印本分析 60 個文字型 LLM benchmarks,依其飽和指標,其中 29 個呈現高度或極高度飽和。[7] 該指標關注前沿模型分數是否在評估不確定性內聚集,數字不能直接解讀成 29 項能力都已被完整解決。研究也沒有發現開放式生成題目能穩定維持較低飽和程度。將考題換成寫故事或編詩,仍須處理如何可靠量化的問題。

Schmidhuber 的框架提供了一個入口:把作品對觀察者造成的改變納入評分。主觀性可以成為測量條件。同一個笑話,第一次聽與已知笑點時,可能有不同效果;同一段音樂,對不同訓練背景的聽者也可能不同。評測須說明作品面對的是誰、對方已經知道什麼,以及在多少時間與資源內能學到什麼。

我會先把三個概念拆成可分別驗證的候選面向:

概念可以先測量的能力還需要另外判斷的部分
創意能否產生具有可驗證新結構的作品、問題或環境,讓觀察者獲得可遷移的新理解?對個人陌生不等於對社群原創;新穎性、用途與成果品質仍須評估。
品味能否在回饋出現前,辨認並選出對特定觀眾、目的與情境更有價值的作品?適合學習的作品未必最動人;審美判斷還包含情緒、文化與價值取向。
好玩一段互動能否提供持續可學的挑戰,其學習進展能否預測自願探索與主觀感受?停留時間與學習進展都不能單獨代表愉悅,需要行為與感受的交叉檢驗。

這樣的評測可以讓模型承擔不同角色:創作作品、判斷作品、預測觀眾反應,再以觀眾實際的學習與行為檢查預測。生成能力、選擇能力與理解觀眾的能力,就有機會取得彼此可對照的分數。這些候選量是否足以代表創意、品味與好玩,則由實驗逐步確定。

一個可行的起點,是讓模型創作具有隱藏規則的微型世界,例如小遊戲、幾何系統或符號語言。先用執行器確認規則一致,再讓標準化的觀察者探索,記錄它何時掌握規律;最後用未展示過的案例與規則組合,檢驗新理解能否遷移。模型也可以事先挑選作品,預測哪一件對某位觀察者最有價值,接受結果檢驗。

留出案例是這個 benchmark 構想另外加入的驗證層。原論文的內在獎勵比較同一份歷史的壓縮成本;跨案例測試則檢查改善是否帶來超出已看資料的能力。熟悉規則的重複、結構可學但尚未掌握的問題,以及初始預測誤差相近的隨機材料,可以作為不同對照。要宣稱作品促成了改善,還須比較相同學習預算下的替代材料,排除單純多練習的效果。

評量創作者時,可以讓人工觀察者從相同檢查點開始;評量學習者時,則須同時報告初始能力、學習速度與最終能力,以免把原本已掌握規則、進展較少的模型誤判成學習能力較差。人類實驗需要控制先備知識並隨機分派條件。開發評分方式與檢驗其效度的資料也要分開,並加入不同能力與背景的觀察者,檢查分數是否只反映單一評估者的偏誤。

相關評測已朝經驗中的學習前進。ARC-AGI-3 要求代理人在沒有明示規則與目標的陌生互動環境中探索、建立模型並採取行動。[8] 這裡可以再往前追問:模型能否創造出值得探索的環境,並準確辨認誰會從中學到什麼?

動態產生任務可能延長評測壽命,但生成器本身仍可能被學熟,評分器也可能被針對性優化。持續更新的測試需要保留校準項目以維持可比性,同時檢驗未見過的任務家族。是否更耐飽和、是否能預測實際創作與使用體驗,都需要資料支持。

我期待的進展,是讓「創造值得理解之物」取得可靠的回饋訊號。如果我們能測量一件作品如何讓特定觀察者發現新結構、形成新能力,再把這份測量與人的感受和選擇接起來,創意、品味與好玩就有機會成為可比較的標的,甚至可系統性優化的能力,這篇論文將可延伸到下一代 AI 的評測與訓練。終極來說,我相信只要是能被驗證(verification)的目標和任務,都會被 AI 解決。


論文資料

Jürgen Schmidhuber. Driven by Compression Progress: A Simple Principle Explains Essential Aspects of Subjective Beauty, Novelty, Surprise, Interestingness, Attention, Curiosity, Creativity, Art, Science, Music, Jokes. arXiv:0812.4360v2, revised 15 April 2009. 版本與摘要;論文 PDF。

註釋與延伸閱讀

[1] 原文第 4 至 5 頁以約 101010^{10} 個神經元、每個神經元平均 10410^4 個突觸、每個突觸最多 6 bits,並假設一半容量用來保存原始資料,估得約 3×10143\times10^{14} bits。再以約 3×1093\times10^9 秒的一生換算,得到平均約 10510^5 bits/s。這是依賴強假設的容量估算,不宜讀成大腦實際儲存感覺串流的測量結果。 ↩

[2] 原論文附錄 A.1 至 A.5,尤其第 19 頁式(3)至(5)。這裡把 log⁡\log 明寫成 log2⁡\log_2,對應原文「少一個位元與執行時間減半等值」的解釋。非同步實作另見第 20 頁式(6)。 ↩

[3] 原文第 13 頁對 π\pi 數字頻率的敘述預設了十進位常態性;它不由 π\pi 可計算推出。定義與證明狀態可參考 David H. Bailey 的講義 Are the Digits of Pi Random?,第 8 頁。 ↩

[4] 原文第 7 頁 §2.3 先寫主觀美與編碼所需位元數成比例,隨後又說可比較模式中描述最短者最美,方向不一致。§2.4 式(1)把趣味性寫成美對時間的一階導數。導讀採用 B=−CB=-C 只是讓兩處概念方向一致的示意約定,不能當成人類美感的實證定律。 ↩

[5] Laurent Itti and Pierre Baldi. Bayesian Surprise Attracts Human Attention. NIPS 2005. 會議論文。每位觀察者觀看影片子集,每段影片有四位觀察者的眼動紀錄;50 段影片不是每人都觀看 50 段。本文引用的是該次實驗的視覺注意力結果。 ↩

[6] Alexandr Ten, Pramod Kaushik, Pierre-Yves Oudeyer, and Jacqueline Gottlieb. Humans monitor learning progress in curiosity-driven exploration. Nature Communications 12, 5972 (2021). 研究原文。 ↩

[7] Mubashara Akhtar et al. When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation. arXiv:2602.16763v1 (18 February 2026), §4.1. 研究原文。29/60 是該研究選樣與飽和指標下的結果,不能直接外推為所有現存 benchmark 的飽和比例。 ↩

[8] ARC Prize Foundation,ARC-AGI-3 官方評測說明,參見探索、建模、目標設定與規劃執行等能力的定義。 ↩

發表迴響

探索更多來自 EntropyZone 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀