我對使用 GPT 或一般大型語言模型(LLM)處理任何事情的問題是:除了愚蠢的任務,也就是重複且容易自動化的程序(這些在 LLM 出現前,我會用 Emacs 巨集來完成),即使 LLM 做得「有效率」,我想以尋找資訊為例,假設以下情境:你是否用過 Google 的「我很幸運」按鈕?這個按鈕通常會直接給你搜尋的第一個結果,而不顯示搜尋結果頁面。假設你生活在一個完美的世界,每次 Google 搜尋你都點這個按鈕,且它極其精準有效地找到你想要的完美答案,也就是說,你一生中每次搜尋從第一個結果開始都是成功的。

在這樣的世界裡,你認為你的智慧會因為不必真正做研究、遇見瘋狂的人、文化、爭議、笑話、寫出有趣內容而追蹤的人、你不同意但無法輕易否定的論點、帶你走向各處的腳註、半壞掉的部落格、逼你磨練自己觀點的錯誤看法,或是彼此強烈矛盾的資訊來源,而必須建立一套世界模型來承受這種張力,而成長多少?

因為缺少的不是資訊,而是經驗。而經驗才是智慧真正被訓練的地方。

「我很幸運」式的智慧是為了快速抵達答案而優化,而非為了成長。你得到答案,但沒有其他(記住,我們假設這是個好答案)。你不會學到想法如何交鋒、變異或消亡。你不會培養出對知識真偽的嗅覺,也無法在正式證明之前感覺到哪裡怪怪的。

回到現實,LLM 從來沒有那麼好,它們永遠無法達到那個假設中的「我很幸運」水準,這與它們的設計本質有關。我從未問過 GPT 關於我專精領域的問題,得到的答案能像我一樣專家般充分。人們傾向認為 GPT(及其他 LLM)表現很好,但那通常是因為問題本身他們不太懂(蓋爾曼失憶效應)。即使它聽起來很自信,也可能是在近似、平均、誇大或自信地複製錯誤。它給出的答案沒有任何保證是最佳、具爭議性或正確的,只是合理的答案。而這個區別很重要,因為智慧不是建立在合理性上,而是建立在理解為何某事可能錯誤、誰反對、隱藏了什麼假設,以及當假設失效時會破壞什麼。

一個工具可以很有效率,但仍會腐蝕智力,不是因為它一直說謊,而是因為它說謊說得夠好。它的流暢掩蓋了不確定性,而不確定性是重要的,除非你想讓智力腐爛。

或許我應該再補充一次,愚蠢的任務例外,也就是重複且容易自動化的程序,這些在 LLM 出現前我會用 Emacs 巨集來完成。

「蓋爾曼失憶效應簡述如下:你打開報紙看到一篇你熟悉領域的文章。以 Murray 為例,是物理;以我為例,是娛樂圈。你讀到記者完全不了解事實或議題,文章錯得離譜,甚至顛倒因果。我稱這類故事為「濕街道造成下雨」的故事,報紙裡充斥著這種錯誤。你帶著無奈或好笑讀完錯誤百出的故事,然後翻到國內外新聞,卻又認為報紙對巴勒斯坦的報導比剛才讀的故事更準確。你翻頁,然後忘了你所知道的。」—麥可·克萊頓。