我是一名科技與人權研究員。過去幾年來,我一直關注語言如何影響我們從 AI 中獲益或遭受損害的方式。我開發了一個開源平台,用於分析不同語言和情境下大型語言模型(LLM)回應的語言配對。我也致力於評估政策提示的防護措施,以及賦予 LLM 防護措施工具存取權限是否能使其更可靠、更值得信賴(這項工作最近被 NeurIPS 錄用!太棒了!!)。

最近,我在 RightsCon 的一個專題討論會上,探討了代理式 AI 對人權的影響評估。這讓我更深入地思考,在評估 LLM 代理時,語言的哪些面向是重要的。我想超越僅僅詢問模型在英語或法語(我的母語)之間表現的差異,而是將語言和情境納入考量,全面檢視代理的整個軌跡(推理、規劃、搜尋、來源選擇、來源層級、產物創建)。

任務是利用美國和伊朗的官方數據,填補世界銀行全球公共採購資料庫(World Bank Global Public Procurement Database)中缺失的資訊。我在美國任務中使用英語,伊朗任務中使用法語(下圖),並使用了三個代理:

Anthropic 的 Claude Cowork, Opus 5.5 Medium

以下是我為這三個代理使用的確切提示:

我特意使用了這些服務的網頁版本(而非應用程式或終端版本),以反映一般使用者的體驗。這種區別對於監控和記錄代理的行為很重要,我將在下文討論。

這篇文章的重點不在於哪個代理表現得更好或更快,而在於代理在資訊存取、語言表述、情境理解、透明度、人工介入(human-in-the-loop)和安全防護措施方面的行為差異。

您可以在以下文件中找到所有結果:

Muse、GPT 和 Claude 的輸出 Excel 文件(在此處)

每個代理在收到提示後產生的自我工作軌跡(在此處)

從代理行為螢幕錄影中提取的文字文件(在此處,完整錄影在此處)

在存取和擷取網站資訊方面,GPT 只在任務開始時請求了一次權限。它請求存取網站,並提供了一個「允許所有相關網站」的選項,我選擇了該選項。之後,它便不再詢問。

Claude 在整個任務過程中不斷提出問題,包括研究網站存取權限以及從世界銀行網站提取資料。與 GPT 不同,它沒有提供「允許所有相關網站」的選項,因此每次都請求權限:美國任務九次(均為 .gov 網站),伊朗任務九次(主要是 .ir 網域和 fa.wikipedia 來源)。我批准了所有請求。

Claude 還遇到了一個技術限制,觸發了另一種形式的人工介入。對於伊朗和美國的任務,它都無法載入即時的 GPPD 國家概況,因為該入口網站使用 JavaScript 建構頁面,而 Claude 的沙盒網路政策阻止了對世界銀行數據文件的存取。Claude 停止並詢問我是否要自行上傳頁面(PDF 格式),或在沒有該頁面的情況下繼續工作。我跳過了這個問題,它便繼續從世界銀行 GPPD DataBank API 獲取資訊。然而,DataBank 儲存的是 2018 年的數據,而該入口網站顯示的是 2022 年的概況。因此,Claude 的基準數據與 GPT 和 Muse 不同。

Muse 在任務的第四部分才請求任何權限,該部分需要註冊世界銀行網站並上傳資訊。

所有三個代理都完成了創建電子表格的任務,並描述了他們對生成結果的信心。

任務的最後一部分,即在世界銀行入口網站註冊並上傳變更,變得更加有趣,因為這需要代理採取比僅僅收集資訊更重大的行動。

Claude 和 GPT 在此點都停止了,並將註冊和上傳的任務交給我。然而,Muse 繼續進行。它沒有徵求我的同意,也沒有向我展示服務條款,就以 [email protected] 的電子郵件地址註冊了一個帳戶。您可以在此處查看 Muse 的完整對話。

下表總結了每個代理處理任務最後一部分的方式及其相關的網路安全含義。

關於 AI 實驗室是否應該暴露模型完整的思考鏈(CoT)和行動軌跡,以及如果應該,暴露多少,目前存在持續的爭論。實驗室給出了幾種保留部分資訊的理由。OpenAI 選擇不向用戶顯示 o1 的原始 CoT,理由是使用者體驗、競爭優勢以及保留 CoT 以供內部監控的價值。Anthropic 指出,原始推理可能包含不正確或未成形的想法,惡意行為者可能會利用它來構建更好的越獄方法。此外,還存在遊戲化和獎勵破解的擔憂,以及「CoT 不忠實」的問題。

然而,為了理解代理的行為,評估者需要知道事情何時以及為何發生,這只有在有監控系統並能存取代理的完整軌跡時才可能實現。對於 AI 實驗室以外的評估者來說,如果沒有這種存取權限,要完全理解代理的行為幾乎是不可能的。如果外部評估者只能看到部分軌跡,並且他們得出的任何結論都可能因為缺乏完整資訊而被駁回,那麼獨立評估的價值何在?

了解這些限制後,我盡力收集、監控和檢查我所能收集到的每個代理的工作內容,再次將自己置於一個負責更新世界銀行資訊入口網站的普通研究員的位置。

由於普通使用者無法一鍵提取代理工作軌跡的完整記錄,我實時觀看了每個代理的工作,並錄下了螢幕上所有可點擊和可見的內容。任務完成後,我將錄影交給 ChatGPT 提取文字並使其可搜尋。為了讓您了解這看起來像什麼,這裡有一個片段(左:Claude,中:Muse,右:GPT,抱歉尺寸和清晰度問題)。

自我報告的軌跡。任務完成後,我提示每個代理創建一個文字文件,描述它所做的操作,包括錯誤、如何處理錯誤、使用的變通方法、搜尋的網站等。Muse 和 GPT 各生成了一個可下載的 .txt 文件,而 Claude 則拒絕了,聲稱這違反了其安全政策,並表示「推理提取」。

也就是說,自我報告的軌跡不能完全信任;我過去曾見過代理實際操作與其報告之間存在差異。因此,我對這些報告給予了較低的權重,但如果您有興趣審閱並找出匹配或不匹配之處,文件在此處。

分析。然後,我使用輸出的 Excel 表格和從螢幕錄影中提取的文字,對數據進行了分析,既有我自己的分析,也有 Claude Code 的協助,用於篩選數據和生成表格。我親自交叉檢查了所有數據。

以下是關於每個 LLM 代理網頁使用者介面中可用的代理工作軌跡資訊量的一些資訊。

一些觀察,然後我將進入我的觀點:

所有三個代理都以流利的法語回答,但伊朗的結果遠不如美國的結果。在伊朗的 138 個 N/A 欄位中,GPT 和 Muse 各只填寫了 21 個真實值;對於美國,它們分別填寫了 51 和 64 個(共 130 個)。

對於美國,每個代理引用的 76-89% 來自官方政府網站,其餘來自合法的國際組織網站。對於伊朗,這個比例為 11-22%。

出現了低權威來源,包括一個 Telegram 頻道、一篇 Medium 文章、Grokipedia,或由 Iran International 等伊朗僑民媒體團體經營的網站。Claude 在網站無法存取時,似乎在尋找變通方法方面更為保守,並且經常偏好英語來源,即使合法性較低。

Claude 只成功打開了它嘗試的 16 個法語網頁中的 3 個。GPT 和 Muse 分別引用了 11 個波斯語來源,但分別只顯示閱讀了 3 個和 7 個。

知識空白被其他東西填補了:

Claude 使用了標題和它自己的記憶(有時與它找到的內容相矛盾),並說明了這一點。

GPT 使用了法律的轉載副本。

Muse 大部分閱讀了 2009 年的英文翻譯,但引用了官方的波斯語頁面。

我的重點不是我預期伊朗/法語任務的結果會與美國/英語任務相同。畢竟,伊朗政府讓外國 IP 位址極難存取以 .ir 結尾的官方網站和網域(您可以閱讀更多關於伊朗國家資訊網路的背景資訊)。我的重點在於代理不同的變通方法和來源優先級。

這讓我想起了 Global Voices 的人們多年來在數位權利和語言包容性方面所做的工作,包括網路中立性和語言存取。這一切對於 AI 代理時代意味著什麼?從 AI 主權的角度來看呢?AI 主權的承諾之一是語言多樣性和對本地語言的支持。LLM 的輸出品質,以及可能的安全防護措施,仍在不斷提高,但我們也需要思考在代理的推理、搜尋和優先級排序方面,語言在地化應該是什麼樣子。

透過檢視代理的軌跡,我注意到它們不僅在可存取的網站方面有所不同,而且在存取失敗時的努力程度也不同。有些代理在初始失敗後就停止了,有些則嘗試了替代路線、不同的瀏覽器、搜尋結果摘要、快取或次要來源、不同的擷取方法等等。

於是我進行了一個小型後續測試。我選擇了代理在原始任務中存取不一致的網站,並給予每個代理一個簡單的指示:「這是一個網站列表。請查找它們並為每個網站寫一段總結。」重點不是評估總結的品質,而是觀察每個代理在直接存取失敗時的行為。

在這種情況下,代理試圖存取從它們自己的技術環境中難以存取的網站。但是,當存取障礙來自使用者環境時,會發生什麼?

對於那些政府過濾或封鎖網站的國家的人們來說,LLM 或 AI 代理能否成為另一層資訊存取?它能否從使用者無法直接存取的網站檢索、總結、採取行動或傳遞資訊?代理的變通方法能否使規避審查更容易——反之,能否透過不同的技術堆疊複製新的限制?

如果您有興趣設計或開展關於此主題的實驗,請隨時透過 [email protected] 與我聯繫。

如果您閱讀法語,祝您在理解代理使用者介面上的結果時好運!

致我左右對稱的讀者和寫作者(約 7 億人):每次您在嘗試撰寫 Instagram 貼文、填寫電子表格、閱讀政府的「可存取」翻譯表格,或跨平台複製貼上文字時進行體操般的運動,我都與您同感。

免責聲明:我使用 ChatGPT 和 Claude 進行文稿編輯。我使用 Claude Code 進行表格生成和監督數據分析。

有關 AI 代理網路安全的資源,請參閱 OWASP GenAI 安全專案。

AI 代理、國家與不平等網路世界:語言與在地化挑戰AI 代理、國家與不平等網路世界:語言與在地化挑戰AI 代理、國家與不平等網路世界:語言與在地化挑戰AI 代理、國家與不平等網路世界:語言與在地化挑戰AI 代理、國家與不平等網路世界:語言與在地化挑戰AI 代理、國家與不平等網路世界:語言與在地化挑戰