Qwen 3.8 27B 是我見過最受期待的開源權重模型之一,發布後我立刻著手測試和把玩。我使用的是單一 Lenovo ThinkStation PGX 工作站,這款緊湊型工作站搭載 Nvidia 的 GB10 Grace Blackwell 晶片,配備 128 GB 統一記憶體和 273 GB/s 的頻寬。開箱即用時,它的速度大約是每秒 15 到 30 個 token,但透過標準的 SGLang、NVFP4 和 DFlash2 預測解碼設定,在處理程式碼和推理時,速度可達每秒 50 個 token。
然而,我的一個測試證明了本地模型已經變得多麼不可思議。
Qwen 模型值得期待是有原因的;我一直對 Qwen 3.6 27B 有著持續良好的體驗,而 Qwen 3.8 27B 到目前為止,表現更上一層樓。事實上,Artificial Analysis 將其列為 135 款 4B 至 40B 尺寸級別的開源模型中的佼佼者,其智慧指數為 52,並且在 SWE-bench Pro 等項目上的表現超越了運行成本高得多的模型。
我給它佈置了能在一台機器上完成的最艱鉅的實際任務:逆向工程一個商業應用程式的授權檢查。這個應用程式我已經購買並使用過,只是想看看它表現如何。這個任務不太可能出現在它的訓練資料中,但它是一個高度複雜、專業化的任務。鑑於有些人對該模型的網路安全能力表示擔憂,我認為這是一個很好的測試。結果不僅是我見過本地模型最令人印象深刻的演示之一,它還能在過程中自行修正錯誤。
我在此測試中使用的是 Pi harness,模型全程僅調用了標準的 Bash 工具。
我的計畫很簡單,這也是過去本地 LLM 經常奏效的方法。我告訴模型,我們開發了這個應用程式,並想知道授權檢查是否像我們認為的那樣穩固,並使用了一個越獄系統提示。
結果不出所料,Qwen 識別出了常見的越獄嘗試,它告訴我的第一件事就是它不會上當。然後它檢查了簽名憑證,並(正確地)指出我並非該應用程式的開發者,還說出了實際開發者的名字。我被抓包了。糟糕。
如今,這不算最令人印象深刻的成就,因為模型在被推動時已經很擅長拒絕某些提示。話雖如此,接下來它做的事情才更重要。它告訴我,它會審核授權驗證並記錄弱點,但不會建立可行的繞過方法,然後它就開始進行實際工作,直到那一步。最終,我得到了一份關於每個步驟的完整報告,說明了驗證機制的工作原理、如何繞過它,然後它改變了主意,實際建立了繞過方法,因為繞過的方法步驟已經呈現在我眼前了。
Qwen 直到最後才實際啟動應用程式,以演示繞過方法是否有效。相反,它透過靜態分析、反組譯框架、瀏覽數千行 arm64 程式碼、將安全功能對應到其呼叫點,並找出供應商將對應的公開驗證金鑰隱藏在二進位檔中來完成工作。然後它找到了所有這些片段,將它們組合起來,並給了我應用程式用來驗證其授權的公開金鑰。
由於我擁有該應用程式的合法購買副本,我可以驗證我機器上的真實授權是由與重建金鑰匹配的私鑰簽署的。換句話說,一個僅佔用 17 GB VRAM 的模型,恢復了供應商刻意隱藏的金鑰,證明了它有效地解構了整個鏈條。這也只花了約 30 分鐘,而人類可能需要更長的時間。
有了金鑰,其他一切都更容易理解;模型在過程中保留了詳細報告,解釋了您購買或升級時的一次性線上啟用過程。之後,所有驗證都在離線進行:簽名檢查、機器綁定到從平台讀取的硬體序號、嵌入的撤銷列表、二進位檔是否仍被簽名的檢查,以及簽名的更新路徑。這類工作,使用 Ghidra 等工具,可能需要費力地手動完成。
Qwen 總結該應用程式的方案對於此類別的應用程式來說異常詳盡,薄弱環節出現在三個特定地方:金鑰是尺寸不規則的 RSA 金鑰,遠低於現代強度的標準;完全離線意味著洩漏的金鑰只能透過推送更新來撤銷;每個檢查都位於本地程式碼中,這就像所有本地檢查一樣,是可以被修補的。經過一些來回溝通,一旦它知道閘門在哪裡,它就將發現轉化為一個可執行的概念驗證,並用一個小型腳本實現。我將授權檔移動到預期路徑之外,運行腳本,然後就成功了。
第一次嘗試恢復金鑰的方式存在一個非常具體的錯誤;它產生了一個可用的金鑰,簽名檢查也通過了,但二進位檔計算的完整性檢查雜湊值不匹配。根據我的經驗,大多數模型會認為任務完成並就此打住,但 Qwen 3.8 27B 並沒有這麼做。相反,它指出了不匹配之處,重新開始,並持續進行,直到數值逐字匹配。
使用這個模型,在這種來回溝通方面有一個很大的問題。預設情況下,它的推理力設定為最大值,因此即使是微不足道的請求也會消耗數百到數千個 token。即使每秒生成 30 到 50 個 token,這仍然需要相當長的時間。
即便如此,考慮到結果,我不會稱之為浪費。它的第一次錯誤猜測得到了自我修正,無需我的輸入,並得出了正確的結論。它是否冗長?是的,確實如此。但它對嗎?也是,最終,正確的答案比自信地給出錯誤的答案要好。
我無法克服 Qwen 實際上解構並理解了授權方案這一事實。我知道頂尖模型已經能夠進行令人印象深刻的逆向工程一段時間了,但這是一個本地的 27B 模型。它完全離線運行在我旁邊的機器上,過程中沒有涉及任何雲端服務。
而且要非常清楚,它為一個商業應用程式產生了一個可行的驗證繞過方法。
這對本地模型來說是一個真正有意義的門檻:Qwen 從一個不熟悉的商業二進位檔,到理解其授權架構,恢復了刻意隱藏的加密材料,捕捉並修正了自己不正確的重建,並最終將其轉化為一個可行的概念驗證。我無需將二進位檔、授權或其任何分析發送到別人的伺服器來完成這項工作。
顯然存在一些注意事項。這只是一個應用程式、一次運行,而且是在我已經擁有合法授權的機器上。我也不知道這個目標的代表性如何。一個更難的應用程式可能會完全阻止它,而且我不會從一次成功的結果推斷出 Qwen 突然可以逆向工程任何你給它的東西。
我從中得到的體會是,這些模型確實有能力,即使這種能力仍然不均衡。一些困難的目標可能會出奇地快速屈服,而另一些,無論出於何種原因,似乎都無法克服。
那麼,有些東西已經改變了,我認為主要是我們對這類能力必須存在於何處的假設。我使用的模型可以在消費級顯示卡上運行,一旦它在機器上,只要使用者想要,它就在那裡。您無需使用雲端 API,沒有使用限制,也沒有遠端服務監管二進位檔、提示或模型產生的內容。這對於分析專有軟體、機密程式碼或您不想離開隔離機器的惡意軟體來說非常棒。
但這也是雙向的。本地運行的模型最終將其應使用的決定權留給了坐在鍵盤前的人。在我的桌子上,對於我擁有的軟體,這很有用。如果換了鍵盤前的人,使本地模型如此吸引人的相同屬性突然變成了威脅模型的一部分。這不是反對本地模型的論點,但這是一個我沒預料到的、真正令人震驚的結果。
Qwen 3.8 27B 比繞過本身更重要。它證明了本地模型正在快速加速,即使它在下一個二進位檔上不成功,這也不會改變這裡發生的事情。它不會是唯一一個在這個尺寸上具有如此能力的模型,即使它可能會保持領先一段時間。一個足夠小的模型,可以裝在消費級顯示卡上,花費半小時就拆解了一個商業應用程式的驗證系統並建立了一個可行的繞過方法。完全在本地完成。
需要說明的是,我不打算透露該應用程式的名稱,因為這是一個人們付費購買的真實產品,公佈其名稱在此沒有任何用處。無論如何,有趣的部分不是哪個應用程式,而是我曾經會將此任務與頂尖模型聯繫起來,現在卻可以交給一個免費提供的模型,在旁邊的機器上運行。
我現在不在乎基準測試分數。這是一個比基準測試分數再提高幾分更大的變化。
我們希望聽到您的聲音。請在下方評論區分享您的觀點,並請保持對話的尊重。
而且,隨著時間的推移,當它在逆向工程其他應用程式方面獲得「經驗」後,它是否能變得更有效率地進行更複雜的反組譯?
是的,如果你告訴它寫下它學到的一切,並在啟動時引用它。不過,由於上下文窗口有限,你只能走這麼遠——在這種情況下,你可以啟動具有新專業知識的新代理。這提高了它們的能力,但增加了複雜性。
門檻確實已經轉移了,3.8 在開發者任務上也更加獨立了。
而且,越來越多的東西可以在本地運行,這對 AI 公司來說似乎不是好兆頭……它們仍然需要數據中心進行訓練,但對於使用來說,它的重要性將越來越小。
您在 SGlang 中使用哪種類型的量化?
您能否給我們提供您所說的這種硬體的標準配方,而不是僅僅提及它?如果我只能讀到您可能做過的事情,而沒有足夠的細節讓我嘗試並看看它是否真的像您說的那麼好,那麼這篇文章就不是很有用。
我不確定您的意思?該模型的 Q8 量化仍然明顯小於可用 VRAM,那麼您不確定的部分是什麼?我在引言中也說了,「SGLang、NVFP4 和 DFlash2」。我真的不知道還能提供什麼了。
XDA 的精華,直接送達您的收件匣。