挑戰者 AMD 在資料中心 GPU 市場能否從領導者 NVIDIA 手中搶下市占率,將取決於其 AI 軟體堆疊 ROCm 的成敗。要挑戰 NVIDIA 的 CUDA 及其龐大的既有基礎,這被許多人視為全球最有價值公司最重要的護城河,這似乎是一項極其艱鉅的任務。

「這就像爬山——一步一步來,」AMD AI 軟體副總裁 Anush Elangovan 在接受 EE Times 獨家專訪時表示。「確定方向,鎖定目標,剩下的就會跟著來。」

Elangovan 在兩年半前 AMD 收購了他的新創公司 Nod.ai 後加入 AMD。這家新創公司擁有 30 名員工,曾投入五到六年的時間開發 AI 編譯器,並以其對 Shark、Torch.MLIR 和 IREE 等重要 AI 儲存庫的主要貢獻者而聞名。Nod 一直與超大規模雲端服務供應商、企業和新創公司合作,提供其基於編譯器的自動化軟體。

EE Times 上一次與 AMD 談論 ROCm 是在 Nod 收購之前。在那次採訪中,AI資深副總裁 Vamsi Boppana 表示,ROCm 是 AMD 的首要任務,公司目標是統一 AMD 不同硬體類型(CPU、GPU 和 FPGA)的 AI 堆疊。

Elangovan 表示,自那時以來,ROCm 已獲得了兩年半的持續投資。

「當時的 ROCm 是一堆零件的集合,」他說。「它最初是為 ASIC 提供韌體——像是,這裡有一塊韌體,那裡有一塊韌體,我們把它們綁在一起。」

今天的 ROCm 團隊正努力效仿 Elangovan 在創立 Nod 之前曾任職的 Google Chrome 團隊。

「如果你是 Chrome 使用者,你可能不知道你正在使用哪個版本——你不在乎,因為它就是能用,」Elangovan 說。「我們已經透過 ROCm 達到了這個境界。在接下來的幾個版本中,我們將達到六週的發布週期。我們將達到一個它就是能用,並且變得無形的境界。」

Elangovan 表示,ROCm 團隊已經趕上了最初的差距,現在需要繼續盡可能快速地推進。

Boppana 兩年半前談到的 AI 堆疊統一,在 Elangovan 和 Nod 團隊的領導下已經實現。內部稱之為 OneROCm,雖然有些部分仍然是硬體特定的,但所有加速都透過 ROCm 堆疊進行,Elangovan 表示。這使得在不同類型的 AMD 硬體之間實現了可移植性。

Elangovan 表示,兩年前,在 NVIDIA 和 AMD GPU 之間實現可移植性可能是一件大事,但現在這個負擔已經減輕,因為人們通常在堆疊的更高層級工作。這一轉變部分得益於 OpenAI 的開源 AI 框架 Triton。

「過去,重點是將 CUDA 核心轉換為 HIP 核心,」Elangovan 說。「但越來越多人轉向 Triton,它成為了 GPU 編程的偉大均衡器。這個偉大的均衡器讓你能夠編寫一個 Triton 核心,並在 AMD 或 NVIDIA 上運行。我們對此進行了大量投資。」

Nod 的一位關鍵工程師正在 AMD 領導 Triton 的工作,並與 OpenAI 密切合作。AMD 也大力投資了 MLIR,這是一個用於加速器的編譯器基礎設施,而前 Nod 團隊繼續維護 Torch.MLIR,這允許將代碼重新定位到不同的硬體類型。

Elangovan 表示,從 CUDA 代碼轉換已不再是常見的要求,因為大多數推理客戶都使用 vLLM 或 SGLang,運行幾個大型語言模型之一,並且完全專注於實現每秒最大的 token 數量。

「我們的團隊擁有 Triton 核心,所以如果出現我們沒有預料到的新注意力演算法,Triton 將是萬能的,但在一兩天內,我們就會為速度建構一個優化版本,」他說。「一旦我們證明部署能力相同,他們就可以執行 pip install vLLM,其他一切都包含在內。」

HIPify 對於 HPC 客戶仍然可用,但總體而言,Elangovan 表示,他依賴 Claude 等 AI 工具來編寫和驗證新的 AMD 核心。

「Claude 比 HIPify 更好,因為它內建了網路搜尋功能。」

ROCm 是 100% 開源的,除了韌體之外。Elangovan 表示,雖然開源使 ROCm 受到開發者社群的嚴格審查,但這也意味著 ROCm 可以以社群創新的速度發展,而不是 AMD 的速度。

「這樣,你可以拿走它並隨心所欲地使用它,並進行創新,」他說。「每個人都可以在他們想要的任何地方切入,無論是編譯器還是運行時,他們的限制在於他們的能力,而不是 AMD 與他們合作的速度。」

AMD 為建立其開發者社群設定了積極的目標,目前正積極開展開發者外展活動。至關重要的是,ROCm 現在開箱即可在配備 AMD Strix Halo 的筆記型電腦上運行,AMD 希望這能幫助吸引開發者到該平台。Elangovan 表示,該公司通常會在發布 Instinct 資料中心硬體版本當天,同時發布 Windows 筆記型電腦的 ROCm 更新。

Elangovan 表示,與開發者社群直接互動「非常、非常重要」。

Elangovan 形容自己是一個不情願的 X (Twitter) 使用者,他加入該平台是為了向開發者提供公司正在進行工作的基礎視角。

「人們開始關注,這就成了我的副業之一,」他笑著說。

Elangovan 個人監控 X 關鍵字,包括「ROCm」、「ROCm 爛透了」、「AMD 軟體無法正常工作」,並對每一個都做出回應。

「大多數情況下只是教育問題,」他說,並補充說他個人盡可能為匿名開發者提供建議和支持。

去年,AMD 在 GitHub 上針對 ROCm 的抱怨進行了民意調查,收到了 1,000 多份回覆。其中許多與支援舊硬體有關,這些硬體現在由 AMD 或社群支援,一年後,所有 1,000 項抱怨都已得到解決,Elangovan 表示。AMD 有一個團隊正在處理 GitHub 的抱怨,但 Elangovan 繼續鼓勵開發者在 X 上發聲,他總是樂於傾聽。

「這真的改變了氣氛,從 AMD 開發者對任何不支援的驅動程式感到非常惱火,到相信他們的努力得到了讚賞,」他說。「通常,當我們解決問題時,會產生倍數效應,因為人們會想,我喜歡這個解決方案……我知道 AMD 有用,我很樂意嘗試一下。」

Elangovan 對即將推出的 MI450(預計於 2026 年下半年出貨)感到「非常興奮」,但在此之外,該團隊也開始研究 ROCm 的功能,使其與 CUDA 區別開來,而不僅僅是一個開發者可以建立的穩健平台。

「我們希望 ROCm 成為一個你可以建立 10 年的平台,」他說。「你不必擔心當新硬體出現時會發生什麼。」

同時,Elangovan 依賴他的創業經驗——多年的起伏,最終使 Nod 開發的編譯器技術被幾乎所有加速器公司使用。

「我們需要在我們的道路上保持信念,然後一步一步來,」他說。