AI 模型正快速演進:今天最適合用於代理程式編碼的模型,三個月後可能就變成來自不同供應商的全新模型。此外,實際應用案例通常需要呼叫多個模型。您的客戶支援代理程式可能會使用快速、便宜的模型來分類使用者的訊息;使用大型、具備推理能力的模型來規劃其動作;並使用輕量級模型來執行個別任務。
這意味著您需要存取所有模型,同時避免在財務和營運上受制於單一供應商。您還需要有適當的系統來監控跨供應商的成本、確保在其中一個供應商發生故障時的可靠性,以及管理使用者所在位置的延遲。
無論何時建構 AI 應用程式,都會面臨這些挑戰,但在建構代理程式時,這些挑戰會變得更加迫切。一個簡單的聊天機器人可能每個使用者提示只進行一次推論呼叫。而一個代理程式可能會將十次呼叫串聯起來以完成單一任務,如此一來,單一緩慢的供應商增加的延遲就不再是 50 毫秒,而是 500 毫秒。一次失敗的請求不再只是需要重試,而是可能導致下游一連串的失敗。
自從推出 AI Gateway 和 Workers AI 以來,我們看到開發者在 Cloudflare 上建構 AI 驅動應用程式的採用率極高,並且我們一直在快速迭代以跟上腳步!在過去幾個月裡,我們更新了儀表板,增加了零設定的預設閘道、對上游故障的自動重試,以及更精細的日誌控制。今天,我們正將 Cloudflare 打造成一個統一的推論層:一個 API,讓您能存取任何供應商的任何 AI 模型,且專為快速和可靠而建。
從今天起,您可以使用與 Workers AI 相同的 AI.run() 綁定來呼叫第三方模型。如果您正在使用 Workers,從 Cloudflare 託管的模型切換到 OpenAI、Anthropic 或任何其他供應商的模型,只需一行程式碼的變更。
對於不使用 Workers 的使用者,我們將在未來幾週內發布 REST API 支援,因此您可以從任何環境存取完整的模型目錄。
我們也很高興地宣布,您現在可以透過單一 API 存取 12 個以上供應商的 70 多種模型 — 只需一行程式碼即可在它們之間切換,並使用一組信用額度支付費用。而且我們正在快速擴展這項服務。
您可以瀏覽我們的模型目錄,尋找最適合您使用案例的模型,從託管在 Cloudflare Workers AI 上的開源模型到主要模型供應商的專有模型。我們很高興能擴展對 Alibaba Cloud、AssemblyAI、Bytedance、Google、InWorld、MiniMax、OpenAI、Pixverse、Recraft、Runway 和 Vidu 等供應商模型的存取 — 他們將透過 AI Gateway 提供模型。特別值得一提的是,我們正在擴展模型產品,納入圖像、影片和語音模型,以便您能夠建構多模態應用程式。
透過單一 API 存取所有模型也意味著您可以在一個地方管理所有 AI 支出。如今,大多數公司平均使用 3.5 個模型,分散在多個供應商之間,這意味著沒有單一供應商能為您提供 AI 使用情況的全面視圖。透過 AI Gateway,您將獲得一個集中化的位置來監控和管理 AI 支出。
透過在請求中包含自訂中繼資料,您可以根據您最關心的屬性細分成本,例如免費與付費使用者、個別客戶或應用程式中的特定工作流程的支出。
AI Gateway 讓您能透過單一 API 存取所有供應商的模型。但有時您需要運行一個您根據自身數據進行了微調的模型,或是一個針對特定使用案例優化的模型。為此,我們正在努力讓使用者能夠將自己的模型帶到 Workers AI。
我們絕大多數的流量來自企業客戶的專用實例,他們在我們的平台上運行自訂模型,而我們希望將此服務擴展到更多客戶。為此,我們利用 Replicate 的 Cog 技術來協助您將機器學習模型容器化。
Cog 的設計非常簡單:您只需要在 cog.yaml 檔案中寫下依賴項,並在 Python 檔案中編寫推論程式碼。Cog 會抽象化打包 ML 模型的所有複雜事項,例如 CUDA 依賴項、Python 版本、權重載入等。
以下是一個 predict.py 檔案的範例,其中包含一個用於設定模型的函式,以及一個在收到推論請求(預測)時執行的函式:
然後,您可以運行 cog build 來建構您的容器映像,並將您的 Cog 容器推送到 Workers AI。我們將為您部署和服務模型,然後您可以透過您慣用的 Workers AI API 存取它。
將 Workers AI 模型與 AI Gateway 結合使用,對於建構即時代理程式來說尤其強大 — 使用者對速度的感知取決於首次 token 的時間,或者代理程式開始回應的速度,而不是完整回應所需的時間。即使總推論時間為 3 秒,首次 token 提前 50 毫秒的響應速度,也能讓代理程式感覺敏捷,而不是遲鈍。
Cloudflare 在全球 330 個城市的數據中心網絡意味著 AI Gateway 能夠同時靠近使用者和推論端點,最大限度地減少串流開始前的網路時間。
Workers AI 的公共目錄也託管開源模型,其中現在包括專為代理程式設計的大型模型,例如 Kimi K2.5 和即時語音模型。當您透過 AI Gateway 呼叫這些 Cloudflare 託管模型時,由於您的程式碼和推論運行在同一個全球網絡上,因此無需額外的公共網路跳轉,從而為您的代理程式提供可能的最低延遲。
在建構代理程式時,速度並非使用者關心的唯一因素 — 可靠性也很重要。代理程式工作流程中的每個步驟都依賴於之前的步驟。可靠的推論對代理程式至關重要,因為一個呼叫的失敗可能會影響整個下游鏈。
透過 AI Gateway,如果您呼叫一個在多個供應商上都可用的模型,而其中一個供應商發生故障,我們將自動路由到另一個可用的供應商,而無需您編寫任何故障轉移邏輯。
如果您使用 Agents SDK 建構長時間運行的代理程式,您的串流推論呼叫也能抵抗斷線。AI Gateway 會在串流回應生成時進行緩衝,獨立於您的代理程式的生命週期。如果您的代理程式在推論過程中被中斷,它可以重新連接到 AI Gateway 並檢索回應,而無需進行新的推論呼叫或為相同的輸出 token 付費兩次。結合 Agents SDK 內建的檢查點功能,最終使用者根本不會注意到。
Replicate 團隊已正式加入我們的 AI 平台團隊,以至於我們甚至不再將自己視為獨立的團隊。我們一直在努力整合 Replicate 和 Cloudflare,包括將所有 Replicate 模型引入 AI Gateway,以及將託管模型重新平台化到 Cloudflare 基礎設施上。很快,您將能夠透過 AI Gateway 存取您在 Replicate 上喜愛的模型,並在 Workers AI 上託管您在 Replicate 上部署的模型。
若要開始,請參閱我們的 AI Gateway 或 Workers AI 文件。透過 Agents SDK 深入了解如何在 Cloudflare 上建構代理程式。