Parloa 使用 OpenAI 模型,為企業模擬、評估並運行語音式客戶服務系統。

在 Parloa 的早期,共同創辦人 Stefan Ostwald 曾花一天時間深入一家保險公司的客服中心,當時他的團隊正在建構早期的語音互動體驗。他坐在客服人員旁邊,一遍又一遍地聽著相同的對話:密碼重設、保單問題、例行性變更。他意識到,這些工作有很大一部分是可以自動化的。

在那次經驗之後,總部位於柏林的 Parloa ⁠ (新開視窗) 開始建構基於規則的語音代理,以自動化高流量的客戶互動。

隨著 ChatGPT 的出現,該公司演進並建構了現在的 AI Agent Management Platform (AMP),該平台建立在包括 GPT‑5.4 在內的新一代模型之上。

AMP 為企業提供了一個大規模設計、部署和管理客戶服務互動的方式。團隊不再需要規劃僵化的意圖和流程,而是以自然語言定義行為,連接內部系統,並利用內建的模擬和評估快速迭代。

Parloa 端對端地運行這些互動,處理從簡單的路由到複雜的多步驟請求。重點在於生產環境的一致性,其中效能、延遲和邊緣案例都至關重要。為此,Parloa 在部署前會持續針對真實客戶情境測試模型。

Parloa 的 Agent Management Platform (AMP) 旨在讓業務使用者和主題專家能夠在不寫程式碼的情況下建構 AI 代理。

「有了 AMP,來自不同業務部門的主題專家實際上能夠以更精簡、更簡單的方式建構代理並連接 API,」O’Reilly 表示。

總體而言,AMP 讓品牌能夠管理整個 AI 代理的生命週期。它透過提供一種更簡單的方式,讓非技術團隊在代理上線前定義其行為。主題專家不再需要編寫程式碼或規劃僵化的意圖樹,而是以自然語言設定代理的角色、指示、工具和界線。這些設定成為模型提示和系統在生產環境中行為的基礎。

定義完成後,代理會在部署前進行測試。Parloa 使用像 GPT‑5.4 這樣的模型來模擬客戶對話,一個模型扮演來電者,另一個模型運行已設定的代理。團隊可以直接檢查這些互動,針對真實情境測試變更,並在正式上線前進行迭代。

隨後,相同的模型會使用確定性檢查和 LLM-as-a-judge 評分組合來評估這些對話。這顯示代理是否遵循指示、正確使用工具,以及是否如預期般完成任務。

在實際對話期間,AMP 的協調層會使用代理設定和對話上下文提示 OpenAI 模型,以生成回應、透過 RAG 檢索資訊,或觸發工具與客戶後端系統互動。Parloa 持續更新此層,採用最新一代的模型,因為它們在真實世界的效能上展現出明顯的提升。

對話結束後,獨立的 OpenAI 驅動工作流程會總結互動內容、分類客戶意圖,並根據定義的規則評估效能。

隨著代理變得越來越複雜,維護單一的單體提示變得更加困難。微小的變更可能會引入意想不到的副作用。為了解決這個問題,Parloa 引入了模組化方法。像身份驗證、預訂變更或帳戶更新等任務可以被分離成獨立的子代理,從而提高指令遵循能力,並使系統更容易隨著時間演進。

同時,該平台整合了確定性控制,在可靠性至關重要的情況下發揮作用。企業可以定義結構化的 API 鏈和事件驅動的邏輯,以確保關鍵步驟按正確順序執行,從而平衡對話的靈活性與可預測的執行。

Parloa 使用 GPT‑4.1、GPT‑5‑mini 等模型來模擬真實的客戶互動,然後在代理上線前,使用 LLM-as-a-judge 和確定性規則的組合來評估這些互動。這使得團隊能夠測試邊緣案例,快速迭代,並在客戶遇到問題前驗證效能。

Parloa 主要與大型企業合作,對這些企業而言,一致性與功能性同等重要。

「當有新模型發布時,我們會對其進行基準測試套件的運行,」資深應用科學家 Matthäus Deutsch 表示。「對我們來說,非常重要的是,事情不僅要在理論基準測試中有效,也要在實際的真實使用案例中有效。」

Parloa 並非依賴抽象的基準測試,而是模擬真實的生產代理,並透過模擬和評估管道運行它們。這些測試衡量指令遵循的可靠性、API 調用的連貫性、延遲以及在真實條件下的整體效能。

這些評估決定了哪些模型已準備好投入生產。只有在真實客戶情境中表現可靠的模型才會被部署。

「企業客戶面臨真實的遷移成本,」Deutsch 表示。「一旦系統在生產環境中運行起來,他們就會保持穩定,只有在效益明顯時才會更換。」

因此,系統在生產環境中表現得可預測,即使在大規模運行時也是如此。在數百萬次客戶互動中,大多數對話都能順利解決。即使電話被轉接給人工代理,很少是因為系統故障而需要轉接。在一次部署中,一家全球旅遊公司將轉接給人工代理的請求減少了 80%。

這種以評估為先的心態已成為核心差異化優勢,讓 Parloa 能夠快速行動,同時又不犧牲生產環境的可靠性。

語音與基於文字的聊天相比,存在一套不同的限制。每次互動都通過一個低延遲的管道運行:語音轉文字、模型推理和文字轉語音。

這個管道使得延遲變得至關重要。即使是模型層面微小的延遲,也會累積成對來電者明顯的停頓,這影響了模型的選擇和優化方式。

Parloa 與 OpenAI 密切合作,為即時使用案例優化效能,重點關注延遲、回應品質和指令遵循。該團隊在將新模型迭代部署到實際客戶互動之前,會在類似生產的環境中持續評估和壓力測試。

Parloa 獨立評估語音堆疊的每個組件:

從一開始,這些系統就為全球部署而建。基準測試涵蓋多種語言,客戶遍布全球各地區營運。這種多語言的嚴謹性反映了 Parloa 的歐洲根源以及企業客戶的期望,他們要求在不同市場上保持一致的效能,而不僅僅是單一語言或地區。

如今,Parloa 的代理已處理數百萬次跨零售、旅遊和保險等行業的對話,支援從支援自動化到產生收入的流程,例如電話購物等使用案例。

Parloa 認為客戶服務正演變成一個完全多模態的體驗。

一次對話可能始於電話,然後在聊天中繼續,並包含連結或互動元素。AMP 的設計旨在將其視為單一互動,而不是將每個步驟視為獨立的流程。隨著時間的推移,AI 代理可能會像網站和行動應用程式一樣,成為客戶旅程的核心。

隨著企業越來越多地自動化客戶互動,Parloa 專注於讓 AI 代理足夠可靠、足夠靈活、足夠值得信賴,以便在全球範圍內運行。