Interfaze 是一個新模型架構,在光學字元辨識 (OCR)、視覺、語音辨識 (STT) 和結構化輸出等九項正面對決的基準測試中,表現優於 Gemini-3-Flash、Claude-Sonnet-4.6、GPT-5.4-Mini 和 Grok-4.3 等模型。

人類在電腦級任務上效率不高。我們會犯錯,但我們擅長決策和理解細微差別。

想像一下,要求一個人閱讀一份 50 頁的 PDF,將每個字詞對應到另一份文件並標註其 XY 位置,然後將整份文件翻譯成中文。你會得到大量的錯誤,支付高昂的人事費用,並等待很長時間才能得到結果。

Transformer 模型也類似。它們在處理細微差別和人類級任務方面非常出色,也會像人類一樣犯錯,但這也是它們保持創造力的原因。

我們一直在將錯誤的模型用於錯誤的任務。

CNN/DNN 自 90 年代初就已存在,從 LeNet-5 到 ResNet,以及最近的 CRNN-CTC。

這些是深度神經網路架構,專門用於 OCR、翻譯或 GUI 偵測等任務。它們處理和感知數據的方式經過訓練,以適應特定任務,這使得它們在特定任務上的準確度高達 100 倍。它們還會產生有用的元數據,如邊界框和信心分數,讓開發人員能夠建立可預測的工作流程。

那麼,為什麼我們這麼多人仍然選擇 Transformer/LLM 來處理確定性任務呢?

DNN 不夠靈活。它們的表現僅取決於訓練數據,並且不擅長處理人類級的細微差別。

它們可能在服務上很便宜,但在維護和為新任務重新訓練方面卻很昂貴。以護照為例:CNN 可以提取出生日期,並附帶邊界框和信心分數,但它無法計算一個人的年齡。

一個新的模型架構,將 DNN/CNN 模型的專長與全方位 Transformer 相結合,讓您獲得兩全其美的優勢。

這意味著在確定性任務上實現高準確度和低成本:

雖然像 Claude Opus 4.7 和 GPT 5.5 這樣的 Pro 級模型是當今市場上用於編碼和複雜推理任務的最佳通用模型,但由於成本高昂和響應時間慢,它們通常不適用於 OCR 或翻譯等高流量任務。

Interfaze 的基準測試對象是具有相似定價層和功能集的模型,這些模型經過優化,能在最快的速度下從模型中榨取最多的性能,同時在規模化時保持低成本。

今天,大多數人為確定性開發者任務會選擇兩類模型:

↓ = 越低越好(詞錯誤率)。— = 未評分(模型沒有原生音訊輸入)。所有其他行:越高越好。

每個模型都在九項基準測試中進行正面對決:OCRBench V2、olmOCR、RefCOCO、VoxPopuli-Cleaned-AA、SOB Value、Spider-2.0-Lite、GPQA Diamond、MMMLU 和 MMMU-Pro。

Interfaze 在幾乎所有基準測試中都領先,對抗每個類別的專業模型以及通用型 Flash/Mini 模型。

我們的目標不是取代 LLM。而是專注於確定性任務。基準測試側重於 OCR、物體偵測和結構化輸出等類別,並包含 GPQA Diamond 等通用基準測試,以展示您對任何 Transformer 模型所期望的問題解決和理解水平。

Interfaze 的定價與 Gemini-3-Flash 相似,每百萬輸入 token 為 1.50 美元,每百萬輸出 token 為 3.50 美元。

我們用戶的第一大使用案例是針對圖像和複雜、長篇 PDF 的 OCR。

Interfaze 在 OCR 方面優於 Chandra OCR 和 Reducto 等 OCR 提供商,以及 Gemini-3-Flash 和 GPT-5.4-Mini 等通用模型。

這不僅僅是任務特定的 CNN 編碼器做得好。而是能夠在共享向量空間中,依賴物體偵測來處理圖形和圖像,或依賴 Transformer 的翻譯層。

如今大多數 LLM 在遵循 JSON 模式方面表現出色,但在用準確的值填充它方面卻很糟糕。沒有公開的基準測試可以衡量這些值的準確性,因此我們上週發布了 SOB(結構化輸出基準測試)。

重點摘要:SOB 提供模型正確的答案及其上下文,然後要求它生成包含其已擁有數據的 JSON 輸出。我們衡量誰最準確,錯誤和幻覺最少,涵蓋文本、圖像和音訊模式(全部正規化為文本)。

與本文檔中使用的相同 Flash/Mini 集合進行比較。請參閱完整的 SOB 排行榜,了解包括 Gemini-3.1-Pro、GPT-5.5 和 Claude-Opus-4.7 等前沿 Pro 級模型在內的全部 28 個模型。

Interfaze 在廣泛的語言中具有出色的多語言性能。

在 VoxPopuli-Cleaned-AA 上,Interfaze 在詞錯誤率方面排名第二。

Interfaze 每秒計算可轉錄 209 秒的音訊,比 Deepgram Nova-3 快約 1.5 倍,比 Scribe v2 快約 8 倍,比 Gemini-3-Flash 快 11 倍以上。

Interfaze 遵循 Chat Completions API 標準,因此任何支援 OpenAI 的 AI SDK 都可以直接使用:只需將其指向 https://api.interfaze.ai/v1 。從 Interfaze dashboard 獲取您的 API 金鑰並插入即可。

下方的每個範例都重複使用了相同的 interfaze 客戶端。

一本雜誌頁面,包含密集的colspan 文字和三張插圖。Interfaze 在同一請求中對圖像運行 OCR 和物體偵測,返回完整文本以及每個圖形的像素座標,全部符合您的模式。

object 包含模式響應:完整頁面文本以及一個 graphic_objects 陣列,其中包含每個插圖的描述和像素座標。precontext 包含相同響應中的原始 OCR(每行和每個單詞的邊界框、信心分數)。

透過我們的混合架構,您可以啟用模型的特定部分來執行特定任務,而無需使用全部權重。

它更快、更便宜,但也有一些權衡,您會獲得一個確定且一致的固定結構化輸出,並且每次請求只能運行一個任務。

使用系統提示中的 <task> 標籤,您可以控制模型哪個部分被啟用。下方,我們對手寫詩歌運行純 OCR。

響應是原始任務結果,包含 name 和 result,可直接使用。

Interfaze 內建了自己的網頁索引,該索引是透過抓取多個 SERP 索引和我們自己的爬蟲建立的。

object 返回精煉的個人資料,精確符合模式,而 precontext 包含 Interfaze 用於驗證答案的原始網頁搜索結果。

下方的片段是一個播客節目的 1 小時 35 分鐘內容。Interfaze 在約 50 秒內將其轉錄,並提供每個區塊的時間戳。

響應是如下所示的原始任務結果。

我們很高興能持續實驗、成長並發現讓確定性 AI 更高效、對所有開發者更易於使用的研究!

免費開始使用,並在您自己的文件、圖像和提示上進行嘗試。我們很期待看到您的創作!