AI 模型 · 數字

檢驗 Jev 的價格與速度說法

一塊淺色石板上刻著一短一長兩道凹槽,短槽末端有一顆小陶瓷球,長槽起點有一顆琥珀色玻璃球
以兩段長度極為不同的路程為靈感的原創抽象編輯插圖。

每一次發表都會帶著一個倍數登場,而 Jev 的倍數很大:「在同等的前沿智慧水準下」快 40 到 200 倍、輸入每百萬 token $0.042,以及輸出 token「FREE (too cheap to meter)」(免費,便宜到不值得計費)。

五天之後,公司之外只有一份量測。這篇文章把兩者並排放在一起,而兩邊的結果,都不是一則發表推文會讓你預期的樣子。

TypeSafe 公布了什麼

2026 年 9 月 15 日的發表文章給出的延遲區間是 70 到 500 毫秒,對比前沿語言模型的 3 到 329 秒,快 40 到 200 倍的說法就是這樣來的。文章還加上:在正式工作流程上快 193.6 倍、便宜 444.6 倍,以及零幻覺、零型別錯誤。

價格特殊到值得講兩次:輸入是以十億為單位計價而不是百萬,而輸出免費。TechCrunch 在 9 月 18 日的報導中,同時列出了客戶端的數字——Vercel 量到快 5 到 18 倍,另一個團隊則是比 Gemini 便宜 10 到 20 倍。

上面每一個數字,都來自 TypeSafe 或它的早期使用者。這不代表其中任何一個是錯的,但確實代表它們全都未經查證。

各項說法及其來源,讀取於 2026-09-20。
說法數字來源是否獨立?
延遲70 到 500 毫秒,對比 3 到 329 秒TypeSafe 發表文章
正式工作流程的速度快 193.6 倍TypeSafe 發表文章
正式工作流程的成本便宜 444.6 倍TypeSafe 發表文章
可靠度零幻覺、零型別錯誤TypeSafe 發表文章
價格每百萬輸入 token $0.042,輸出免費TypeSafe 價格頁屬於公告,不是量測
客戶量到的速度快 5 到 18 倍Vercel,經 TechCrunch 轉述否,由客戶自行回報

一個宣稱的區間,和唯一一個量到的平均值

LangChain 在 9 月 20 日的實驗回報每次呼叫平均 0.44 秒。把它放到和發表文章同一條軸上,它落在區間之內,靠近慢的那一端:440 毫秒對上宣稱的 70 到 500。

兩件事同時成立,而這正是有用的觀察。供應商的區間沒有被推翻,但那個頭條倍數也沒有被重現,因為倍數是一個比值,真正決定它的是基準。對上一個要花三秒的前沿模型,440 毫秒大約是快七倍,不是兩百倍。

一張圖表,顯示 TypeSafe 宣稱的 70 到 500 毫秒區間,以及 LangChain 量到的 440 毫秒平均值標在區間之內
來源:TypeSafe AI 發表文章,2026-09-15;LangChain,2026-09-20。圖表由 Ciyo 製作。(圖為英文)

同一次執行花了多少

成本的比較比較沒有模糊空間。在 LangChain 的實驗中,一次 Jev 判定花費 $0.00035,整輪重複判定合計 $0.34。同一輪改用 Claude Sonnet 4.6 則是 $28.17,差距大約 83 倍。

八十三不是四百四十四。但它也已經足以改變一個團隊的做法:當一輪評估只要三分之一美元,你就不必在覆蓋率和預算之間二選一,可以把評審跑在每一筆追蹤紀錄上,而不是只跑抽樣。

兩張卡片顯示同一輪執行量到的成本,Jev 為 $0.34,Claude Sonnet 4.6 為 $28.17
來源:LangChain,〈Jev-as-a-Judge for Agent Evals〉,2026-09-20。這是單一實驗的數字,不是基準測試。(圖為英文)

把保留事項和數字一起讀

LangChain 自己把限制寫了下來,這是一份值得讀的測試的標記。這項實驗建立在五個天氣請求上,透過一個代理程式重播。變異的結果被描述為觀察性的,而不是訓練目標造成的證據。他們也警告低成本會放大錯誤,因為一個持續判斷錯誤的評估器,會以規模產生糟糕的回饋。

他們還釘住了版本並公開程式碼倉庫,所以這次執行可以被重跑。那就是基準測試和吹噓之間的差別,而在一次發表的五天之後,這種做法比應該有的還要稀少。

為什麼免費的輸出 token 比那個倍數更重要

System One 模型回傳的是有型別的值,不是一整段文字,所以它的輸出從架構上就很小。不對它收費與其說是折扣,不如說是承認幾乎沒有東西可以收。真正有意義的數字是輸入價格,因為一份長長的追蹤紀錄就落在那裡。

TechCrunch 搬出傑文斯悖論(Jevons paradox)來形容接下來會發生的事,而這個類比正好貼合評估這件事:當一次判定便宜到不值得計算,團隊不會少花錢,而是判定得更多、面向更多、更頻繁。預算從「要不要評估」轉移到「這麼多回饋要怎麼處理」。

下一次發表該怎麼查證

在轉述一個數字之前,先找到原始來源和它的日期。問是誰做的測試,以及他們和供應商是什麼關係。找出方法:重複了幾次、對照哪個基準、在什麼任務上。接著問測試裡的任務,像不像你真正在跑的任務,因為一個模型可以很擅長為天氣答案評分,卻在其他所有事情上都未經測試。

最後,查可取用性。Jev 沒有公開權重,躲在早期使用候補名單後面,而且多半是透過 Cloudflare AI Gateway 這類基礎設施抵達使用者手上。一個你無法據以行動的數字,只是冷知識。

關於這些數字的問題

Jev 真的快 40 到 200 倍嗎?

那是 TypeSafe 針對分類任務、對比前沿語言模型給出的數字。公司之外唯一公開的量測是每次呼叫平均 0.44 秒,落在宣稱的 70 到 500 毫秒區間之內,靠近慢的那一端。

一次呼叫要多少錢?

TypeSafe 列出每百萬輸入 token $0.042,輸出免費。LangChain 量到每次呼叫 $0.00035,整輪執行 $0.34,而同一輪用 Claude Sonnet 4.6 要 $28.17。

有人好好做過基準測試嗎?

還沒有。目前只有一項窄幅實驗,附有公開的程式碼倉庫和釘住的版本,而執行它的公司在兩天後和供應商一起辦了直播。

繼續閱讀

Ciyo 書寫創意與代理工具背後的模型,並實測那些自己跑得動的。