Skip to main content
Photo from unsplash: full-stack-ai-tco-banner

全端 AI 應用程式的真實總體擁有成本(TCO)

Written on June 16, 2026 by Jeff Fan.

25 min read
––– views
Read in English

利益揭露:我是 DigitalOcean 的 Solutions Architect,所以文中提到 DigitalOcean 產品時,是「業內人的觀點」而非中立第三方——這些地方我都會明確標示,其餘分析則盡量保持廠商中立。以下皆為個人觀點。

前言

一位技術總監在進行供應商評估前問了一個合理的問題:「哪一家推論(inference)供應商的每 token 價格最划算?」

這是個問錯方向的問題。並不是因為 token 定價不重要——它確實重要——而是因為 token 定價頂多只代表營運一套生產級 AI 應用程式總成本的 30–50%。其餘的成本,藏在那些 token 比較試算表從來不會納入的基礎設施裡:後端運算、向量資料庫、物件儲存、容器編排、網路、可觀測性,以及工程師在橫跨三、四個不同雲端平台之間拼湊計費關係所耗費的工時。

本文要建構出完整的成本全貌——一套生產級 AI 應用程式在整個技術堆疊上實際的營運成本是多少——並指出 DigitalOcean 的全端定位在哪裡帶來結構性優勢,又在哪裡沒有。

重點摘要

  • token 價格比較並不是 TCO 比較——一旦加上運算、向量資料庫、儲存、編排、網路與營運負擔,推論通常只佔生產級 AI 應用程式成本的 30–50%。
  • 在固定模型等級的前提下,單一供應商整合會在那些永遠不會出現在 $/token 表格裡的成本上勝出:跨供應商的對外流量(egress),以及每家供應商各自的營運負擔。
  • DigitalOcean 在 Deploy 2026 發表的分析中,針對每月 100 萬筆訂單的代理程式:約 $68K/月 vs. 約 $85K(Baseten+AWS)vs. 約 $110K(AWS AgentCore)。
  • 全端整合對打造完整應用程式的團隊最有價值;對於 API 包裝型產品,或是已深度投入某家超大規模雲(hyperscaler)的團隊,價值則較低。
  • 應該事先誠實揭露的不足:沒有受管的微調/LoRA、開源模型目錄比 Together 窄,而且歐盟尚無 serverless 推論(目前歐盟資料落地(data residency)只能透過 dedicated 推論達成)。
  • 不要相信任何供應商的 TCO 表——包括這一份。請使用搭配的計算器,由下而上建立你自己的數字。

不完整比較的問題

你在網路上能找到的每一份公開 LLM 定價比較,大致都長這樣:

供應商輸入($/M tokens)輸出($/M tokens)
Together AI$0.18$0.18
Fireworks AI$0.22$0.22
Groq$0.59$0.79
Anthropic Claude Sonnet$3.00$15.00

就其範圍而言,這份比較是準確的。但這就像在比較公寓時,只列出房租,卻略過水電費、停車費、網路費,以及這棟樓的暖氣到底能不能用。標題上的數字看起來很乾淨,實際每月的支出卻高出許多。

一套生產級 AI 應用程式需要:

  • 一個推論端點(serverless 或 dedicated)
  • 後端應用伺服器(運算)
  • 用於檢索與語意搜尋的向量資料庫
  • 用於存放文件、訓練資料、日誌的物件儲存
  • 用於部署的容器編排
  • VPC 網路、負載平衡、TLS 終止
  • 監控、告警與可觀測性堆疊

當你把這些元件從不同供應商組裝起來——一個純推論 API(Together、Fireworks、Groq)外加 AWS 處理其他所有東西——你就是在疊加計費關係、跨供應商的 VPC 對接或網際網路對外流量,以及整合與維護所需的工程時間,而這些全都不會出現在 $/M token 的比較裡。


參考架構:一套生產級 AI 應用程式實際需要什麼

讓我們用一個有代表性的架構把這件事具體化:一套基於 RAG 的 AI 應用程式,每月服務 100 萬個請求,具備文件知識庫、多輪對話歷史,以及一套監控堆疊。

各元件及其 DigitalOcean 對應方案:

層級功能DigitalOcean 元件
推論LLM API 呼叫Inference Hub(serverless)或 Dedicated Inference
應用層商業邏輯、API 閘道Droplets 或 App Platform
向量資料庫語意搜尋、RAG 檢索Managed OpenSearch 或 PostgreSQL + pgvector
物件儲存文件、嵌入、日誌Spaces
容器編排部署、擴展、健康檢查DOKS(Kubernetes)
網路VPC、負載平衡、DNSVPC、Load Balancers、Managed DNS
可觀測性指標、日誌、告警Monitoring

在超大規模雲或多供應商的架構下,上述每一層都各自待在不同的計費儀表板裡。在 DigitalOcean 上,它就是一個帳號、一個 VPC、一張帳單。


TCO 數字:規模化的企業差旅代理程式

DigitalOcean 在其 Deploy 2026 大會上,針對一個具代表性的生產級工作負載發表了一份 TCO 比較:一個每月處理 100 萬筆訂單的企業差旅預訂代理程式。這個工作負載需要多輪推理、文件檢索、即時價格查詢,以及合規日誌記錄。

每月成本比較:

平台每月成本
DigitalOcean AI-Native Cloud$67,727
Baseten + AWS$84,827
AWS AgentCore$110,337

每月 TCO 長條圖:DigitalOcean $67,727、Baseten+AWS $84,827、AWS AgentCore $110,337

在這個工作負載規模下,DigitalOcean 的定價比 Baseten+AWS 便宜 20%,比 AWS AgentCore 便宜 39%。有兩個因素造成這個落差:

各層之間的對外流量費用。 當你的推論端點、向量資料庫與應用層分屬不同供應商的網路時,在它們之間移動的資料就會產生對外流量費用。在單一供應商的架構下,資料中心內部的流量通常是免費或近乎免費的。

營運負擔。 經營一套跨供應商的架構,意味著工程師要維護多套安全設定、多套計費告警、多套支援關係,以及為了串接這些原本就不是設計來協同運作的元件而寫的客製整合程式碼。這份負擔不會出現在每 token 的比較裡,但它會反映在工程團隊的產能上。

可以把它想成統包工程(general contracting)。你可以分別僱用一位結構工程師、一位水電工、一位水管工和一位木工——每個人在自己的專業上大概都很出色。或者,你可以僱用一位統包商,由他來協調所有人。每個工種的單項費用,找統包商可能會稍微高一點,但你換來的是單一的責任歸屬、一份要審閱的合約,以及一位早已解決過協調問題的人。對於小型、簡單的整修,分開找各工種沒有問題。但對於有時程壓力的複雜整修,統包商模式在總成本上始終勝出。

圖鑑式對照:四組分散的供應商工具包,對比一條整合的工具腰帶

別只看供應商的數字——自己算一遍

供應商的 TCO 表是一個起點,而不是定論。因此,與其要你相信上面那些數字,這裡提供一個透明、由下而上的模型,讓你可以自己重跑與修改。它計算的是一個更簡單的參考工作負載——一套每月 100 萬個請求的 RAG 應用程式(每個請求約 2,500 個輸入 / 600 個輸出 token),兩邊都採用相同的開放權重模型等級,這樣這份比較就能把除了 token 價格以外的所有因素隔離出來:

細項(每月)單一供應商多供應商
推論(tokens)$2,015$2,015
應用運算$192$240
向量資料庫 / 搜尋$210$350
物件儲存$25$30
編排 + 負載平衡 + 監控$60$110
跨供應商對外流量$0$135
營運負擔(工程工時)$0$3,040
總計$2,502$5,920
推論佔總成本比例81%34%

在這個情境下,單一供應商整合便宜了 58%——而且請注意這個落差來自哪裡。推論那一行是相同的(同一個模型)。整個差異就是跨供應商的對外流量,以及經營兩家供應商而非一家所帶來的營運負擔——正是 token 價格表所略過的那些成本。另外也請注意,隨著流量上升,固定的營運負擔會被攤平:在每月 500 萬個請求時,同一個模型顯示單一供應商便宜約 24%,這恰好落在 DigitalOcean 公布數字的 20–40% 區間之內。

堆疊長條圖:推論只佔總成本少數,基礎設施與營運負擔才是大宗

兩點誠實的提醒:這是一個比 DigitalOcean 企業差旅代理程式情境更小、更簡單的工作負載(一個多步驟的代理程式每筆訂單會發出許多次前沿模型呼叫,這就是為什麼它的絕對數字高出許多),而營運負擔這一行則是整份模型中最值得爭論的單一假設——它之所以被設計成一個明確、可調整的輸入值,正是為了讓你能對它提出質疑。重點不在於那個確切的金額;而在於推論只佔總成本的少數,而大部分的成本都藏在每 token 比較永遠不會顯示的那些層級裡。完整的模型就在搭配的計算器裡——改變輸入值,你會看到這個結構依然成立。


全端整合在哪裡最有價值

並非每個團隊都能從全端做法中獲得同等的好處。理解它在哪些條件下創造最大價值:

最有價值的情境:

  • 打造完整應用程式的團隊——需要整個技術堆疊、而不只是一個推論端點的新創公司與產品團隊。你需要解決的整合問題越少,出貨速度就越快。
  • 有資料落地(data residency)需求的 EMEA 客戶——主要的純推論供應商(Together AI、Fireworks AI、Groq)只在美國的資料中心提供 serverless 推論。對於受 GDPR 規範的歐洲客戶而言,這是一個合規上的阻礙,而不是偏好問題。DigitalOcean 在阿姆斯特丹營運歐盟 GPU 基礎設施(NVIDIA 裸機 GPU),因此今天就能在該基礎設施上,透過 dedicated / 自管 推論達成歐盟落地的推論。請注意這個誠實的提醒:截至撰稿時,歐盟區域並沒有 serverless 推論端點——若要用 serverless,所有供應商(包括 DO)都只有美國區域可選。歐盟落地目前指的是 dedicated,而非 serverless。
  • 以營運簡化為最佳化目標的團隊——單一 VPC、單一控制平面、單一支援團隊。對於那些基礎設施複雜度是真實負擔的團隊,整合是划算的。
  • 每月 AI 基礎設施支出在 $50-500K 的中端市場公司——在這個規模下,多供應商管理的營運負擔已具實質意義,但工程團隊又還沒大到能配置專責的平台工程師來管理每一家供應商關係。

價值較低的情境:

  • 已投資現有 AWS 或 GCP 基礎設施的團隊——如果你的應用程式已經跑在某家超大規模雲上,且團隊在那裡有深厚的專業,那麼加上一個推論端點只是外掛,而非整套遷移。轉換成本很高;整合帶來的邊際效益則較低。
  • 單一 API 呼叫就是整個產品的工作負載——如果你打造的是一層薄薄地包裝在前沿模型外的東西,沒有向量資料庫、沒有文件儲存、也談不上什麼應用層,那麼全端的故事就不適用。直接挑一家對你的使用情境而言模型最好的推論供應商即可。
  • 需要專門前沿模型的團隊——DO 的開源模型目錄對開放權重模型來說很扎實,但如果你的工作負載需要在最新前沿模型發表當天就用上它,那麼封閉 API 供應商(Anthropic、OpenAI 直連)才是自然的選擇,而 DO 則可能用於非推論的基礎設施。

單一帳單的優勢:那些不會出現在試算表裡的東西

全端整合的營運效益是真實存在的,但事前很難量化。有幾個一再出現的模式:

安全攻擊面縮減。 供應商越少,就有越少的 API 金鑰要輪替、越少的 IAM 設定要維護、越少的稽核日誌要彙整。安全是一項隨供應商數量倍增的成本。

除錯效率。 當一起生產事故橫跨你的推論端點、向量資料庫與應用層時,跨三家供應商的日誌與支援團隊去做根因分析,明顯比在單一平台的可觀測性堆疊內追蹤同一起事故要慢得多。

成本可預測性。 多供應商架構產生的帳單更難預測——不同的計費週期、不同的定價模型、不同的用量指標。一張採用一致計價單位的帳單,能降低財務團隊的負擔,並讓預算規劃更可靠。

供應商關係的單純性。 一個客戶團隊、一次企業協議談判、一條支援升級路徑。在規模化之下,這種營運上的簡化具有實質的金錢價值。


誠實的評估:DigitalOcean 的不足之處

這個系列文章價值的一部分,在於直接面對不足,而不只是談優點。以下是 DO 還沒有答案的地方:

  • 微調與 LoRA。 DO 目前並未針對客製模型變體提供受管的微調。需要把基礎模型調整以適應專有領域資料的團隊——法律、醫療、高度專業的工業領域——必須進行微調,這意味著要麼自行託管,要麼使用有受管微調的供應商(Together AI、Fireworks AI、Replicate)。
  • 開源模型目錄的廣度。 Together AI 擁有市場上最廣的開源模型目錄。對於需要評估數十種開放權重模型變體的團隊,Together 的目錄深度是一項實實在在的優勢。
  • 沒有中東資料中心。 對於有海灣合作委員會(GCC)資料落地需求的客戶,DO 在該地區沒有可用區(AZ)。

這些不足值得在客戶於概念驗證(PoC)中自行發現之前先行揭露。一家對自己做不到的事誠實的供應商,在它做得到的事上會贏得更多信任。


為你的工作負載建立完整的 TCO 全貌

在作結之前,這裡提供一個實用的框架,讓你建立自己的 TCO 比較:

  1. 列出你的應用程式所需的每一個基礎設施元件——不只是推論,還有運算、資料庫、儲存、網路、可觀測性
  2. 在候選平台上為每個元件定價——納入元件之間的對外流量,這是多供應商架構會產生、而單一供應商架構能避免的
  3. 加上工程負擔——橫跨每多一家供應商所需的整合、維護與排障人時。即使只是粗略估計(每多一家供應商每月 2 天),在工程師年薪 $150K 以上的前提下,也會實質改變這份比較
  4. 及早對合規需求進行壓力測試——資料落地、GDPR、SOC2、HIPAA 等需求可能直接淘汰掉某些供應商,而且在架構設計階段就攤開來討論,會比到安全審查時才浮現要好
  5. 以實際的 P95 流量為流量建模——擁有激進免費額度的推論供應商,在低流量時看起來很便宜;但到了生產規模,單位經濟效益往往會翻盤

答案不會永遠偏向全端整合。但那些在敲定架構之前先做過這項分析的團隊,十二個月後遇到的意外始終比較少。


總結

token 定價比較並不是 TCO 比較。一套完整的 AI 應用程式,其營運成本是推論支出的 2–3 倍——當你把每一次生產級部署都需要的運算、儲存、網路、資料庫與營運負擔都算進去之後。

Deploy 2026 針對每月 100 萬筆訂單的企業差旅代理程式所做的 TCO 分析:

  • DigitalOcean AI-Native Cloud:$67,727/月
  • Baseten + AWS:$84,827/月(多 25%)
  • AWS AgentCore:$110,337/月(多 63%)

全端優勢來自三個地方:沒有跨供應商的對外流量費用、整合後的營運負擔,以及單一的計費關係。它對打造完整應用程式的團隊、有 GDPR 需求的 EMEA 客戶,以及基礎設施複雜度是真實負擔的中端市場公司,最有價值。

而它對已深度投資現有超大規模雲的團隊、純 API 包裝型產品,或需要在第零天就取得前沿模型的工作負載,價值較低。

正確的框架:建立完整的基礎設施元件清單,在候選平台上為全部元件定價,加上工程負擔,並在做出架構決策之前先攤開合規需求。


這是「生產環境中的 LLM 推論」五篇系列文章的第 4 篇。第 1 篇談 LLM API 成本隱藏的內部結構。第 2 篇談模型選擇方法論。第 3 篇深入探討 prompt 快取(cache)。第 5 篇談多供應商路由架構。


參考資料


系列文章 — Inference in Production

Tweet this article

Enjoying this post?

Don't miss out 😉. Get an email whenever I post, no spam.

I write 1-2 high quality posts about front-end development each month!

Join - other subscribers