利益揭露:我是 DigitalOcean 的 Solutions Architect,所以文中提到 DigitalOcean 產品時,是「業內人的觀點」而非中立第三方——這些地方我都會明確標示,其餘分析則盡量保持廠商中立。以下皆為個人觀點。
為什麼寫這個系列
幾年前,要把一個 LLM 功能上線,最難的是「讓模型能做到那件事」。到了 2026,這件事大致解決了——模型第一天就能動。真正難的是之後的每一件事:比預算高出 3 倍的帳單、心裡那個「我到底有沒有選對模型」的疑問、使用者實際感受到的延遲,以及你第一次貼上 API key 那刻,就悄悄定下來的架構。
我是一名 Solutions Architect,每天的工作就是幫團隊把推論跑在 production 上。幾乎每一次對話,都會遇到同樣的五個問題。這個系列就是這五個——用我在電話裡會跟你解釋的方式寫,而不是 pricing page 的方式。
把它當成一本實戰指南。每一篇都能單獨讀,今天哪個問題在咬你,就讀哪篇;若按順序讀,它們會串成一個故事:你正在經歷什麼 → 為什麼 → 該怎麼想 → 該怎麼架構。
五篇
-
為什麼你的 LLM 帳單是預期的 3 倍 — pricing page 上的 token 單價是地板價,不是天花板。Output token、看不見的思考 token、非生產環境流量、輸出冗長度、長 context 加價,層層疊成那張沒人編進預算的帳單。錢到底花到哪去,以及把它拉回來的四個槓桿。
-
為你的使用情境選對模型 — 模型選擇是成本與品質上最大的單一槓桿。先定出你的準確度下限,再找「最便宜能過關」的模型。深入談翻譯、RAG、程式碼、客服四種情境——以及為什麼 benchmark 是篩選器,不是判決。
-
Prompt Caching 實戰:從 7% 到 74% — 多數團隊最沒用好、卻槓桿最高的成本與延遲優化,以及那個會悄悄毀掉它的單行錯誤。內含我自己跑的實測:移動一個欄位,就讓快取命中率從 0% 升到 99%、input 成本砍掉 92%。
-
一個全端 AI 應用真正的 TCO — 網路上每一個比較都在比 token 單價,沒有一個比整個技術棧——compute、向量資料庫、儲存、網路、egress、營運。真正的數字藏在那裡;附一個你可以自己重跑的透明模型。
-
多供應商路由不是問題,而是你的架構 — 認真的團隊一開始就是多供應商。為什麼這個直覺是對的、如何按限制條件路由,以及為什麼 「goodput」——在 SLO 內、且答案正確的請求——才是真正該看的指標。
我是怎麼寫的
三個原則貫穿這五篇:
- 從你的問題出發,不是從產品出發。 每一篇開頭談的都是你真實感受過的事,不是某個功能。
- 每個數字都有出處或經過實測。 能自己量的,我就自己跑 benchmark,而不是引用廠商數字——第 3 篇的快取數據與第 4 篇的成本模型都是我自己的,而且工具都開源,你可以自己重現。
- 誠實面對取捨。 包括我經手的工具在哪裡適用、在哪裡不適用。一個你無法信任的建議,不值得讀。
如果你是盯著一張意外帳單的 CTO、正在決定要出什麼的 AI 工程師,或正在設計推論層的平台工程師——這個系列就是為你寫的。從任何一篇開始都可以。
系列文章 — Inference in Production
- 系列前言 — Inference in Production:五篇實戰指南 (你正在這裡)
- 第 1 篇 — 為什麼你的 LLM 帳單是預期的 3 倍
- 第 2 篇 — 為你的使用情境選擇正確的模型
- 第 3 篇 — 提示快取實戰——從 7% 到 74% 命中率
- 第 4 篇 — 全端 AI 應用程式的真實 TCO
- 第 5 篇 — 多供應商路由不是問題——它就是你的架構