企業導入 AI 客服或知識庫機器人時,LLM API 費用在月處理 10 萬則對話的規模下,經濟型與旗艦型模型的費用差距可達百倍以上。本文以 2026 年 9 月當日 OpenAI、Anthropic、Google 三家官方定價為基礎,提供 1 萬、10 萬、100 萬則對話的實際月費試算,協助您在選型階段就抓對預算數量級。
為什麼同樣是「聊天機器人」,費用可以差百倍
LLM API 採按 token 計費,token 可簡單理解為文字被切分後的最小單位,中文一個字大約對應 1-2 個 token。費用差距主要來自兩個變數:一是選用的模型等級(同一家廠商的經濟型與旗艦型模型定價可以差到數十倍),二是每則對話實際消耗的 token 量(受系統提示長度、對話歷史與知識庫檢索片段影響)。多數企業在評估階段只看「這個模型比較準」,卻沒有把用量規模乘進去,導致上線後帳單遠超預期。
實務上更容易被忽略的是,同一個 Agent 在不同對話情境下消耗的 token 量本身就不固定:一句「請問營業時間」與一段需要引用三份合約條文比對的客訴回覆,輸入 token 量可能相差十倍以上。若試算時只用單一平均值估算,很容易低估尖峰情境下的實際費用,建議在正式上線前先用真實情境分佈估算,而不是只用單一對話長度代表全部用量。
2026 年 9 月官方定價比較(每百萬 tokens,美元)
以下定價於 2026 年 9 月 15 日當日直接查詢 OpenAI 官方定價頁、Anthropic(Claude)官方定價頁 與 Google Gemini API 官方定價頁。
| 廠商 | 級別 | 代表模型 | 輸入(USD / 百萬 tokens) | 輸出(USD / 百萬 tokens) |
|---|---|---|---|---|
| OpenAI | 經濟型 | GPT-5-nano | $0.05 | $0.40 |
| OpenAI | 中階 | GPT-5.6 Luna | $0.20 | $1.20 |
| OpenAI | 旗艦型 | GPT-6 Astra(短上下文) | $10.00 | $50.00 |
| Anthropic | 經濟型 | Claude Haiku 4.5 | $1.00 | $5.00 |
| Anthropic | 中階 | Claude Sonnet 5 | $2.00 | $10.00 |
| Anthropic | 旗艦型 | Claude Opus 5 | $5.00 | $25.00 |
| 經濟型 | Gemini 2.5 Flash-Lite | $0.10 | $0.40 | |
| 中階 | Gemini 3.8 Flash | $0.75 | $3.75 | |
| 旗艦型 | Gemini 3.1 Pro Preview(≤20 萬 tokens) | $2.00 | $12.00 |
可以看到三家廠商的經濟型模型定價非常接近,真正拉開差距的是旗艦型模型,尤其輸出端的定價落差最大。企業客服情境多數以「簡短回答」為主,輸出 token 量通常遠低於輸入,因此輸入定價的影響力在實務上往往更大。
月費實際試算:1 萬 / 10 萬 / 100 萬則對話
試算假設:每則對話平均消耗 1,500 tokens 輸入(含系統提示、對話歷史與 RAG 檢索片段)與 400 tokens 輸出,此為諾訊科技依實際專案觀察的合理假設,僅反映純 LLM API 用量,不含向量資料庫、伺服器或人力成本。金額為美元,因 LLM API 本身以美元計費;換算新台幣僅供參考,以 1 美元約當 NT$32 估算(諾訊科技估算匯率,非官方牌告)。
| 廠商/級別 | 每則對話成本 | 月費 @ 1 萬則 | 月費 @ 10 萬則 | 月費 @ 100 萬則 |
|---|---|---|---|---|
| OpenAI 經濟型(GPT-5-nano) | $0.00024 | $2.4 | $24 | $235 |
| OpenAI 旗艦型(GPT-6 Astra) | $0.035 | $350 | $3,500 | $35,000 |
| Anthropic 經濟型(Haiku 4.5) | $0.0035 | $35 | $350 | $3,500 |
| Anthropic 旗艦型(Opus 5) | $0.0175 | $175 | $1,750 | $17,500 |
| Google 經濟型(Flash-Lite 2.5) | $0.00031 | $3.1 | $31 | $310 |
| Google 旗艦型(Pro 3.1 Preview) | $0.0078 | $78 | $780 | $7,800 |
從這張表可以看出兩個重點:第一,同一家廠商內部經濟型與旗艦型的費用差距可達百倍(如 OpenAI 從 $2.4 到 $350,@1 萬則對話);第二,10 萬則對話規模下,選錯模型等級的年度費用差距可能高達新台幣百萬元以上,這也是為什麼模型選型不該只看「哪個比較聰明」。
開源模型自架划算嗎?
開源模型(如 Llama 系列、Mistral 系列)本身沒有 token 費用,但需要自行租用或建置 GPU 主機、負擔模型維運與更新的工程成本。以中小型企業每月 10 萬則對話的規模,自架 GPU 主機的固定成本(每月可能落在數百至數千美元,依機型而定)往往高於直接呼叫經濟型 API,只有在對話量達每月數百萬則以上、且已有 GPU 維運能力的企業,自架才可能划算。依諾訊科技 2026 年的接案觀察,多數中小企業客戶在用量爬升到自架划算的門檻前,通常已經先擴大了其他業務規模,因此直接採用 API 服務仍是更務實的起點。
另一個常被低估的因素是模型更新的維運責任:呼叫 API 服務時,廠商會持續在背後汰換與優化模型版本,企業幾乎不用介入;但自架開源模型代表企業要自行追蹤上游模型的版本更新、評估是否要升級,以及處理升級後可能出現的行為差異,這部分的工程人力成本,經常沒有被算進最初的自架划算與否的評估裡。
除了選模型,還有哪些方法能降低費用
選對模型等級只是控制費用的第一步,實務上還有幾種常見做法可以在不換模型的前提下,進一步壓低每月帳單:
- 快取常見問答:將高重複率的問題(如營業時間、退換貨政策)預先快取答案,不必每次都呼叫 LLM。
- 縮短系統提示:系統提示是每次對話的固定成本,精簡措辭可直接降低每則對話的輸入 token 量。
- 分流簡單問題:用規則式判斷或關鍵字比對先過濾簡單問題,只有真正需要理解語意的問題才呼叫 LLM。
- 控制 RAG 檢索片段數量:知識庫檢索回傳的片段數量與長度直接影響輸入 token,可透過調整檢索參數控制成本。
常見誤區與避坑提醒
以下是企業在試算 LLM API 費用時最常見的幾個誤區,多數不是計算錯誤,而是漏看了會隨時間或規模放大的變數。
- 只看單則對話成本,忽略規模效應:單則幾分錢看似便宜,但乘上每月數十萬則對話後金額差距會被放大。
- 忽略輸出 token 的隱藏成本:多數廠商的輸出定價是輸入的 5-10 倍,若 Agent 容易產生冗長回答,成本會不成比例上升。
- 沒有設定用量上限:LLM API 預設沒有硬性上限,若 Agent 邏輯出現迴圈或被濫用,帳單可能在短時間內暴增。
- 把試算當成保證:實際 token 用量會隨對話複雜度波動,建議先以小規模上線觀察真實用量,再放大預算規劃。
選廠商不是只看價格
預算量級抓定之後,價格就不再是唯一該考慮的變數。以下是我們在每個專案都會一併評估的幾個實務因素:
- 上下文視窗與文件長度:如果知識庫包含長篇技術手冊或合約文件,模型能接受的最大上下文長度,會決定您能否把完整文件當作上下文直接送入,還是必須切得更細,這本身也會影響 RAG 檢索的成本。
- 工具呼叫與結構化輸出的穩定性:如果 Agent 需要呼叫內部 API 或回傳給下游系統的嚴謹 JSON 格式,就需要挑選 Function Calling 表現穩定的模型;較便宜的模型較容易產生格式錯誤的輸出,導致需要重試邏輯,這其實是隱藏在 token 費用之外的額外成本。
- 速率限制與延遲:高流量的客服情境需要事先確認廠商在您預計使用的方案等級下,每分鐘請求數與每分鐘 token 數的上限,而不是只看牌告價格——對話進行到一半撞到速率限制,體驗上比多付一點單價費用更糟。
- 資料處理與合約條款:受規管產業的企業客戶在簽約前應該逐一確認各家廠商的資料保留政策與是否選擇退出訓練用途,這些條款在不同廠商、甚至同一廠商不同方案之間都可能不同。
這些因素都不會出現在單純的每 token 定價表裡,但足以讓一個原本看起來便宜的選項整個出局,也可能讓企業願意為特定情境多付一點單價,換取更穩定的行為表現。
多模型策略經常勝過只選一家廠商
我們建置過的企業級專案,很少真的每一則請求都只用同一個模型。更常見的做法是分層路由:用經濟型模型當作第一層分類器或處理簡單的事實查詢,只有在對話被判斷為複雜、模糊或高風險時(例如涉及退款、客訴,或 Agent 信心不足的請求),才升級呼叫中階甚至旗艦型模型。由於同一家廠商的經濟型模型往往比旗艦型便宜 10-50 倍,即使只是把 70-80% 的流量導向較便宜的層級,也能大幅降低總體 LLM 支出,同時把品質保留給真正需要的對話。建置這套路由邏輯的工程成本,相較於對話量攀升到每月數十萬則之後累積下來的節省金額,其實相當有限。
模型選擇與架構設計互相影響
模型定價只是故事的一半,Agent 的架構設計方式,會決定您實際要付多少這個定價。每一輪對話都把完整歷史重新送出的聊天機器人,消耗的輸入 token 會遠高於先把較早的對話摘要、只保留近期上下文的做法。同樣地,一次 RAG 查詢檢索十個文件片段的成本,會是精心調校成只檢索三個高相關片段的好幾倍。這些架構決策都不會出現在廠商的定價頁面上,但兩者都可能讓實際帳單,在不換模型的情況下,出現 2-3 倍的差距——這也是為什麼前面的試算表應該被當成架構決策的起點,而不只是選模型的依據。
如何解讀本文的數字
本文的每則對話費用試算,是以「1,500 輸入 token + 400 輸出 token」為假設基準,這是諾訊科技依實際專案觀察整理出的合理情境,用來說明費用結構如何隨模型等級與用量變化,並非您實際專案的保證數字。真實對話的 token 量會依系統提示長度、對話輪數與知識庫檢索片段多寡而有落差,簡短的是非題型客服對話可能遠低於這個假設,需要多輪推理或長文件比對的情境則可能明顯超過。
建議把本文的試算表當成選型階段抓量級的工具,正式簽約前,先用一小批真實對話樣本實測平均 token 量,再代入官方定價重新試算一次,確保預算數字貼近您實際的使用情境,而不是直接套用本文的假設值。
下一步
若您正在評估企業 AI 客服或知識庫機器人的年度預算,建議先估算預期對話量與典型對話長度,再對照上述試算表抓出合理的模型等級。諾訊科技提供從模型選型、RAG 架構設計到上線後用量監控的完整服務,歡迎參考 AI Agent 開發服務 了解我們如何協助企業控制 LLM 營運成本。若想對照不同服務的合作流程與費用區間,也可參考 合作流程與費用 頁面。