進階功能
負載平衡
將 API 流量分散至多個模型和供應商,最大化吞吐量、最小化延遲,並避免單一供應商瓶頸 — 全部在儀表板中設定。
負載平衡策略
TokSpan 支援多種路由策略,可在儀表板中按頻道設定:
| 策略 | 運作方式 | 最適合 |
|---|---|---|
| 加權隨機 | 根據指定權重分配請求(例如 70% 模型 A、30% 模型 B) | 逐步遷移、A/B 測試、成本最佳化 |
| 優先順序(容錯移轉) | 路由至優先順序最高的可用模型;沿鏈向下備援 | 生產環境韌性、主要/備援設定 |
| 基於速率限制 | 當模型達到速率限制時分配溢出的流量 | 高吞吐量批次處理 |
在儀表板中設定負載平衡
- 登入 TokSpan 儀表板,網址為api.tokspan.com/dashboard
- 在側邊欄中前往頻道
- 針對加權分配:為同一模型群組建立多個頻道,為每個頻道分配不同權重
- 針對基於優先順序:在單一頻道內設定模型優先順序排序
- 儲存設定 — 變更立即生效,無需重啟
範例:跨供應商加權分配
將同一模型類型的流量在兩個供應商之間以 60/40 分割:
| 頻道 | 模型 | 權重 | 佔比 |
|---|---|---|---|
| 頻道 A | GPT-4o (OpenAI) | 60 | 60% 流量 |
| 頻道 B | Claude Opus 4.8 (Anthropic) | 40 | 40% 流量 |
使用者呼叫一個模型名稱 — TokSpan 透明地處理分配。無需用戶端變更。
專業提示:測試新供應商時從 90/10 分配開始。隨著對可靠性和回應品質的信心增加,逐步提高權重。