API 參考
音訊與 TTS
透過統一的 OpenAI 相容 API 進行文字轉語音及語音轉文字。存取來自 OpenAI、ElevenLabs 及其他音訊供應商的模型。
文字轉語音
http
POST https://api.tokspan.com/v1/audio/speech參數
| 參數 | 類型 | 必要 | 說明 |
|---|---|---|---|
| model | string | 是 | TTS 模型:tts-1、tts-1-hd、gpt-4o-mini-tts |
| input | string | 是 | 要轉換為語音的文字(最大 4096 字元) |
| voice | string | 是 | 語音:alloy、echo、fable、onyx、nova、shimmer |
| response_format | string | 否 | mp3(預設)、opus、aac、flac、wav、pcm |
| speed | number | 否 | 播放速度:0.25 到 4.0。預設值:1.0 |
範例
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key",
base_url="https://api.tokspan.com/v1",
)
# Text-to-Speech
response = client.audio.speech.create(
model="tts-1",
voice="alloy",
input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")語音轉文字
http
POST https://api.tokspan.com/v1/audio/transcriptions參數
| 參數 | 類型 | 必要 | 說明 |
|---|---|---|---|
| model | string | 是 | STT 模型:whisper-1 |
| file | file | 是 | 音訊檔案(mp3、mp4、mpeg、mpga、m4a、wav、webm) |
| language | string | 否 | ISO 639-1 語言代碼以獲得更好準確度 |
| response_format | string | 否 | json(預設)、text、srt、vtt、verbose_json |
| temperature | number | 否 | 取樣溫度(0–1)。預設值:0 |
範例
python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text",
)
print(transcript)可用模型
請參閱模型頁面了解所有支援的 TTS 和 STT 供應商,包含 OpenAI TTS、Whisper 和 ElevenLabs。