API 參考

音訊與 TTS

透過統一的 OpenAI 相容 API 進行文字轉語音及語音轉文字。存取來自 OpenAI、ElevenLabs 及其他音訊供應商的模型。

文字轉語音

http
POST https://api.tokspan.com/v1/audio/speech

參數

參數類型必要說明
modelstringTTS 模型:tts-1tts-1-hdgpt-4o-mini-tts
inputstring要轉換為語音的文字(最大 4096 字元)
voicestring語音:alloyechofableonyxnovashimmer
response_formatstringmp3(預設)、opusaacflacwavpcm
speednumber播放速度:0.25 到 4.0。預設值:1.0

範例

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key",
    base_url="https://api.tokspan.com/v1",
)

# Text-to-Speech
response = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")

語音轉文字

http
POST https://api.tokspan.com/v1/audio/transcriptions

參數

參數類型必要說明
modelstringSTT 模型:whisper-1
filefile音訊檔案(mp3、mp4、mpeg、mpga、m4a、wav、webm)
languagestringISO 639-1 語言代碼以獲得更好準確度
response_formatstringjson(預設)、textsrtvttverbose_json
temperaturenumber取樣溫度(0–1)。預設值:0

範例

python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text",
)
print(transcript)

可用模型

請參閱模型頁面了解所有支援的 TTS 和 STT 供應商,包含 OpenAI TTS、Whisper 和 ElevenLabs。