API リファレンス

音声と TTS

統一されたOpenAI互換APIを通じて、テキスト読み上げと音声認識を実現します。OpenAI、ElevenLabs、その他の音声プロバイダーのモデルにアクセスできます。

テキスト読み上げ

http
POST https://api.tokspan.com/v1/audio/speech

パラメータ

パラメータ必須説明
modelstringはいTTS モデル:tts-1tts-1-hdgpt-4o-mini-tts
inputstringはい音声に変換するテキスト(最大 4096 文字)
voicestringはい音声:alloyechofableonyxnovashimmer
response_formatstringいいえmp3(デフォルト)、opusaacflacwavpcm
speednumberいいえ再生速度:0.25~4.0。デフォルト:1.0

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key",
    base_url="https://api.tokspan.com/v1",
)

# Text-to-Speech
response = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")

音声認識

http
POST https://api.tokspan.com/v1/audio/transcriptions

パラメータ

パラメータ必須説明
modelstringはいSTT モデル:whisper-1
filefileはい音声ファイル(mp3、mp4、mpeg、mpga、m4a、wav、webm)
languagestringいいえ精度向上のための ISO 639-1 言語コード
response_formatstringいいえjson(デフォルト)、textsrtvttverbose_json
temperaturenumberいいえサンプリング温度(0~1)。デフォルト:0

python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text",
)
print(transcript)

利用可能なモデル

OpenAI TTS、Whisper、ElevenLabs を含むすべての対応 TTS および STT プロバイダーについては、モデルページ をご参照ください。