API リファレンス
音声と TTS
統一されたOpenAI互換APIを通じて、テキスト読み上げと音声認識を実現します。OpenAI、ElevenLabs、その他の音声プロバイダーのモデルにアクセスできます。
テキスト読み上げ
http
POST https://api.tokspan.com/v1/audio/speechパラメータ
| パラメータ | 型 | 必須 | 説明 |
|---|---|---|---|
| model | string | はい | TTS モデル:tts-1、tts-1-hd、gpt-4o-mini-tts |
| input | string | はい | 音声に変換するテキスト(最大 4096 文字) |
| voice | string | はい | 音声:alloy、echo、fable、onyx、nova、shimmer |
| response_format | string | いいえ | mp3(デフォルト)、opus、aac、flac、wav、pcm |
| speed | number | いいえ | 再生速度:0.25~4.0。デフォルト:1.0 |
例
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key",
base_url="https://api.tokspan.com/v1",
)
# Text-to-Speech
response = client.audio.speech.create(
model="tts-1",
voice="alloy",
input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")音声認識
http
POST https://api.tokspan.com/v1/audio/transcriptionsパラメータ
| パラメータ | 型 | 必須 | 説明 |
|---|---|---|---|
| model | string | はい | STT モデル:whisper-1 |
| file | file | はい | 音声ファイル(mp3、mp4、mpeg、mpga、m4a、wav、webm) |
| language | string | いいえ | 精度向上のための ISO 639-1 言語コード |
| response_format | string | いいえ | json(デフォルト)、text、srt、vtt、verbose_json |
| temperature | number | いいえ | サンプリング温度(0~1)。デフォルト:0 |
例
python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text",
)
print(transcript)利用可能なモデル
OpenAI TTS、Whisper、ElevenLabs を含むすべての対応 TTS および STT プロバイダーについては、モデルページ をご参照ください。