Справочник API
Аудио и TTS
Преобразование текста в речь и речи в текст через единый API, совместимый с OpenAI. Доступ к моделям OpenAI, ElevenLabs и других аудиопровайдеров.
Преобразование текста в речь (TTS)
http
POST https://api.tokspan.com/v1/audio/speechПараметры
| Параметр | Тип | Обязательный | Описание |
|---|---|---|---|
| model | string | Да | Модель TTS: tts-1, tts-1-hd, gpt-4o-mini-tts |
| input | string | Да | Текст для преобразования в речь (макс. 4096 символов) |
| voice | string | Да | Голос: alloy, echo, fable, onyx, nova, shimmer |
| response_format | string | Нет | mp3 (по умолчанию), opus, aac, flac, wav, pcm |
| speed | number | Нет | Скорость воспроизведения: от 0,25 до 4,0. По умолчанию: 1.0 |
Пример
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key",
base_url="https://api.tokspan.com/v1",
)
# Text-to-Speech
response = client.audio.speech.create(
model="tts-1",
voice="alloy",
input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")Преобразование речи в текст (STT)
http
POST https://api.tokspan.com/v1/audio/transcriptionsПараметры
| Параметр | Тип | Обязательный | Описание |
|---|---|---|---|
| model | string | Да | Модель STT: whisper-1 |
| file | file | Да | Аудиофайл (mp3, mp4, mpeg, mpga, m4a, wav, webm) |
| language | string | Нет | Код языка ISO 639-1 для повышения точности |
| response_format | string | Нет | json (по умолчанию), text, srt, vtt, verbose_json |
| temperature | number | Нет | Температура сэмплирования (0–1). По умолчанию: 0 |
Пример
python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text",
)
print(transcript)Доступные модели
См. страницу Моделей для всех поддерживаемых провайдеров TTS и STT, включая OpenAI TTS, Whisper и ElevenLabs.