Справочник API

Аудио и TTS

Преобразование текста в речь и речи в текст через единый API, совместимый с OpenAI. Доступ к моделям OpenAI, ElevenLabs и других аудиопровайдеров.

Преобразование текста в речь (TTS)

http
POST https://api.tokspan.com/v1/audio/speech

Параметры

ПараметрТипОбязательныйОписание
modelstringДаМодель TTS: tts-1, tts-1-hd, gpt-4o-mini-tts
inputstringДаТекст для преобразования в речь (макс. 4096 символов)
voicestringДаГолос: alloy, echo, fable, onyx, nova, shimmer
response_formatstringНетmp3 (по умолчанию), opus, aac, flac, wav, pcm
speednumberНетСкорость воспроизведения: от 0,25 до 4,0. По умолчанию: 1.0

Пример

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key",
    base_url="https://api.tokspan.com/v1",
)

# Text-to-Speech
response = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")

Преобразование речи в текст (STT)

http
POST https://api.tokspan.com/v1/audio/transcriptions

Параметры

ПараметрТипОбязательныйОписание
modelstringДаМодель STT: whisper-1
filefileДаАудиофайл (mp3, mp4, mpeg, mpga, m4a, wav, webm)
languagestringНетКод языка ISO 639-1 для повышения точности
response_formatstringНетjson (по умолчанию), text, srt, vtt, verbose_json
temperaturenumberНетТемпература сэмплирования (0–1). По умолчанию: 0

Пример

python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text",
)
print(transcript)

Доступные модели

См. страницу Моделей для всех поддерживаемых провайдеров TTS и STT, включая OpenAI TTS, Whisper и ElevenLabs.