Referencia API

Audio y TTS

Conversión de texto a voz y voz a texto a través de una API unificada compatible con OpenAI. Accede a modelos de OpenAI, ElevenLabs y otros proveedores de audio.

Texto a Voz

http
POST https://api.tokspan.com/v1/audio/speech

Parámetros

ParámetroTipoRequeridoDescripción
modelstringModelo TTS: tts-1, tts-1-hd, gpt-4o-mini-tts
inputstringTexto a convertir en voz (máx. 4096 caracteres)
voicestringVoz: alloy, echo, fable, onyx, nova, shimmer
response_formatstringNomp3 (predeterminado), opus, aac, flac, wav, pcm
speednumberNoVelocidad de reproducción: 0.25 a 4.0. Predeterminado: 1.0

Ejemplo

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key",
    base_url="https://api.tokspan.com/v1",
)

# Text-to-Speech
response = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")

Voz a Texto

http
POST https://api.tokspan.com/v1/audio/transcriptions

Parámetros

ParámetroTipoRequeridoDescripción
modelstringModelo STT: whisper-1
filefileArchivo de audio (mp3, mp4, mpeg, mpga, m4a, wav, webm)
languagestringNoCódigo de idioma ISO 639-1 para mejor precisión
response_formatstringNojson (predeterminado), text, srt, vtt, verbose_json
temperaturenumberNoTemperatura de muestreo (0–1). Predeterminado: 0

Ejemplo

python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text",
)
print(transcript)

Modelos Disponibles

Consulte la página de Modelos para todos los proveedores de TTS y STT compatibles, incluyendo OpenAI TTS, Whisper y ElevenLabs.