Referencia API
Audio y TTS
Conversión de texto a voz y voz a texto a través de una API unificada compatible con OpenAI. Accede a modelos de OpenAI, ElevenLabs y otros proveedores de audio.
Texto a Voz
http
POST https://api.tokspan.com/v1/audio/speechParámetros
| Parámetro | Tipo | Requerido | Descripción |
|---|---|---|---|
| model | string | Sí | Modelo TTS: tts-1, tts-1-hd, gpt-4o-mini-tts |
| input | string | Sí | Texto a convertir en voz (máx. 4096 caracteres) |
| voice | string | Sí | Voz: alloy, echo, fable, onyx, nova, shimmer |
| response_format | string | No | mp3 (predeterminado), opus, aac, flac, wav, pcm |
| speed | number | No | Velocidad de reproducción: 0.25 a 4.0. Predeterminado: 1.0 |
Ejemplo
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key",
base_url="https://api.tokspan.com/v1",
)
# Text-to-Speech
response = client.audio.speech.create(
model="tts-1",
voice="alloy",
input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")Voz a Texto
http
POST https://api.tokspan.com/v1/audio/transcriptionsParámetros
| Parámetro | Tipo | Requerido | Descripción |
|---|---|---|---|
| model | string | Sí | Modelo STT: whisper-1 |
| file | file | Sí | Archivo de audio (mp3, mp4, mpeg, mpga, m4a, wav, webm) |
| language | string | No | Código de idioma ISO 639-1 para mejor precisión |
| response_format | string | No | json (predeterminado), text, srt, vtt, verbose_json |
| temperature | number | No | Temperatura de muestreo (0–1). Predeterminado: 0 |
Ejemplo
python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text",
)
print(transcript)Modelos Disponibles
Consulte la página de Modelos para todos los proveedores de TTS y STT compatibles, incluyendo OpenAI TTS, Whisper y ElevenLabs.