Tham Khảo API

Âm Thanh & TTS

Chuyển đổi văn bản thành giọng nói và giọng nói thành văn bản thông qua API hợp nhất tương thích OpenAI. Truy cập các mô hình từ OpenAI, ElevenLabs và các nhà cung cấp âm thanh khác.

Chuyển Văn Bản Thành Giọng Nói (TTS)

http
POST https://api.tokspan.com/v1/audio/speech

Tham Số

Tham SốKiểuBắt BuộcMô Tả
modelstringMô hình TTS: tts-1, tts-1-hd, gpt-4o-mini-tts
inputstringVăn bản cần chuyển thành giọng nói (tối đa 4096 ký tự)
voicestringGiọng nói: alloy, echo, fable, onyx, nova, shimmer
response_formatstringKhôngmp3 (mặc định), opus, aac, flac, wav, pcm
speednumberKhôngTốc độ phát: 0.25 đến 4.0. Mặc định: 1.0

Ví Dụ

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key",
    base_url="https://api.tokspan.com/v1",
)

# Text-to-Speech
response = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")

Chuyển Giọng Nói Thành Văn Bản (STT)

http
POST https://api.tokspan.com/v1/audio/transcriptions

Tham Số

Tham SốKiểuBắt BuộcMô Tả
modelstringMô hình STT: whisper-1
filefileTệp âm thanh (mp3, mp4, mpeg, mpga, m4a, wav, webm)
languagestringKhôngMã ngôn ngữ ISO 639-1 để cải thiện độ chính xác
response_formatstringKhôngjson (mặc định), text, srt, vtt, verbose_json
temperaturenumberKhôngNhiệt độ lấy mẫu (0–1). Mặc định: 0

Ví Dụ

python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text",
)
print(transcript)

Mô Hình Khả Dụng

Xem trang Mô Hình để biết tất cả nhà cung cấp TTS và STT được hỗ trợ, bao gồm OpenAI TTS, Whisper và ElevenLabs.